{"product_id":"138665","title":"Apprendre l'apprentissage par renforcement grâce au code, comme un développeur ","description":"\u003ccenter\u003e\u003cdiv style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/tmgdisk01.cafe24.com\/images\/vs\/4172\/sv\/3jXPCfLD4CyqSv1ICFel0HlFD6f3lv.png?v=1765066268\" style=\"max-width:100%;max-height:10px\"\u003e\u003c\/div\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\n\n\u003cdiv style=\"width:95%\"\u003e\n\n\u003cdiv style=\"text-align:center;font-size:30px;font-weight:bolder;line-height:1.6em\"\u003e Apprendre l'apprentissage par renforcement grâce au code, comme un développeur \u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"border-bottom:1px;border-bottom-style:dotted;border-color:;padding-bottom:20px\"\u003e\u003ccenter\u003e\u003ctable align=\"center\" width=\"100%\"\u003e\u003ctbody style=\"border:0px\"\u003e\n\n\u003ctr\u003e\u003ctd align=\"center\" style=\"line-height:1.2em;text-align:center;font-size:18px;color:black;font-weight:bold;padding-bottom:20px;\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\u003ctr\u003e\u003ctd style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/image.yes24.com\/goods\/151347658\/XL\" style=\"max-width:100%;height:auto\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\n\u003c\/tbody\u003e\u003c\/table\u003e\u003c\/center\u003e\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;{split_style6}padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e Description \u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;word-break:break-all;font-size:14px;line-height:1.6em;\"\u003e\n\n\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eIntroduction au livre\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e\u003cdiv\u003e \u003cb\u003eÉcrire de l'apprentissage par renforcement pour les développeurs !\u003cbr\u003e Même si les mathématiques vous ont toujours intimidé, vous pouvez désormais commencer l'apprentissage par renforcement grâce au code.\u003cbr\u003e Un guide d'introduction pratique avec des exemples concrets, de Stable Baselines3 à Optuna !\u003c\/b\u003e\u003cbr\u003e \u003cbr\u003eL'apprentissage par renforcement peut sembler complexe, et vous ne savez pas par où commencer ? Les mathématiques sont ardues, les aspects pratiques sont compliqués et les concepts abstraits… C'est pourquoi ce livre propose une approche différente.\u003cbr\u003e\u003cbr\u003e « Apprendre l’apprentissage par renforcement avec du code, comme un développeur » est un ouvrage d’introduction pratique conçu pour réduire la distance et la complexité mathématique associées à l’apprentissage par renforcement et permettre d’apprendre l’IA d’une manière conviviale pour les développeurs.\u003cbr\u003e Il minimise les théories et formules mathématiques complexes, organise les concepts de manière à ce qu'ils soient compréhensibles intuitivement et explique comment les concepts sont liés au code réel grâce à divers exemples et aides visuelles.\u003cbr\u003e Un mélange équilibré de théorie et de pratique, des explications accessibles et des projets basés sur des problèmes du monde réel aident les étudiants à intégrer naturellement l'apprentissage par renforcement, du concept à la mise en œuvre.\u003cbr\u003e\u003cbr\u003e \u003cbr\u003eEn commençant par une formation pratique dans l'environnement OpenAI Gym, vous pouvez implémenter directement des algorithmes représentatifs tels que DQN, A2C et PPO, et expérimenter des implémentations avancées à l'aide du framework Stable-Baselines3 et de l'outil de réglage automatique Optuna.\u003cbr\u003e Grâce à des exemples proches des tâches du monde réel, comme la répartition des actifs et les modalités de travail par rotation, vous pouvez faire le lien avec des situations concrètes sans vous demander : « Où puis-je utiliser cela ? »\u003cbr\u003e Ce livre est un guide convivial destiné aux développeurs débutants qui découvrent l'apprentissage par renforcement, et un guide pratique qui développe la pensée critique et les compétences d'application grâce à une pratique répétitive du code.\u003cbr\u003e Si vous êtes un développeur qui souhaite concevoir sa propre stratégie, commencez dès maintenant par ce livre.\u003cbr\u003e\n\n\u003c\/div\u003e\u003c\/div\u003e\n\u003cdiv\u003e\u003cul\u003e\u003cli\u003e Vous pouvez consulter un aperçu du contenu du livre.\u003cbr\u003e \u003cspan\u003eAperçu\u003c\/span\u003e\n\n\u003c\/li\u003e\u003c\/ul\u003e\u003c\/div\u003e\n\u003c\/div\u003e \",\"\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eindice\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e Pour commencer,\u003cbr\u003e\u003cbr\u003e Chapitre 1 : Concepts fondamentaux de l'apprentissage par renforcement\u003cbr\u003e _1.1 Qu'est-ce que l'apprentissage par renforcement ?\u003cbr\u003e 1.2 Probabilités et processus stochastiques\u003cbr\u003e __1.2.1 Probabilité\u003cbr\u003e 1.2.2 Probabilité conditionnelle\u003cbr\u003e __1.2.3 Processus stochastiques\u003cbr\u003e _1.3.\u003cbr\u003e chaîne de Markov\u003cbr\u003e __1.3.1 Propriété de Markov \u003cbr\u003e1.3.2 Propriété de Markov et mouvement brownien\u003cbr\u003e 1.3.3 Chaîne de Markov\u003cbr\u003e _1.4 Processus de récompense de Markov\u003cbr\u003e 1.4.1 Composition des récompenses de Markov\u003cbr\u003e __1.4.2 Quelle est la valeur attendue de la probabilité ?\u003cbr\u003e __1.4.3 Valeur de retour\u003cbr\u003e __1.4.4 Fonction de valeur d'état\u003cbr\u003e\u003cbr\u003e Chapitre 2 : Algorithmes d’apprentissage par renforcement de base\u003cbr\u003e _2.1 Qu'est-ce qu'un processus de décision markovien ?\u003cbr\u003e _2.2 Composants MDP\u003cbr\u003e 2.2.1 Matrice de transition d'état et fonction de récompense dans un processus de décision markovien (MDP)\u003cbr\u003e 2.2.2 Politique dans le MDP\u003cbr\u003e 2.2.3 Étude de cas comparative entre MRP et MDP\u003cbr\u003e __2.2.4 Matrice de transition d'état et fonction de récompense prenant en compte la politique\u003cbr\u003e _2.3 Fonction de valeur d'état MDP\u003cbr\u003e __2.3.1 Quelle est la fonction de valeur d'état du MDP ?\u003cbr\u003e __2.3.2 Exemple de fonction de valeur d'état MDP\u003cbr\u003e _2.4 Fonction de valeur d'action MDP\u003cbr\u003e __2.4.1 Qu'est-ce qu'une fonction de valeur d'action MDP ?\u003cbr\u003e 2.4.2 Relation entre la fonction de valeur d'action et la fonction de valeur d'état du MDP\u003cbr\u003e __2.4.3 Exemple de fonction de valeur d'action MDP\u003cbr\u003e _2.5 Fonction de valeur optimale MDP\u003cbr\u003e __2.5.1 Quelle est la fonction de valeur optimale du MDP ?\u003cbr\u003e __2.5.2 Exemple de fonction de valeur optimale MDP\u003cbr\u003e 2.6 Différents termes utilisés dans l'apprentissage par renforcement\u003cbr\u003e 2.6.1 Évaluation et contrôle des politiques\u003cbr\u003e __2.6.2 Modèles basés sur un modèle et modèles sans modèle\u003cbr\u003e \u003cbr\u003eChapitre 3 : Programmation dynamique et méthodes de Monte Carlo\u003cbr\u003e _3.1.\u003cbr\u003e programmation dynamique\u003cbr\u003e __3.1.1.\u003cbr\u003e Qu'est-ce que la programmation dynamique ?\u003cbr\u003e __3.1.2.\u003cbr\u003e Monde en grille\u003cbr\u003e __3.1.3 Exemple de programmation dynamique\u003cbr\u003e 3.2 Méthode de Monte Carlo\u003cbr\u003e __3.2.1 Qu'est-ce que la méthode de Monte Carlo ?\u003cbr\u003e 3.2.2 Méthode de Monte Carlo utilisant la moyenne incrémentale\u003cbr\u003e 3.2.3 Exemple de la méthode de Monte Carlo\u003cbr\u003e\u003cbr\u003e Chapitre 4 : Apprentissage différentiel temporel, Salsa et Q-Learning\u003cbr\u003e 4.1 Apprentissage en accéléré\u003cbr\u003e __4.1.1 Qu'est-ce que l'apprentissage par différence temporelle ?\u003cbr\u003e 4.1.2 Fonction de valeur d'action plutôt que fonction de valeur d'état\u003cbr\u003e 4.1.3 Exemple d'apprentissage différentiel dans le temps\u003cbr\u003e _4.2 Salsa\u003cbr\u003e 4.2.1 Concept SARSA\u003cbr\u003e __4.2.2 Exemple de salsa\u003cbr\u003e _4.3 Q Course\u003cbr\u003e __4.3.1 Conformément à la politique et hors politique\u003cbr\u003e 4.3.2 Échantillonnage d'importance\u003cbr\u003e __4.3.3 Q Course\u003cbr\u003e __4.3.4 Exemple d'apprentissage par renforcement Q\u003cbr\u003e 4.3.4 Comparaison d'exemples de Salsa et d'apprentissage par renforcement (Q-Learning)\u003cbr\u003e\u003cbr\u003e Chapitre 5 : Concepts de l'intelligence artificielle\u003cbr\u003e 5.1 Apprentissage automatique\u003cbr\u003e 5.2 Analyse de régression linéaire\u003cbr\u003e 5.3 Analyse de classification\u003cbr\u003e 5.4 Apprentissage profond\u003cbr\u003e 5.5 Apprendre les bases de l'intelligence artificielle avec des programmes\u003cbr\u003e __5.5.1 Qu'est-ce que TensorFlow ?\u003cbr\u003e __5.5.2 Exemple de base de réseau neuronal artificiel\u003cbr\u003e\u003cbr\u003e Chapitre 6 Approximation de fonctions\u003cbr\u003e _6.1 Différenciation\u003cbr\u003e 6.2 Différentiation partielle \u003cbr\u003e_6.3 Scalaires et vecteurs\u003cbr\u003e _6.4 Gradient\u003cbr\u003e _6.5 Descente en pente\u003cbr\u003e 6.6 Descente de gradient stochastique\u003cbr\u003e 6.7 Notation pour la différentiation partielle et la descente de gradient dans l'apprentissage par renforcement\u003cbr\u003e _6.8 Approximation de fonction\u003cbr\u003e\u003cbr\u003e Chapitre 7 : Apprentissage par renforcement basé sur la valeur et algorithme DQN\u003cbr\u003e _7.1 Algorithme DQN\u003cbr\u003e _7.2 Poteau de chariot\u003cbr\u003e 7.3 Le problème de l'exploration et de la cupidité\u003cbr\u003e _7.4 Structure de base de l'algorithme DQN\u003cbr\u003e _7.5 Analyse complète du code de l'algorithme DQN\u003cbr\u003e _7.6 Structure détaillée de l'algorithme DQN\u003cbr\u003e 7.7 Analyse des résultats d'apprentissage de l'algorithme DQN\u003cbr\u003e\u003cbr\u003e Chapitre 8 Apprentissage par renforcement basé sur des politiques Algorithme REINFORCE\u003cbr\u003e _8.1 Retour sur les réseaux neuronaux artificiels\u003cbr\u003e 8.2 Gradient de politique\u003cbr\u003e 8.3 Fonctionnement de l'algorithme REINFORCE\u003cbr\u003e 8.4 Structure de base de l'algorithme REINFORCE\u003cbr\u003e Analyse complète du code de l'algorithme REINFORCE 8.5\u003cbr\u003e 8.6 Structure détaillée de l'algorithme REINFORCE\u003cbr\u003e 8.7 Analyse des résultats d'apprentissage de l'algorithme REINFORCE\u003cbr\u003e\u003cbr\u003e Chapitre 9 Algorithme A2C basé sur des politiques\u003cbr\u003e _9.1 Algorithme acteur-critique\u003cbr\u003e __9.1.1 Qu'est-ce que l'algorithme Actor Critic ?\u003cbr\u003e 9.1.2 Structure et fonctionnement de l'algorithme acteur-critique\u003cbr\u003e _9.2 Avantage Acteur Critique \u003cbr\u003e_9.3 Structure de base de l'algorithme A2C\u003cbr\u003e Analyse complète du code de l'algorithme A2C _9.4\u003cbr\u003e _9.5 Analyse détaillée de la structure de l'algorithme A2C\u003cbr\u003e 9.6 Analyse des résultats d'apprentissage de l'algorithme A2C\u003cbr\u003e Chapitre 10 Algorithme PPO basé sur les politiques\u003cbr\u003e\u003cbr\u003e _10.1 Échantillonnage d'importance\u003cbr\u003e _10.2 Gradient de politique en temps réel\u003cbr\u003e _10.3 Technique de découpage\u003cbr\u003e _10,4 GAE\u003cbr\u003e _10.5 Structure de base de l'algorithme PPO\u003cbr\u003e _10.6 Analyse complète du code de l'algorithme PPO\u003cbr\u003e _10.7 Structure détaillée de l'algorithme PPO\u003cbr\u003e Analyse des résultats d'apprentissage de l'algorithme PPO _10.8\u003cbr\u003e\u003cbr\u003e Chapitre 11 : Réglage des réseaux de neurones artificiels\u003cbr\u003e _11.1 Aperçu du réglage des réseaux de neurones artificiels\u003cbr\u003e _11.2 Prétraitement des données d'entrée\u003cbr\u003e __11.2.1 Normalisation\u003cbr\u003e __11.2.2 Normalisation\u003cbr\u003e 11.3 Choix d'une fonction de coût\u003cbr\u003e _11.4 Algorithme d'activation\u003cbr\u003e _11.5 Initialisation du poids\u003cbr\u003e _11.6 Algorithme d'optimisation\u003cbr\u003e _11.7 Discussion sur le nombre de nœuds et de couches cachées\u003cbr\u003e _11.8 Autres techniques de stabilisation et d'amélioration des performances de l'entraînement des modèles\u003cbr\u003e __11.8.1 Découpage par dégradé\u003cbr\u003e __11.8.2 Résiliation anticipée\u003cbr\u003e Optimisation du réseau neuronal artificiel de l'algorithme PPO _11.9\u003cbr\u003e _11.10 Application du code de réglage de l'algorithme PPO\u003cbr\u003e 11.11 Analyse des résultats d'optimisation de l'algorithme PPO\u003cbr\u003e \u003cbr\u003eChapitre 12 Techniques d'optimisation bayésienne\u003cbr\u003e _12.1 Probabilité fréquentiste et bayésienne\u003cbr\u003e _12.2 Calcul de la probabilité bayésienne\u003cbr\u003e _12.3 Package d'optimisation bayésienne Optuna\u003cbr\u003e __12.3.1 Exemple Optuna\u003cbr\u003e _12.4 code complet d'optimisation optuna\u003cbr\u003e 12.5 Analyse des résultats de l'optimisation bayésienne\u003cbr\u003e\u003cbr\u003e Chapitre 13 Lignes de base stables 3\u003cbr\u003e _13.1 Qu'est-ce que Stable-Baselines3 ?\u003cbr\u003e __13.1.1 Introduction aux frameworks d'apprentissage par renforcement open source\u003cbr\u003e __13.1.2 Relation avec les valeurs de référence, évolution de SB2 à SB3\u003cbr\u003e __13.1.3 Pourquoi SB3 ? Implémentation directe vs.\u003cbr\u003e Utilisation de la bibliothèque\u003cbr\u003e _13.2 Composants principaux du SB3\u003cbr\u003e 13.2.1 Politique : Le cerveau de l'agent\u003cbr\u003e __13.2.2 Modèle : Le centre d'apprentissage\u003cbr\u003e __13.2.3 Env : Lien vers l’environnement\u003cbr\u003e 13.2.4 Rappel : Contrôle et surveillance pendant l’apprentissage\u003cbr\u003e __13.2.5 VecEnv : Accélération grâce aux environnements parallèles\u003cbr\u003e 13.3 Composantes clés du SB3 illustrées par des exemples\u003cbr\u003e 13.3.1 Comprendre les composants principaux de SB3\u003cbr\u003e __13.3.2 Hyperparamètres de classe SB3 PPO\u003cbr\u003e __13.3.3 Réglage de classe SB3 PPO appliqué\u003cbr\u003e __13.3.4 Exécution de l'exemple de code et métriques d'évaluation\u003cbr\u003e __13.3.5 Indicateurs clés pour l'interprétation des résultats d'apprentissage \u003cbr\u003e__13.3.6 TensorBoard\u003cbr\u003e\u003cbr\u003e Chapitre 14 : Stratégies d’allocation d’actifs en IA\u003cbr\u003e _14.1 Qu’est-ce qu’une stratégie de répartition d’actifs ?\u003cbr\u003e _14.2 Le portefeuille tous temps de Ray Dalio\u003cbr\u003e __14.2.1 Qu'est-ce qu'un portefeuille tout temps ?\u003cbr\u003e 14.2.2 Rôles par catégorie d'actifs\u003cbr\u003e __14.2.3 Allocation d'actifs de Ray Dalio\u003cbr\u003e 14.2.4 Avantages et inconvénients du portefeuille tous temps\u003cbr\u003e 14.2.5 Évaluation de la performance d'un portefeuille d'investissement résistant aux aléas climatiques\u003cbr\u003e __14.2.6 Portfolio tout temps et apprentissage par renforcement\u003cbr\u003e _14.3 Stratégie de mise en œuvre du code de portefeuille tout temps\u003cbr\u003e _14.4 Portefeuille tous temps Code complet\u003cbr\u003e _14.5 Structure détaillée du portefeuille tous temps\u003cbr\u003e\u003cbr\u003e Chapitre 15 : Optimisation des stratégies d’allocation d’actifs de l’IA\u003cbr\u003e _15.1 Premier réglage : application des techniques de réglage empiriques\u003cbr\u003e _15.2 Réglage de la seconde : Utilisation du package Optuna\u003cbr\u003e 15.3 Comparaison avec la stratégie d'achat et de conservation\u003cbr\u003e _15.4 Éléments de réglage supplémentaires\u003cbr\u003e\u003cbr\u003e [Annexe A] Préparation de l'environnement de pratique\u003cbr\u003e _A.1 Préparation à l'apprentissage\u003cbr\u003e __A.1.1 Installation de Python\u003cbr\u003e __A.1.2 Installation des packages requis\u003cbr\u003e _A.2 Exécution de Jupyter Notebook\u003cbr\u003e _A.3 Vérifier la version du programme\u003cbr\u003e\u003cbr\u003e [Annexe B] ChatGPT a évolué vers RLHF : l’intersection de l’IA générative et de l’apprentissage par renforcement \u003cbr\u003e_A.1 Comment l'IA générative et Chat GPT ont-elles été créées ?\u003cbr\u003e __A.1.1 Le concept d'IA générative\u003cbr\u003e __A.1.2 Comment ChatGPT a-t-il été entraîné ?\u003cbr\u003e __A.1.3 Comment GPT comprend-il et exprime-t-il le contexte ?\u003cbr\u003e __A.1.4 Résumé\u003cbr\u003e _A.2 Qu'est-ce que RLHF ?\u003cbr\u003e __A.2.1 Qu’est-ce que le feedback humain ?\u003cbr\u003e __A.2.2 Pourquoi ChatGPT a-t-il besoin d'un modèle de récompense pour apprendre les « bonnes réponses » ?\u003cbr\u003e __A.2.3 Processus d'apprentissage global du RLHF\u003cbr\u003e _A.3 Lien entre PPO et les algorithmes basés sur les politiques que nous avons appris\u003cbr\u003e __A.3.1 PPO que nous avons appris et PPO réellement utilisé\u003cbr\u003e __A.3.2 Comment ChatGPT est-il devenu un exemple représentatif d'apprentissage par renforcement basé sur des politiques ?\u003cbr\u003e __A.3.3 La place du PPO dans le processus d'apprentissage par renforcement pratique\u003cbr\u003e _A.4 Comprendre RLHF à travers des exemples\u003cbr\u003e __A.4.1 Examen complet du code\u003cbr\u003e __A.4.2 Comprendre le code\u003cbr\u003e _A.5 Comment l'apprentissage par renforcement fera-t-il évoluer l'IA générative ?\u003cbr\u003e A.5.1 Le problème du tri et le rôle de l'apprentissage par renforcement\u003cbr\u003e __A.5.2 Orientations futures de l'évolution des modèles de langage\u003cbr\u003e __A.5.3 Un changement philosophique dans l'apprentissage par renforcement vers une « IA centrée sur l'humain »\u003cbr\u003e \u003cbr\u003eRecherche\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e \",\"\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eImage détaillée\u003c\/b\u003e \u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\u003cdiv\u003e\u003cimg src=\"https:\/\/image.yes24.com\/momo\/TopCate5560\/MidCate003\/555921034.jpg\" border=\"0\" alt=\"Image détaillée 1\"\u003e\u003c\/div\u003e\u003c\/div\u003e \",\"\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eAvis de l'éditeur\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e Ce livre a été écrit pour les innombrables programmeurs qui hésitaient devant la théorie mathématique et le code complexe de l'apprentissage par renforcement.\u003cbr\u003e L’apprentissage par renforcement, connu depuis l’apparition d’AlphaGo comme une « intelligence artificielle douée pour les jeux », est en réalité une méthode d’apprentissage autonome et flexible qui découvre par elle-même les stratégies optimales grâce à une interaction continue avec l’environnement.\u003cbr\u003e Ces caractéristiques les rendent parfaitement adaptés à la résolution de problèmes du monde réel caractérisés par l'imprévisibilité et la complexité, et ils sont particulièrement bien établis comme une arme viable pour la génération de profits sur les marchés financiers, notamment les systèmes de négociation automatisés, les stratégies de négociation à haute fréquence et les modèles de gestion des risques.\u003cbr\u003e\u003cbr\u003e Ce livre n'est pas simplement un ouvrage théorique ; c'est un guide pratique qui aide les lecteurs à tirer parti de l'apprentissage par renforcement pour obtenir des résultats concrets sur les marchés du monde réel. \u003cbr\u003eVoici les principales caractéristiques et la structure de ce livre.\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePublic cible de ce livre\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e Les développeurs qui souhaitent étudier l'apprentissage par renforcement mais qui se sentent freinés par les mathématiques ou les explications théoriques\u003cbr\u003e • Un programmeur qui souhaite aller au-delà de la simple automatisation des tâches et créer un système intelligent capable de prendre des décisions et de s'adapter à la situation.\u003cbr\u003e • Les investisseurs individuels intéressés par les marchés d'actifs tels que les actions, les cryptomonnaies et les matières premières, et qui souhaitent concevoir leurs propres stratégies génératrices de profits.\u003cbr\u003e • Les fondateurs ou planificateurs de startups qui développent des applications d'investissement basées sur l'IA, des conseillers financiers automatisés et des produits SaaS financiers utilisant l'apprentissage par renforcement\u003cbr\u003e • Les professionnels qui souhaitent automatiser les transactions ou les flux de travail répétitifs et les doter de capacités d'apprentissage et d'adaptabilité.\u003cbr\u003e\u003cbr\u003e \u003cb\u003eStructure de ce livre\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e Ce livre est globalement divisé en sept parties principales et une annexe.\u003cbr\u003e Chaque partie suit le schéma concept → mise en œuvre → pratique → application, et le niveau de difficulté augmente progressivement. \u003cbr\u003e• Concepts de base de l'apprentissage par renforcement - Explication intuitive des probabilités, des chaînes de Markov, des processus de décision markoviens, des fonctions de valeur et de l'équation de Bellman.\u003cbr\u003e • Algorithmes de base - Apprenez les techniques fondamentales telles que la programmation dynamique, Monte Carlo, l'apprentissage TD, SARSA et l'apprentissage Q, ainsi que le code correspondant.\u003cbr\u003e • Concepts d'intelligence artificielle et approximation de fonctions - Couvre les principes des réseaux neuronaux, la descente de gradient, les fonctions d'activation et l'utilisation des frameworks d'apprentissage profond.\u003cbr\u003e Apprentissage par renforcement basé sur la valeur (DQN) - Mettez en œuvre le DQN avec l'exemple CartPole et pratiquez l'équilibre exploration-exploitation et la mémoire de relecture.\u003cbr\u003e • Réglage et optimisation - Pratiquez les fonctions d'activation, l'initialisation des poids, les optimiseurs, le prétraitement des données, les fonctions de perte, l'écrêtage du gradient et l'optimisation bayésienne basée sur Optuna.\u003cbr\u003e • Projet de marché financier - Créer un environnement d'allocation d'actifs à l'aide des données yfinance et effectuer l'apprentissage, le réglage et l'analyse des performances avec PPO.\u003cbr\u003e • Annexe - Guide pour la mise en place d'un environnement de pratique, explication détaillée du RLHF\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e \"]\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e SPÉCIFICATIONS DES PRODUITS\u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;font-size:14px;line-height:1.6em;\"\u003e\n\n \u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e- \u003cstrong\u003eDate d'émission :\u003c\/strong\u003e 25 août 2025\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eNombre de pages, poids, dimensions :\u003c\/strong\u003e 542 pages | 182 × 232 × 35 mm\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN13 :\u003c\/strong\u003e 9788965404200\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN10 :\u003c\/strong\u003e 8965404207 \u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cspan\u003e\u003c\/span\u003e\n\n\u003c\/center\u003e\n\n\n\u003c\/center\u003e","brand":"LIBRAIRIE COREENNE","offers":[{"title":"Default Title","offer_id":43893270511658,"sku":"138665","price":41.0,"currency_code":"EUR","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0683\/2750\/5962\/files\/5f4e827fc2c473793e3f98b9124bebb4.jpg?v=1765394980","url":"https:\/\/librairie.coreenne.fr\/products\/138665","provider":"LIBRAIRIE COREENNE","version":"1.0","type":"link"}