{"product_id":"138156","title":"Apprentissage par renforcement robuste ","description":"\u003ccenter\u003e\u003cdiv style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/tmgdisk01.cafe24.com\/images\/vs\/4172\/sv\/3jXPCfJfoTlRuKMPh0i7e3e10Veuil.png?v=1765060793\" style=\"max-width:100%;max-height:10px\"\u003e\u003c\/div\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\n\n\u003cdiv style=\"width:95%\"\u003e\n\n\u003cdiv style=\"text-align:center;font-size:30px;font-weight:bolder;line-height:1.6em\"\u003e Apprentissage par renforcement robuste \u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"border-bottom:1px;border-bottom-style:dotted;border-color:;padding-bottom:20px\"\u003e\u003ccenter\u003e\u003ctable align=\"center\" width=\"100%\"\u003e\u003ctbody style=\"border:0px\"\u003e\n\n\u003ctr\u003e\u003ctd align=\"center\" style=\"line-height:1.2em;text-align:center;font-size:18px;color:black;font-weight:bold;padding-bottom:20px;\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\u003ctr\u003e\u003ctd style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/image.yes24.com\/goods\/89605439\/XL\" style=\"max-width:100%;height:auto\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\n\u003c\/tbody\u003e\u003c\/table\u003e\u003c\/center\u003e\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;{split_style6}padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e Description \u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;word-break:break-all;font-size:14px;line-height:1.6em;\"\u003e\n\n\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eIntroduction au livre\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e\u003cdiv\u003e \u003cb\u003eLa bible absolue de l'apprentissage par renforcement, révisée pour la première fois en 20 ans avec un contenu considérablement enrichi !\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain.\u003cbr\u003e Dans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.\u003cbr\u003e Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.\u003cbr\u003e\n\u003c\/div\u003e\u003c\/div\u003e\n\u003cdiv\u003e\u003cul\u003e  \u003cli\u003eVous pouvez consulter un aperçu du contenu du livre.\u003cbr\u003e \u003cspan\u003eAperçu\u003c\/span\u003e\n\n\u003c\/li\u003e\n\u003c\/ul\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eindice\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e \u003cb\u003eCHAPITRE 01 Introduction 1\u003c\/b\u003e\u003cbr\u003e 1.1 Apprentissage par renforcement 2\u003cbr\u003e 1.2 Exemple 5\u003cbr\u003e 1.3 Composantes de l'apprentissage par renforcement 7\u003cbr\u003e 1.4 Limitations et portée 9\u003cbr\u003e 1.5 Exemple étendu : Tic-Tac-Toe 10\u003cbr\u003e 1.6 Résumé 16\u003cbr\u003e 1.7 Histoire ancienne de l'apprentissage par renforcement 17\u003cbr\u003e Référence 27\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE I Solutions sous forme de tableau\u003c\/b\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 02 Questions à choix multiples 31\u003c\/b\u003e\u003cbr\u003e 2.1 Problème à choix multiple 32\u003cbr\u003e 2.2 Méthode de la valeur comportementale 34\u003cbr\u003e 2.3 Test à 10 choix 35\u003cbr\u003e 2.4 Implémentation progressive 38\u003cbr\u003e 2.5 Traces de problèmes anormaux 40\u003cbr\u003e 2.6 Valeur initiale positive 42\u003cbr\u003e 2.7 Sélection de l'action de limite de confiance 44\u003cbr\u003e 2.8 Algorithme de sélection multiple par gradient 46\u003cbr\u003e 2.9 Recherche associée (choix multiple contextuel) 50\u003cbr\u003e 2.10 Résumé 51\u003cbr\u003e Références et faits historiques 54\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 03 Processus de décision markoviens finis 57\u003c\/b\u003e\u003cbr\u003e 3.1 Interface agent-environnement 58\u003cbr\u003e 3.2 Objectifs et récompenses 64\u003cbr\u003e 3.3 Récompenses et épisode 66\u003cbr\u003e 3.4 Notation unifiée pour les œuvres épisodiques et continues 69\u003cbr\u003e 3.5 Fonctions de politique et de valeur 70 \u003cbr\u003e3.6 Politique optimale et fonction de valeur optimale 76\u003cbr\u003e 3.7 Optimalité et approximation 82\u003cbr\u003e 3.8 Résumé 83\u003cbr\u003e Références et faits historiques 84\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 04 PROGRAMMATION DYNAMIQUE 89\u003c\/b\u003e\u003cbr\u003e 4.1 Évaluation des politiques (prévision) 90\u003cbr\u003e 4.2 Amélioration des politiques 94\u003cbr\u003e 4.3 Répétition de la politique 97\u003cbr\u003e 4.4 Valeur Répéter 100\u003cbr\u003e 4.5 Programmation dynamique asynchrone 103\u003cbr\u003e 4.6 Itération 104 de la politique généralisée\u003cbr\u003e 4.7 Efficacité de la programmation dynamique 106\u003cbr\u003e 4.8 Résumé 107\u003cbr\u003e Références et faits historiques 109\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 05 Méthodes de Monte Carlo 111\u003c\/b\u003e\u003cbr\u003e 5.1 Prévision par la méthode de Monte-Carlo 112\u003cbr\u003e 5.2 Estimation de la valeur d'action par la méthode de Monte Carlo 118\u003cbr\u003e 5.3 Contrôle Monte Carlo 119\u003cbr\u003e 5.4 Contrôle Monte Carlo sans exploration initiale 123\u003cbr\u003e 5.5 Prédiction des politiques inactives à l'aide de l'extraction d'importance 126\u003cbr\u003e 5.6 Implémentation progressive 133\u003cbr\u003e 5.7 Contrôle Monte Carlo inactif 135\u003cbr\u003e Méthode d'extraction d'importance tenant compte des remises 138\u003cbr\u003e 5.9 Méthode d'extraction de l'importance au niveau de la décision 139\u003cbr\u003e 5.10 Résumé 141\u003cbr\u003e Références et faits historiques 143\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 06 Apprentissage différentiel dans le temps 145\u003c\/b\u003e\u003cbr\u003e Prédiction TD 6.1 : 146\u003cbr\u003e 6.2 Avantages de la méthode de prédiction TD 150\u003cbr\u003e 6.3 Optimalité de TD(0) 153 \u003cbr\u003e6.4 Salsa : Contrôle TD actif de la politique 157\u003cbr\u003e 6.5 Q Apprentissage : Contrôle TD 160 de la politique inactive\u003cbr\u003e 6.6 Valeur attendue Salsa 162\u003cbr\u003e 6.7 Maximisation de la variance et apprentissage dual 163\u003cbr\u003e 6.8 Jeux, conditions d'après-match et autres cas particuliers 166\u003cbr\u003e 6.9 Résumé 168\u003cbr\u003e Références et faits historiques 169\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 07 Bootstrap en n étapes 171\u003c\/b\u003e\u003cbr\u003e 7.1 Prédiction TD en n étapes 172\u003cbr\u003e 7.2 salsa de niveau n 177\u003cbr\u003e 7.3 Apprentissage des politiques inactives à n étapes 179\u003cbr\u003e 7.4 Méthode pas à pas de prise de décision avec variables de contrôle 181\u003cbr\u003e 7.5 Apprentissage passif de politiques sans extraction d'importance : un algorithme d'augmentation d'arbres à n étapes 184\u003cbr\u003e 7.6 Algorithme d'intégration : Q(σ) en n étapes 187\u003cbr\u003e 7.7 Résumé 189\u003cbr\u003e Références et faits historiques 190\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 08 Planification et apprentissage à l'aide de méthodes tabulaires 191\u003c\/b\u003e\u003cbr\u003e 8.1 Modèles et plans 192\u003cbr\u003e 8.2 Dyna : Intégration de la planification, de l'action et de l'apprentissage 194\u003cbr\u003e 8.3 Lorsque le modèle est erroné 199\u003cbr\u003e 8.4 Traitement par lots prioritaire 202\u003cbr\u003e 8.5 Mises à jour attendues vs. Exemples de mises à jour 206\u003cbr\u003e 8.6 Échantillonnage de trajectoire 210\u003cbr\u003e 8.7 Programmation dynamique en temps réel 213\u003cbr\u003e 8.8 Planification au point de décision 217 \u003cbr\u003e8.9 Exploration empirique 219\u003cbr\u003e 8.10 Algorithme de lancer de dés 221\u003cbr\u003e 8.11 Recherche arborescente Monte Carlo 223\u003cbr\u003e 8.12 Résumé 227\u003cbr\u003e 8.13 Partie 1 Résumé : Dimension 228\u003cbr\u003e Références et faits historiques 231\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE II Solutions approximatives\u003c\/b\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 09 Prédiction active des politiques par approximation 237\u003c\/b\u003e\u003cbr\u003e 9.1 Approximation de la fonction valeur 238\u003cbr\u003e 9.2 Objectifs prédictifs (VE) 239\u003cbr\u003e 9.3 Méthodes probabilistes du gradient et du semi-gradient 241\u003cbr\u003e 9.4 Méthodes linéaires 246\u003cbr\u003e 9.5 Création de fonctionnalités pour les méthodes linéaires 253\u003cbr\u003e 9.6 Sélection manuelle des paramètres d'intervalle de temps 268\u003cbr\u003e 9.7 Approximation de fonctions non linéaires : réseaux de neurones artificiels 269\u003cbr\u003e 9.8 Moindres carrés TD 275\u003cbr\u003e 9.9 Approximation de fonction basée sur la mémoire 278\u003cbr\u003e 9.10 Approximation de fonctions à noyau 280\u003cbr\u003e Analyse approfondie des enseignements tirés des politiques actives du 11 septembre : focus et accentuation 282\u003cbr\u003e 9.12 Résumé 285\u003cbr\u003e Références et faits historiques 286\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 10 Contrôle actif des politiques avec approximation 293\u003c\/b\u003e\u003cbr\u003e 10.1 Contrôle épisodique de semi-pente 294\u003cbr\u003e 10.2 Salsa 297 à demi-pente et niveau n\u003cbr\u003e 10.3 Récompense moyenne : Définition d’un nouveau problème pour les tâches continues 300 \u003cbr\u003e10.4 Opposition aux réglages à prix réduit 304\u003cbr\u003e 10.5 Salsa différentielle à demi-pente et à n étapes 307\u003cbr\u003e 10.6 Résumé 308\u003cbr\u003e Références et faits historiques 308\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 11 : Méthodes de politique inactive utilisant l'approximation 311\u003c\/b\u003e\u003cbr\u003e 11.1 Méthode de la demi-pente 312\u003cbr\u003e 11.2 Exemple d'émission de politique inactive 315\u003cbr\u003e 11.3 Trinité Mortelle 320\u003cbr\u003e 11.4 Géométrie des fonctions linéaires 322\u003cbr\u003e 11.5 Descente de pente dans Bellman Erreur 327\u003cbr\u003e 11.6 L'erreur de Bellman ne peut être apprise 332\u003cbr\u003e 11.7 Méthode TD du gradient 337\u003cbr\u003e 11.8 Méthode TD forte 341\u003cbr\u003e 11.9 Réduction de la variance 343\u003cbr\u003e 11.10 Résumé 345\u003cbr\u003e Références et faits historiques 346\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 12 Traces admissibles 349\u003c\/b\u003e\u003cbr\u003e 12,1 λ gain 350\u003cbr\u003e 12.2 TD(λ) 355\u003cbr\u003e 12.3 Méthode de gain λ à n étapes interrompues 359\u003cbr\u003e 12.4 Mise à jour : Algorithme de gain λ en ligne 361\u003cbr\u003e 12,5 True Online TD(λ) 363\u003cbr\u003e 12.6 Traces néerlandaises dans l'apprentissage Monte Carlo 366\u003cbr\u003e 12.7 Salsa (λ) 368\u003cbr\u003e 12.8 Variables λ et γ 372\u003cbr\u003e 12.9 Traces de stratégie inactives avec variables de contrôle 374\u003cbr\u003e 12.10 De Q(λ) de Watkins à l'augmentation d'arbres (λ) 378 \u003cbr\u003e12.11 Méthode de politique d'inactivité stable utilisant des traces 381\u003cbr\u003e 12.12 Problème d'implémentation 383\u003cbr\u003e 12.13 Conclusion 384\u003cbr\u003e Références et faits historiques 386\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 13 Méthodes de gradient de politique 389\u003c\/b\u003e\u003cbr\u003e 13.1 Approximation des politiques et ses avantages 390\u003cbr\u003e 13.2 Résumé du gradient de politique 393\u003cbr\u003e 13.3 RENFORCEMENT : Gradient de politique Monte Carlo 395\u003cbr\u003e 13.4 RENFORCEMENT 399 avec valeurs de référence\u003cbr\u003e 13.5 La méthode du critique-acteur 401\u003cbr\u003e 13.6 Gradients de politique pour les problèmes continus 403\u003cbr\u003e 13.7 Paramétrage des politiques pour les actions continues 406\u003cbr\u003e 13.8 Résumé 408\u003cbr\u003e Références et faits historiques 409\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE III : UNE FOUILLE PLUS PROFONDE\u003c\/b\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 14 Psychologie 413\u003c\/b\u003e\u003cbr\u003e 14.1 Prédiction et contrôle 414\u003cbr\u003e 14.2 Conditionnement classique 416\u003cbr\u003e 14.3 Conditionnement instrumental 433\u003cbr\u003e 14.4 Renforcement différé 438\u003cbr\u003e 14.5 Carte cognitive 440\u003cbr\u003e 14.6 Comportement habituel et orienté vers un but 442\u003cbr\u003e 14.7 Résumé 447\u003cbr\u003e Références et faits historiques 449\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 15 : NEUROSCIENCES 457\u003c\/b\u003e\u003cbr\u003e 15.1 Fondements des neurosciences 458\u003cbr\u003e 15.2 Signaux de récompense, signaux de renforcement, valeur et erreur de prédiction 460\u003cbr\u003e 15.3 Hypothèse d'erreur de prédiction de récompense 463 \u003cbr\u003e15,4 Dopamine 465\u003cbr\u003e 15.5 Preuves expérimentales en faveur de l'hypothèse d'erreur de prédiction de la récompense 469\u003cbr\u003e 15,6 TD erreur\/similarité dopamine 473\u003cbr\u003e 15.7 Neurobehavior-Critic 479\u003cbr\u003e 15.8 Règles d'apprentissage du faiseur et du critique 482\u003cbr\u003e 15.9 Neurones hédonistes 488\u003cbr\u003e 15.10 Apprentissage par renforcement collectif 490\u003cbr\u003e 15.11 Méthodes basées sur des modèles dans le cerveau 494\u003cbr\u003e 15.12 Dépendance 496\u003cbr\u003e 15.13 Résumé 497\u003cbr\u003e Références et faits historiques 501\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 16 Applications et études de cas 511\u003c\/b\u003e\u003cbr\u003e 16.1 TD-Garmon 511\u003cbr\u003e 16.2 Joueur de dames de Samuel 518\u003cbr\u003e 16.3 Pari double de Watson 522\u003cbr\u003e 16.4 Optimisation du contrôle de la mémoire 526\u003cbr\u003e 16,5 Compétences en jeux vidéo de niveau humain 531\u003cbr\u003e 16.6 Maîtriser le jeu de Baduk 539\u003cbr\u003e 16.7 Services Web personnalisés 550\u003cbr\u003e 16,8 Fièvre Hausse 554\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 17 Frontière 559\u003c\/b\u003e\u003cbr\u003e 17.1 Fonctions de valeur générales et opérations auxiliaires 559\u003cbr\u003e 17.2 Abstraction temporelle par le biais des options 562\u003cbr\u003e 17.3 Observations et conditions 565\u003cbr\u003e 17.4 Conception du signal de compensation 572\u003cbr\u003e 17.5 Problèmes restants 576\u003cbr\u003e 17.6 L'avenir de l'intelligence artificielle 580\u003cbr\u003e Références et faits historiques 584\u003cbr\u003e\u003cbr\u003e Référence 588\u003cbr\u003e Recherche 626\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e  \u003ch5\u003e\n\u003cb\u003eImage détaillée\u003c\/b\u003e \u003c\/h5\u003e\n\u003c\/div\u003e\n\u003cdiv\u003e\u003cdiv\u003e\u003cimg src=\"https:\/\/image.yes24.com\/momo\/TopCate2997\/MidCate009\/299683116(1).jpg\" border=\"0\" alt=\"Image détaillée 1\"\u003e\u003c\/div\u003e\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eDans le livre\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e La technologie de l'intelligence artificielle a énormément progressé au cours des 20 années écoulées depuis la première publication de ce livre en 1998.\u003cbr\u003e Les progrès réalisés dans le domaine des technologies d'apprentissage automatique, notamment l'apprentissage par renforcement, ont donné une impulsion majeure au développement de l'intelligence artificielle.\u003cbr\u003e Si les progrès de la technologie d'apprentissage automatique sont en partie dus à l'augmentation remarquable de la puissance de calcul des ordinateurs, le développement de nouvelles théories et de nouveaux algorithmes a également joué un rôle important.\u003cbr\u003e Malgré ces changements, la réalisation de la deuxième édition de cet ouvrage a été longtemps retardée et n'a pu commencer qu'en 2012.\u003cbr\u003e L’objectif de cette deuxième édition est identique à celui de la première publication de cet ouvrage.\u003cbr\u003e L’objectif est donc de permettre aux lecteurs de tous les domaines concernés de comprendre facilement et clairement les concepts et algorithmes fondamentaux de l’apprentissage par renforcement.\u003cbr\u003e --- Extrait de la « Préface »\u003cbr\u003e\u003cbr\u003e Considérons le problème d'apprentissage suivant : \u003cbr\u003eVous devez choisir à plusieurs reprises l'une des k options ou actions différentes.\u003cbr\u003e Après chaque sélection, une récompense numérique est attribuée.\u003cbr\u003e À ce moment-là, la valeur représentant la récompense est obtenue à partir d'une distribution de probabilité stationnaire (une distribution de probabilité qui ne change pas au fil du temps_translator) déterminée en fonction de l'action sélectionnée.\u003cbr\u003e L'objectif de la sélection est de maximiser la valeur attendue du montant total de la récompense accordée sur une période donnée, par exemple, sur la période de sélection d'actions 1 000 fois ou sur 1 000 étapes temporelles.\u003cbr\u003e --- p.32\u003cbr\u003e\u003cbr\u003e Une autre réponse raisonnable consiste simplement à observer que nous avons rencontré l'état A une fois et que le gain résultant était nul, donc nous estimons que la valeur de V(A) est nulle.\u003cbr\u003e Cette réponse est donnée par la méthode de Monte Carlo par lots.\u003cbr\u003e Notez que cette réponse donne l'erreur des moindres carrés pour les données d'entraînement. \u003cbr\u003eEn fait, cette réponse donne une erreur de 0 sur les données d'entraînement.\u003cbr\u003e --- p.155\u003cbr\u003e\u003cbr\u003e Le surapprentissage est un problème inhérent à toutes les méthodes d'approximation de fonctions qui possèdent de nombreux degrés de liberté et qui ajustent une fonction à partir de données d'entraînement limitées.\u003cbr\u003e Bien que ce problème soit moins prononcé dans l'apprentissage par renforcement en ligne, qui n'est pas limité par des données d'entraînement restreintes, la généralisation efficace reste un enjeu crucial.\u003cbr\u003e Le surapprentissage est un problème général des réseaux de neurones artificiels, mais il devient plus grave avec les réseaux de neurones artificiels profonds en raison de leur tendance à avoir un très grand nombre de poids.\u003cbr\u003e --- p.272\u003cbr\u003e\u003cbr\u003e Contrairement aux modèles en phase d'essai tels que le modèle Rescorla-Wagner, le modèle TD est un modèle en temps réel. \u003cbr\u003eDans le modèle de Rescorla-Wagner, une étape t représente un essai de conditionnement complet. Le modèle TD ne tient pas compte des détails de ce qui se passe pendant un essai de conditionnement ni entre les essais.\u003cbr\u003e Au cours de chaque essai de conditionnement, l'animal peut être exposé à différents stimuli survenant à des moments précis et pendant des périodes de temps spécifiques.\u003cbr\u003e\n\n\u003c\/div\u003e\n\u003cdiv\u003e --- p.423\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eAvis de l'éditeur\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e \u003cb\u003eLa bible absolue de l'apprentissage par renforcement, révisée pour la première fois en 20 ans avec un contenu considérablement enrichi !\u003cbr\u003e Comprenez les concepts fondamentaux et les algorithmes les plus récents de l'apprentissage par renforcement de manière simple et claire !\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain. \u003cbr\u003eDans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.\u003cbr\u003e Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.\u003cbr\u003e\u003cbr\u003e Comme la première édition, la deuxième édition se concentre sur les algorithmes d'apprentissage en ligne fondamentaux, mais inclut davantage de contenu mathématique dans des encadrés séparés.\u003cbr\u003e Ce livre est globalement divisé en trois parties :\u003cbr\u003e\u003cbr\u003e ■ Dans la première partie, nous avons abordé autant de méthodes d'apprentissage par renforcement que possible, en appliquant uniquement des méthodes basées sur des tableaux qui peuvent trouver des solutions précises.\u003cbr\u003e De nombreux algorithmes présentés dans la première partie sont nouveaux dans la deuxième édition, notamment UCB, Expected Value Salsa et Dual Learning. \u003cbr\u003e■ Dans la deuxième partie, les méthodes présentées dans la première partie sont étendues aux méthodes basées sur l'approximation de fonctions, avec de nouvelles sections couvrant des sujets tels que les réseaux neuronaux artificiels et les méthodes basées sur Fourier, et le contenu sur l'apprentissage de politiques inactives et les méthodes de gradient de politique est enrichi.\u003cbr\u003e ■ La troisième partie comprend de nouveaux chapitres sur la façon dont l'apprentissage par renforcement est lié à la psychologie et aux neurosciences, ainsi que des chapitres mis à jour sur des études de cas telles que AlphaGo et AlphaGo Zero, les jeux Atari et les stratégies de paris d'IBM Watson.\u003cbr\u003e Dans le dernier chapitre, nous avons abordé l'impact de l'apprentissage par renforcement sur la société future. \u003cbr\u003e\n\n\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e SPÉCIFICATIONS DES PRODUITS \u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;font-size:14px;line-height:1.6em;\"\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eDate de publication :\u003c\/strong\u003e 31 mars 2020\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e \u003cstrong\u003eNombre de pages, poids, dimensions :\u003c\/strong\u003e 664 pages | 1 290 g | 188 × 245 × 33 mm\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN13 :\u003c\/strong\u003e 9791190665179\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN10 :\u003c\/strong\u003e 1190665174 \u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cspan\u003e\u003c\/span\u003e\n\n\u003c\/center\u003e\n\n\n\u003c\/center\u003e","brand":"LIBRAIRIE COREENNE","offers":[{"title":"Default Title","offer_id":43893206057002,"sku":"138156","price":51.0,"currency_code":"EUR","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0683\/2750\/5962\/files\/7f0db25de1bd521544a455703f76a69d.jpg?v=1765391912","url":"https:\/\/librairie.coreenne.fr\/products\/138156","provider":"LIBRAIRIE COREENNE","version":"1.0","type":"link"}