
Apprentissage par renforcement robuste
Description
Introduction au livre
La bible absolue de l'apprentissage par renforcement, révisée pour la première fois en 20 ans avec un contenu considérablement enrichi !
L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain.
Dans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.
Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.
L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain.
Dans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.
Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
CHAPITRE 01 Introduction 1
1.1 Apprentissage par renforcement 2
1.2 Exemple 5
1.3 Composantes de l'apprentissage par renforcement 7
1.4 Limitations et portée 9
1.5 Exemple étendu : Tic-Tac-Toe 10
1.6 Résumé 16
1.7 Histoire ancienne de l'apprentissage par renforcement 17
Référence 27
PARTIE I Solutions sous forme de tableau
CHAPITRE 02 Questions à choix multiples 31
2.1 Problème à choix multiple 32
2.2 Méthode de la valeur comportementale 34
2.3 Test à 10 choix 35
2.4 Implémentation progressive 38
2.5 Traces de problèmes anormaux 40
2.6 Valeur initiale positive 42
2.7 Sélection de l'action de limite de confiance 44
2.8 Algorithme de sélection multiple par gradient 46
2.9 Recherche associée (choix multiple contextuel) 50
2.10 Résumé 51
Références et faits historiques 54
CHAPITRE 03 Processus de décision markoviens finis 57
3.1 Interface agent-environnement 58
3.2 Objectifs et récompenses 64
3.3 Récompenses et épisode 66
3.4 Notation unifiée pour les œuvres épisodiques et continues 69
3.5 Fonctions de politique et de valeur 70
3.6 Politique optimale et fonction de valeur optimale 76
3.7 Optimalité et approximation 82
3.8 Résumé 83
Références et faits historiques 84
CHAPITRE 04 PROGRAMMATION DYNAMIQUE 89
4.1 Évaluation des politiques (prévision) 90
4.2 Amélioration des politiques 94
4.3 Répétition de la politique 97
4.4 Valeur Répéter 100
4.5 Programmation dynamique asynchrone 103
4.6 Itération 104 de la politique généralisée
4.7 Efficacité de la programmation dynamique 106
4.8 Résumé 107
Références et faits historiques 109
CHAPITRE 05 Méthodes de Monte Carlo 111
5.1 Prévision par la méthode de Monte-Carlo 112
5.2 Estimation de la valeur d'action par la méthode de Monte Carlo 118
5.3 Contrôle Monte Carlo 119
5.4 Contrôle Monte Carlo sans exploration initiale 123
5.5 Prédiction des politiques inactives à l'aide de l'extraction d'importance 126
5.6 Implémentation progressive 133
5.7 Contrôle Monte Carlo inactif 135
Méthode d'extraction d'importance tenant compte des remises 138
5.9 Méthode d'extraction de l'importance au niveau de la décision 139
5.10 Résumé 141
Références et faits historiques 143
CHAPITRE 06 Apprentissage différentiel dans le temps 145
Prédiction TD 6.1 : 146
6.2 Avantages de la méthode de prédiction TD 150
6.3 Optimalité de TD(0) 153
6.4 Salsa : Contrôle TD actif de la politique 157
6.5 Q Apprentissage : Contrôle TD 160 de la politique inactive
6.6 Valeur attendue Salsa 162
6.7 Maximisation de la variance et apprentissage dual 163
6.8 Jeux, conditions d'après-match et autres cas particuliers 166
6.9 Résumé 168
Références et faits historiques 169
CHAPITRE 07 Bootstrap en n étapes 171
7.1 Prédiction TD en n étapes 172
7.2 salsa de niveau n 177
7.3 Apprentissage des politiques inactives à n étapes 179
7.4 Méthode pas à pas de prise de décision avec variables de contrôle 181
7.5 Apprentissage passif de politiques sans extraction d'importance : un algorithme d'augmentation d'arbres à n étapes 184
7.6 Algorithme d'intégration : Q(σ) en n étapes 187
7.7 Résumé 189
Références et faits historiques 190
CHAPITRE 08 Planification et apprentissage à l'aide de méthodes tabulaires 191
8.1 Modèles et plans 192
8.2 Dyna : Intégration de la planification, de l'action et de l'apprentissage 194
8.3 Lorsque le modèle est erroné 199
8.4 Traitement par lots prioritaire 202
8.5 Mises à jour attendues vs. Exemples de mises à jour 206
8.6 Échantillonnage de trajectoire 210
8.7 Programmation dynamique en temps réel 213
8.8 Planification au point de décision 217
8.9 Exploration empirique 219
8.10 Algorithme de lancer de dés 221
8.11 Recherche arborescente Monte Carlo 223
8.12 Résumé 227
8.13 Partie 1 Résumé : Dimension 228
Références et faits historiques 231
PARTIE II Solutions approximatives
CHAPITRE 09 Prédiction active des politiques par approximation 237
9.1 Approximation de la fonction valeur 238
9.2 Objectifs prédictifs (VE) 239
9.3 Méthodes probabilistes du gradient et du semi-gradient 241
9.4 Méthodes linéaires 246
9.5 Création de fonctionnalités pour les méthodes linéaires 253
9.6 Sélection manuelle des paramètres d'intervalle de temps 268
9.7 Approximation de fonctions non linéaires : réseaux de neurones artificiels 269
9.8 Moindres carrés TD 275
9.9 Approximation de fonction basée sur la mémoire 278
9.10 Approximation de fonctions à noyau 280
Analyse approfondie des enseignements tirés des politiques actives du 11 septembre : focus et accentuation 282
9.12 Résumé 285
Références et faits historiques 286
CHAPITRE 10 Contrôle actif des politiques avec approximation 293
10.1 Contrôle épisodique de semi-pente 294
10.2 Salsa 297 à demi-pente et niveau n
10.3 Récompense moyenne : Définition d’un nouveau problème pour les tâches continues 300
10.4 Opposition aux réglages à prix réduit 304
10.5 Salsa différentielle à demi-pente et à n étapes 307
10.6 Résumé 308
Références et faits historiques 308
CHAPITRE 11 : Méthodes de politique inactive utilisant l'approximation 311
11.1 Méthode de la demi-pente 312
11.2 Exemple d'émission de politique inactive 315
11.3 Trinité Mortelle 320
11.4 Géométrie des fonctions linéaires 322
11.5 Descente de pente dans Bellman Erreur 327
11.6 L'erreur de Bellman ne peut être apprise 332
11.7 Méthode TD du gradient 337
11.8 Méthode TD forte 341
11.9 Réduction de la variance 343
11.10 Résumé 345
Références et faits historiques 346
CHAPITRE 12 Traces admissibles 349
12,1 λ gain 350
12.2 TD(λ) 355
12.3 Méthode de gain λ à n étapes interrompues 359
12.4 Mise à jour : Algorithme de gain λ en ligne 361
12,5 True Online TD(λ) 363
12.6 Traces néerlandaises dans l'apprentissage Monte Carlo 366
12.7 Salsa (λ) 368
12.8 Variables λ et γ 372
12.9 Traces de stratégie inactives avec variables de contrôle 374
12.10 De Q(λ) de Watkins à l'augmentation d'arbres (λ) 378
12.11 Méthode de politique d'inactivité stable utilisant des traces 381
12.12 Problème d'implémentation 383
12.13 Conclusion 384
Références et faits historiques 386
CHAPITRE 13 Méthodes de gradient de politique 389
13.1 Approximation des politiques et ses avantages 390
13.2 Résumé du gradient de politique 393
13.3 RENFORCEMENT : Gradient de politique Monte Carlo 395
13.4 RENFORCEMENT 399 avec valeurs de référence
13.5 La méthode du critique-acteur 401
13.6 Gradients de politique pour les problèmes continus 403
13.7 Paramétrage des politiques pour les actions continues 406
13.8 Résumé 408
Références et faits historiques 409
PARTIE III : UNE FOUILLE PLUS PROFONDE
CHAPITRE 14 Psychologie 413
14.1 Prédiction et contrôle 414
14.2 Conditionnement classique 416
14.3 Conditionnement instrumental 433
14.4 Renforcement différé 438
14.5 Carte cognitive 440
14.6 Comportement habituel et orienté vers un but 442
14.7 Résumé 447
Références et faits historiques 449
CHAPITRE 15 : NEUROSCIENCES 457
15.1 Fondements des neurosciences 458
15.2 Signaux de récompense, signaux de renforcement, valeur et erreur de prédiction 460
15.3 Hypothèse d'erreur de prédiction de récompense 463
15,4 Dopamine 465
15.5 Preuves expérimentales en faveur de l'hypothèse d'erreur de prédiction de la récompense 469
15,6 TD erreur/similarité dopamine 473
15.7 Neurobehavior-Critic 479
15.8 Règles d'apprentissage du faiseur et du critique 482
15.9 Neurones hédonistes 488
15.10 Apprentissage par renforcement collectif 490
15.11 Méthodes basées sur des modèles dans le cerveau 494
15.12 Dépendance 496
15.13 Résumé 497
Références et faits historiques 501
CHAPITRE 16 Applications et études de cas 511
16.1 TD-Garmon 511
16.2 Joueur de dames de Samuel 518
16.3 Pari double de Watson 522
16.4 Optimisation du contrôle de la mémoire 526
16,5 Compétences en jeux vidéo de niveau humain 531
16.6 Maîtriser le jeu de Baduk 539
16.7 Services Web personnalisés 550
16,8 Fièvre Hausse 554
CHAPITRE 17 Frontière 559
17.1 Fonctions de valeur générales et opérations auxiliaires 559
17.2 Abstraction temporelle par le biais des options 562
17.3 Observations et conditions 565
17.4 Conception du signal de compensation 572
17.5 Problèmes restants 576
17.6 L'avenir de l'intelligence artificielle 580
Références et faits historiques 584
Référence 588
Recherche 626
1.1 Apprentissage par renforcement 2
1.2 Exemple 5
1.3 Composantes de l'apprentissage par renforcement 7
1.4 Limitations et portée 9
1.5 Exemple étendu : Tic-Tac-Toe 10
1.6 Résumé 16
1.7 Histoire ancienne de l'apprentissage par renforcement 17
Référence 27
PARTIE I Solutions sous forme de tableau
CHAPITRE 02 Questions à choix multiples 31
2.1 Problème à choix multiple 32
2.2 Méthode de la valeur comportementale 34
2.3 Test à 10 choix 35
2.4 Implémentation progressive 38
2.5 Traces de problèmes anormaux 40
2.6 Valeur initiale positive 42
2.7 Sélection de l'action de limite de confiance 44
2.8 Algorithme de sélection multiple par gradient 46
2.9 Recherche associée (choix multiple contextuel) 50
2.10 Résumé 51
Références et faits historiques 54
CHAPITRE 03 Processus de décision markoviens finis 57
3.1 Interface agent-environnement 58
3.2 Objectifs et récompenses 64
3.3 Récompenses et épisode 66
3.4 Notation unifiée pour les œuvres épisodiques et continues 69
3.5 Fonctions de politique et de valeur 70
3.6 Politique optimale et fonction de valeur optimale 76
3.7 Optimalité et approximation 82
3.8 Résumé 83
Références et faits historiques 84
CHAPITRE 04 PROGRAMMATION DYNAMIQUE 89
4.1 Évaluation des politiques (prévision) 90
4.2 Amélioration des politiques 94
4.3 Répétition de la politique 97
4.4 Valeur Répéter 100
4.5 Programmation dynamique asynchrone 103
4.6 Itération 104 de la politique généralisée
4.7 Efficacité de la programmation dynamique 106
4.8 Résumé 107
Références et faits historiques 109
CHAPITRE 05 Méthodes de Monte Carlo 111
5.1 Prévision par la méthode de Monte-Carlo 112
5.2 Estimation de la valeur d'action par la méthode de Monte Carlo 118
5.3 Contrôle Monte Carlo 119
5.4 Contrôle Monte Carlo sans exploration initiale 123
5.5 Prédiction des politiques inactives à l'aide de l'extraction d'importance 126
5.6 Implémentation progressive 133
5.7 Contrôle Monte Carlo inactif 135
Méthode d'extraction d'importance tenant compte des remises 138
5.9 Méthode d'extraction de l'importance au niveau de la décision 139
5.10 Résumé 141
Références et faits historiques 143
CHAPITRE 06 Apprentissage différentiel dans le temps 145
Prédiction TD 6.1 : 146
6.2 Avantages de la méthode de prédiction TD 150
6.3 Optimalité de TD(0) 153
6.4 Salsa : Contrôle TD actif de la politique 157
6.5 Q Apprentissage : Contrôle TD 160 de la politique inactive
6.6 Valeur attendue Salsa 162
6.7 Maximisation de la variance et apprentissage dual 163
6.8 Jeux, conditions d'après-match et autres cas particuliers 166
6.9 Résumé 168
Références et faits historiques 169
CHAPITRE 07 Bootstrap en n étapes 171
7.1 Prédiction TD en n étapes 172
7.2 salsa de niveau n 177
7.3 Apprentissage des politiques inactives à n étapes 179
7.4 Méthode pas à pas de prise de décision avec variables de contrôle 181
7.5 Apprentissage passif de politiques sans extraction d'importance : un algorithme d'augmentation d'arbres à n étapes 184
7.6 Algorithme d'intégration : Q(σ) en n étapes 187
7.7 Résumé 189
Références et faits historiques 190
CHAPITRE 08 Planification et apprentissage à l'aide de méthodes tabulaires 191
8.1 Modèles et plans 192
8.2 Dyna : Intégration de la planification, de l'action et de l'apprentissage 194
8.3 Lorsque le modèle est erroné 199
8.4 Traitement par lots prioritaire 202
8.5 Mises à jour attendues vs. Exemples de mises à jour 206
8.6 Échantillonnage de trajectoire 210
8.7 Programmation dynamique en temps réel 213
8.8 Planification au point de décision 217
8.9 Exploration empirique 219
8.10 Algorithme de lancer de dés 221
8.11 Recherche arborescente Monte Carlo 223
8.12 Résumé 227
8.13 Partie 1 Résumé : Dimension 228
Références et faits historiques 231
PARTIE II Solutions approximatives
CHAPITRE 09 Prédiction active des politiques par approximation 237
9.1 Approximation de la fonction valeur 238
9.2 Objectifs prédictifs (VE) 239
9.3 Méthodes probabilistes du gradient et du semi-gradient 241
9.4 Méthodes linéaires 246
9.5 Création de fonctionnalités pour les méthodes linéaires 253
9.6 Sélection manuelle des paramètres d'intervalle de temps 268
9.7 Approximation de fonctions non linéaires : réseaux de neurones artificiels 269
9.8 Moindres carrés TD 275
9.9 Approximation de fonction basée sur la mémoire 278
9.10 Approximation de fonctions à noyau 280
Analyse approfondie des enseignements tirés des politiques actives du 11 septembre : focus et accentuation 282
9.12 Résumé 285
Références et faits historiques 286
CHAPITRE 10 Contrôle actif des politiques avec approximation 293
10.1 Contrôle épisodique de semi-pente 294
10.2 Salsa 297 à demi-pente et niveau n
10.3 Récompense moyenne : Définition d’un nouveau problème pour les tâches continues 300
10.4 Opposition aux réglages à prix réduit 304
10.5 Salsa différentielle à demi-pente et à n étapes 307
10.6 Résumé 308
Références et faits historiques 308
CHAPITRE 11 : Méthodes de politique inactive utilisant l'approximation 311
11.1 Méthode de la demi-pente 312
11.2 Exemple d'émission de politique inactive 315
11.3 Trinité Mortelle 320
11.4 Géométrie des fonctions linéaires 322
11.5 Descente de pente dans Bellman Erreur 327
11.6 L'erreur de Bellman ne peut être apprise 332
11.7 Méthode TD du gradient 337
11.8 Méthode TD forte 341
11.9 Réduction de la variance 343
11.10 Résumé 345
Références et faits historiques 346
CHAPITRE 12 Traces admissibles 349
12,1 λ gain 350
12.2 TD(λ) 355
12.3 Méthode de gain λ à n étapes interrompues 359
12.4 Mise à jour : Algorithme de gain λ en ligne 361
12,5 True Online TD(λ) 363
12.6 Traces néerlandaises dans l'apprentissage Monte Carlo 366
12.7 Salsa (λ) 368
12.8 Variables λ et γ 372
12.9 Traces de stratégie inactives avec variables de contrôle 374
12.10 De Q(λ) de Watkins à l'augmentation d'arbres (λ) 378
12.11 Méthode de politique d'inactivité stable utilisant des traces 381
12.12 Problème d'implémentation 383
12.13 Conclusion 384
Références et faits historiques 386
CHAPITRE 13 Méthodes de gradient de politique 389
13.1 Approximation des politiques et ses avantages 390
13.2 Résumé du gradient de politique 393
13.3 RENFORCEMENT : Gradient de politique Monte Carlo 395
13.4 RENFORCEMENT 399 avec valeurs de référence
13.5 La méthode du critique-acteur 401
13.6 Gradients de politique pour les problèmes continus 403
13.7 Paramétrage des politiques pour les actions continues 406
13.8 Résumé 408
Références et faits historiques 409
PARTIE III : UNE FOUILLE PLUS PROFONDE
CHAPITRE 14 Psychologie 413
14.1 Prédiction et contrôle 414
14.2 Conditionnement classique 416
14.3 Conditionnement instrumental 433
14.4 Renforcement différé 438
14.5 Carte cognitive 440
14.6 Comportement habituel et orienté vers un but 442
14.7 Résumé 447
Références et faits historiques 449
CHAPITRE 15 : NEUROSCIENCES 457
15.1 Fondements des neurosciences 458
15.2 Signaux de récompense, signaux de renforcement, valeur et erreur de prédiction 460
15.3 Hypothèse d'erreur de prédiction de récompense 463
15,4 Dopamine 465
15.5 Preuves expérimentales en faveur de l'hypothèse d'erreur de prédiction de la récompense 469
15,6 TD erreur/similarité dopamine 473
15.7 Neurobehavior-Critic 479
15.8 Règles d'apprentissage du faiseur et du critique 482
15.9 Neurones hédonistes 488
15.10 Apprentissage par renforcement collectif 490
15.11 Méthodes basées sur des modèles dans le cerveau 494
15.12 Dépendance 496
15.13 Résumé 497
Références et faits historiques 501
CHAPITRE 16 Applications et études de cas 511
16.1 TD-Garmon 511
16.2 Joueur de dames de Samuel 518
16.3 Pari double de Watson 522
16.4 Optimisation du contrôle de la mémoire 526
16,5 Compétences en jeux vidéo de niveau humain 531
16.6 Maîtriser le jeu de Baduk 539
16.7 Services Web personnalisés 550
16,8 Fièvre Hausse 554
CHAPITRE 17 Frontière 559
17.1 Fonctions de valeur générales et opérations auxiliaires 559
17.2 Abstraction temporelle par le biais des options 562
17.3 Observations et conditions 565
17.4 Conception du signal de compensation 572
17.5 Problèmes restants 576
17.6 L'avenir de l'intelligence artificielle 580
Références et faits historiques 584
Référence 588
Recherche 626
Image détaillée
.jpg)
Dans le livre
La technologie de l'intelligence artificielle a énormément progressé au cours des 20 années écoulées depuis la première publication de ce livre en 1998.
Les progrès réalisés dans le domaine des technologies d'apprentissage automatique, notamment l'apprentissage par renforcement, ont donné une impulsion majeure au développement de l'intelligence artificielle.
Si les progrès de la technologie d'apprentissage automatique sont en partie dus à l'augmentation remarquable de la puissance de calcul des ordinateurs, le développement de nouvelles théories et de nouveaux algorithmes a également joué un rôle important.
Malgré ces changements, la réalisation de la deuxième édition de cet ouvrage a été longtemps retardée et n'a pu commencer qu'en 2012.
L’objectif de cette deuxième édition est identique à celui de la première publication de cet ouvrage.
L’objectif est donc de permettre aux lecteurs de tous les domaines concernés de comprendre facilement et clairement les concepts et algorithmes fondamentaux de l’apprentissage par renforcement.
--- Extrait de la « Préface »
Considérons le problème d'apprentissage suivant :
Vous devez choisir à plusieurs reprises l'une des k options ou actions différentes.
Après chaque sélection, une récompense numérique est attribuée.
À ce moment-là, la valeur représentant la récompense est obtenue à partir d'une distribution de probabilité stationnaire (une distribution de probabilité qui ne change pas au fil du temps_translator) déterminée en fonction de l'action sélectionnée.
L'objectif de la sélection est de maximiser la valeur attendue du montant total de la récompense accordée sur une période donnée, par exemple, sur la période de sélection d'actions 1 000 fois ou sur 1 000 étapes temporelles.
--- p.32
Une autre réponse raisonnable consiste simplement à observer que nous avons rencontré l'état A une fois et que le gain résultant était nul, donc nous estimons que la valeur de V(A) est nulle.
Cette réponse est donnée par la méthode de Monte Carlo par lots.
Notez que cette réponse donne l'erreur des moindres carrés pour les données d'entraînement.
En fait, cette réponse donne une erreur de 0 sur les données d'entraînement.
--- p.155
Le surapprentissage est un problème inhérent à toutes les méthodes d'approximation de fonctions qui possèdent de nombreux degrés de liberté et qui ajustent une fonction à partir de données d'entraînement limitées.
Bien que ce problème soit moins prononcé dans l'apprentissage par renforcement en ligne, qui n'est pas limité par des données d'entraînement restreintes, la généralisation efficace reste un enjeu crucial.
Le surapprentissage est un problème général des réseaux de neurones artificiels, mais il devient plus grave avec les réseaux de neurones artificiels profonds en raison de leur tendance à avoir un très grand nombre de poids.
--- p.272
Contrairement aux modèles en phase d'essai tels que le modèle Rescorla-Wagner, le modèle TD est un modèle en temps réel.
Dans le modèle de Rescorla-Wagner, une étape t représente un essai de conditionnement complet. Le modèle TD ne tient pas compte des détails de ce qui se passe pendant un essai de conditionnement ni entre les essais.
Au cours de chaque essai de conditionnement, l'animal peut être exposé à différents stimuli survenant à des moments précis et pendant des périodes de temps spécifiques.
Les progrès réalisés dans le domaine des technologies d'apprentissage automatique, notamment l'apprentissage par renforcement, ont donné une impulsion majeure au développement de l'intelligence artificielle.
Si les progrès de la technologie d'apprentissage automatique sont en partie dus à l'augmentation remarquable de la puissance de calcul des ordinateurs, le développement de nouvelles théories et de nouveaux algorithmes a également joué un rôle important.
Malgré ces changements, la réalisation de la deuxième édition de cet ouvrage a été longtemps retardée et n'a pu commencer qu'en 2012.
L’objectif de cette deuxième édition est identique à celui de la première publication de cet ouvrage.
L’objectif est donc de permettre aux lecteurs de tous les domaines concernés de comprendre facilement et clairement les concepts et algorithmes fondamentaux de l’apprentissage par renforcement.
--- Extrait de la « Préface »
Considérons le problème d'apprentissage suivant :
Vous devez choisir à plusieurs reprises l'une des k options ou actions différentes.
Après chaque sélection, une récompense numérique est attribuée.
À ce moment-là, la valeur représentant la récompense est obtenue à partir d'une distribution de probabilité stationnaire (une distribution de probabilité qui ne change pas au fil du temps_translator) déterminée en fonction de l'action sélectionnée.
L'objectif de la sélection est de maximiser la valeur attendue du montant total de la récompense accordée sur une période donnée, par exemple, sur la période de sélection d'actions 1 000 fois ou sur 1 000 étapes temporelles.
--- p.32
Une autre réponse raisonnable consiste simplement à observer que nous avons rencontré l'état A une fois et que le gain résultant était nul, donc nous estimons que la valeur de V(A) est nulle.
Cette réponse est donnée par la méthode de Monte Carlo par lots.
Notez que cette réponse donne l'erreur des moindres carrés pour les données d'entraînement.
En fait, cette réponse donne une erreur de 0 sur les données d'entraînement.
--- p.155
Le surapprentissage est un problème inhérent à toutes les méthodes d'approximation de fonctions qui possèdent de nombreux degrés de liberté et qui ajustent une fonction à partir de données d'entraînement limitées.
Bien que ce problème soit moins prononcé dans l'apprentissage par renforcement en ligne, qui n'est pas limité par des données d'entraînement restreintes, la généralisation efficace reste un enjeu crucial.
Le surapprentissage est un problème général des réseaux de neurones artificiels, mais il devient plus grave avec les réseaux de neurones artificiels profonds en raison de leur tendance à avoir un très grand nombre de poids.
--- p.272
Contrairement aux modèles en phase d'essai tels que le modèle Rescorla-Wagner, le modèle TD est un modèle en temps réel.
Dans le modèle de Rescorla-Wagner, une étape t représente un essai de conditionnement complet. Le modèle TD ne tient pas compte des détails de ce qui se passe pendant un essai de conditionnement ni entre les essais.
Au cours de chaque essai de conditionnement, l'animal peut être exposé à différents stimuli survenant à des moments précis et pendant des périodes de temps spécifiques.
--- p.423
Avis de l'éditeur
La bible absolue de l'apprentissage par renforcement, révisée pour la première fois en 20 ans avec un contenu considérablement enrichi !
Comprenez les concepts fondamentaux et les algorithmes les plus récents de l'apprentissage par renforcement de manière simple et claire !
L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain.
Dans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.
Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.
Comme la première édition, la deuxième édition se concentre sur les algorithmes d'apprentissage en ligne fondamentaux, mais inclut davantage de contenu mathématique dans des encadrés séparés.
Ce livre est globalement divisé en trois parties :
■ Dans la première partie, nous avons abordé autant de méthodes d'apprentissage par renforcement que possible, en appliquant uniquement des méthodes basées sur des tableaux qui peuvent trouver des solutions précises.
De nombreux algorithmes présentés dans la première partie sont nouveaux dans la deuxième édition, notamment UCB, Expected Value Salsa et Dual Learning.
■ Dans la deuxième partie, les méthodes présentées dans la première partie sont étendues aux méthodes basées sur l'approximation de fonctions, avec de nouvelles sections couvrant des sujets tels que les réseaux neuronaux artificiels et les méthodes basées sur Fourier, et le contenu sur l'apprentissage de politiques inactives et les méthodes de gradient de politique est enrichi.
■ La troisième partie comprend de nouveaux chapitres sur la façon dont l'apprentissage par renforcement est lié à la psychologie et aux neurosciences, ainsi que des chapitres mis à jour sur des études de cas telles que AlphaGo et AlphaGo Zero, les jeux Atari et les stratégies de paris d'IBM Watson.
Dans le dernier chapitre, nous avons abordé l'impact de l'apprentissage par renforcement sur la société future.
Comprenez les concepts fondamentaux et les algorithmes les plus récents de l'apprentissage par renforcement de manière simple et claire !
L’apprentissage par renforcement, l’un des domaines de recherche les plus actifs en intelligence artificielle, est une méthode d’apprentissage numérique qui maximise la récompense accordée à un apprenant interagissant avec un environnement complexe et incertain.
Dans leur ouvrage intitulé Robust Reinforcement Learning, Richard Sutton et Andrew Barto expliquent de manière claire et simple les concepts et algorithmes fondamentaux de l'apprentissage par renforcement.
Depuis la publication de la première édition, de nouveaux sujets ont été ajoutés et les sujets déjà traités ont été mis à jour avec les contenus les plus récents.
Comme la première édition, la deuxième édition se concentre sur les algorithmes d'apprentissage en ligne fondamentaux, mais inclut davantage de contenu mathématique dans des encadrés séparés.
Ce livre est globalement divisé en trois parties :
■ Dans la première partie, nous avons abordé autant de méthodes d'apprentissage par renforcement que possible, en appliquant uniquement des méthodes basées sur des tableaux qui peuvent trouver des solutions précises.
De nombreux algorithmes présentés dans la première partie sont nouveaux dans la deuxième édition, notamment UCB, Expected Value Salsa et Dual Learning.
■ Dans la deuxième partie, les méthodes présentées dans la première partie sont étendues aux méthodes basées sur l'approximation de fonctions, avec de nouvelles sections couvrant des sujets tels que les réseaux neuronaux artificiels et les méthodes basées sur Fourier, et le contenu sur l'apprentissage de politiques inactives et les méthodes de gradient de politique est enrichi.
■ La troisième partie comprend de nouveaux chapitres sur la façon dont l'apprentissage par renforcement est lié à la psychologie et aux neurosciences, ainsi que des chapitres mis à jour sur des études de cas telles que AlphaGo et AlphaGo Zero, les jeux Atari et les stratégies de paris d'IBM Watson.
Dans le dernier chapitre, nous avons abordé l'impact de l'apprentissage par renforcement sur la société future.
SPÉCIFICATIONS DES PRODUITS
- Date de publication : 31 mars 2020
Nombre de pages, poids, dimensions : 664 pages | 1 290 g | 188 × 245 × 33 mm
- ISBN13 : 9791190665179
- ISBN10 : 1190665174
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne