Passer aux informations sur le produit
Apprentissage par renforcement profond robuste
Apprentissage par renforcement profond robuste
Description
Introduction au livre
Le moyen idéal de se constituer une base solide en apprentissage par renforcement profond !

Ce livre est une introduction à l'apprentissage par renforcement profond qui combine de manière unique théorie et pratique.
Il commence par une explication intuitive, se poursuit par une explication détaillée des algorithmes d'apprentissage par renforcement profond et des méthodes d'implémentation utilisant la bibliothèque SLM Lab, et enfin aborde les détails de l'application pratique de l'apprentissage par renforcement profond.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
Préface du traducteur xii
Avis du lecteur bêta xiii
Recommandation xv
Début XVI
Remerciements xxi

CHAPITRE 01 Introduction à l'apprentissage par renforcement 1

1.1 Apprentissage par renforcement 1
1.2 L'apprentissage par renforcement en tant que processus de décision markovien 7
1.3 Fonctions apprises par apprentissage par renforcement 11
1.4 Algorithme d'apprentissage par renforcement profond 13
1.4.1 Algorithme basé sur les politiques 14
1.4.2 Algorithmes basés sur la valeur 15
1.4.3 Algorithmes basés sur des modèles 16
1.4.4 Méthode combinée 17
1.4.5 Algorithmes traités dans ce livre 18
1.4.6 Algorithmes de politique actifs et inactifs 19
1.4.7 Résumé 19
1.5 Apprentissage profond pour l'apprentissage par renforcement 20
1.6 Apprentissage par renforcement et apprentissage supervisé 22
1.6.1 Absence d'Oracle 23
1.6.2 La rareté des retours d'information 24
1.6.3 Génération de données 24
1.7 Résumé 25

PARTIE I Algorithmes basés sur des politiques et des valeurs

CHAPITRE 02 RENFORCEMENT 29

2.1 Politique 30
2.2 Fonction objectif 31
2.3 Pente de la politique 31
2.3.1 Calcul du gradient de politique 33
2.4 Échantillonnage de Monte Carlo 36
2.5 RENFORCEMENT Algorithme 37
2.5.1 Amélioration du REINFRACTION 38
2.6 Mise en œuvre de REINFRACTION 39
2.6.1 Implémentation minimale de REINFORCE 39
2.6.2 Création de politiques avec PyTorch 42
2.6.3 Extraction d'actions 44
2.6.4 Calcul des pertes de la police 45
2.6.5 RENFORCEMENT Boucle d'entraînement 46
2.6.6 Mémoire de relecture de la politique active 47
2.7 Formation des agents REINFORCE 50
2.8 Résultats expérimentaux 53
2.8.1 Expérience : L'effet du taux d'actualisation ?? 53
2.8.2 Expérience : Effet des valeurs de référence 55
2.9 Résumé 57
2.10 Lectures complémentaires 57
2.11 Histoire 58

CHAPITRE 03 SARSA 59

3.1 Fonction Q et fonction V 60
3.2 Apprentissage en accéléré 63
3.2.1 Intuition concernant l'apprentissage des différences temporelles 66
3.3 Sélection d'actions de la salsa 73
3.3.1 Exploration et exploitation 74
3.4 Algorithme Salsa 75
3.4.1 Algorithme de politique d'activation 76
3.5 Application de la salsa 77
3.5.1 Fonction comportementale : Epsilon-Gourmand 77
3.5.2 Calcul de la perte Q 78
3.5.3 Boucle d'entraînement Salsa 80
3.5.4 Reproduction du déploiement de la politique active Mémoire 81
3.6 Formation d'agent Salsa 83
3.7 Résultats expérimentaux 86
3.7.1 Expérience : L'effet du taux d'apprentissage 86
3.8 Résumé 87
3.9 Lectures complémentaires 88
3.10 Histoire 89

CHAPITRE 04 Réseau Q profond (DQN) 91

4.1 Apprentissage de la fonction Q de DQN 92
4.2 Sélection des actions dans DQN 94
4.2.1 Politique de Boltzmann 97
4.3 Reproduction de l'expérience 100
4.4 Algorithme DQN 101
4.5 Application de la DQN 103
4.5.1 Calcul de la perte Q 103
4.5.2 Boucle d'entraînement DQN 104
4.5.3 Mémoire reproduite 105
4.6 Formation de l'agent DQN 108
4.7 Résultats expérimentaux 111
4.7.1 Expérience : L'effet de l'architecture du réseau neuronal 111
4.8 Résumé 113
4.9 Lectures complémentaires 114
4.10 Histoire 114

CHAPITRE 05 Amélioration du DQN 115

5.1 Réseau cible 116
5.2 Double DQN 119
5.3 Reproduction d'expérience prioritaire (PER) 123
5.3.1 Échantillonnage d'importance 125
5.4 Mise en œuvre de la DQN 126 modifiée
5.4.1 Initialisation du réseau 127
5.4.2 Calcul de la perte Q 128
5.4.3 Mise à jour du réseau cible 129
5.4.4 DQN 130 avec réseau cible
5.4.5 Double DQN 130
5.4.6 Reproduction des expériences prioritaires 131
5.5 Entraînement d'un agent DQN pour les jeux Atari 137
5.6 Résultats expérimentaux 142
5.6.1 Expérience : Effet du DQN double et du PER 142
5.7 Résumé 146
5.8 Lectures complémentaires 146

PARTIE II Méthodes combinées

CHAPITRE 06 Avantage Acteur-Critique (A2C) 149

6.1 Acteur 150
6.2 Critiques 150
6.2.1 Fonction Avantage 151
6.2.2 Découverte de la fonction avantage 155
6.3 Algorithme A2C 156
6.4 Mise en œuvre de l'A2C 159
6.4.1 Estimation de l'avantage 160
6.4.2 Calcul de la perte de valeur et de la perte de la police 162
6.4.3 Boucle de formation acteur-critique 163
6.5 Architecture réseau 164
6.6 Formation de l'agent A2C 166
6.6.1 Application de l'algorithme A2C avec gain en n étapes au jeu Pong 166
6.6.2 Application de l'A2C au jeu Pong à l'aide de GAE 169
6.6.3 A2C 170 utilisant un gain à n étapes dans le problème du piéton bipède
6.7 Résultats expérimentaux 173
6.7.1 Expérience : Effet des gains à n étages 173
6.7.2 Expérience : Effet de ?? sur GAE 175
6.8 Résumé 176
6.9 Lectures complémentaires 177
6.10 Histoire 177

CHAPITRE 07 Optimisation de politique proximale (PPO) 179

7.1 Objectif du mandataire 180
7.1.1 Effondrement des performances 180
7.1.2 Modification de la fonction objectif 182
7.2 Optimisation de politique proximale (PPO) 189
7.3 Algorithme PPO 193
7.4 Mise en œuvre du PPO 195
7.4.1 Calcul des pertes liées à la police PPO 195
7.4.2 Boucle d'entraînement PPO 196
7.5 Formation des agents PPO 198
7.5.1 PPO 198 pour le jeu Pong
7.5.2 PPO 201 pour les piétons bipèdes
7.6 Résultats expérimentaux 203
7.6.1 Expérience : Effet de ?? sur GAE 204
7.6.2 Expérience : Effet de la variable de découpage ?? 205
7.7 Résumé 207
7.8 Lectures complémentaires 208

CHAPITRE 209 : MÉTHODES DE PARALLÉLISATION

8.1 Parallélisme synchrone 210
8.2 Parallélisme asynchrone 212
8.2.1 Hogwild ! 213
8.3 Formation de l'agent A3C 216
8.4 Résumé 219
8.5 Lectures complémentaires 219

CHAPITRE 09 Résumé de l'algorithme 221

PARTIE III Détails pour la pratique

CHAPITRE 10 Utilisation de l'apprentissage par renforcement profond 225

10.1 Techniques de génie logiciel 226
10.1.1 Tests unitaires 226
10.1.2 Qualité du code 232
10.1.3 Flux de travail Git 233
10.2 Conseils de débogage 236
10.2.1 Signal de survie 236
10.2.2 Diagnostic de la pente de la politique 237
10.2.3 Diagnostic des données 238
10.2.4 Préprocesseur 239
10.2.5 Mémoire 239
10.2.6 Fonction de l'algorithme 240
10.2.7 Réseaux neuronaux 240
10.2.8 Simplification de l'algorithme 243
10.2.9 Simplification du problème 243
10.2.10 Hyperparamètre 244
10.2.11 Flux de travail du laboratoire 244
10.3 Astuce Atari 245
10.4 Almanach de l'apprentissage par renforcement profond 249
10.4.1 Tableau des hyperparamètres 249
10.4.2 Comparaison des performances des algorithmes 252
10.5 Résumé 255

CHAPITRE 11 SLM Lab 257

11.1 Algorithmes implémentés dans le laboratoire SLM 257
Fichier de spécifications 11.2 260
11.2.1 Syntaxe de la spécification de recherche 262
11.3 Exécution du laboratoire SLM 265
11.3.1 Commande SLM Lab 265
11.4 Analyse des résultats expérimentaux 266
11.4.1 Aperçu des données expérimentales 266
11.5 Résumé 268

CHAPITRE 12 ARCHITECTURE RÉSEAU 269

12.1 Types de réseaux neuronaux 269
12.1.1 Perceptron multicouche (MLP) 270
12.1.2 Réseaux de neurones convolutifs (CNN) 272
12.1.3 Réseaux de neurones récurrents (RNN) 274
12.2 Guide de sélection des groupes de réseau 275
12.2.1 MDP et POMDP 275
12.2.2 Choisir un réseau adapté à votre environnement 279
12.3 API réseau 282
12.3.1 Estimation des formes des couches d'entrée et de sortie 284
12.3.2 Création automatique du réseau 286
12.3.3 Étape de formation 289
12.3.4 Exposition des méthodes de base 290
12.4 Résumé 291
12.5 Lectures complémentaires 292

CHAPITRE 13 MATÉRIEL 293

13.1 Ordinateur 294
13.2 Types de données 300
13.3 Optimisation du type de données dans l'apprentissage par renforcement 302
13.4 Sélection du matériel 307
13.5 Résumé 308

CHAPITRE 14 STATUT 311

Exemple 312 de l'État 14.1
14.2 État complet 319
14.3 Complexité d'état 320
14.4 Perte d'informations d'État 325
14.4.1 Conversion en niveaux de gris de l'image 325
14.4.2 Dioxyde 326
14.4.3 Hash Dispatch 327
14.4.4 Perte de métadonnées 327
14.5 Prétraitement 331
14.5.1 Normalisation 332
14.5.2 Traitement d'images 333
14.5.3 Prétraitement temporel 335
14.6 Résumé 339

CHAPITRE 15 : COMPORTEMENT 341

15.1 Exemple d'action 341
15.2 Intégrité de l'action 345
15.3 La complexité du comportement 347
15.4 Résumé 352
15.5 Lectures complémentaires : Concevoir des comportements dans la vie quotidienne 353

CHAPITRE 16 RÉCOMPENSES 357

16.1 Le rôle de la rémunération 357
16.2 Lignes directrices pour la conception de la rémunération 359
16.3 Résumé 364

CHAPITRE 17 Fonctions de transfert 365

17.1 Vérification de faisabilité 366
17.2 Vérification de la réalité 368
17.3 Résumé 371

ANNEXE A : Chronologie de l'apprentissage par renforcement profond 372
ANNEXE B Exemple d'environnement 374
B.1 Environnements discrets 375
B.1.1 CartPole-v0 375
B.1.2 MountainCar-v0 376
B.1.3 LunarLander-v2 377
B.1.4 PongNoFrameskip-v4 378
B.1.5 BreakoutNoFrameskip-v4 378
B.2 Environnement continu 379
B.2.1 Pendule-v0 379
B.2.2 Marcheur bipède-v2 380

Épilogue 381

Image détaillée
Image détaillée 1

Dans le livre
Ce livre présente l'intégralité du processus d'apprentissage par renforcement profond.
Il commence par présenter l'intuition, puis explique la théorie et les algorithmes, et se termine par des implémentations concrètes et des conseils pratiques.
C’est précisément pourquoi ce livre inclut une bibliothèque appelée SLM Lab, qui contient le code d’implémentation de tous les algorithmes abordés dans ce livre.
En bref, ce livre est exactement ce que nous aurions aimé avoir lorsque nous avons commencé à étudier l'apprentissage par renforcement profond.

--- p.18

Depuis 2012, l'apprentissage profond a été appliqué avec succès à divers problèmes et a contribué au développement de technologies de pointe dans un large éventail de domaines, notamment la vision par ordinateur, la traduction automatique, la compréhension du langage naturel et la synthèse vocale.
Au moment où j'écris ces lignes, l'apprentissage profond est la technique d'approximation de fonctions la plus puissante jamais créée par l'humanité.

--- p.20

Les algorithmes d'apprentissage par renforcement profond comportent généralement de nombreux hyperparamètres.
Par exemple, il convient de déterminer le type de réseau, l'architecture, la fonction d'activation, la technique d'optimisation et le taux d'apprentissage.
Les fonctions de réseau neuronal plus avancées peuvent inclure l'écrêtage du gradient et les schémas de décroissance du taux d'apprentissage, qui ne sont pertinents que dans la partie « profonde » de l'apprentissage par renforcement profond !
--- p.50

Le nom « Monte Carlo » ne signifie rien de particulier.
On s'en souvient simplement comme d'une autre expression pour « estimation probabiliste ».
Mais l'origine du nom est intéressante.
Le nom a été suggéré par Nicholas Metropolis, un physicien et concepteur d'ordinateurs qui a également inventé le nom étrange d'ordinateur MANIAC.
Metropolis a entendu l'histoire de l'oncle d'Ulam qui a emprunté de l'argent à ses proches simplement parce qu'il « devait aller à Monte Carlo ».
Dès lors, le nom de Monte Carlo semblait trop approprié pour désigner l'estimation probabiliste.
--- p.58

Lors de la conception d'un nouvel algorithme ou composant d'apprentissage par renforcement, il est nécessaire de prouver que l'algorithme conçu est théoriquement correct avant sa mise en œuvre.
Cela est particulièrement vrai lors de la réalisation de recherches.
De même, lorsqu'on tente de résoudre un problème dans un nouvel environnement, il est nécessaire de vérifier au préalable si le problème est réellement soluble par apprentissage par renforcement avant d'appliquer l'algorithme.
Il convient d'en tenir compte notamment lors du développement d'applications.
Si un algorithme d'apprentissage par renforcement échoue alors que tout est théoriquement correct et peut être résolu par l'apprentissage par renforcement, cela peut être dû à une erreur d'implémentation.
Si c'est le cas, vous devez déboguer votre code.

--- p.226

En pratique, la création de modèles de niveau supérieur équivaut à la création d'une stratégie de contrôle à partir des contrôles d'origine.
C'est un peu comme la façon dont les accords deviennent des stratégies de contrôle plus simples, construites à partir de touches individuelles de piano.
Cette technique est une sorte de métacontrôle, et n'importe qui peut l'utiliser à tout moment.
Actuellement, il n'existe aucun moyen de permettre aux agents d'apprentissage par renforcement de concevoir leurs propres stratégies de contrôle.
Par conséquent, un métacontrôle est nécessaire pour l'agent.
Du point de vue de l'agent, nous devons concevoir des modèles de niveau supérieur d'un point de vue humain.
Parfois, au lieu d'exprimer une action comme une seule action complexe, on peut l'exprimer plus simplement en combinant plusieurs sous-actions.
--- p.348
SPÉCIFICATIONS DES PRODUITS
- Date de publication : 17 février 2022
- Nombre de pages, poids, dimensions : 428 pages | 188 × 245 × 21 mm
- ISBN13 : 9791191600674
- ISBN10 : 119160067X

Vous aimerez peut-être aussi

카테고리