{"product_id":"139618","title":"Apprentissage par renforcement profond robuste ","description":"\u003ccenter\u003e\u003cdiv style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/tmgdisk01.cafe24.com\/images\/vs\/4172\/sv\/3jXPBvi5kFeTRzIDrtDeqF9Nz6DPhX.png?v=1765075579\" style=\"max-width:100%;max-height:10px\"\u003e\u003c\/div\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\u003ccenter\u003e\n\n\u003cdiv style=\"width:95%\"\u003e\n\n\u003cdiv style=\"text-align:center;font-size:30px;font-weight:bolder;line-height:1.6em\"\u003e Apprentissage par renforcement profond robuste \u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"border-bottom:1px;border-bottom-style:dotted;border-color:;padding-bottom:20px\"\u003e\u003ccenter\u003e\u003ctable align=\"center\" width=\"100%\"\u003e\u003ctbody style=\"border:0px\"\u003e\n\n\u003ctr\u003e\u003ctd align=\"center\" style=\"line-height:1.2em;text-align:center;font-size:18px;color:black;font-weight:bold;padding-bottom:20px;\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\u003ctr\u003e\u003ctd style=\"text-align:center\"\u003e\u003cimg src=\"https:\/\/image.yes24.com\/goods\/106709909\/XL\" style=\"max-width:100%;height:auto\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\n\n\n\u003c\/tbody\u003e\u003c\/table\u003e\u003c\/center\u003e\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;{split_style6}padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e Description \u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;word-break:break-all;font-size:14px;line-height:1.6em;\"\u003e\n\n\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eIntroduction au livre\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e\u003cdiv\u003e \u003cb\u003eLe moyen idéal de se constituer une base solide en apprentissage par renforcement profond !\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e Ce livre est une introduction à l'apprentissage par renforcement profond qui combine de manière unique théorie et pratique.\u003cbr\u003e Il commence par une explication intuitive, se poursuit par une explication détaillée des algorithmes d'apprentissage par renforcement profond et des méthodes d'implémentation utilisant la bibliothèque SLM Lab, et enfin aborde les détails de l'application pratique de l'apprentissage par renforcement profond.\u003cbr\u003e\n\n\u003c\/div\u003e\u003c\/div\u003e\n\u003cdiv\u003e\u003cul\u003e\u003cli\u003e Vous pouvez consulter un aperçu du contenu du livre.\u003cbr\u003e \u003cspan\u003eAperçu\u003c\/span\u003e\n\n\u003c\/li\u003e\u003c\/ul\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eindice\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e  \u003cdiv\u003ePréface du traducteur xii\u003cbr\u003e Avis du lecteur bêta xiii\u003cbr\u003e Recommandation xv\u003cbr\u003e Début XVI\u003cbr\u003e Remerciements xxi\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 01 Introduction à l'apprentissage par renforcement 1\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 1.1 Apprentissage par renforcement 1\u003cbr\u003e 1.2 L'apprentissage par renforcement en tant que processus de décision markovien 7\u003cbr\u003e 1.3 Fonctions apprises par apprentissage par renforcement 11\u003cbr\u003e 1.4 Algorithme d'apprentissage par renforcement profond 13\u003cbr\u003e 1.4.1 Algorithme basé sur les politiques 14\u003cbr\u003e 1.4.2 Algorithmes basés sur la valeur 15\u003cbr\u003e 1.4.3 Algorithmes basés sur des modèles 16\u003cbr\u003e 1.4.4 Méthode combinée 17\u003cbr\u003e 1.4.5 Algorithmes traités dans ce livre 18\u003cbr\u003e 1.4.6 Algorithmes de politique actifs et inactifs 19\u003cbr\u003e 1.4.7 Résumé 19\u003cbr\u003e 1.5 Apprentissage profond pour l'apprentissage par renforcement 20\u003cbr\u003e 1.6 Apprentissage par renforcement et apprentissage supervisé 22\u003cbr\u003e 1.6.1 Absence d'Oracle 23\u003cbr\u003e 1.6.2 La rareté des retours d'information 24\u003cbr\u003e 1.6.3 Génération de données 24\u003cbr\u003e 1.7 Résumé 25\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE I Algorithmes basés sur des politiques et des valeurs\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 02 RENFORCEMENT 29\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 2.1 Politique 30\u003cbr\u003e 2.2 Fonction objectif 31\u003cbr\u003e 2.3 Pente de la politique 31\u003cbr\u003e 2.3.1 Calcul du gradient de politique 33\u003cbr\u003e 2.4 Échantillonnage de Monte Carlo 36\u003cbr\u003e 2.5 RENFORCEMENT Algorithme 37\u003cbr\u003e 2.5.1 Amélioration du REINFRACTION 38\u003cbr\u003e 2.6 Mise en œuvre de REINFRACTION 39 \u003cbr\u003e2.6.1 Implémentation minimale de REINFORCE 39\u003cbr\u003e 2.6.2 Création de politiques avec PyTorch 42\u003cbr\u003e 2.6.3 Extraction d'actions 44\u003cbr\u003e 2.6.4 Calcul des pertes de la police 45\u003cbr\u003e 2.6.5 RENFORCEMENT Boucle d'entraînement 46\u003cbr\u003e 2.6.6 Mémoire de relecture de la politique active 47\u003cbr\u003e 2.7 Formation des agents REINFORCE 50\u003cbr\u003e 2.8 Résultats expérimentaux 53\u003cbr\u003e 2.8.1 Expérience : L'effet du taux d'actualisation ?? 53\u003cbr\u003e 2.8.2 Expérience : Effet des valeurs de référence 55\u003cbr\u003e 2.9 Résumé 57\u003cbr\u003e 2.10 Lectures complémentaires 57\u003cbr\u003e 2.11 Histoire 58\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 03 SARSA 59\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 3.1 Fonction Q et fonction V 60\u003cbr\u003e 3.2 Apprentissage en accéléré 63\u003cbr\u003e 3.2.1 Intuition concernant l'apprentissage des différences temporelles 66\u003cbr\u003e 3.3 Sélection d'actions de la salsa 73\u003cbr\u003e 3.3.1 Exploration et exploitation 74\u003cbr\u003e 3.4 Algorithme Salsa 75\u003cbr\u003e 3.4.1 Algorithme de politique d'activation 76\u003cbr\u003e 3.5 Application de la salsa 77\u003cbr\u003e 3.5.1 Fonction comportementale : Epsilon-Gourmand 77\u003cbr\u003e 3.5.2 Calcul de la perte Q 78\u003cbr\u003e 3.5.3 Boucle d'entraînement Salsa 80\u003cbr\u003e 3.5.4 Reproduction du déploiement de la politique active Mémoire 81\u003cbr\u003e 3.6 Formation d'agent Salsa 83\u003cbr\u003e 3.7 Résultats expérimentaux 86\u003cbr\u003e 3.7.1 Expérience : L'effet du taux d'apprentissage 86\u003cbr\u003e 3.8 Résumé 87\u003cbr\u003e 3.9 Lectures complémentaires 88\u003cbr\u003e 3.10 Histoire 89\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 04 Réseau Q profond (DQN) 91\u003c\/b\u003e\u003cbr\u003e \u003cbr\u003e4.1 Apprentissage de la fonction Q de DQN 92\u003cbr\u003e 4.2 Sélection des actions dans DQN 94\u003cbr\u003e 4.2.1 Politique de Boltzmann 97\u003cbr\u003e 4.3 Reproduction de l'expérience 100\u003cbr\u003e 4.4 Algorithme DQN 101\u003cbr\u003e 4.5 Application de la DQN 103\u003cbr\u003e 4.5.1 Calcul de la perte Q 103\u003cbr\u003e 4.5.2 Boucle d'entraînement DQN 104\u003cbr\u003e 4.5.3 Mémoire reproduite 105\u003cbr\u003e 4.6 Formation de l'agent DQN 108\u003cbr\u003e 4.7 Résultats expérimentaux 111\u003cbr\u003e 4.7.1 Expérience : L'effet de l'architecture du réseau neuronal 111\u003cbr\u003e 4.8 Résumé 113\u003cbr\u003e 4.9 Lectures complémentaires 114\u003cbr\u003e 4.10 Histoire 114\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 05 Amélioration du DQN 115\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 5.1 Réseau cible 116\u003cbr\u003e 5.2 Double DQN 119\u003cbr\u003e 5.3 Reproduction d'expérience prioritaire (PER) 123\u003cbr\u003e 5.3.1 Échantillonnage d'importance 125\u003cbr\u003e 5.4 Mise en œuvre de la DQN 126 modifiée\u003cbr\u003e 5.4.1 Initialisation du réseau 127\u003cbr\u003e 5.4.2 Calcul de la perte Q 128\u003cbr\u003e 5.4.3 Mise à jour du réseau cible 129\u003cbr\u003e 5.4.4 DQN 130 avec réseau cible\u003cbr\u003e 5.4.5 Double DQN 130\u003cbr\u003e 5.4.6 Reproduction des expériences prioritaires 131\u003cbr\u003e 5.5 Entraînement d'un agent DQN pour les jeux Atari 137\u003cbr\u003e 5.6 Résultats expérimentaux 142\u003cbr\u003e 5.6.1 Expérience : Effet du DQN double et du PER 142\u003cbr\u003e 5.7 Résumé 146\u003cbr\u003e 5.8 Lectures complémentaires 146\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE II Méthodes combinées\u003c\/b\u003e\u003cbr\u003e \u003cbr\u003e\u003cb\u003eCHAPITRE 06 Avantage Acteur-Critique (A2C) 149\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 6.1 Acteur 150\u003cbr\u003e 6.2 Critiques 150\u003cbr\u003e 6.2.1 Fonction Avantage 151\u003cbr\u003e 6.2.2 Découverte de la fonction avantage 155\u003cbr\u003e 6.3 Algorithme A2C 156\u003cbr\u003e 6.4 Mise en œuvre de l'A2C 159\u003cbr\u003e 6.4.1 Estimation de l'avantage 160\u003cbr\u003e 6.4.2 Calcul de la perte de valeur et de la perte de la police 162\u003cbr\u003e 6.4.3 Boucle de formation acteur-critique 163\u003cbr\u003e 6.5 Architecture réseau 164\u003cbr\u003e 6.6 Formation de l'agent A2C 166\u003cbr\u003e 6.6.1 Application de l'algorithme A2C avec gain en n étapes au jeu Pong 166\u003cbr\u003e 6.6.2 Application de l'A2C au jeu Pong à l'aide de GAE 169\u003cbr\u003e 6.6.3 A2C 170 utilisant un gain à n étapes dans le problème du piéton bipède\u003cbr\u003e 6.7 Résultats expérimentaux 173\u003cbr\u003e 6.7.1 Expérience : Effet des gains à n étages 173\u003cbr\u003e 6.7.2 Expérience : Effet de ?? sur GAE 175\u003cbr\u003e 6.8 Résumé 176\u003cbr\u003e 6.9 Lectures complémentaires 177\u003cbr\u003e 6.10 Histoire 177\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 07 Optimisation de politique proximale (PPO) 179\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 7.1 Objectif du mandataire 180\u003cbr\u003e 7.1.1 Effondrement des performances 180\u003cbr\u003e 7.1.2 Modification de la fonction objectif 182\u003cbr\u003e 7.2 Optimisation de politique proximale (PPO) 189\u003cbr\u003e 7.3 Algorithme PPO 193\u003cbr\u003e 7.4 Mise en œuvre du PPO 195\u003cbr\u003e 7.4.1 Calcul des pertes liées à la police PPO 195 \u003cbr\u003e7.4.2 Boucle d'entraînement PPO 196\u003cbr\u003e 7.5 Formation des agents PPO 198\u003cbr\u003e 7.5.1 PPO 198 pour le jeu Pong\u003cbr\u003e 7.5.2 PPO 201 pour les piétons bipèdes\u003cbr\u003e 7.6 Résultats expérimentaux 203\u003cbr\u003e 7.6.1 Expérience : Effet de ?? sur GAE 204\u003cbr\u003e 7.6.2 Expérience : Effet de la variable de découpage ?? 205\u003cbr\u003e 7.7 Résumé 207\u003cbr\u003e 7.8 Lectures complémentaires 208\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 209 : MÉTHODES DE PARALLÉLISATION\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 8.1 Parallélisme synchrone 210\u003cbr\u003e 8.2 Parallélisme asynchrone 212\u003cbr\u003e 8.2.1 Hogwild ! 213\u003cbr\u003e 8.3 Formation de l'agent A3C 216\u003cbr\u003e 8.4 Résumé 219\u003cbr\u003e 8.5 Lectures complémentaires 219\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 09 Résumé de l'algorithme 221\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e \u003cb\u003ePARTIE III Détails pour la pratique\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 10 Utilisation de l'apprentissage par renforcement profond 225\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 10.1 Techniques de génie logiciel 226\u003cbr\u003e 10.1.1 Tests unitaires 226\u003cbr\u003e 10.1.2 Qualité du code 232\u003cbr\u003e 10.1.3 Flux de travail Git 233\u003cbr\u003e 10.2 Conseils de débogage 236\u003cbr\u003e 10.2.1 Signal de survie 236\u003cbr\u003e 10.2.2 Diagnostic de la pente de la politique 237\u003cbr\u003e 10.2.3 Diagnostic des données 238\u003cbr\u003e 10.2.4 Préprocesseur 239\u003cbr\u003e 10.2.5 Mémoire 239\u003cbr\u003e 10.2.6 Fonction de l'algorithme 240\u003cbr\u003e 10.2.7 Réseaux neuronaux 240\u003cbr\u003e 10.2.8 Simplification de l'algorithme 243 \u003cbr\u003e10.2.9 Simplification du problème 243\u003cbr\u003e 10.2.10 Hyperparamètre 244\u003cbr\u003e 10.2.11 Flux de travail du laboratoire 244\u003cbr\u003e 10.3 Astuce Atari 245\u003cbr\u003e 10.4 Almanach de l'apprentissage par renforcement profond 249\u003cbr\u003e 10.4.1 Tableau des hyperparamètres 249\u003cbr\u003e 10.4.2 Comparaison des performances des algorithmes 252\u003cbr\u003e 10.5 Résumé 255\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 11 SLM Lab 257\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 11.1 Algorithmes implémentés dans le laboratoire SLM 257\u003cbr\u003e Fichier de spécifications 11.2 260\u003cbr\u003e 11.2.1 Syntaxe de la spécification de recherche 262\u003cbr\u003e 11.3 Exécution du laboratoire SLM 265\u003cbr\u003e 11.3.1 Commande SLM Lab 265\u003cbr\u003e 11.4 Analyse des résultats expérimentaux 266\u003cbr\u003e 11.4.1 Aperçu des données expérimentales 266\u003cbr\u003e 11.5 Résumé 268\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 12 ARCHITECTURE RÉSEAU 269\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 12.1 Types de réseaux neuronaux 269\u003cbr\u003e 12.1.1 Perceptron multicouche (MLP) 270\u003cbr\u003e 12.1.2 Réseaux de neurones convolutifs (CNN) 272\u003cbr\u003e 12.1.3 Réseaux de neurones récurrents (RNN) 274\u003cbr\u003e 12.2 Guide de sélection des groupes de réseau 275\u003cbr\u003e 12.2.1 MDP et POMDP 275\u003cbr\u003e 12.2.2 Choisir un réseau adapté à votre environnement 279\u003cbr\u003e 12.3 API réseau 282\u003cbr\u003e 12.3.1 Estimation des formes des couches d'entrée et de sortie 284\u003cbr\u003e 12.3.2 Création automatique du réseau 286\u003cbr\u003e 12.3.3 Étape de formation 289\u003cbr\u003e 12.3.4 Exposition des méthodes de base 290\u003cbr\u003e 12.4 Résumé 291 \u003cbr\u003e12.5 Lectures complémentaires 292\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 13 MATÉRIEL 293\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 13.1 Ordinateur 294\u003cbr\u003e 13.2 Types de données 300\u003cbr\u003e 13.3 Optimisation du type de données dans l'apprentissage par renforcement 302\u003cbr\u003e 13.4 Sélection du matériel 307\u003cbr\u003e 13.5 Résumé 308\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 14 STATUT 311\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e Exemple 312 de l'État 14.1\u003cbr\u003e 14.2 État complet 319\u003cbr\u003e 14.3 Complexité d'état 320\u003cbr\u003e 14.4 Perte d'informations d'État 325\u003cbr\u003e 14.4.1 Conversion en niveaux de gris de l'image 325\u003cbr\u003e 14.4.2 Dioxyde 326\u003cbr\u003e 14.4.3 Hash Dispatch 327\u003cbr\u003e 14.4.4 Perte de métadonnées 327\u003cbr\u003e 14.5 Prétraitement 331\u003cbr\u003e 14.5.1 Normalisation 332\u003cbr\u003e 14.5.2 Traitement d'images 333\u003cbr\u003e 14.5.3 Prétraitement temporel 335\u003cbr\u003e 14.6 Résumé 339\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 15 : COMPORTEMENT 341\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 15.1 Exemple d'action 341\u003cbr\u003e 15.2 Intégrité de l'action 345\u003cbr\u003e 15.3 La complexité du comportement 347\u003cbr\u003e 15.4 Résumé 352\u003cbr\u003e 15.5 Lectures complémentaires : Concevoir des comportements dans la vie quotidienne 353\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 16 RÉCOMPENSES 357\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 16.1 Le rôle de la rémunération 357\u003cbr\u003e 16.2 Lignes directrices pour la conception de la rémunération 359\u003cbr\u003e 16.3 Résumé 364\u003cbr\u003e\u003cbr\u003e \u003cb\u003eCHAPITRE 17 Fonctions de transfert 365\u003c\/b\u003e\u003cbr\u003e\u003cbr\u003e 17.1 Vérification de faisabilité 366\u003cbr\u003e 17.2 Vérification de la réalité 368\u003cbr\u003e 17.3 Résumé 371\u003cbr\u003e\u003cbr\u003e ANNEXE A : Chronologie de l'apprentissage par renforcement profond 372 \u003cbr\u003eANNEXE B Exemple d'environnement 374\u003cbr\u003e B.1 Environnements discrets 375\u003cbr\u003e B.1.1 CartPole-v0 375\u003cbr\u003e B.1.2 MountainCar-v0 376\u003cbr\u003e B.1.3 LunarLander-v2 377\u003cbr\u003e B.1.4 PongNoFrameskip-v4 378\u003cbr\u003e B.1.5 BreakoutNoFrameskip-v4 378\u003cbr\u003e B.2 Environnement continu 379\u003cbr\u003e B.2.1 Pendule-v0 379\u003cbr\u003e B.2.2 Marcheur bipède-v2 380\u003cbr\u003e\u003cbr\u003e Épilogue 381\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eImage détaillée\u003c\/b\u003e \u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\u003cdiv\u003e\u003cimg src=\"https:\/\/image.yes24.com\/momo\/TopCate3750\/MidCate002\/374915889(1).jpg\" border=\"0\" alt=\"Image détaillée 1\"\u003e\u003c\/div\u003e\u003c\/div\u003e\n\u003cbr\u003e\u003cdiv\u003e\u003ch5\u003e \u003cb\u003eDans le livre\u003c\/b\u003e\n\u003c\/h5\u003e\u003c\/div\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e\n\u003cdiv\u003e Ce livre présente l'intégralité du processus d'apprentissage par renforcement profond.\u003cbr\u003e Il commence par présenter l'intuition, puis explique la théorie et les algorithmes, et se termine par des implémentations concrètes et des conseils pratiques.\u003cbr\u003e C’est précisément pourquoi ce livre inclut une bibliothèque appelée SLM Lab, qui contient le code d’implémentation de tous les algorithmes abordés dans ce livre.\u003cbr\u003e En bref, ce livre est exactement ce que nous aurions aimé avoir lorsque nous avons commencé à étudier l'apprentissage par renforcement profond.\u003cbr\u003e\u003cbr\u003e --- p.18\u003cbr\u003e \u003cbr\u003eDepuis 2012, l'apprentissage profond a été appliqué avec succès à divers problèmes et a contribué au développement de technologies de pointe dans un large éventail de domaines, notamment la vision par ordinateur, la traduction automatique, la compréhension du langage naturel et la synthèse vocale.\u003cbr\u003e Au moment où j'écris ces lignes, l'apprentissage profond est la technique d'approximation de fonctions la plus puissante jamais créée par l'humanité.\u003cbr\u003e\u003cbr\u003e --- p.20\u003cbr\u003e\u003cbr\u003e Les algorithmes d'apprentissage par renforcement profond comportent généralement de nombreux hyperparamètres.\u003cbr\u003e Par exemple, il convient de déterminer le type de réseau, l'architecture, la fonction d'activation, la technique d'optimisation et le taux d'apprentissage.\u003cbr\u003e Les fonctions de réseau neuronal plus avancées peuvent inclure l'écrêtage du gradient et les schémas de décroissance du taux d'apprentissage, qui ne sont pertinents que dans la partie « profonde » de l'apprentissage par renforcement profond !\u003cbr\u003e --- p.50\u003cbr\u003e\u003cbr\u003e Le nom « Monte Carlo » ne signifie rien de particulier. \u003cbr\u003eOn s'en souvient simplement comme d'une autre expression pour « estimation probabiliste ».\u003cbr\u003e Mais l'origine du nom est intéressante.\u003cbr\u003e Le nom a été suggéré par Nicholas Metropolis, un physicien et concepteur d'ordinateurs qui a également inventé le nom étrange d'ordinateur MANIAC.\u003cbr\u003e Metropolis a entendu l'histoire de l'oncle d'Ulam qui a emprunté de l'argent à ses proches simplement parce qu'il « devait aller à Monte Carlo ».\u003cbr\u003e Dès lors, le nom de Monte Carlo semblait trop approprié pour désigner l'estimation probabiliste.\u003cbr\u003e --- p.58\u003cbr\u003e\u003cbr\u003e Lors de la conception d'un nouvel algorithme ou composant d'apprentissage par renforcement, il est nécessaire de prouver que l'algorithme conçu est théoriquement correct avant sa mise en œuvre.\u003cbr\u003e Cela est particulièrement vrai lors de la réalisation de recherches. \u003cbr\u003eDe même, lorsqu'on tente de résoudre un problème dans un nouvel environnement, il est nécessaire de vérifier au préalable si le problème est réellement soluble par apprentissage par renforcement avant d'appliquer l'algorithme.\u003cbr\u003e Il convient d'en tenir compte notamment lors du développement d'applications.\u003cbr\u003e Si un algorithme d'apprentissage par renforcement échoue alors que tout est théoriquement correct et peut être résolu par l'apprentissage par renforcement, cela peut être dû à une erreur d'implémentation.\u003cbr\u003e Si c'est le cas, vous devez déboguer votre code.\u003cbr\u003e\u003cbr\u003e --- p.226\u003cbr\u003e\u003cbr\u003e En pratique, la création de modèles de niveau supérieur équivaut à la création d'une stratégie de contrôle à partir des contrôles d'origine.\u003cbr\u003e C'est un peu comme la façon dont les accords deviennent des stratégies de contrôle plus simples, construites à partir de touches individuelles de piano.\u003cbr\u003e Cette technique est une sorte de métacontrôle, et n'importe qui peut l'utiliser à tout moment. \u003cbr\u003eActuellement, il n'existe aucun moyen de permettre aux agents d'apprentissage par renforcement de concevoir leurs propres stratégies de contrôle.\u003cbr\u003e Par conséquent, un métacontrôle est nécessaire pour l'agent.\u003cbr\u003e Du point de vue de l'agent, nous devons concevoir des modèles de niveau supérieur d'un point de vue humain.\u003cbr\u003e Parfois, au lieu d'exprimer une action comme une seule action complexe, on peut l'exprimer plus simplement en combinant plusieurs sous-actions.\u003cbr\u003e\n\n\u003c\/div\u003e\n\u003cdiv\u003e --- p.348 \u003c\/div\u003e\n\u003c\/div\u003e\n\u003cdiv\u003e\u003c\/div\u003e\n\u003c\/div\u003e\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cdiv style=\"width:95%;padding-top:20px;padding-bottom:20px\"\u003e\n\n\u003cdiv style=\"text-align:left;font-size:16px;font-weight:bold;padding-bottom:20px\"\u003e SPÉCIFICATIONS DES PRODUITS \u003c\/div\u003e\n\n\u003cdiv style=\"text-align:left;font-size:14px;line-height:1.6em;\"\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eDate de publication :\u003c\/strong\u003e 17 février 2022\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eNombre de pages, poids, dimensions :\u003c\/strong\u003e 428 pages | 188 × 245 × 21 mm\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN13 :\u003c\/strong\u003e 9791191600674\u003c\/div\u003e\n\n\u003cdiv style=\"width:100%;margin-bottom:5px;line-height:1.6em;font-size:14px\"\u003e - \u003cstrong\u003eISBN10 :\u003c\/strong\u003e 119160067X \u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\n\u003c\/div\u003e\n\n\u003ccenter\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003ccenter\u003e\u003ctable\u003e\u003ctr\u003e\u003ctd style=\"height:10px\"\u003e\u003c\/td\u003e\u003c\/tr\u003e\u003c\/table\u003e\u003c\/center\u003e\n\n\u003cspan\u003e\u003c\/span\u003e\n\n\u003c\/center\u003e\n\n\n\u003c\/center\u003e","brand":"LIBRAIRIE COREENNE","offers":[{"title":"Default Title","offer_id":43893369503786,"sku":"139618","price":40.0,"currency_code":"EUR","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0683\/2750\/5962\/files\/602f8279bb0a31e33f374881fe829fed.jpg?v=1765398695","url":"https:\/\/librairie.coreenne.fr\/products\/139618","provider":"LIBRAIRIE COREENNE","version":"1.0","type":"link"}