
Apprentissage profond à partir de zéro 4
Description
Introduction au livre
La série « Deep Learning from Scratch », cette fois-ci axée sur l'apprentissage par renforcement !
De la théorie de base de l'apprentissage par renforcement à la résolution de problèmes et à l'apprentissage par renforcement profond, tout dans un seul livre !
La caractéristique de ce livre, comme son titre l'indique, est de « construire à partir de zéro ».
Apprenez en implémentant des algorithmes d'apprentissage par renforcement à partir de zéro, sans dépendre de bibliothèques externes dont le fonctionnement interne est inconnu.
Comprendre les principes à l'aide d'images, résoudre des problèmes d'apprentissage par renforcement à l'aide des mathématiques, puis les mettre en œuvre par le biais du code pour réviser ce que vous avez appris.
Le code est écrit de manière à être aussi concis que possible tout en révélant clairement les idées importantes de l'apprentissage par renforcement.
Il est structuré de manière à ce que vous puissiez expérimenter à la fois la difficulté et le plaisir de l'apprentissage par renforcement en augmentant progressivement le niveau et en abordant divers problèmes.
De la théorie de base de l'apprentissage par renforcement à la résolution de problèmes et à l'apprentissage par renforcement profond, tout dans un seul livre !
La caractéristique de ce livre, comme son titre l'indique, est de « construire à partir de zéro ».
Apprenez en implémentant des algorithmes d'apprentissage par renforcement à partir de zéro, sans dépendre de bibliothèques externes dont le fonctionnement interne est inconnu.
Comprendre les principes à l'aide d'images, résoudre des problèmes d'apprentissage par renforcement à l'aide des mathématiques, puis les mettre en œuvre par le biais du code pour réviser ce que vous avez appris.
Le code est écrit de manière à être aussi concis que possible tout en révélant clairement les idées importantes de l'apprentissage par renforcement.
Il est structuré de manière à ce que vous puissiez expérimenter à la fois la difficulté et le plaisir de l'apprentissage par renforcement en augmentant progressivement le niveau et en abordant divers problèmes.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
CHAPITRE 1 : LE PROBLÈME DES BANDITS
1.1 Classification et apprentissage par renforcement automatique
_1.2 Bandit Issue
_1.3 Algorithme de bandit
1.4 Implémentation de l'algorithme Bandit
_1.5 Problème anormal
_1.6 Résumé
CHAPITRE 2 Processus de décision markoviens
_2.1 Qu'est-ce qu'un processus de décision markovien (MDP) ?
_2.2 Environnement et agent sous forme de formules
_2.3 Objectifs du MDP
_2.4 Exemple MDP
_2.5 Résumé
CHAPITRE 3 Équation de Bellman
3.1 Dérivation de l'équation de Bellman
_3.2 Exemple d'équation de Bellman
_3.3 Fonction valeur-action (fonction Q) et équation de Bellman
_3.4 Équation d'optimalité de Bellman
_3.5 Exemple d'équation d'optimalité de Bellman
_3.6 Résumé
CHAPITRE 4 PROGRAMMATION DYNAMIQUE
4.1 Programmation dynamique et évaluation des politiques
_4.2 Vers un problème plus important
4.3 Méthode de répétition des politiques
_4.4 Mise en œuvre de l'itération de la politique
4.5 Méthode de répétition des valeurs
_4.6 Résumé
CHAPITRE 5 Méthode de Monte Carlo
5.1 Principes de base de la méthode de Monte Carlo
5.2 Évaluation des politiques à l'aide de la méthode de Monte Carlo
5.3 Mise en œuvre de la méthode de Monte Carlo
5.4 Politique de contrôle par la méthode de Monte Carlo
_5.5 Échantillonnage hors stratégie et par importance
_5.6 Résumé
CHAPITRE 6 TD Law
6.1 Évaluation des politiques à l'aide de la méthode TD
_6.2 SARSA
_6.3 SARSA hors politique
_6.4 Q Course
6.5 Modèle de distribution et modèle d'échantillonnage
_6.6 Résumé
CHAPITRE 7 : RÉSEAUX DE NEURONES ET APPRENTISSAGE Q
_7.1 Les bases de DeZero
7.2 Régression linéaire
_7.3 Réseaux neuronaux
_7.4 Apprentissage par renforcement Q et réseaux de neurones
_7.5 Résumé
CHAPITRE 8 DQN
_8.1 OpenAI Gym
_8.2 Technologie de base de DQN
_8.3 DQN et Atari
Extension DQN _8.4
_8.5 Résumé
CHAPITRE 9 GRADIENTS DE POLITIQUES
9.1 La méthode de gradient de politique la plus simple
_9.2 RENFORCEMENT
_9.3 Ligne de base
_9.4 Acteur-Critique
_9.5 Avantages des techniques fondées sur les politiques
_9.6 Résumé
CHAPITRE 10 Un pas de plus
_10.1 Classification des algorithmes d'apprentissage par renforcement profond
10.2 Algorithmes avancés de la série de gradients de politique
10.3 Algorithmes avancés de la série DQN
_10.4 Étude de cas
10.5 Défis et potentiels de l'apprentissage par renforcement profond
_10.6 Résumé
ANNEXE A Méthode de Monte Carlo hors stratégie
A.1 Théorie de la méthode de Monte Carlo hors stratégie
A.2 Mise en œuvre de la méthode de Monte Carlo hors stratégie
ANNEXE B Méthode TD à n étapes
ANNEXE C Comprendre le double DQN
C.1 Qu'est-ce que le surapprentissage dans DQN ?
C.2 Solutions de surapprentissage
ANNEXE D Preuve par la méthode du gradient de politique
D.1 Dérivation de la méthode de pente de la politique
D.2 Dérivation de la ligne de base
1.1 Classification et apprentissage par renforcement automatique
_1.2 Bandit Issue
_1.3 Algorithme de bandit
1.4 Implémentation de l'algorithme Bandit
_1.5 Problème anormal
_1.6 Résumé
CHAPITRE 2 Processus de décision markoviens
_2.1 Qu'est-ce qu'un processus de décision markovien (MDP) ?
_2.2 Environnement et agent sous forme de formules
_2.3 Objectifs du MDP
_2.4 Exemple MDP
_2.5 Résumé
CHAPITRE 3 Équation de Bellman
3.1 Dérivation de l'équation de Bellman
_3.2 Exemple d'équation de Bellman
_3.3 Fonction valeur-action (fonction Q) et équation de Bellman
_3.4 Équation d'optimalité de Bellman
_3.5 Exemple d'équation d'optimalité de Bellman
_3.6 Résumé
CHAPITRE 4 PROGRAMMATION DYNAMIQUE
4.1 Programmation dynamique et évaluation des politiques
_4.2 Vers un problème plus important
4.3 Méthode de répétition des politiques
_4.4 Mise en œuvre de l'itération de la politique
4.5 Méthode de répétition des valeurs
_4.6 Résumé
CHAPITRE 5 Méthode de Monte Carlo
5.1 Principes de base de la méthode de Monte Carlo
5.2 Évaluation des politiques à l'aide de la méthode de Monte Carlo
5.3 Mise en œuvre de la méthode de Monte Carlo
5.4 Politique de contrôle par la méthode de Monte Carlo
_5.5 Échantillonnage hors stratégie et par importance
_5.6 Résumé
CHAPITRE 6 TD Law
6.1 Évaluation des politiques à l'aide de la méthode TD
_6.2 SARSA
_6.3 SARSA hors politique
_6.4 Q Course
6.5 Modèle de distribution et modèle d'échantillonnage
_6.6 Résumé
CHAPITRE 7 : RÉSEAUX DE NEURONES ET APPRENTISSAGE Q
_7.1 Les bases de DeZero
7.2 Régression linéaire
_7.3 Réseaux neuronaux
_7.4 Apprentissage par renforcement Q et réseaux de neurones
_7.5 Résumé
CHAPITRE 8 DQN
_8.1 OpenAI Gym
_8.2 Technologie de base de DQN
_8.3 DQN et Atari
Extension DQN _8.4
_8.5 Résumé
CHAPITRE 9 GRADIENTS DE POLITIQUES
9.1 La méthode de gradient de politique la plus simple
_9.2 RENFORCEMENT
_9.3 Ligne de base
_9.4 Acteur-Critique
_9.5 Avantages des techniques fondées sur les politiques
_9.6 Résumé
CHAPITRE 10 Un pas de plus
_10.1 Classification des algorithmes d'apprentissage par renforcement profond
10.2 Algorithmes avancés de la série de gradients de politique
10.3 Algorithmes avancés de la série DQN
_10.4 Étude de cas
10.5 Défis et potentiels de l'apprentissage par renforcement profond
_10.6 Résumé
ANNEXE A Méthode de Monte Carlo hors stratégie
A.1 Théorie de la méthode de Monte Carlo hors stratégie
A.2 Mise en œuvre de la méthode de Monte Carlo hors stratégie
ANNEXE B Méthode TD à n étapes
ANNEXE C Comprendre le double DQN
C.1 Qu'est-ce que le surapprentissage dans DQN ?
C.2 Solutions de surapprentissage
ANNEXE D Preuve par la méthode du gradient de politique
D.1 Dérivation de la méthode de pente de la politique
D.2 Dérivation de la ligne de base
Image détaillée

Avis de l'éditeur
Le meilleur moyen de maîtriser l'apprentissage par renforcement est de construire des bases solides !
L'apprentissage profond est un domaine en pleine expansion, avec de nouveaux algorithmes et applications annoncés presque quotidiennement.
Avec le rythme rapide du développement, les technologies et services connexes évoluent eux aussi rapidement, si bien que des choses autrefois populaires disparaissent aujourd'hui.
Mais d'un autre côté, il y a des choses qui se sont transmises sans changement.
Le savoir que vous acquerrez dans ce livre est immuable.
Les idées et les techniques qui constituent la base de l'apprentissage par renforcement restent inchangées.
Même les algorithmes modernes reposent sur des idées qui existent depuis longtemps.
Des sujets tels que les principes fondamentaux de l'apprentissage par renforcement, les processus de décision markoviens, l'équation de Bellman, l'apprentissage Q et les réseaux neuronaux resteront importants.
Par conséquent, pour comprendre l'apprentissage par renforcement actuel et même l'apprentissage par renforcement profond, il est en fait plus simple d'apprendre les bases de l'apprentissage par renforcement étape par étape.
Nous prendrons soin d'expliquer chaque symbole de formule et chaque ligne de code afin que vous puissiez les lire même si vous ne possédez que des connaissances de base en Python et en mathématiques.
J'espère que ce livre vous permettra d'apprendre les bases de l'apprentissage par renforcement et de découvrir la beauté de « ce qui ne change pas ».
Que la Force soit avec vous tous…
Public cible
- Les lecteurs qui souhaitent apprendre correctement les principes de l'apprentissage par renforcement
- Les développeurs qui souhaitent approfondir leurs connaissances en apprentissage profond
- Débutants en science des données ayant des connaissances en Python et intéressés par l'apprentissage profond et l'apprentissage par renforcement.
Contenu principal
- Résolution du « problème du bandit », qui consiste à trouver séquentiellement le meilleur candidat parmi plusieurs candidats (Chapitre 1)
- Définition d'un problème général d'apprentissage par renforcement comme un « processus de décision markovien » (Chapitre 2)
- Dérivation de l'« équation de Bellman », qui est essentielle pour trouver la réponse optimale dans le processus de décision markovien (Chapitre 3)
- Méthodes de résolution de l'équation de Bellman : programmation dynamique (chapitre 4), méthode de Monte Carlo (chapitre 5) et méthode TD (chapitre 6).
- Découvrez l'apprentissage profond et appliquez-le aux algorithmes d'apprentissage par renforcement (Chapitre 7)
- Apprenez à implémenter et à étendre DQN (Chapitre 8)
Une approche différente de DQN : l’algorithme du gradient de politique (chapitre 9)
- Algorithme A3C/DDPG/TRPO/Rainbow et apprentissage par renforcement profond (Chapitre 10)
L'apprentissage profond est un domaine en pleine expansion, avec de nouveaux algorithmes et applications annoncés presque quotidiennement.
Avec le rythme rapide du développement, les technologies et services connexes évoluent eux aussi rapidement, si bien que des choses autrefois populaires disparaissent aujourd'hui.
Mais d'un autre côté, il y a des choses qui se sont transmises sans changement.
Le savoir que vous acquerrez dans ce livre est immuable.
Les idées et les techniques qui constituent la base de l'apprentissage par renforcement restent inchangées.
Même les algorithmes modernes reposent sur des idées qui existent depuis longtemps.
Des sujets tels que les principes fondamentaux de l'apprentissage par renforcement, les processus de décision markoviens, l'équation de Bellman, l'apprentissage Q et les réseaux neuronaux resteront importants.
Par conséquent, pour comprendre l'apprentissage par renforcement actuel et même l'apprentissage par renforcement profond, il est en fait plus simple d'apprendre les bases de l'apprentissage par renforcement étape par étape.
Nous prendrons soin d'expliquer chaque symbole de formule et chaque ligne de code afin que vous puissiez les lire même si vous ne possédez que des connaissances de base en Python et en mathématiques.
J'espère que ce livre vous permettra d'apprendre les bases de l'apprentissage par renforcement et de découvrir la beauté de « ce qui ne change pas ».
Que la Force soit avec vous tous…
Public cible
- Les lecteurs qui souhaitent apprendre correctement les principes de l'apprentissage par renforcement
- Les développeurs qui souhaitent approfondir leurs connaissances en apprentissage profond
- Débutants en science des données ayant des connaissances en Python et intéressés par l'apprentissage profond et l'apprentissage par renforcement.
Contenu principal
- Résolution du « problème du bandit », qui consiste à trouver séquentiellement le meilleur candidat parmi plusieurs candidats (Chapitre 1)
- Définition d'un problème général d'apprentissage par renforcement comme un « processus de décision markovien » (Chapitre 2)
- Dérivation de l'« équation de Bellman », qui est essentielle pour trouver la réponse optimale dans le processus de décision markovien (Chapitre 3)
- Méthodes de résolution de l'équation de Bellman : programmation dynamique (chapitre 4), méthode de Monte Carlo (chapitre 5) et méthode TD (chapitre 6).
- Découvrez l'apprentissage profond et appliquez-le aux algorithmes d'apprentissage par renforcement (Chapitre 7)
- Apprenez à implémenter et à étendre DQN (Chapitre 8)
Une approche différente de DQN : l’algorithme du gradient de politique (chapitre 9)
- Algorithme A3C/DDPG/TRPO/Rainbow et apprentissage par renforcement profond (Chapitre 10)
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 26 janvier 2024
Nombre de pages, poids, dimensions : 372 pages | 684 g | 183 × 235 × 15 mm
- ISBN13 : 9791169211956
- ISBN10 : 116921195X
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne