Passer aux informations sur le produit
Apprentissage profond à partir de zéro 4
Apprentissage profond à partir de zéro 4
Description
Introduction au livre
La série « Deep Learning from Scratch », cette fois-ci axée sur l'apprentissage par renforcement !
De la théorie de base de l'apprentissage par renforcement à la résolution de problèmes et à l'apprentissage par renforcement profond, tout dans un seul livre !


La caractéristique de ce livre, comme son titre l'indique, est de « construire à partir de zéro ».
Apprenez en implémentant des algorithmes d'apprentissage par renforcement à partir de zéro, sans dépendre de bibliothèques externes dont le fonctionnement interne est inconnu.
Comprendre les principes à l'aide d'images, résoudre des problèmes d'apprentissage par renforcement à l'aide des mathématiques, puis les mettre en œuvre par le biais du code pour réviser ce que vous avez appris.
Le code est écrit de manière à être aussi concis que possible tout en révélant clairement les idées importantes de l'apprentissage par renforcement.
Il est structuré de manière à ce que vous puissiez expérimenter à la fois la difficulté et le plaisir de l'apprentissage par renforcement en augmentant progressivement le niveau et en abordant divers problèmes.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
CHAPITRE 1 : LE PROBLÈME DES BANDITS

1.1 Classification et apprentissage par renforcement automatique
_1.2 Bandit Issue
_1.3 Algorithme de bandit
1.4 Implémentation de l'algorithme Bandit
_1.5 Problème anormal
_1.6 Résumé

CHAPITRE 2 Processus de décision markoviens

_2.1 Qu'est-ce qu'un processus de décision markovien (MDP) ?
_2.2 Environnement et agent sous forme de formules
_2.3 Objectifs du MDP
_2.4 Exemple MDP
_2.5 Résumé

CHAPITRE 3 Équation de Bellman

3.1 Dérivation de l'équation de Bellman
_3.2 Exemple d'équation de Bellman
_3.3 Fonction valeur-action (fonction Q) et équation de Bellman
_3.4 Équation d'optimalité de Bellman
_3.5 Exemple d'équation d'optimalité de Bellman
_3.6 Résumé

CHAPITRE 4 PROGRAMMATION DYNAMIQUE

4.1 Programmation dynamique et évaluation des politiques
_4.2 Vers un problème plus important
4.3 Méthode de répétition des politiques
_4.4 Mise en œuvre de l'itération de la politique
4.5 Méthode de répétition des valeurs
_4.6 Résumé

CHAPITRE 5 Méthode de Monte Carlo

5.1 Principes de base de la méthode de Monte Carlo
5.2 Évaluation des politiques à l'aide de la méthode de Monte Carlo
5.3 Mise en œuvre de la méthode de Monte Carlo
5.4 Politique de contrôle par la méthode de Monte Carlo
_5.5 Échantillonnage hors stratégie et par importance
_5.6 Résumé

CHAPITRE 6 TD Law

6.1 Évaluation des politiques à l'aide de la méthode TD
_6.2 SARSA
_6.3 SARSA hors politique
_6.4 Q Course
6.5 Modèle de distribution et modèle d'échantillonnage
_6.6 Résumé

CHAPITRE 7 : RÉSEAUX DE NEURONES ET APPRENTISSAGE Q

_7.1 Les bases de DeZero
7.2 Régression linéaire
_7.3 Réseaux neuronaux
_7.4 Apprentissage par renforcement Q et réseaux de neurones
_7.5 Résumé

CHAPITRE 8 DQN

_8.1 OpenAI Gym
_8.2 Technologie de base de DQN
_8.3 DQN et Atari
Extension DQN _8.4
_8.5 Résumé

CHAPITRE 9 GRADIENTS DE POLITIQUES

9.1 La méthode de gradient de politique la plus simple
_9.2 RENFORCEMENT
_9.3 Ligne de base
_9.4 Acteur-Critique
_9.5 Avantages des techniques fondées sur les politiques
_9.6 Résumé

CHAPITRE 10 Un pas de plus

_10.1 Classification des algorithmes d'apprentissage par renforcement profond
10.2 Algorithmes avancés de la série de gradients de politique
10.3 Algorithmes avancés de la série DQN
_10.4 Étude de cas
10.5 Défis et potentiels de l'apprentissage par renforcement profond
_10.6 Résumé

ANNEXE A Méthode de Monte Carlo hors stratégie
A.1 Théorie de la méthode de Monte Carlo hors stratégie
A.2 Mise en œuvre de la méthode de Monte Carlo hors stratégie

ANNEXE B Méthode TD à n étapes

ANNEXE C Comprendre le double DQN
C.1 Qu'est-ce que le surapprentissage dans DQN ?
C.2 Solutions de surapprentissage

ANNEXE D Preuve par la méthode du gradient de politique
D.1 Dérivation de la méthode de pente de la politique
D.2 Dérivation de la ligne de base

Image détaillée
Image détaillée 1

Avis de l'éditeur
Le meilleur moyen de maîtriser l'apprentissage par renforcement est de construire des bases solides !

L'apprentissage profond est un domaine en pleine expansion, avec de nouveaux algorithmes et applications annoncés presque quotidiennement.
Avec le rythme rapide du développement, les technologies et services connexes évoluent eux aussi rapidement, si bien que des choses autrefois populaires disparaissent aujourd'hui.
Mais d'un autre côté, il y a des choses qui se sont transmises sans changement.
Le savoir que vous acquerrez dans ce livre est immuable.
Les idées et les techniques qui constituent la base de l'apprentissage par renforcement restent inchangées.
Même les algorithmes modernes reposent sur des idées qui existent depuis longtemps.
Des sujets tels que les principes fondamentaux de l'apprentissage par renforcement, les processus de décision markoviens, l'équation de Bellman, l'apprentissage Q et les réseaux neuronaux resteront importants.
Par conséquent, pour comprendre l'apprentissage par renforcement actuel et même l'apprentissage par renforcement profond, il est en fait plus simple d'apprendre les bases de l'apprentissage par renforcement étape par étape.
Nous prendrons soin d'expliquer chaque symbole de formule et chaque ligne de code afin que vous puissiez les lire même si vous ne possédez que des connaissances de base en Python et en mathématiques.
J'espère que ce livre vous permettra d'apprendre les bases de l'apprentissage par renforcement et de découvrir la beauté de « ce qui ne change pas ».
Que la Force soit avec vous tous…

Public cible

- Les lecteurs qui souhaitent apprendre correctement les principes de l'apprentissage par renforcement
- Les développeurs qui souhaitent approfondir leurs connaissances en apprentissage profond
- Débutants en science des données ayant des connaissances en Python et intéressés par l'apprentissage profond et l'apprentissage par renforcement.

Contenu principal

- Résolution du « problème du bandit », qui consiste à trouver séquentiellement le meilleur candidat parmi plusieurs candidats (Chapitre 1)
- Définition d'un problème général d'apprentissage par renforcement comme un « processus de décision markovien » (Chapitre 2)
- Dérivation de l'« équation de Bellman », qui est essentielle pour trouver la réponse optimale dans le processus de décision markovien (Chapitre 3)
- Méthodes de résolution de l'équation de Bellman : programmation dynamique (chapitre 4), méthode de Monte Carlo (chapitre 5) et méthode TD (chapitre 6).
- Découvrez l'apprentissage profond et appliquez-le aux algorithmes d'apprentissage par renforcement (Chapitre 7)
- Apprenez à implémenter et à étendre DQN (Chapitre 8)
Une approche différente de DQN : l’algorithme du gradient de politique (chapitre 9)
- Algorithme A3C/DDPG/TRPO/Rainbow et apprentissage par renforcement profond (Chapitre 10)
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 26 janvier 2024
Nombre de pages, poids, dimensions : 372 pages | 684 g | 183 × 235 × 15 mm
- ISBN13 : 9791169211956
- ISBN10 : 116921195X

Vous aimerez peut-être aussi

카테고리