Passer aux informations sur le produit
apprentissage par renforcement
apprentissage par renforcement
Description
Introduction au livre
Comprendre les concepts et algorithmes clés
Un manuel sur l'apprentissage par renforcement mis en œuvre par la pratique

« Apprentissage par renforcement » s’adresse aux lecteurs qui souhaitent apprendre systématiquement l’apprentissage par renforcement, des principes de base à ses applications.
Nous présentons tout d'abord une nouvelle idée pour résoudre le problème et expliquons les principes de base qui la sous-tendent.
Ensuite, nous présentons un algorithme basé sur une formule et organisons le contenu de manière à ce que les étudiants puissent implémenter l'algorithme dans un environnement réel et évaluer ses performances d'apprentissage en pratiquant des programmes utilisant TensorFlow et Gymnasium.
Il couvre également tout, de la programmation dynamique traditionnelle aux algorithmes les plus récents tels que DQN, PPO et SAC, et reflète fidèlement des domaines d'application avancés tels que la conduite autonome, les robots intelligents et l'AGI, ainsi que les dernières tendances de la recherche.

※ Ce livre a été conçu comme manuel pour les cours universitaires, il ne fournit donc pas de réponses aux exercices pratiques.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
CHAPITRE 01 Introduction
1 Qu'est-ce que l'apprentissage par renforcement ?
2. Apprentissage automatique = Apprentissage supervisé + Apprentissage non supervisé + Apprentissage par renforcement
3 témoignages de réussite et applications
4. Bref historique
5 lectures
Problèmes pratiques

CHAPITRE 02 Établir les bases de l'apprentissage par renforcement
1. Agents qui interagissent avec l'environnement
2. Programmation MDP avec Python
3. Comparaison des gains attendus entre les politiques aléatoires et optimales
4 Fonctions de politique et de valeur
5. Comprendre la difficulté et les approches de l'apprentissage par renforcement
Problèmes pratiques

CHAPITRE 03 Programmation dynamique
1. Principe
2. Équation de Bellman et algorithme d'itération de politique
3. Équation d'optimalité de Bellman et algorithme d'itération de valeur
4. Programmation dynamique des tâches stochastiques
5 Caractéristiques et limites de la programmation dynamique
Problèmes pratiques

CHAPITRE 04 Méthode de Monte Carlo
Générateur d'épisodes
2. Équilibre entre exploration et exploration
3. Évaluation des politiques publiques par la méthode de Monte-Carlo
4. Apprentissage des politiques par la méthode de Monte Carlo
5 techniques d'amélioration des performances
Problèmes pratiques

CHAPITRE 05 Apprentissage différentiel dans le temps
1. Principe
2. Évaluation des politiques
3 Sarsa
4. Apprentissage par renforcement (Q-Learning)
Apprendre le blackjack avec l'apprentissage par renforcement (Q-Learning)
6 Entraînement CartPole avec Q-Learning
7 techniques d'amélioration des performances
8. Élargir la perspective
Problèmes pratiques

CHAPITRE 06 Méthodes d'approximation utilisant des réseaux de neurones
1. Notions de base des réseaux de neurones
2. Implémentation du réseau neuronal
Apprentissage par renforcement (Q-learning) utilisant 3 réseaux de neurones
4. Implémentation de l'apprentissage par renforcement Q basé sur un réseau neuronal : tâche CartPole
5. Implémentation de l'apprentissage par renforcement Q basé sur un réseau neuronal : tâche de Blackjack
6 Controverses et nouvelles pistes pour les réseaux neuronaux
Problèmes pratiques

CHAPITRE 07 Méthodes d'apprentissage profond
1 Un changement majeur vers l'apprentissage profond
2DQNs
3 Replay Memory
4 notions de base de l'apprentissage profond
5 Environnement de jeu Atari
Jeu Atari 6 Pong utilisant DQN
7 Remarques supplémentaires
Problèmes pratiques

CHAPITRE 08 Méthode du gradient de politique
1. Apprentissage axé sur les politiques
2 Algorithme RENFORCE
3. RENFORCER la programmation : tâches discrètes
Gradient de politique pour 4 tâches consécutives
5. RENFORCER la programmation : Tâches continues
6. Accélérer les opérations sur les tableaux en Python
Problèmes pratiques

CHAPITRE 09 La méthode de l'activiste-critique
1. Collaboration entre militants et critiques
2. Compromis biais-variance
3. Fonction de profit
4 A2C et A3C
5 Programmation A2C : Tâches discrètes
6 Programmation A2C : Tâches continues
Problèmes pratiques

CHAPITRE 10 MÉTHODE DE LA RÉGION DE CONFIDENTIALITÉ
1. Amélioration de la politique relative aux billets uniques
2 Algorithme TRPO
3 Algorithme PPO
4. Améliorer l'efficacité du PPO
5 Programmation PPO : Tâches continues
Problèmes pratiques

CHAPITRE 11 Combinaison de l'optimisation des politiques et du DQN
1. Motivation et développement
2. Algorithme d'apprentissage DDPG
3. Exercice de programmation : Apprentissage des tâches de type « hopper » à l’aide de DDPG
4 Algorithme d'apprentissage TD3
5 Exercices de programmation : Apprentissage de la tâche du sauteur à l’aide de TD3
6 algorithmes d'apprentissage SAC
7 Exercices de programmation : Apprentissage des tâches de type « hopper » avec SAC
8. Analyse comparative
Problèmes pratiques

CHAPITRE 12 L'apprentissage par mimétisme
1. Idée et développement
2. Actions en double
3. Apprentissage par renforcement inverse
4. Apprentissage par mimétisme adverse
5. Mimétisme par observation
Problèmes pratiques

CHAPITRE 13 APPLICATIONS AVANCÉES
1 Produits avancés conçus grâce à l'apprentissage par renforcement : opportunités et défis
2 jeux vidéo
3 jeux de société
4 Modèles de langage à grande échelle
5. Conduite autonome
6 robots
7 Vers une intelligence artificielle générale
Problèmes pratiques

Références
Recherche

Image détaillée
Image détaillée 1
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 24 juillet 2025
Nombre de pages, poids, dimensions : 536 pages | 1 059 g | 188 × 257 × 21 mm
- ISBN13 : 9791173400070

Vous aimerez peut-être aussi

카테고리