Passer aux informations sur le produit
Apprendre l'apprentissage par renforcement grâce au code, comme un développeur
Apprendre l'apprentissage par renforcement grâce au code, comme un développeur
Description
Introduction au livre
Écrire de l'apprentissage par renforcement pour les développeurs !
Même si les mathématiques vous ont toujours intimidé, vous pouvez désormais commencer l'apprentissage par renforcement grâce au code.
Un guide d'introduction pratique avec des exemples concrets, de Stable Baselines3 à Optuna !


L'apprentissage par renforcement peut sembler complexe, et vous ne savez pas par où commencer ? Les mathématiques sont ardues, les aspects pratiques sont compliqués et les concepts abstraits… C'est pourquoi ce livre propose une approche différente.

« Apprendre l’apprentissage par renforcement avec du code, comme un développeur » est un ouvrage d’introduction pratique conçu pour réduire la distance et la complexité mathématique associées à l’apprentissage par renforcement et permettre d’apprendre l’IA d’une manière conviviale pour les développeurs.
Il minimise les théories et formules mathématiques complexes, organise les concepts de manière à ce qu'ils soient compréhensibles intuitivement et explique comment les concepts sont liés au code réel grâce à divers exemples et aides visuelles.
Un mélange équilibré de théorie et de pratique, des explications accessibles et des projets basés sur des problèmes du monde réel aident les étudiants à intégrer naturellement l'apprentissage par renforcement, du concept à la mise en œuvre.


En commençant par une formation pratique dans l'environnement OpenAI Gym, vous pouvez implémenter directement des algorithmes représentatifs tels que DQN, A2C et PPO, et expérimenter des implémentations avancées à l'aide du framework Stable-Baselines3 et de l'outil de réglage automatique Optuna.
Grâce à des exemples proches des tâches du monde réel, comme la répartition des actifs et les modalités de travail par rotation, vous pouvez faire le lien avec des situations concrètes sans vous demander : « Où puis-je utiliser cela ? »
Ce livre est un guide convivial destiné aux développeurs débutants qui découvrent l'apprentissage par renforcement, et un guide pratique qui développe la pensée critique et les compétences d'application grâce à une pratique répétitive du code.
Si vous êtes un développeur qui souhaite concevoir sa propre stratégie, commencez dès maintenant par ce livre.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu
","
indice
Pour commencer,

Chapitre 1 : Concepts fondamentaux de l'apprentissage par renforcement
_1.1 Qu'est-ce que l'apprentissage par renforcement ?
1.2 Probabilités et processus stochastiques
__1.2.1 Probabilité
1.2.2 Probabilité conditionnelle
__1.2.3 Processus stochastiques
_1.3.
chaîne de Markov
__1.3.1 Propriété de Markov
1.3.2 Propriété de Markov et mouvement brownien
1.3.3 Chaîne de Markov
_1.4 Processus de récompense de Markov
1.4.1 Composition des récompenses de Markov
__1.4.2 Quelle est la valeur attendue de la probabilité ?
__1.4.3 Valeur de retour
__1.4.4 Fonction de valeur d'état

Chapitre 2 : Algorithmes d’apprentissage par renforcement de base
_2.1 Qu'est-ce qu'un processus de décision markovien ?
_2.2 Composants MDP
2.2.1 Matrice de transition d'état et fonction de récompense dans un processus de décision markovien (MDP)
2.2.2 Politique dans le MDP
2.2.3 Étude de cas comparative entre MRP et MDP
__2.2.4 Matrice de transition d'état et fonction de récompense prenant en compte la politique
_2.3 Fonction de valeur d'état MDP
__2.3.1 Quelle est la fonction de valeur d'état du MDP ?
__2.3.2 Exemple de fonction de valeur d'état MDP
_2.4 Fonction de valeur d'action MDP
__2.4.1 Qu'est-ce qu'une fonction de valeur d'action MDP ?
2.4.2 Relation entre la fonction de valeur d'action et la fonction de valeur d'état du MDP
__2.4.3 Exemple de fonction de valeur d'action MDP
_2.5 Fonction de valeur optimale MDP
__2.5.1 Quelle est la fonction de valeur optimale du MDP ?
__2.5.2 Exemple de fonction de valeur optimale MDP
2.6 Différents termes utilisés dans l'apprentissage par renforcement
2.6.1 Évaluation et contrôle des politiques
__2.6.2 Modèles basés sur un modèle et modèles sans modèle

Chapitre 3 : Programmation dynamique et méthodes de Monte Carlo
_3.1.
programmation dynamique
__3.1.1.
Qu'est-ce que la programmation dynamique ?
__3.1.2.
Monde en grille
__3.1.3 Exemple de programmation dynamique
3.2 Méthode de Monte Carlo
__3.2.1 Qu'est-ce que la méthode de Monte Carlo ?
3.2.2 Méthode de Monte Carlo utilisant la moyenne incrémentale
3.2.3 Exemple de la méthode de Monte Carlo

Chapitre 4 : Apprentissage différentiel temporel, Salsa et Q-Learning
4.1 Apprentissage en accéléré
__4.1.1 Qu'est-ce que l'apprentissage par différence temporelle ?
4.1.2 Fonction de valeur d'action plutôt que fonction de valeur d'état
4.1.3 Exemple d'apprentissage différentiel dans le temps
_4.2 Salsa
4.2.1 Concept SARSA
__4.2.2 Exemple de salsa
_4.3 Q Course
__4.3.1 Conformément à la politique et hors politique
4.3.2 Échantillonnage d'importance
__4.3.3 Q Course
__4.3.4 Exemple d'apprentissage par renforcement Q
4.3.4 Comparaison d'exemples de Salsa et d'apprentissage par renforcement (Q-Learning)

Chapitre 5 : Concepts de l'intelligence artificielle
5.1 Apprentissage automatique
5.2 Analyse de régression linéaire
5.3 Analyse de classification
5.4 Apprentissage profond
5.5 Apprendre les bases de l'intelligence artificielle avec des programmes
__5.5.1 Qu'est-ce que TensorFlow ?
__5.5.2 Exemple de base de réseau neuronal artificiel

Chapitre 6 Approximation de fonctions
_6.1 Différenciation
6.2 Différentiation partielle
_6.3 Scalaires et vecteurs
_6.4 Gradient
_6.5 Descente en pente
6.6 Descente de gradient stochastique
6.7 Notation pour la différentiation partielle et la descente de gradient dans l'apprentissage par renforcement
_6.8 Approximation de fonction

Chapitre 7 : Apprentissage par renforcement basé sur la valeur et algorithme DQN
_7.1 Algorithme DQN
_7.2 Poteau de chariot
7.3 Le problème de l'exploration et de la cupidité
_7.4 Structure de base de l'algorithme DQN
_7.5 Analyse complète du code de l'algorithme DQN
_7.6 Structure détaillée de l'algorithme DQN
7.7 Analyse des résultats d'apprentissage de l'algorithme DQN

Chapitre 8 Apprentissage par renforcement basé sur des politiques Algorithme REINFORCE
_8.1 Retour sur les réseaux neuronaux artificiels
8.2 Gradient de politique
8.3 Fonctionnement de l'algorithme REINFORCE
8.4 Structure de base de l'algorithme REINFORCE
Analyse complète du code de l'algorithme REINFORCE 8.5
8.6 Structure détaillée de l'algorithme REINFORCE
8.7 Analyse des résultats d'apprentissage de l'algorithme REINFORCE

Chapitre 9 Algorithme A2C basé sur des politiques
_9.1 Algorithme acteur-critique
__9.1.1 Qu'est-ce que l'algorithme Actor Critic ?
9.1.2 Structure et fonctionnement de l'algorithme acteur-critique
_9.2 Avantage Acteur Critique
_9.3 Structure de base de l'algorithme A2C
Analyse complète du code de l'algorithme A2C _9.4
_9.5 Analyse détaillée de la structure de l'algorithme A2C
9.6 Analyse des résultats d'apprentissage de l'algorithme A2C
Chapitre 10 Algorithme PPO basé sur les politiques

_10.1 Échantillonnage d'importance
_10.2 Gradient de politique en temps réel
_10.3 Technique de découpage
_10,4 GAE
_10.5 Structure de base de l'algorithme PPO
_10.6 Analyse complète du code de l'algorithme PPO
_10.7 Structure détaillée de l'algorithme PPO
Analyse des résultats d'apprentissage de l'algorithme PPO _10.8

Chapitre 11 : Réglage des réseaux de neurones artificiels
_11.1 Aperçu du réglage des réseaux de neurones artificiels
_11.2 Prétraitement des données d'entrée
__11.2.1 Normalisation
__11.2.2 Normalisation
11.3 Choix d'une fonction de coût
_11.4 Algorithme d'activation
_11.5 Initialisation du poids
_11.6 Algorithme d'optimisation
_11.7 Discussion sur le nombre de nœuds et de couches cachées
_11.8 Autres techniques de stabilisation et d'amélioration des performances de l'entraînement des modèles
__11.8.1 Découpage par dégradé
__11.8.2 Résiliation anticipée
Optimisation du réseau neuronal artificiel de l'algorithme PPO _11.9
_11.10 Application du code de réglage de l'algorithme PPO
11.11 Analyse des résultats d'optimisation de l'algorithme PPO

Chapitre 12 Techniques d'optimisation bayésienne
_12.1 Probabilité fréquentiste et bayésienne
_12.2 Calcul de la probabilité bayésienne
_12.3 Package d'optimisation bayésienne Optuna
__12.3.1 Exemple Optuna
_12.4 code complet d'optimisation optuna
12.5 Analyse des résultats de l'optimisation bayésienne

Chapitre 13 Lignes de base stables 3
_13.1 Qu'est-ce que Stable-Baselines3 ?
__13.1.1 Introduction aux frameworks d'apprentissage par renforcement open source
__13.1.2 Relation avec les valeurs de référence, évolution de SB2 à SB3
__13.1.3 Pourquoi SB3 ? Implémentation directe vs.
Utilisation de la bibliothèque
_13.2 Composants principaux du SB3
13.2.1 Politique : Le cerveau de l'agent
__13.2.2 Modèle : Le centre d'apprentissage
__13.2.3 Env : Lien vers l’environnement
13.2.4 Rappel : Contrôle et surveillance pendant l’apprentissage
__13.2.5 VecEnv : Accélération grâce aux environnements parallèles
13.3 Composantes clés du SB3 illustrées par des exemples
13.3.1 Comprendre les composants principaux de SB3
__13.3.2 Hyperparamètres de classe SB3 PPO
__13.3.3 Réglage de classe SB3 PPO appliqué
__13.3.4 Exécution de l'exemple de code et métriques d'évaluation
__13.3.5 Indicateurs clés pour l'interprétation des résultats d'apprentissage
__13.3.6 TensorBoard

Chapitre 14 : Stratégies d’allocation d’actifs en IA
_14.1 Qu’est-ce qu’une stratégie de répartition d’actifs ?
_14.2 Le portefeuille tous temps de Ray Dalio
__14.2.1 Qu'est-ce qu'un portefeuille tout temps ?
14.2.2 Rôles par catégorie d'actifs
__14.2.3 Allocation d'actifs de Ray Dalio
14.2.4 Avantages et inconvénients du portefeuille tous temps
14.2.5 Évaluation de la performance d'un portefeuille d'investissement résistant aux aléas climatiques
__14.2.6 Portfolio tout temps et apprentissage par renforcement
_14.3 Stratégie de mise en œuvre du code de portefeuille tout temps
_14.4 Portefeuille tous temps Code complet
_14.5 Structure détaillée du portefeuille tous temps

Chapitre 15 : Optimisation des stratégies d’allocation d’actifs de l’IA
_15.1 Premier réglage : application des techniques de réglage empiriques
_15.2 Réglage de la seconde : Utilisation du package Optuna
15.3 Comparaison avec la stratégie d'achat et de conservation
_15.4 Éléments de réglage supplémentaires

[Annexe A] Préparation de l'environnement de pratique
_A.1 Préparation à l'apprentissage
__A.1.1 Installation de Python
__A.1.2 Installation des packages requis
_A.2 Exécution de Jupyter Notebook
_A.3 Vérifier la version du programme

[Annexe B] ChatGPT a évolué vers RLHF : l’intersection de l’IA générative et de l’apprentissage par renforcement
_A.1 Comment l'IA générative et Chat GPT ont-elles été créées ?
__A.1.1 Le concept d'IA générative
__A.1.2 Comment ChatGPT a-t-il été entraîné ?
__A.1.3 Comment GPT comprend-il et exprime-t-il le contexte ?
__A.1.4 Résumé
_A.2 Qu'est-ce que RLHF ?
__A.2.1 Qu’est-ce que le feedback humain ?
__A.2.2 Pourquoi ChatGPT a-t-il besoin d'un modèle de récompense pour apprendre les « bonnes réponses » ?
__A.2.3 Processus d'apprentissage global du RLHF
_A.3 Lien entre PPO et les algorithmes basés sur les politiques que nous avons appris
__A.3.1 PPO que nous avons appris et PPO réellement utilisé
__A.3.2 Comment ChatGPT est-il devenu un exemple représentatif d'apprentissage par renforcement basé sur des politiques ?
__A.3.3 La place du PPO dans le processus d'apprentissage par renforcement pratique
_A.4 Comprendre RLHF à travers des exemples
__A.4.1 Examen complet du code
__A.4.2 Comprendre le code
_A.5 Comment l'apprentissage par renforcement fera-t-il évoluer l'IA générative ?
A.5.1 Le problème du tri et le rôle de l'apprentissage par renforcement
__A.5.2 Orientations futures de l'évolution des modèles de langage
__A.5.3 Un changement philosophique dans l'apprentissage par renforcement vers une « IA centrée sur l'humain »

Recherche
","
Image détaillée
Image détaillée 1
","
Avis de l'éditeur
Ce livre a été écrit pour les innombrables programmeurs qui hésitaient devant la théorie mathématique et le code complexe de l'apprentissage par renforcement.
L’apprentissage par renforcement, connu depuis l’apparition d’AlphaGo comme une « intelligence artificielle douée pour les jeux », est en réalité une méthode d’apprentissage autonome et flexible qui découvre par elle-même les stratégies optimales grâce à une interaction continue avec l’environnement.
Ces caractéristiques les rendent parfaitement adaptés à la résolution de problèmes du monde réel caractérisés par l'imprévisibilité et la complexité, et ils sont particulièrement bien établis comme une arme viable pour la génération de profits sur les marchés financiers, notamment les systèmes de négociation automatisés, les stratégies de négociation à haute fréquence et les modèles de gestion des risques.

Ce livre n'est pas simplement un ouvrage théorique ; c'est un guide pratique qui aide les lecteurs à tirer parti de l'apprentissage par renforcement pour obtenir des résultats concrets sur les marchés du monde réel.
Voici les principales caractéristiques et la structure de ce livre.

Public cible de ce livre

Les développeurs qui souhaitent étudier l'apprentissage par renforcement mais qui se sentent freinés par les mathématiques ou les explications théoriques
• Un programmeur qui souhaite aller au-delà de la simple automatisation des tâches et créer un système intelligent capable de prendre des décisions et de s'adapter à la situation.
• Les investisseurs individuels intéressés par les marchés d'actifs tels que les actions, les cryptomonnaies et les matières premières, et qui souhaitent concevoir leurs propres stratégies génératrices de profits.
• Les fondateurs ou planificateurs de startups qui développent des applications d'investissement basées sur l'IA, des conseillers financiers automatisés et des produits SaaS financiers utilisant l'apprentissage par renforcement
• Les professionnels qui souhaitent automatiser les transactions ou les flux de travail répétitifs et les doter de capacités d'apprentissage et d'adaptabilité.

Structure de ce livre

Ce livre est globalement divisé en sept parties principales et une annexe.
Chaque partie suit le schéma concept → mise en œuvre → pratique → application, et le niveau de difficulté augmente progressivement.
• Concepts de base de l'apprentissage par renforcement - Explication intuitive des probabilités, des chaînes de Markov, des processus de décision markoviens, des fonctions de valeur et de l'équation de Bellman.
• Algorithmes de base - Apprenez les techniques fondamentales telles que la programmation dynamique, Monte Carlo, l'apprentissage TD, SARSA et l'apprentissage Q, ainsi que le code correspondant.
• Concepts d'intelligence artificielle et approximation de fonctions - Couvre les principes des réseaux neuronaux, la descente de gradient, les fonctions d'activation et l'utilisation des frameworks d'apprentissage profond.
Apprentissage par renforcement basé sur la valeur (DQN) - Mettez en œuvre le DQN avec l'exemple CartPole et pratiquez l'équilibre exploration-exploitation et la mémoire de relecture.
• Réglage et optimisation - Pratiquez les fonctions d'activation, l'initialisation des poids, les optimiseurs, le prétraitement des données, les fonctions de perte, l'écrêtage du gradient et l'optimisation bayésienne basée sur Optuna.
• Projet de marché financier - Créer un environnement d'allocation d'actifs à l'aide des données yfinance et effectuer l'apprentissage, le réglage et l'analyse des performances avec PPO.
• Annexe - Guide pour la mise en place d'un environnement de pratique, explication détaillée du RLHF
"]
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 25 août 2025
- Nombre de pages, poids, dimensions : 542 pages | 182 × 232 × 35 mm
- ISBN13 : 9788965404200
- ISBN10 : 8965404207

Vous aimerez peut-être aussi

카테고리