
Mathématiques du modèle de diffusion
Description
Introduction au livre
Principes mathématiques de la technologie de modélisation de la diffusion pour la génération d'images/vidéos/voix/textes
Le modèle de diffusion attire l'attention en tant que modèle génératif qui crée des données de haute qualité grâce à des technologies telles que DALL-E2, Midjourney et Stable Diffusion qui génèrent des images correspondant au texte.
Ce livre explique en détail les concepts de base du modèle de diffusion, son processus de développement et des exemples d'application.
En examinant mathématiquement les principes du modèle de diffusion, nous pouvons mieux comprendre la théorie et mettre en évidence le fort potentiel de ce modèle.
Le modèle de diffusion attire l'attention en tant que modèle génératif qui crée des données de haute qualité grâce à des technologies telles que DALL-E2, Midjourney et Stable Diffusion qui génèrent des images correspondant au texte.
Ce livre explique en détail les concepts de base du modèle de diffusion, son processus de développement et des exemples d'application.
En examinant mathématiquement les principes du modèle de diffusion, nous pouvons mieux comprendre la théorie et mettre en évidence le fort potentiel de ce modèle.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
Préface du traducteur viii
Recommandation ix
Préface xi
Liste des symboles xv
CHAPITRE 1 Modèle génératif 1
1.1 Qu'est-ce qu'un modèle génératif ? 1
1.2 Modèle énergétique et fonction de distribution 4
1.3 Méthode d'apprentissage 6
1.4 La difficulté de générer des données multimodales en grande dimension 13
Score 1,5 : Pente 14 pour l’entrée de log-vraisemblance
__1.5.1 Méthode de Monte Carlo de Langevin 16
__1.5.2 Correspondance des scores 18
__1.5.3 Appariement implicite des scores 19
__1.5.4 Preuve que l'appariement implicite des scores peut estimer les scores 22
__1.5.5 Débruitage par correspondance de scores 26
__1.5.6 Preuve que la correspondance de scores débruitée peut estimer les scores 30
__1.5.7 Preuve lorsque le bruit suit une distribution normale 32
__1.5.8 Résumé des méthodes d'appariement des scores 37
Résumé 37
CHAPITRE 2 Modèles de diffusion 39
2.1 Modèles basés sur le score et modèles de probabilité de diffusion de débruitage 39
2.2 Modèle basé sur le score 40
__2.2.1 Problèmes liés à la méthode de Monte Carlo de Langevin utilisant des scores estimés 40
__2.2.2 Les modèles basés sur les scores combinent les scores de plusieurs distributions post-perturbation 42
2.3 Modèle de probabilité de diffusion de débruitage 46
__2.3.1 Modèle à variable latente comprenant des processus de diffusion et de diffusion inverse 46
__2.3.2 DDPM Apprentissage 51
__2.3.3 56 avec correspondance de score de débruitage dans DDPM
__2.3.4 Génération de données à l'aide de DDPM 61
2.4 Structure unifiée utilisant le rapport signal/bruit de SBM et DDPM 62
__2.4.1 Relation entre le SBM et le DDPM 62
__2.4.2 Modèle à temps continu 70
2.4.3 La même solution peut être obtenue quel que soit le programme de bruit 71
__2.4.4 Programme de bruit apprenable 72
Résumé 73
CHAPITRE 3 Modèles de diffusion en temps continu 75
3.1 Équations différentielles stochastiques 76
3.2 Représentation SDE de SBM et DDPM 77
3.3 Processus de dédiffusion de l'expression SDE 80
3.4 Apprentissage du modèle de diffusion de représentation SDE 81
3.5 Modèle de diffusion d'expression SDE Échantillonnage 83
3.6 Flux de probabilité ODE 84
3.6.1 Démonstration que les vraisemblances marginales du flux de probabilité de l'EDO et de l'EDS sont identiques 86
__3.6.2 Calcul de vraisemblance pour les EDO probabilistes de flux 88
__3.6.3 Flux de probabilité dans le signal et le bruit ODE 88
3.7 Caractéristiques du modèle de diffusion 89
3.7.1 Relation avec les modèles de variables latentes existants 90
3.7.2 Le modèle de diffusion est stable lors de l'apprentissage 91
3.7.3 Décomposition des problèmes de génération complexes en problèmes de sous-génération plus simples 92
3.7.4 Différentes conditions peuvent être combinées 93
3.7.5 La symétrie de la création peut être introduite naturellement 94
3.7.6 Lors de l'extraction d'échantillons, le nombre d'étapes est important, ce qui ralentit la vitesse de génération.
3.7.7 Question non résolue de la généralisation au modèle de diffusion 95
Résumé 96
CHAPITRE 4 ÉVOLUTION DU MODÈLE DE DIFFUSION 97
4.1 Score de 97 en génération conditionnelle
4.2 Guide du classificateur 98
4.3 Conseil 99 sans utiliser de classificateur
4.4 Modèle de diffusion de sous-espace 102
__4.4.1 Apprentissage du modèle de diffusion de sous-espace 104
__4.4.2 Échantillonnage des modèles de diffusion de sous-espace 106
4.5 Modèle de diffusion tenant compte de la symétrie 107
__4.5.1 Géométrie et symétrie 107
4.5.2 Arrangement rotationnel des composés 110
Résumé 117
CHAPITRE 5 APPLICATIONS 119
5.1 Génération d'images, super-résolution, complémentation et transformation d'images 120
5.2 Création de vidéos et de panoramas 121
5.3 Extraction et transformation sémantiques 122
5.4 Synthèse vocale et accentuation 123
5.5 Formation et rotation des composés 124
5.6 Amélioration de la robustesse aux perturbations adverses 125
5.7 Compression des données 126
Résumé 127
ANNEXE A Annexe 129
A.1 Distribution de probabilité a posteriori lorsque la distribution a priori est normale et la vraisemblance est linéairement normale 129
A.2 ELBO 130
A.3 Dérivation d'une équation différentielle ordinaire de flux probabiliste à l'aide de signaux et de bruit 131
A.4 Problème de génération conditionnelle 135
A.5 Modèle de diffusion implicite de débruitage 137
A.6 Démonstration de l'équation différentielle stochastique pour le processus de diffusion inverse 141
A.7 Modèle de diffusion avec bruit non gaussien 146
A.8 Bits analogiques : Modèle de diffusion à variable discrète 147
Référence 149
Recherche 154
Recommandation ix
Préface xi
Liste des symboles xv
CHAPITRE 1 Modèle génératif 1
1.1 Qu'est-ce qu'un modèle génératif ? 1
1.2 Modèle énergétique et fonction de distribution 4
1.3 Méthode d'apprentissage 6
1.4 La difficulté de générer des données multimodales en grande dimension 13
Score 1,5 : Pente 14 pour l’entrée de log-vraisemblance
__1.5.1 Méthode de Monte Carlo de Langevin 16
__1.5.2 Correspondance des scores 18
__1.5.3 Appariement implicite des scores 19
__1.5.4 Preuve que l'appariement implicite des scores peut estimer les scores 22
__1.5.5 Débruitage par correspondance de scores 26
__1.5.6 Preuve que la correspondance de scores débruitée peut estimer les scores 30
__1.5.7 Preuve lorsque le bruit suit une distribution normale 32
__1.5.8 Résumé des méthodes d'appariement des scores 37
Résumé 37
CHAPITRE 2 Modèles de diffusion 39
2.1 Modèles basés sur le score et modèles de probabilité de diffusion de débruitage 39
2.2 Modèle basé sur le score 40
__2.2.1 Problèmes liés à la méthode de Monte Carlo de Langevin utilisant des scores estimés 40
__2.2.2 Les modèles basés sur les scores combinent les scores de plusieurs distributions post-perturbation 42
2.3 Modèle de probabilité de diffusion de débruitage 46
__2.3.1 Modèle à variable latente comprenant des processus de diffusion et de diffusion inverse 46
__2.3.2 DDPM Apprentissage 51
__2.3.3 56 avec correspondance de score de débruitage dans DDPM
__2.3.4 Génération de données à l'aide de DDPM 61
2.4 Structure unifiée utilisant le rapport signal/bruit de SBM et DDPM 62
__2.4.1 Relation entre le SBM et le DDPM 62
__2.4.2 Modèle à temps continu 70
2.4.3 La même solution peut être obtenue quel que soit le programme de bruit 71
__2.4.4 Programme de bruit apprenable 72
Résumé 73
CHAPITRE 3 Modèles de diffusion en temps continu 75
3.1 Équations différentielles stochastiques 76
3.2 Représentation SDE de SBM et DDPM 77
3.3 Processus de dédiffusion de l'expression SDE 80
3.4 Apprentissage du modèle de diffusion de représentation SDE 81
3.5 Modèle de diffusion d'expression SDE Échantillonnage 83
3.6 Flux de probabilité ODE 84
3.6.1 Démonstration que les vraisemblances marginales du flux de probabilité de l'EDO et de l'EDS sont identiques 86
__3.6.2 Calcul de vraisemblance pour les EDO probabilistes de flux 88
__3.6.3 Flux de probabilité dans le signal et le bruit ODE 88
3.7 Caractéristiques du modèle de diffusion 89
3.7.1 Relation avec les modèles de variables latentes existants 90
3.7.2 Le modèle de diffusion est stable lors de l'apprentissage 91
3.7.3 Décomposition des problèmes de génération complexes en problèmes de sous-génération plus simples 92
3.7.4 Différentes conditions peuvent être combinées 93
3.7.5 La symétrie de la création peut être introduite naturellement 94
3.7.6 Lors de l'extraction d'échantillons, le nombre d'étapes est important, ce qui ralentit la vitesse de génération.
3.7.7 Question non résolue de la généralisation au modèle de diffusion 95
Résumé 96
CHAPITRE 4 ÉVOLUTION DU MODÈLE DE DIFFUSION 97
4.1 Score de 97 en génération conditionnelle
4.2 Guide du classificateur 98
4.3 Conseil 99 sans utiliser de classificateur
4.4 Modèle de diffusion de sous-espace 102
__4.4.1 Apprentissage du modèle de diffusion de sous-espace 104
__4.4.2 Échantillonnage des modèles de diffusion de sous-espace 106
4.5 Modèle de diffusion tenant compte de la symétrie 107
__4.5.1 Géométrie et symétrie 107
4.5.2 Arrangement rotationnel des composés 110
Résumé 117
CHAPITRE 5 APPLICATIONS 119
5.1 Génération d'images, super-résolution, complémentation et transformation d'images 120
5.2 Création de vidéos et de panoramas 121
5.3 Extraction et transformation sémantiques 122
5.4 Synthèse vocale et accentuation 123
5.5 Formation et rotation des composés 124
5.6 Amélioration de la robustesse aux perturbations adverses 125
5.7 Compression des données 126
Résumé 127
ANNEXE A Annexe 129
A.1 Distribution de probabilité a posteriori lorsque la distribution a priori est normale et la vraisemblance est linéairement normale 129
A.2 ELBO 130
A.3 Dérivation d'une équation différentielle ordinaire de flux probabiliste à l'aide de signaux et de bruit 131
A.4 Problème de génération conditionnelle 135
A.5 Modèle de diffusion implicite de débruitage 137
A.6 Démonstration de l'équation différentielle stochastique pour le processus de diffusion inverse 141
A.7 Modèle de diffusion avec bruit non gaussien 146
A.8 Bits analogiques : Modèle de diffusion à variable discrète 147
Référence 149
Recherche 154
Image détaillée

Dans le livre
Un modèle génératif est un modèle qui génère des données dans le domaine cible.
Et certains modèles génératifs peuvent également évaluer la vraisemblance p(x) des données x données.
Comprendre comment les données sont générées est un moyen efficace de les comprendre, et la possibilité de générer librement des données peut être bénéfique à de nombreuses applications.
Ainsi, de nombreuses recherches sur les modèles génératifs sont menées depuis longtemps.
--- p.1
Le premier est le modèle basé sur le score (SBM).
Comme nous l'avons vu au chapitre 1, nous pouvons obtenir des échantillons de la distribution de probabilité cible en utilisant la méthode de Monte Carlo de Langevin, qui utilise des scores estimés par correspondance de scores de débruitage.
Cependant, en pratique, l'estimation des scores pose problème, l'échantillonnage prend beaucoup de temps et il ne fonctionne pas bien dans les distributions multimodales de grande dimension.
Pour remédier à ce problème, nous examinons les scores d'apprentissage à partir de distributions perturbées par un bruit de différentes tailles et générant des données à l'aide de la méthode de Monte Carlo de Langevin.
--- p.39
Les équations différentielles ordinaires (EDO) de flux probabilistes peuvent être considérées comme une forme particulière d'EDO neuronales, qui sont des modèles génératifs utilisant des EDO.
Les modèles ODE neuronaux modélisent le changement à chaque étape temporelle à l'aide d'un réseau neuronal en modifiant les données extraites de la distribution a priori à l'aide d'équations différentielles.
L'équation différentielle ordinaire du flux de probabilité définit ce montant de changement sur la base de l'équation précédente (3.6).
--- p.85
Un guidage qui n'utilise pas de classificateur peut résoudre le problème du guidage par classificateur.
Il n'est pas nécessaire d'entraîner le classificateur séparément des scores inconditionnels à différents niveaux de bruit, et lors de l'entraînement général, les conditions peuvent être supprimées avec une certaine probabilité.
L'apprentissage peut donc être grandement simplifié.
De plus, en partageant l'apprentissage des scores conditionnels et inconditionnels, nous pouvons améliorer considérablement la qualité de la génération en réduisant la possibilité de découvrir des relations entre y et x qui sont en réalité sans rapport.
--- p.101
La génération vidéo, qui était la tâche la plus difficile à apprendre, est également mise en œuvre à l'aide d'un modèle de diffusion.
La génération vidéo peut être vue comme le problème de la génération d'une image pour chaque image fixe.
La génération vidéo pose un problème de génération de données de très grande dimension, ce qui rendait difficile même le surapprentissage des données d'entraînement.
La génération vidéo à l'aide d'un modèle de diffusion est une méthode permettant de générer des images et de les utiliser comme conditions.
Et certains modèles génératifs peuvent également évaluer la vraisemblance p(x) des données x données.
Comprendre comment les données sont générées est un moyen efficace de les comprendre, et la possibilité de générer librement des données peut être bénéfique à de nombreuses applications.
Ainsi, de nombreuses recherches sur les modèles génératifs sont menées depuis longtemps.
--- p.1
Le premier est le modèle basé sur le score (SBM).
Comme nous l'avons vu au chapitre 1, nous pouvons obtenir des échantillons de la distribution de probabilité cible en utilisant la méthode de Monte Carlo de Langevin, qui utilise des scores estimés par correspondance de scores de débruitage.
Cependant, en pratique, l'estimation des scores pose problème, l'échantillonnage prend beaucoup de temps et il ne fonctionne pas bien dans les distributions multimodales de grande dimension.
Pour remédier à ce problème, nous examinons les scores d'apprentissage à partir de distributions perturbées par un bruit de différentes tailles et générant des données à l'aide de la méthode de Monte Carlo de Langevin.
--- p.39
Les équations différentielles ordinaires (EDO) de flux probabilistes peuvent être considérées comme une forme particulière d'EDO neuronales, qui sont des modèles génératifs utilisant des EDO.
Les modèles ODE neuronaux modélisent le changement à chaque étape temporelle à l'aide d'un réseau neuronal en modifiant les données extraites de la distribution a priori à l'aide d'équations différentielles.
L'équation différentielle ordinaire du flux de probabilité définit ce montant de changement sur la base de l'équation précédente (3.6).
--- p.85
Un guidage qui n'utilise pas de classificateur peut résoudre le problème du guidage par classificateur.
Il n'est pas nécessaire d'entraîner le classificateur séparément des scores inconditionnels à différents niveaux de bruit, et lors de l'entraînement général, les conditions peuvent être supprimées avec une certaine probabilité.
L'apprentissage peut donc être grandement simplifié.
De plus, en partageant l'apprentissage des scores conditionnels et inconditionnels, nous pouvons améliorer considérablement la qualité de la génération en réduisant la possibilité de découvrir des relations entre y et x qui sont en réalité sans rapport.
--- p.101
La génération vidéo, qui était la tâche la plus difficile à apprendre, est également mise en œuvre à l'aide d'un modèle de diffusion.
La génération vidéo peut être vue comme le problème de la génération d'une image pour chaque image fixe.
La génération vidéo pose un problème de génération de données de très grande dimension, ce qui rendait difficile même le surapprentissage des données d'entraînement.
La génération vidéo à l'aide d'un modèle de diffusion est une méthode permettant de générer des images et de les utiliser comme conditions.
--- p.121
Avis de l'éditeur
Comprendre les modèles de diffusion à l'aide de formules et de figures
Nous avons tous constaté l'impact des progrès de l'IA qui génèrent des images à partir de texte, comme DALL-E2, Midjourney et Stable Diffusion.
Ces technologies reposent sur le modèle de diffusion.
Comprendre les modèles de prolifération qui génèrent des données de haute qualité est essentiel pour comprendre l'IA générative actuelle, mais la littérature pertinente est rare.
Ce livre explique en détail les concepts de base du modèle de diffusion, son processus de développement et des cas d'application.
Pour vous aider à comprendre la formule plus intuitivement, nous fournissons plusieurs figures et graphiques, et en comparant la stabilité d'apprentissage, l'estimation de vraisemblance et la génération conditionnelle avec les modèles génératifs existants, vous pouvez clairement comprendre le modèle de diffusion.
Ce qui rend ce livre encore plus exceptionnel, c'est qu'il a été écrit par Daisuke Okanohara, directeur de la recherche chez Preferred Networks, la principale entreprise japonaise spécialisée dans l'IA.
Daisuke Okanohara, auteur chevronné reconnu pour « la richesse du contexte qu'il offre autour de la technologie », a remporté le 32e prix Okawa Publishing pour cet ouvrage.
Si vous souhaitez bien comprendre le modèle de diffusion qui est au cœur de l'intelligence artificielle actuelle, ce livre vous servira de guide.
Contenu principal
● Aperçu et concepts de base du modèle génératif
● Comprendre les modèles de diffusion à l'aide de modèles basés sur le rapport signal/bruit et sur le score
● Caractéristiques des modèles de diffusion à temps continu et des modèles de diffusion
● Développement de modèles de diffusion tels que le guidage par classificateur, le sous-espace et la symétrie
● Exemples d'application des modèles de diffusion tels que la vidéo, la synthèse vocale et les composés
Nous avons tous constaté l'impact des progrès de l'IA qui génèrent des images à partir de texte, comme DALL-E2, Midjourney et Stable Diffusion.
Ces technologies reposent sur le modèle de diffusion.
Comprendre les modèles de prolifération qui génèrent des données de haute qualité est essentiel pour comprendre l'IA générative actuelle, mais la littérature pertinente est rare.
Ce livre explique en détail les concepts de base du modèle de diffusion, son processus de développement et des cas d'application.
Pour vous aider à comprendre la formule plus intuitivement, nous fournissons plusieurs figures et graphiques, et en comparant la stabilité d'apprentissage, l'estimation de vraisemblance et la génération conditionnelle avec les modèles génératifs existants, vous pouvez clairement comprendre le modèle de diffusion.
Ce qui rend ce livre encore plus exceptionnel, c'est qu'il a été écrit par Daisuke Okanohara, directeur de la recherche chez Preferred Networks, la principale entreprise japonaise spécialisée dans l'IA.
Daisuke Okanohara, auteur chevronné reconnu pour « la richesse du contexte qu'il offre autour de la technologie », a remporté le 32e prix Okawa Publishing pour cet ouvrage.
Si vous souhaitez bien comprendre le modèle de diffusion qui est au cœur de l'intelligence artificielle actuelle, ce livre vous servira de guide.
Contenu principal
● Aperçu et concepts de base du modèle génératif
● Comprendre les modèles de diffusion à l'aide de modèles basés sur le rapport signal/bruit et sur le score
● Caractéristiques des modèles de diffusion à temps continu et des modèles de diffusion
● Développement de modèles de diffusion tels que le guidage par classificateur, le sous-espace et la symétrie
● Exemples d'application des modèles de diffusion tels que la vidéo, la synthèse vocale et les composés
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 5 juillet 2024
Nombre de pages, poids, dimensions : 172 pages | 360 g | 170 × 225 × 11 mm
- ISBN13 : 9791193926444
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne