Passer aux informations sur le produit
Le guide complet de l'exploration de texte en Python
Le guide complet de l'exploration de texte en Python
Description
Introduction au livre
L'exploration de textes nécessite une connaissance approfondie du traitement automatique du langage naturel, des statistiques et des techniques d'apprentissage profond, mais si l'on se laisse absorber par les aspects théoriques, la mise en œuvre peut facilement devenir un rêve lointain.
Ce livre explique l'exploration de textes à travers des exemples pratiques directement applicables à des situations réelles.
Il explique, en particulier aux débutants, le concept du prétraitement de texte et diverses applications détaillées à partir des notions de base.
Nous présentons des exemples d'utilisation de diverses techniques d'apprentissage automatique pour des tâches d'exploration de texte telles que la classification de documents et l'analyse des sentiments, et expliquons comment réduire la dimensionnalité et visualiser les résultats, effectuer une modélisation thématique, et obtenir et visualiser les tendances thématiques.

En plus de la classification de documents utilisant des techniques d'apprentissage profond de base, il comprend également un apprentissage par ajustement fin utilisant BERT, qui est largement utilisé de nos jours.
De plus, à mesure que l'intérêt pour les modèles de langage pré-entraînés augmente, le contenu théorique de ces modèles et de divers modèles de transformation de type transformeur est expliqué.
Nous avons également ajouté une formation pratique et un apprentissage par ajustement fin pour la synthèse de documents et la réponse aux questions à l'aide du modèle de transformateur.
De plus, la plupart des chapitres sont illustrés par suffisamment d'exemples pour vous aider à gagner en confiance dans l'analyse de documents coréens.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
[Partie 1] Principes de base de l'exploration de texte

Chapitre 1 : Principes de base de l'exploration de texte
1.1 Définition de l'exploration de texte
1.2 Évolutions du paradigme de l'exploration de texte
___1.2.1 Représentation des documents basée sur le comptage
___1.2.2 Représentation de documents basée sur la séquence
1.3 Connaissances et outils nécessaires à l'exploration de textes
___1.3.1 Techniques de traitement automatique du langage naturel
___1.3.2 Statistiques et algèbre linéaire
___1.3.3 Techniques de visualisation
___1.3.4 Apprentissage automatique
___1.3.5 Apprentissage profond
1.4 Principales applications de l'exploration de texte
1.4.1 Classification des documents
1.4.2 Création de documents
___1.4.3 Résumé du document
___1.4.4 Questions et réponses
___1.4.5 Traduction automatique
___1.4.6 Modélisation thématique
1.5 Environnement de pratique et logiciels utilisés dans ce livre
___1.5.1 Environnement de pratique de base
___1.5.2 Bibliothèques liées au traitement automatique du langage naturel
___1.5.3 Bibliothèques liées à l'apprentissage automatique
___1.5.4 Bibliothèques liées à l'apprentissage profond

Chapitre 2 : Prétraitement du texte
2.1 Concept de prétraitement de texte
___2.1.1 Pourquoi le prétraitement est-il nécessaire ?
___2.1.2 Étapes de prétraitement
___2.1.3 Configuration de l'exercice
2.2 Tokenisation
___2.2.1 Tokenisation des phrases
___2.2.2 Tokenisation des mots
___2.2.3 Tokenisation à l'aide d'expressions régulières
___2.2.4 Suppression des mots parasites et des mots vides
2.3 Normalisation
___2.3.1 Extraction de la tige
___2.3.2 Extraction des mots-clés
2.4 Étiquetage morphosyntaxique
___2.4.1 Comprendre les parties du discours
___2.4.2 Étiquetage morphosyntaxique à l'aide de NLTK
___2.4.3 Analyse morphologique et étiquetage morphosyntaxique du coréen
___2.4.4 Références

Chapitre 3 : Graphiques et nuages ​​de mots
3.1 Graphique de fréquence des mots - Quels sont les mots les plus fréquemment utilisés ?
3.2 Visualisez le contenu en un coup d'œil grâce à un nuage de mots
3.3 Graphiques et nuages ​​de mots pour les documents coréens

[Partie 2] Exploration de texte basée sur BOW

Chapitre 4 : Représentation des documents basée sur le comptage
4.1 Concept de représentation de documents basée sur le comptage
4.2 Génération de vecteurs de comptage basée sur BOW
4.3 Création d'un vecteur de comptage avec scikit-learn
4.4 Conversion vectorielle du texte coréen
4.4.1 Téléchargement des données
4.5 Utilisation des vecteurs de comptage
4.6 Améliorons les performances avec TF-IDF

Chapitre 5 : Classification des documents basée sur le BOW
5.1 Préparation des données et extraction des caractéristiques des groupes de discussion
___5.1.1 Vérification et séparation des ensembles de données
___5.1.2 Extraction de caractéristiques basée sur le comptage
5.2 Comprendre l'apprentissage automatique et les processus de classification des documents
5.3 Classification de documents à l'aide du classificateur naïf bayésien
5.4 Classification des documents par analyse de régression logistique
___5.4.1 Prévention du surapprentissage par régression Ridge
5.4.2 Sélection de caractéristiques par régression Lasso
5.5 Autres méthodes de classification de documents utilisant des arbres de décision, etc.
5.6 Comment améliorer les performances
5.7 Problèmes et solutions basés sur le comptage utilisant les n-grammes
5.7.1 Informations contextuelles non disponibles par le biais des statistiques
___5.7.2 Comprendre les n-grammes
5.7.3 Classification de documents à l'aide de n-grammes
5.8 Classification des documents coréens
5.8.1 Prédiction des titres de films pour la prochaine critique
___5.8.2 Efforts visant à améliorer la performance

Chapitre 6 : Réduction de dimensionnalité
6.1 La malédiction de la dimensionnalité et les raisons de la réduction de dimensionnalité
6.2 Réduction de dimensionnalité par ACP
6.3 Réduction de dimensionnalité et compréhension sémantique à l'aide de l'analyse sémantique latente (LSA)
6.3.1 Réduction de dimensionnalité et performances avec LSA
6.3.2 Calcul de la similarité sémantique entre documents à l'aide de LSA
6.3.3 Analyse des thèmes latents
___6.3.4 Analyse de la similarité sémantique entre les mots
6.4 Visualisation et réduction de dimensionnalité à l'aide de tSNE

Chapitre 7 : Trouver des sujets grâce à la modélisation thématique
7.1 Comprendre la modélisation thématique et l'analyse discriminante linéaire (LDA)
___7.1.1 Qu'est-ce que la modélisation thématique ?
___7.1.2 Structure du modèle LDA
___7.1.3 Évaluation du modèle et détermination du nombre approprié de sujets
7.2 Modélisation thématique avec Scikit-Learn
7.2.1 Préparation des données
___7.2.2 Exécution de la modélisation thématique LDA
___7.2.3 Choisir le nombre optimal de sujets
7.3 Modélisation thématique à l'aide de Gensim
___7.3.1 Utilisation et visualisation de Gensim
___7.3.2 Sélection optimale des valeurs à l'aide de la confusion et de la cohésion thématique
7.4 Découvrir comment les sujets évoluent au fil du temps grâce aux tendances thématiques
7.5 Modélisation dynamique des sujets

Chapitre 8 : Analyse des sentiments
8.1 Comprendre l'analyse des sentiments
8.1.1 Analyse des sentiments basée sur le vocabulaire
8.1.2 Analyse des sentiments basée sur l'apprentissage automatique
8.2 Analyse des sentiments des critiques de films à l'aide d'un dictionnaire des sentiments
___8.2.1 Préparation des données d'évaluation de films NLTK
8.2.2 Analyse des sentiments à l'aide de TextBlob
___8.2.3 Analyse des sentiments à l'aide d'AFINN
8.2.4 Analyse des sentiments à l'aide de VADER
8.3 Analyse des sentiments basée sur l'apprentissage automatique
8.3.1 Analyse des sentiments des critiques de films NLTK basée sur l'apprentissage automatique
8.3.2 Analyse des sentiments des critiques de films Next basée sur l'apprentissage automatique
8.4 Références

Chapitre 9 : Comprendre les réseaux neuronaux artificiels et l’apprentissage profond
9.1 Comprendre les réseaux neuronaux artificiels
___9.1.1 Structure et composants des réseaux de neurones artificiels
___9.1.2 Apprentissage dans les réseaux de neurones artificiels
___9.1.3 Comprendre la fonction de perte
___9.1.4 Descente en pente
9.2 Comprendre l'apprentissage profond
___9.2.1 Qu'est-ce que l'apprentissage profond ?
___9.2.2 Problèmes liés aux réseaux neuronaux profonds
___9.2.3 Solutions en apprentissage profond
___9.2.4 Divers algorithmes d'apprentissage profond
___9.2.5 Environnement de développement et d'utilisation de l'apprentissage profond

[Partie 3] Techniques d'apprentissage profond pour l'exploration de texte

Chapitre 10 : Réseaux de neurones récurrents (RNN) – Classification de documents par apprentissage profond
10.1 Pourquoi RNN ?
___10.1.1 Comprendre les RNN
___10.1.2 Pourquoi les RNN sont adaptés à la classification de documents
___10.1.3 Application des RNN à la classification de documents
10.2 Comprendre les plongements lexicaux
___10.2.1 Qu'est-ce qu'un plongement lexical ?
___10.2.2 BOW et intégration de documents
___10.2.3 Représentations vectorielles de mots et apprentissage profond
10.3 Classification de documents à l'aide de RNN - Analyse des sentiments des critiques de films NLTK
___10.3.1 Préparation des données pour l'intégration de mots
___10.3.2 Classification à l'aide de modèles de réseaux neuronaux généraux autres que les RNN
10.3.3 Classification de documents basée sur les RNN utilisant les informations d'ordre des documents
10.4 Amélioration des performances grâce à l'utilisation de LSTM, Bi-LSTM et GRU

Chapitre 11 : Comprendre Word2Vec, ELMo et Doc2Vec
11.1 Word2Vec - Une technique représentative d'intégration de mots
___11.1.1 Principes de l'apprentissage Word2Vec
___11.1.2 Utilisation de Word2Vec - Importation du modèle entraîné
___11.1.3 FastText - Application des n-grammes aux plongements lexicaux
11.2 ELMo - Distinguer le sens des mots en fonction du contexte
___11.2.1 Problèmes avec Word2Vec
___11.2.2 Structure ELMo
11.3 Doc2Vec - Intégration de documents contextuelle

Chapitre 12 : CNN - Classification de documents par classification d’images
12.1 L'émergence et le fonctionnement de CNN
12.2 Classification de documents à l'aide de CNN
12.2.1 Principes de la classification de documents à l'aide de CNN
12.2.2 Classification des critiques de films dans NLTK à l'aide de CNN

Chapitre 13 : Attention et transformateurs
13.1 Seq2seq : une technique d’apprentissage profond à partir de la traduction
13.2 Améliorer les performances grâce à l'attention
13.3 L'attention portée à soi et les transformateurs
___13.3.1 Comprendre l'attention portée à soi-même
___13.3.2 Structure du transformateur
___13.3.3 Principe d'auto-attention de l'encodeur
___13.3.4 Fonctionnement du décodeur

Chapitre 14 : Compréhension et applications simples de BERT
14.1 Pourquoi les modèles de langage sont-ils importants ?
14.2 Compréhension théorique des modèles de langage pré-apprentissage
14.3 Structure BERT
14.4 Pré-entraînement et ajustement fin à l'aide de modèles de langage
14.5 Utilisation directe de modèles BERT pré-entraînés
14.6 Utilisation de tokeniseurs et de modèles avec classes automatiques

Chapitre 15 : Optimisation du modèle pré-entraîné BERT
15.1 Prétraitement pour l'entraînement de BERT
15.2 Optimisation de l'apprentissage à l'aide d'un formateur Transformer
15.3 Optimisation de l'apprentissage avec PyTorch

Chapitre 16 : Utilisation de BERT sur des documents coréens
16.1 Optimisation du modèle de pré-entraînement BERT multilingue
16.2 Optimisation PyTorch du modèle pré-entraîné KoBERT

Chapitre 17 : État actuel des modèles de transformation des transformateurs
17.1 Différents tokeniseurs pour les modèles de variantes de transformateurs
__17.1.1 Tokeniseur BPE (encodage par paires d'octets)
__17.1.2 Tokeniseur WordPiece
__17.1.3 Tokenizer Unigram SentencePièce
__17.2 Modèle de déformation de transformateur basé sur GPT
__17.2.1 GPT-2
__17.2.2 GPT-3
__17.2.3 ChatGPT
17.3 Modèle de transformateur variante basé sur BERT
__17.3.1 RoBERTa (Approche de pré-entraînement BERT robuste et optimisée)
__17.3.2 ALBERT (Un BERT allégé)
__17.3.3 ELECTRA (Apprentissage efficace d'un encodeur qui classe avec précision les remplacements de jetons)
17.4 Modèle de transformateur utilisant à la fois un encodeur et un décodeur
__17.4.1 BART (Transformateurs bidirectionnels et autorégressifs)
__17.4.2 T5 (Transformateur de transfert texte-à-texte)
17.5 État actuel des modèles de modification des transformateurs domestiques

Chapitre 18 : Résumé du document à l’aide du modèle Transformer
18.1 Comprendre les résumés de documents
__18.1.1 Métrique de performance du résumé du document : ROUGE
__18.1.2 Résumé du document : Ensemble de données et modèle de transformation du transformateur
18.2 Synthèse de documents à l'aide de pipelines
18.3 Résumé de documents à l'aide du modèle T5 et des classifications automatiques
18.4 Optimisation de l'apprentissage à l'aide du modèle et du formateur T5
18.5 Résumé des documents coréens

Chapitre 19 : Réponse aux questions à l’aide du modèle Transformer
19.1 Comprendre le système de questions-réponses
19.2 Réponse aux requêtes à l'aide de pipelines
19.3 Réponse aux questions à l'aide des classes automatiques
19.4 Optimisation de l'apprentissage par questions-réponses à l'aide d'un formateur
19.5 Questions-réponses coréennes

Image détaillée
Image détaillée 1

Avis de l'éditeur
Ce que ce livre couvre

- Techniques de prétraitement de texte telles que la tokenisation, la racinisation, l'extraction de mots, le traitement des mots vides et l'étiquetage morphosyntaxique

- Tracer des graphiques de fréquence des mots et des nuages ​​de mots

- Convertir les documents en vecteurs de comptage et en vecteurs TF-IDF, et trouver les similarités entre les documents.

- Effectuer la classification des documents et l'analyse des sentiments à l'aide de diverses techniques d'apprentissage automatique/d'apprentissage profond.

- Convertir des documents coréens à l'aide de KoNLPy et les analyser avec divers algorithmes d'apprentissage automatique.

- Réduction de la dimensionnalité des vecteurs de documents, modélisation thématique LDA, modélisation thématique dynamique, et identification et visualisation des tendances thématiques.

- Comprendre les techniques d'intégration de mots telles que Word2Vec, ELMo et Doc2Vec

- Comprendre et utiliser BERT, s'exercer à l'apprentissage par ajustement fin à l'aide de PyTorch et s'exercer à utiliser BERT sur des documents coréens

- Compréhension des modèles de langage pré-entraînés et des différentes variantes de transformateurs tels que GPT-2, GPT-3, chatGPT, RoBERTa, ALBERT, ELECTRA, BART et T5.

- Exercices de résumé de document et de questions-réponses utilisant des modèles de transformateurs tels que T5, KoBART, DistilBERT et KoELECTRA
SPÉCIFICATIONS DES PRODUITS
- Date de publication : 28 février 2023
- Nombre de pages, poids, dimensions : 424 pages | 175 × 235 × 22 mm
- ISBN13 : 9791158394226
- ISBN10 : 1158394225

Vous aimerez peut-être aussi

카테고리