
Analyse de texte coréen accessible à tous avec Python
Description
Introduction au livre
Même les maquettes géantes du futur lointain commencent par de petites maquettes !
Mettons en œuvre dès maintenant un modèle petit et simple de nos propres mains !
Comprend 4 projets pratiques faciles à réaliser par tous !
Comment les ordinateurs comprennent-ils le coréen ? Que faut-il pour traiter un texte coréen par ordinateur ? Que vous débutiez en analyse de texte ou que vous souhaitiez consolider et perfectionner vos connaissances fondamentales en analyse de texte et en traitement automatique du langage naturel, ce livre contient des informations essentielles.
Avant de nous lancer dans un projet à part entière, nous apprendrons d'abord les concepts de base de Python nécessaires à l'analyse de texte et l'utilisation de base des bibliothèques Python essentielles, ainsi que les fonctions et les méthodes de prétraitement des données textuelles.
Ensuite, nous aborderons le modèle du sac de mots et le TF-IDF, qui sont des concepts fondamentaux de l'analyse de texte et des méthodes de vectorisation pour convertir du texte en données numériques.
Nous allons maintenant procéder à un projet concret utilisant quatre ensembles de données coréens différents.
Le projet couvre l'intégralité du processus, du téléchargement des données au prétraitement et à la visualisation, et la formation pratique a été conçue sous forme de Colab afin que vous puissiez facilement la suivre n'importe où dès maintenant.
Mettons en œuvre dès maintenant un modèle petit et simple de nos propres mains !
Comprend 4 projets pratiques faciles à réaliser par tous !
Comment les ordinateurs comprennent-ils le coréen ? Que faut-il pour traiter un texte coréen par ordinateur ? Que vous débutiez en analyse de texte ou que vous souhaitiez consolider et perfectionner vos connaissances fondamentales en analyse de texte et en traitement automatique du langage naturel, ce livre contient des informations essentielles.
Avant de nous lancer dans un projet à part entière, nous apprendrons d'abord les concepts de base de Python nécessaires à l'analyse de texte et l'utilisation de base des bibliothèques Python essentielles, ainsi que les fonctions et les méthodes de prétraitement des données textuelles.
Ensuite, nous aborderons le modèle du sac de mots et le TF-IDF, qui sont des concepts fondamentaux de l'analyse de texte et des méthodes de vectorisation pour convertir du texte en données numériques.
Nous allons maintenant procéder à un projet concret utilisant quatre ensembles de données coréens différents.
Le projet couvre l'intégralité du processus, du téléchargement des données au prétraitement et à la visualisation, et la formation pratique a été conçue sous forme de Colab afin que vous puissiez facilement la suivre n'importe où dès maintenant.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
Chapitre 1 : Premiers pas avec Colab
Entrée LEÇON OT
LEÇON 01 Exécuter Colab
____1 Comment
____2 touches de raccourci
LEÇON 02 Ouvrir le code d'entraînement dans Colab
Thème Colab ____1
Chapitre 2 : Manipulation des chaînes de caractères en Python
Entrée LEÇON OT
LEÇON 01 Avant l'entraînement aux cordes
LEÇON 02 Exercices de cordes
____1 représentation de chaîne
____2 Gestion des erreurs
____3 Méthode d'expression + gestion des erreurs
LEÇON O3 : Plusieurs façons de manipuler les chaînes de caractères
____1 variable
____2 Indexation
____3 Découpe
____4 Longueur de la chaîne, nombre de mots
____5 fonctions de chaînes de caractères
____6 répétitions
____7 fonction
____8 Liste des méthodes intégrées de chaînes de caractères
Chapitre 3 : Travailler avec les bibliothèques
Entrée LEÇON OT
LEÇON 01 Les pandas
____1 Comprendre les data frames et les séries
____2 Manipulation des chaînes de caractères avec l'accesseur str
LEÇON 02 NumPy
____1 Comprendre les tableaux NumPy
____2 Visualisation des tableaux NumPy avec matplotlib
Chapitre 4 : Modèle du sac de mots et TF-IDF
Entrée LEÇON OT
LEÇON 01 Modèle du sac de mots
Comment fabriquer un modèle de sac à ____1 mot
____2 Créer un modèle de sac de mots
____3 n-grammes : Utilisés pour regrouper les mots avant et après
____4 min_df et max_df : Réglage de la fréquence
____5 max_features : Limiter le nombre de mots à apprendre
____6 mots vides : Supprimer les mots vides
____7 analyseur : défini par caractère ou mot
LEÇON 02 TF-IDF
____1 Comment appliquer les pondérations TF-IDF
Chapitre 5 : Classification des sujets des actualités Yonhap
Entrée LEÇON OT
LEÇON 01 Sélection des données
LEÇON 02 Processus de classification
LEÇON 03 Paramètres de base pour la classification
____1 Importer la bibliothèque
____2 Paramètres de police pour la visualisation
LEÇON 04 Chargement des données
LEÇON 05 Prétraitement des données
____1 Fusion de données pour le prétraitement des données
____2 Vérifiez la fréquence des réponses correctes
____3 Vérifier la longueur des caractères
____4 Visualisation d'histogrammes à l'aide de matplotlib et seaborn
____5 Vérifiez la fréquence des lettres et des mots par thème
LEÇON 06 Prétraitement du texte
Supprimer ____1 numéro
____2 Mettez toutes les lettres anglaises en minuscules
____3 Supprimer les particules, les terminaisons et la ponctuation à l'aide d'un analyseur morphologique
____4 Supprimer les mots vides
LEÇON 07 Séparation des ensembles de données d'entraînement et de test
LEÇON 08 Vectorisation des mots
LEÇON 09 Apprentissage et prédiction
____1 Classificateur de forêt aléatoire
____2 validation croisée
____3 Apprentissage
LEÇON 10 Chargement de la feuille de réponses
Chapitre 6 : Visualisation et classification des données des pétitions nationales
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 Paramètres de base pour l'analyse
____1 Importer la bibliothèque
LEÇON 03 : Charger des données avec Pandas
____1 Télécharger les fichiers sur Google Drive
____2 Examiner les données téléchargées
____3 Vérifiez s'il y a des valeurs manquantes
LEÇON 04 Analyse et visualisation des données avec Pandas
____1 Ajouter une colonne « Pétition » pour les réponses
____2 Analyse par période de pétition
____3 Période de pétition et analyse par secteur
____4 Visualisation
LEÇON 05 : Créer un nuage de mots avec Soynlp
____1 Bibliothèques et données
____2 Tokenisation
____3 Prétraitement des données textuelles
____4 Dessinez un nuage de mots
____5 Extrayez uniquement les noms et visualisez-les
LEÇON 06 : Classification des données de pétitions nationales en formats binaires à l’aide de l’apprentissage automatique
____1 Apprentissage supervisé et séparation des ensembles de données
____2 Déterminer la cible de classification binaire
____3 Prédire les votes en fonction de la moyenne
____4 Prétraitement
____5 Création d'un ensemble d'entraînement et d'un ensemble de test
____6 Vectorisation des mots
____7 Application des pondérations TF-IDF
____8 Entraînement avec LightGBM
Taux ____9
Prédire ____10
____11 Évaluation de la précision des résultats de prédiction
Chapitre 7 : Modélisation thématique, RNN et LSTM pour la « Fondation 120 Dasan Call »
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 : Classification des sujets à l’aide de l’allocation de Dirichlet latente
____1 Installation de la bibliothèque et chargement des données
Vectorisation de ____2 mots
____3 Application de l'allocation de Dirichlet latente
____4 Visualisation avec pyLDAvis
____5 Analyse de similarité
LEÇON 03 : Classification de texte avec des réseaux neuronaux récurrents
____1 Importation des bibliothèques et des données
____2 Ensembles de données d'entraînement et de test distincts
____3 Créer des valeurs d'étiquette sous forme de matrice
____4 Vectoriser
____5 rembourrage
LEÇON 04 Création d'un modèle
____1 LSTM bidirectionnel
Compilez le modèle ____2
____3 Apprentissage
____4 Prédire
____5 Évaluez-le
Chapitre 8 : Analyse des commentaires sur les événements infraoniques
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 Paramètres de base pour l'analyse
____1 Importer la bibliothèque
____2 Chargement des données
LEÇON 03 Prétraitement des données
____1 Supprimer les messages en double
____2 Convertir en minuscules
LEÇON 04 : Séparer les « cours d’intérêt » par division de chaînes
LEÇON 05 Vectorisation
LEÇON 06 Vectorisation avec les poids TF-IDF
LEÇON 07 Regroupement
____1 KMeans
____2 MiniBatchKMeans
____3 Évaluer les prédictions de regroupement
____4 Analyse des coefficients de silhouette
Chapitre 9 : Automatisation de la génération de phrases avec ChatGPT
Entrée LEÇON OT
LEÇON 01 Le concept de modèles génératifs
LEÇON 02 Taille et type des paramètres du modèle génératif
LEÇON 03 Utilisation de ChatGPT
LEÇON 04 Service de la génération coréenne : Rutton
Entrée LEÇON OT
LEÇON 01 Exécuter Colab
____1 Comment
____2 touches de raccourci
LEÇON 02 Ouvrir le code d'entraînement dans Colab
Thème Colab ____1
Chapitre 2 : Manipulation des chaînes de caractères en Python
Entrée LEÇON OT
LEÇON 01 Avant l'entraînement aux cordes
LEÇON 02 Exercices de cordes
____1 représentation de chaîne
____2 Gestion des erreurs
____3 Méthode d'expression + gestion des erreurs
LEÇON O3 : Plusieurs façons de manipuler les chaînes de caractères
____1 variable
____2 Indexation
____3 Découpe
____4 Longueur de la chaîne, nombre de mots
____5 fonctions de chaînes de caractères
____6 répétitions
____7 fonction
____8 Liste des méthodes intégrées de chaînes de caractères
Chapitre 3 : Travailler avec les bibliothèques
Entrée LEÇON OT
LEÇON 01 Les pandas
____1 Comprendre les data frames et les séries
____2 Manipulation des chaînes de caractères avec l'accesseur str
LEÇON 02 NumPy
____1 Comprendre les tableaux NumPy
____2 Visualisation des tableaux NumPy avec matplotlib
Chapitre 4 : Modèle du sac de mots et TF-IDF
Entrée LEÇON OT
LEÇON 01 Modèle du sac de mots
Comment fabriquer un modèle de sac à ____1 mot
____2 Créer un modèle de sac de mots
____3 n-grammes : Utilisés pour regrouper les mots avant et après
____4 min_df et max_df : Réglage de la fréquence
____5 max_features : Limiter le nombre de mots à apprendre
____6 mots vides : Supprimer les mots vides
____7 analyseur : défini par caractère ou mot
LEÇON 02 TF-IDF
____1 Comment appliquer les pondérations TF-IDF
Chapitre 5 : Classification des sujets des actualités Yonhap
Entrée LEÇON OT
LEÇON 01 Sélection des données
LEÇON 02 Processus de classification
LEÇON 03 Paramètres de base pour la classification
____1 Importer la bibliothèque
____2 Paramètres de police pour la visualisation
LEÇON 04 Chargement des données
LEÇON 05 Prétraitement des données
____1 Fusion de données pour le prétraitement des données
____2 Vérifiez la fréquence des réponses correctes
____3 Vérifier la longueur des caractères
____4 Visualisation d'histogrammes à l'aide de matplotlib et seaborn
____5 Vérifiez la fréquence des lettres et des mots par thème
LEÇON 06 Prétraitement du texte
Supprimer ____1 numéro
____2 Mettez toutes les lettres anglaises en minuscules
____3 Supprimer les particules, les terminaisons et la ponctuation à l'aide d'un analyseur morphologique
____4 Supprimer les mots vides
LEÇON 07 Séparation des ensembles de données d'entraînement et de test
LEÇON 08 Vectorisation des mots
LEÇON 09 Apprentissage et prédiction
____1 Classificateur de forêt aléatoire
____2 validation croisée
____3 Apprentissage
LEÇON 10 Chargement de la feuille de réponses
Chapitre 6 : Visualisation et classification des données des pétitions nationales
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 Paramètres de base pour l'analyse
____1 Importer la bibliothèque
LEÇON 03 : Charger des données avec Pandas
____1 Télécharger les fichiers sur Google Drive
____2 Examiner les données téléchargées
____3 Vérifiez s'il y a des valeurs manquantes
LEÇON 04 Analyse et visualisation des données avec Pandas
____1 Ajouter une colonne « Pétition » pour les réponses
____2 Analyse par période de pétition
____3 Période de pétition et analyse par secteur
____4 Visualisation
LEÇON 05 : Créer un nuage de mots avec Soynlp
____1 Bibliothèques et données
____2 Tokenisation
____3 Prétraitement des données textuelles
____4 Dessinez un nuage de mots
____5 Extrayez uniquement les noms et visualisez-les
LEÇON 06 : Classification des données de pétitions nationales en formats binaires à l’aide de l’apprentissage automatique
____1 Apprentissage supervisé et séparation des ensembles de données
____2 Déterminer la cible de classification binaire
____3 Prédire les votes en fonction de la moyenne
____4 Prétraitement
____5 Création d'un ensemble d'entraînement et d'un ensemble de test
____6 Vectorisation des mots
____7 Application des pondérations TF-IDF
____8 Entraînement avec LightGBM
Taux ____9
Prédire ____10
____11 Évaluation de la précision des résultats de prédiction
Chapitre 7 : Modélisation thématique, RNN et LSTM pour la « Fondation 120 Dasan Call »
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 : Classification des sujets à l’aide de l’allocation de Dirichlet latente
____1 Installation de la bibliothèque et chargement des données
Vectorisation de ____2 mots
____3 Application de l'allocation de Dirichlet latente
____4 Visualisation avec pyLDAvis
____5 Analyse de similarité
LEÇON 03 : Classification de texte avec des réseaux neuronaux récurrents
____1 Importation des bibliothèques et des données
____2 Ensembles de données d'entraînement et de test distincts
____3 Créer des valeurs d'étiquette sous forme de matrice
____4 Vectoriser
____5 rembourrage
LEÇON 04 Création d'un modèle
____1 LSTM bidirectionnel
Compilez le modèle ____2
____3 Apprentissage
____4 Prédire
____5 Évaluez-le
Chapitre 8 : Analyse des commentaires sur les événements infraoniques
Entrée LEÇON OT
LEÇON 01 Processus d'analyse
LEÇON 02 Paramètres de base pour l'analyse
____1 Importer la bibliothèque
____2 Chargement des données
LEÇON 03 Prétraitement des données
____1 Supprimer les messages en double
____2 Convertir en minuscules
LEÇON 04 : Séparer les « cours d’intérêt » par division de chaînes
LEÇON 05 Vectorisation
LEÇON 06 Vectorisation avec les poids TF-IDF
LEÇON 07 Regroupement
____1 KMeans
____2 MiniBatchKMeans
____3 Évaluer les prédictions de regroupement
____4 Analyse des coefficients de silhouette
Chapitre 9 : Automatisation de la génération de phrases avec ChatGPT
Entrée LEÇON OT
LEÇON 01 Le concept de modèles génératifs
LEÇON 02 Taille et type des paramètres du modèle génératif
LEÇON 03 Utilisation de ChatGPT
LEÇON 04 Service de la génération coréenne : Rutton
Image détaillée

Avis de l'éditeur
N'importe qui peut facilement analyser diverses données textuelles coréennes !
Préparation : Environnement Colab et notions de base de Python
Les exemples et les projets présentés dans ce livre peuvent être exécutés directement dans Colab en un seul clic, sans installation.
Avant de nous lancer dans un projet à part entière, nous apprendrons les concepts de base de Python nécessaires à l'analyse de texte et l'utilisation de base des bibliothèques Python essentielles telles que Pandas, NumPy et Scikit-learn, ainsi que les fonctions et méthodes de prétraitement des données textuelles.
Concept : Concepts de base des méthodes d'analyse textuelle
Comprendre les concepts de base des méthodes d'analyse de texte, notamment comment les ordinateurs comprennent le coréen et comment ils analysent les données textuelles.
Et nous apprenons le modèle de sac de mots et TF-IDF comme méthodes de vectorisation pour convertir du texte en données numériques à utiliser avec des bibliothèques d'apprentissage automatique/d'apprentissage profond.
Projets : Analyse de quatre projets concrets
Nous allons procéder à un projet concret utilisant quatre ensembles de données coréens différents.
(1) Classification thématique des titres d'articles de Yonhap News (2) Analyse textuelle des pétitions nationales (3) Modélisation thématique et analyse de similarité des données de la Fondation 120 Dasan Call (4) Analyse de regroupement des commentaires d'événements Infraon
[Préface de l'auteur]
« Quand pourrai-je construire un modèle complexe après avoir appris à traiter des textes triviaux ? »
Quand on voit les performances incroyables des modèles de très grande taille, on se demande ce qu'il est possible de faire avec relativement peu de données et des tâches simples.
Mais même les plus grands modèles ont probablement commencé par de petites tentatives.
Les modèles récents peuvent générer des images ou du texte, ou répondre à des questions comme un humain, avec seulement une ou deux lignes de code API.
Mais si vous souhaitez implémenter directement dans du texte même un modèle simple et de petite taille, il peut être difficile de savoir par où commencer.
Ce livre est le fruit de mon expérience d'analyse de textes et de rencontres avec des experts de divers domaines, ainsi que d'une réflexion sur la manière de transmettre facilement les compétences et les contenus.
À une époque où de nouvelles recherches sont publiées chaque jour, j'espère que cela constituera un bon point de départ pour l'apprentissage des bases de l'analyse textuelle.
— Extrait de la préface de l'auteure Park Jo-eun
« S’il n’existe pas de manuel d’analyse de textes coréens, pourquoi ne pas simplement transcrire les lettres en coréen tout en analysant un texte anglais de la même manière ? »
Mais les débutants ignorent souvent que si les caractères coréens apparaissent illisibles, ils doivent rechercher les mots « encodage UTF-8 ».
De plus, il est difficile de savoir quelles données utiliser pour commencer, et il est difficile de toujours demander à quelqu'un pourquoi un code qui fonctionne parfaitement dans les livres ou les cours magistraux provoque des erreurs lorsque j'essaie de le reproduire moi-même.
Tout le monde est comme ça.
Pour quelqu'un qui s'y connaît, cela peut paraître un rebord très bas, mais pour quelqu'un qui ne s'y connaît pas, il est difficile de le franchir.
Ce livre couvre une variété de textes en coréen et a été soigneusement structuré pour permettre aux lecteurs d'apprendre NumPy, Pandas et Scikit-learn naturellement en apprenant les parties qui changent lorsqu'on modifie les données et en répétant les mêmes parties.
Cependant, vous constaterez une nette augmentation de la difficulté en passant du chapitre 3 au chapitre 4.
Mais j’espère qu’après le chapitre 6, je pourrai enfin me sentir comme un employé de deuxième année et dire : « Ah ! C’est similaire ! »
Si certaines parties ne fonctionnent pas en raison d'incompatibilités de versions, il sera très utile pour vos études que vous les corrigiez vous-même et que vous les téléchargiez sur GitHub.
Même si les choses tournent mal, n'abandonnez pas. Laissez une question en suspens, résolvez-la, puis reprenez vos études.
J’espère que nous pourrons travailler ensemble en tant que partenaires actifs plutôt qu’en tant que lecteurs passifs, tout en nous lançant des défis dans le domaine créatif.
Ensuite, les méthodes d'analyse textuelle permettront également de percer le mystère de l'apprentissage profond.
— Extrait de la préface de l'auteure Song Young-sook
Préparation : Environnement Colab et notions de base de Python
Les exemples et les projets présentés dans ce livre peuvent être exécutés directement dans Colab en un seul clic, sans installation.
Avant de nous lancer dans un projet à part entière, nous apprendrons les concepts de base de Python nécessaires à l'analyse de texte et l'utilisation de base des bibliothèques Python essentielles telles que Pandas, NumPy et Scikit-learn, ainsi que les fonctions et méthodes de prétraitement des données textuelles.
Concept : Concepts de base des méthodes d'analyse textuelle
Comprendre les concepts de base des méthodes d'analyse de texte, notamment comment les ordinateurs comprennent le coréen et comment ils analysent les données textuelles.
Et nous apprenons le modèle de sac de mots et TF-IDF comme méthodes de vectorisation pour convertir du texte en données numériques à utiliser avec des bibliothèques d'apprentissage automatique/d'apprentissage profond.
Projets : Analyse de quatre projets concrets
Nous allons procéder à un projet concret utilisant quatre ensembles de données coréens différents.
(1) Classification thématique des titres d'articles de Yonhap News (2) Analyse textuelle des pétitions nationales (3) Modélisation thématique et analyse de similarité des données de la Fondation 120 Dasan Call (4) Analyse de regroupement des commentaires d'événements Infraon
[Préface de l'auteur]
« Quand pourrai-je construire un modèle complexe après avoir appris à traiter des textes triviaux ? »
Quand on voit les performances incroyables des modèles de très grande taille, on se demande ce qu'il est possible de faire avec relativement peu de données et des tâches simples.
Mais même les plus grands modèles ont probablement commencé par de petites tentatives.
Les modèles récents peuvent générer des images ou du texte, ou répondre à des questions comme un humain, avec seulement une ou deux lignes de code API.
Mais si vous souhaitez implémenter directement dans du texte même un modèle simple et de petite taille, il peut être difficile de savoir par où commencer.
Ce livre est le fruit de mon expérience d'analyse de textes et de rencontres avec des experts de divers domaines, ainsi que d'une réflexion sur la manière de transmettre facilement les compétences et les contenus.
À une époque où de nouvelles recherches sont publiées chaque jour, j'espère que cela constituera un bon point de départ pour l'apprentissage des bases de l'analyse textuelle.
— Extrait de la préface de l'auteure Park Jo-eun
« S’il n’existe pas de manuel d’analyse de textes coréens, pourquoi ne pas simplement transcrire les lettres en coréen tout en analysant un texte anglais de la même manière ? »
Mais les débutants ignorent souvent que si les caractères coréens apparaissent illisibles, ils doivent rechercher les mots « encodage UTF-8 ».
De plus, il est difficile de savoir quelles données utiliser pour commencer, et il est difficile de toujours demander à quelqu'un pourquoi un code qui fonctionne parfaitement dans les livres ou les cours magistraux provoque des erreurs lorsque j'essaie de le reproduire moi-même.
Tout le monde est comme ça.
Pour quelqu'un qui s'y connaît, cela peut paraître un rebord très bas, mais pour quelqu'un qui ne s'y connaît pas, il est difficile de le franchir.
Ce livre couvre une variété de textes en coréen et a été soigneusement structuré pour permettre aux lecteurs d'apprendre NumPy, Pandas et Scikit-learn naturellement en apprenant les parties qui changent lorsqu'on modifie les données et en répétant les mêmes parties.
Cependant, vous constaterez une nette augmentation de la difficulté en passant du chapitre 3 au chapitre 4.
Mais j’espère qu’après le chapitre 6, je pourrai enfin me sentir comme un employé de deuxième année et dire : « Ah ! C’est similaire ! »
Si certaines parties ne fonctionnent pas en raison d'incompatibilités de versions, il sera très utile pour vos études que vous les corrigiez vous-même et que vous les téléchargiez sur GitHub.
Même si les choses tournent mal, n'abandonnez pas. Laissez une question en suspens, résolvez-la, puis reprenez vos études.
J’espère que nous pourrons travailler ensemble en tant que partenaires actifs plutôt qu’en tant que lecteurs passifs, tout en nous lançant des défis dans le domaine créatif.
Ensuite, les méthodes d'analyse textuelle permettront également de percer le mystère de l'apprentissage profond.
— Extrait de la préface de l'auteure Song Young-sook
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 29 mai 2023
Nombre de pages, poids, dimensions : 316 pages | 714 g | 183 × 235 × 18 mm
- ISBN13 : 9791140704521
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne