
Technologie qui prend en charge le big data
Description
Introduction au livre
Le succès des entreprises modernes repose sur la manière dont les données sont collectées, intégrées et traitées !
Tout ce que vous devez savoir sur le big data et les technologies associées, par un expert en traitement des données !
« Comment systématiser le traitement des données ? »
« Technologies de soutien au Big Data » organise les éléments et les technologies nécessaires à une série de traitements de données, en mettant l'accent sur les aspects techniques, établit une base pour un traitement efficace des données et couvre diverses technologies qui prennent en charge l'automatisation du système.
À mesure que les performances des ordinateurs s'améliorent, les attentes concernant le développement de systèmes axés sur les données, et notamment sur l'apprentissage automatique, augmentent.
Par conséquent, à l'avenir, quelle que soit la taille du système, la demande de « technologies qui intègrent le traitement des données au sein même du système » augmentera progressivement.
La diversité des supports visuels et l'introduction systématique aux technologies connexes présentées dans cet ouvrage seront d'une grande aide aux lecteurs qui découvrent le monde du big data.
Tout ce que vous devez savoir sur le big data et les technologies associées, par un expert en traitement des données !
« Comment systématiser le traitement des données ? »
« Technologies de soutien au Big Data » organise les éléments et les technologies nécessaires à une série de traitements de données, en mettant l'accent sur les aspects techniques, établit une base pour un traitement efficace des données et couvre diverses technologies qui prennent en charge l'automatisation du système.
À mesure que les performances des ordinateurs s'améliorent, les attentes concernant le développement de systèmes axés sur les données, et notamment sur l'apprentissage automatique, augmentent.
Par conséquent, à l'avenir, quelle que soit la taille du système, la demande de « technologies qui intègrent le traitement des données au sein même du système » augmentera progressivement.
La diversité des supports visuels et l'introduction systématique aux technologies connexes présentées dans cet ouvrage seront d'une grande aide aux lecteurs qui découvrent le monde du big data.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
CHAPITRE 1 Connaissances de base du Big Data _ 1
1-1 [Contexte] Établissement du Big Data 3
Traitement accéléré des données grâce aux systèmes distribués : deux technologies représentatives qui permettent de surmonter la difficulté de gérer les mégadonnées.
Utilisation novatrice des systèmes distribués en entreprise - Coexistence avec les entrepôts de données 7
Élargir le champ de l'analyse de données que vous pouvez réaliser vous-même - Accélérer l'utilisation du Big Data grâce aux services cloud et à la découverte de données 8
1-2 Fondements de l'analyse des données à l'ère du Big Data 11
[Réintroduction] Technologie du Big Data - Structure de traitement des données utilisant des systèmes distribués 11
Entrepôts de données et data marts - Principes de base du pipeline de données 16
Lacs de données - Accumulation des données telles quelles 17
Élaboration d'une base solide en analyse de données, étape par étape : équipes et rôles, débuter modestement et s'étendre progressivement (19)
Objectif de la collecte de données – Trois exemples : « Extraction », « Traitement » et « Visualisation » 22
Analyse des données confirmatoire et exploratoire 25
1-3 [Apprentissage d'attributs] Analyses spéciales et cadres de données utilisant des langages de script 26
Langages de traitement des données et de script - Langages Python populaires et DataFrames 26
Data Frames, les bases des bases - Construction à partir de « tableaux imbriqués » 27
Exemple de journal d'accès d'un serveur web - facilement traitable avec les data frames pandas 28
Agrégation interactive de données de séries temporelles - Agrégation de données à l'aide de DataFrames 30
Utilisation des résultats SQL sous forme de DataFrame 31
1-4 Outils et surveillance de la BI 33
Suivi avec des tableurs - Comprendre l'état actuel de votre projet 33
Prise de décision fondée sur les données - Suivi des indicateurs clés de performance (KPI) 35
Identifier les changements et comprendre les détails - Utilisation des outils de BI 37
Déterminer la frontière entre travail manuel et travail automatisé 39
1-5 Résumé 42
CHAPITRE 2 Exploration des mégadonnées _ 43
45 points de base du décompte croisé 2-1
Tableaux de transactions, tableaux croisés et tableaux dynamiques — Le concept d’« agrégation croisée » 45
Tables de consultation - Ajout d'attributs par combinaison de tables 47
Agrégation de tables avec SQL - Préparation à l'agrégation croisée de données en masse 50
Agrégation des données ? Entrepôt de données ? Visualisation — Configuration du système déterminée par la taille de l’entrepôt de données 55
2-2 Stockage à grande vitesse par colonnes 56
Réduction de la latence de la base de données 56
Accès aux bases de données orienté colonnes - Compression des colonnes pour réduire les E/S disque 58
Une approche de base de données MPP - Exploiter la puissance multicœur grâce au parallélisme 61
2-3 Outils d'analyse et de visualisation ad hoc 64
Analyse ad hoc avec les notebooks Jupyter - Enregistrement des processus d'analyse dans un notebook 64
Outils du tableau de bord - Visualisez régulièrement les résultats agrégés 68
Outils de BI - Tableaux de bord interactifs 75
2-4 Structure de base d'un entrepôt de données 77
Création de data marts parfaits pour la visualisation - OLAP 77
Dénormalisation d'un tableau 79
Extraction de tableaux en vue de la visualisation de modèles multidimensionnels 82
2-5 Résumé 86
CHAPITRE 3 Traitement distribué des mégadonnées _ 87
3-1 Cadre pour le traitement distribué à grande échelle 89
Données structurées et non structurées 89
Hadoop : une plateforme commune pour le traitement distribué des données 92
Spark - Traitement de données en mémoire à haute vitesse 99
3-2 Moteur de requêtes 101
Pipeline 101 : Création d’un data mart
Création de données structurées avec Hive 102
Structure de Presto, le moteur de requêtes interactif - Agrégation de données structurées avec Presto 109
Choisir un framework d'analyse de données : bases de données MPP, Hive, Presto et Spark 115
3-3 Création d'un entrepôt de données 119
Tableaux de faits - Accumulation de données de séries chronologiques 119
Tableaux agrégés - Réduction du nombre d'enregistrements 122
Tableau instantané - Enregistrement de l'état du maître 123
Tableau historique - Modifications de la matrice d'enregistrement 127
[Dernière étape] Complétez le tableau dénormalisé en ajoutant les dimensions 127
3-4 Résumé 130
CHAPITRE 4 Accumulation de données massives _ 131
4-1 Collecte de données en masse et en continu 133
Stockage d'objets et ingestion de données - Chargement des données dans un stockage distribué 133
Transfert de données en masse - Nécessité d'un serveur ETL 135
Transfert de données en flux continu - Transfert de données pour la gestion de petits volumes de données transmises en continu 137
4-2 Compromis [Performance × Fiabilité] dans la transmission des messages 143
Courtier de messages - Installation d'une couche intermédiaire pour résoudre les problèmes de performance du stockage 143
Garantir la transmission des messages est difficile - Problèmes de fiabilité et trois approches de conception 146
La déduplication est une opération coûteuse 149
Pipelines de collecte de données - Stockage adapté à l'analyse de données à long terme 152
4-3 Optimisation des données de séries temporelles 154
Temps de traitement et temps de l'événement - L'objectif principal de l'analyse des données est le temps de l'événement 154
Partitionnement et problèmes liés au temps de traitement - Analyses complètes à éviter autant que possible 154
Index de séries temporelles - Agrégation efficace par date d'événement ① 156
Agrégation conditionnelle par heure d'événement ② 157
Partitionnement par date d'événement - Partitionnement de tables, Tables de séries chronologiques 158
4-4 Stockage distribué des données non structurées 161
[Stratégie de base] Utilisation des données avec les bases de données NoSQL 161
KVS distribué - Amélioration des performances d'écriture sur disque 162
Stockage en colonnes larges - Analyse et stockage de données structurées 166
Magasin de documents - Gestion des données sans schéma 169
Moteurs de recherche - Trouver des données avec la recherche par mots-clés 171
4-5 Résumé 175
CHAPITRE 5 Pipeline de données massives _ 177
5-1 Gestion des flux de travail 179
[Connaissances de base] Gestion des flux de travail - Gestion du flux de données 179
Réfléchir d'abord à la manière de se remettre des erreurs 183
Décrire les tâches comme des opérations idempotentes — l'exécution multiple d'une même tâche produit le même résultat 188
Rendre l'ensemble du flux de travail idempotent 194
Files d'attente de tâches - Contrôle de la consommation des ressources 195
5-2 Flux de données par lots 199
L'ère de MapReduce est révolue - Flux de données et flux de travail 199
Un nouveau cadre pour remplacer MapReduce - Représentation interne via des DAG 201
Combinaison des flux de données et des flux de travail 204
Séparation des flux de données et du SQL - Pipelines d'entrepôt de données et pipelines de data marts 207
5-3 Flux de données en continu 209
Répartition du traitement entre traitement par lots et traitement en flux continu 209
Intégration du traitement par lots et du traitement en flux continu 211
Remplacement des résultats du traitement en flux continu par le traitement par lots – Résolution de deux problèmes du traitement en flux continu 214
Traitement des données hors séquence 217
5-4 Résumé 220
CHAPITRE 6 Établir les bases de l'analyse des mégadonnées _ 223
6-1 Analyse ad hoc de données sans schéma 225
Collecte de données sans schéma 225
Préparation de l'environnement d'exécution interactif 228
Environnements distribués avec Spark - Favoriser la croissance des données 232
Agrégation des données pour la construction d'un data mart 237
Visualisation des données avec les outils de BI 241
6-2 Pipelines de données avec Hadoop 245
Traitement quotidien par lots 245
[Tâche 1] Extraction de données avec Embulk 246
[Tâche 2] Structuration des données avec Hive 248
[Tâche 3] Agrégation de données avec Presto 250
6-3 Automatisation par les outils de gestion des flux de travail 253
Airflow - Gestion des flux de travail par scripts 253
Exécution d'un flux de travail depuis le terminal 257
Démarrez le planificateur pour exécuter régulièrement le DAG 260
Contrôle des ressources consommées par les tâches 265
Exécution de pipelines de données dans Hadoop 266
6-4 Pipeline de données par services cloud 268
La relation entre l'analyse des données et les services cloud 268
Amazon Web Services 270
Google Cloud Platform 272
Données du trésor 274
Résumé 6-5 279
1-1 [Contexte] Établissement du Big Data 3
Traitement accéléré des données grâce aux systèmes distribués : deux technologies représentatives qui permettent de surmonter la difficulté de gérer les mégadonnées.
Utilisation novatrice des systèmes distribués en entreprise - Coexistence avec les entrepôts de données 7
Élargir le champ de l'analyse de données que vous pouvez réaliser vous-même - Accélérer l'utilisation du Big Data grâce aux services cloud et à la découverte de données 8
1-2 Fondements de l'analyse des données à l'ère du Big Data 11
[Réintroduction] Technologie du Big Data - Structure de traitement des données utilisant des systèmes distribués 11
Entrepôts de données et data marts - Principes de base du pipeline de données 16
Lacs de données - Accumulation des données telles quelles 17
Élaboration d'une base solide en analyse de données, étape par étape : équipes et rôles, débuter modestement et s'étendre progressivement (19)
Objectif de la collecte de données – Trois exemples : « Extraction », « Traitement » et « Visualisation » 22
Analyse des données confirmatoire et exploratoire 25
1-3 [Apprentissage d'attributs] Analyses spéciales et cadres de données utilisant des langages de script 26
Langages de traitement des données et de script - Langages Python populaires et DataFrames 26
Data Frames, les bases des bases - Construction à partir de « tableaux imbriqués » 27
Exemple de journal d'accès d'un serveur web - facilement traitable avec les data frames pandas 28
Agrégation interactive de données de séries temporelles - Agrégation de données à l'aide de DataFrames 30
Utilisation des résultats SQL sous forme de DataFrame 31
1-4 Outils et surveillance de la BI 33
Suivi avec des tableurs - Comprendre l'état actuel de votre projet 33
Prise de décision fondée sur les données - Suivi des indicateurs clés de performance (KPI) 35
Identifier les changements et comprendre les détails - Utilisation des outils de BI 37
Déterminer la frontière entre travail manuel et travail automatisé 39
1-5 Résumé 42
CHAPITRE 2 Exploration des mégadonnées _ 43
45 points de base du décompte croisé 2-1
Tableaux de transactions, tableaux croisés et tableaux dynamiques — Le concept d’« agrégation croisée » 45
Tables de consultation - Ajout d'attributs par combinaison de tables 47
Agrégation de tables avec SQL - Préparation à l'agrégation croisée de données en masse 50
Agrégation des données ? Entrepôt de données ? Visualisation — Configuration du système déterminée par la taille de l’entrepôt de données 55
2-2 Stockage à grande vitesse par colonnes 56
Réduction de la latence de la base de données 56
Accès aux bases de données orienté colonnes - Compression des colonnes pour réduire les E/S disque 58
Une approche de base de données MPP - Exploiter la puissance multicœur grâce au parallélisme 61
2-3 Outils d'analyse et de visualisation ad hoc 64
Analyse ad hoc avec les notebooks Jupyter - Enregistrement des processus d'analyse dans un notebook 64
Outils du tableau de bord - Visualisez régulièrement les résultats agrégés 68
Outils de BI - Tableaux de bord interactifs 75
2-4 Structure de base d'un entrepôt de données 77
Création de data marts parfaits pour la visualisation - OLAP 77
Dénormalisation d'un tableau 79
Extraction de tableaux en vue de la visualisation de modèles multidimensionnels 82
2-5 Résumé 86
CHAPITRE 3 Traitement distribué des mégadonnées _ 87
3-1 Cadre pour le traitement distribué à grande échelle 89
Données structurées et non structurées 89
Hadoop : une plateforme commune pour le traitement distribué des données 92
Spark - Traitement de données en mémoire à haute vitesse 99
3-2 Moteur de requêtes 101
Pipeline 101 : Création d’un data mart
Création de données structurées avec Hive 102
Structure de Presto, le moteur de requêtes interactif - Agrégation de données structurées avec Presto 109
Choisir un framework d'analyse de données : bases de données MPP, Hive, Presto et Spark 115
3-3 Création d'un entrepôt de données 119
Tableaux de faits - Accumulation de données de séries chronologiques 119
Tableaux agrégés - Réduction du nombre d'enregistrements 122
Tableau instantané - Enregistrement de l'état du maître 123
Tableau historique - Modifications de la matrice d'enregistrement 127
[Dernière étape] Complétez le tableau dénormalisé en ajoutant les dimensions 127
3-4 Résumé 130
CHAPITRE 4 Accumulation de données massives _ 131
4-1 Collecte de données en masse et en continu 133
Stockage d'objets et ingestion de données - Chargement des données dans un stockage distribué 133
Transfert de données en masse - Nécessité d'un serveur ETL 135
Transfert de données en flux continu - Transfert de données pour la gestion de petits volumes de données transmises en continu 137
4-2 Compromis [Performance × Fiabilité] dans la transmission des messages 143
Courtier de messages - Installation d'une couche intermédiaire pour résoudre les problèmes de performance du stockage 143
Garantir la transmission des messages est difficile - Problèmes de fiabilité et trois approches de conception 146
La déduplication est une opération coûteuse 149
Pipelines de collecte de données - Stockage adapté à l'analyse de données à long terme 152
4-3 Optimisation des données de séries temporelles 154
Temps de traitement et temps de l'événement - L'objectif principal de l'analyse des données est le temps de l'événement 154
Partitionnement et problèmes liés au temps de traitement - Analyses complètes à éviter autant que possible 154
Index de séries temporelles - Agrégation efficace par date d'événement ① 156
Agrégation conditionnelle par heure d'événement ② 157
Partitionnement par date d'événement - Partitionnement de tables, Tables de séries chronologiques 158
4-4 Stockage distribué des données non structurées 161
[Stratégie de base] Utilisation des données avec les bases de données NoSQL 161
KVS distribué - Amélioration des performances d'écriture sur disque 162
Stockage en colonnes larges - Analyse et stockage de données structurées 166
Magasin de documents - Gestion des données sans schéma 169
Moteurs de recherche - Trouver des données avec la recherche par mots-clés 171
4-5 Résumé 175
CHAPITRE 5 Pipeline de données massives _ 177
5-1 Gestion des flux de travail 179
[Connaissances de base] Gestion des flux de travail - Gestion du flux de données 179
Réfléchir d'abord à la manière de se remettre des erreurs 183
Décrire les tâches comme des opérations idempotentes — l'exécution multiple d'une même tâche produit le même résultat 188
Rendre l'ensemble du flux de travail idempotent 194
Files d'attente de tâches - Contrôle de la consommation des ressources 195
5-2 Flux de données par lots 199
L'ère de MapReduce est révolue - Flux de données et flux de travail 199
Un nouveau cadre pour remplacer MapReduce - Représentation interne via des DAG 201
Combinaison des flux de données et des flux de travail 204
Séparation des flux de données et du SQL - Pipelines d'entrepôt de données et pipelines de data marts 207
5-3 Flux de données en continu 209
Répartition du traitement entre traitement par lots et traitement en flux continu 209
Intégration du traitement par lots et du traitement en flux continu 211
Remplacement des résultats du traitement en flux continu par le traitement par lots – Résolution de deux problèmes du traitement en flux continu 214
Traitement des données hors séquence 217
5-4 Résumé 220
CHAPITRE 6 Établir les bases de l'analyse des mégadonnées _ 223
6-1 Analyse ad hoc de données sans schéma 225
Collecte de données sans schéma 225
Préparation de l'environnement d'exécution interactif 228
Environnements distribués avec Spark - Favoriser la croissance des données 232
Agrégation des données pour la construction d'un data mart 237
Visualisation des données avec les outils de BI 241
6-2 Pipelines de données avec Hadoop 245
Traitement quotidien par lots 245
[Tâche 1] Extraction de données avec Embulk 246
[Tâche 2] Structuration des données avec Hive 248
[Tâche 3] Agrégation de données avec Presto 250
6-3 Automatisation par les outils de gestion des flux de travail 253
Airflow - Gestion des flux de travail par scripts 253
Exécution d'un flux de travail depuis le terminal 257
Démarrez le planificateur pour exécuter régulièrement le DAG 260
Contrôle des ressources consommées par les tâches 265
Exécution de pipelines de données dans Hadoop 266
6-4 Pipeline de données par services cloud 268
La relation entre l'analyse des données et les services cloud 268
Amazon Web Services 270
Google Cloud Platform 272
Données du trésor 274
Résumé 6-5 279
Image détaillée

Dans le livre
Le terme « big data » a commencé à apparaître fréquemment dans les médias vers la fin de 2011 et 2012, à peu près au moment où de nombreuses entreprises ont commencé à adopter des systèmes distribués pour le traitement des données.
Bien que le traitement des données par ordinateur existât déjà, le terme « big data » a commencé à être utilisé ici et là, et le mouvement visant à utiliser les données à des fins commerciales s'est dynamisé.
--- p.3
La différence entre les outils de tableau de bord et les outils de BI n'est pas si stricte.
Alors que la première met l'accent sur la facilité d'ajout de nouveaux graphiques, la seconde privilégie une exploration plus interactive des données.
Par exemple, si vous souhaitez prendre votre temps et examiner vos données lentement, en cliquant par exemple sur un graphique pour passer à une vue détaillée ou en affichant les données brutes qui constituent la base d'une agrégation, un outil de BI est un bon choix.
--- p.68
Hadoop est actuellement connu comme un système représentant le big data, mais historiquement, son développement a commencé vers 2003 en tant que système de fichiers distribué pour 'Nutch', un robot d'exploration Web open source.
Par la suite, en 2006, il est devenu un projet indépendant et a été distribué sous le nom d'Apache Hadoop.
--- p.92
Premièrement, les fichiers stockés sur un support de stockage objet sont difficiles à remplacer.
Une fois un fichier créé, la seule solution est de le remplacer intégralement.
Cela convient parfaitement aux fichiers journaux qui ne seront plus modifiés, mais ce n'est pas adapté aux éléments fréquemment modifiés, comme les bases de données.
Les données fréquemment écrites doivent être stockées dans une base de données relationnelle distincte et faire l'objet d'instantanés réguliers, ou stockées dans une autre base de données distribuée.
--- p.161
Par ailleurs, les données événementielles analysées dans cet ouvrage, telles que les messages envoyés depuis des millions de smartphones, ne peuvent être utilisées directement.
Dans le chapitre précédent, nous avons abordé le flux de données centré sur le flux de messages en tant que méthode de livraison de messages en temps réel.
Si le traitement par lots commence par le stockage des données reçues de cette manière dans un stockage distribué, le traitement en flux continu poursuit le traitement sans passer par un stockage distribué.
Bien que le traitement des données par ordinateur existât déjà, le terme « big data » a commencé à être utilisé ici et là, et le mouvement visant à utiliser les données à des fins commerciales s'est dynamisé.
--- p.3
La différence entre les outils de tableau de bord et les outils de BI n'est pas si stricte.
Alors que la première met l'accent sur la facilité d'ajout de nouveaux graphiques, la seconde privilégie une exploration plus interactive des données.
Par exemple, si vous souhaitez prendre votre temps et examiner vos données lentement, en cliquant par exemple sur un graphique pour passer à une vue détaillée ou en affichant les données brutes qui constituent la base d'une agrégation, un outil de BI est un bon choix.
--- p.68
Hadoop est actuellement connu comme un système représentant le big data, mais historiquement, son développement a commencé vers 2003 en tant que système de fichiers distribué pour 'Nutch', un robot d'exploration Web open source.
Par la suite, en 2006, il est devenu un projet indépendant et a été distribué sous le nom d'Apache Hadoop.
--- p.92
Premièrement, les fichiers stockés sur un support de stockage objet sont difficiles à remplacer.
Une fois un fichier créé, la seule solution est de le remplacer intégralement.
Cela convient parfaitement aux fichiers journaux qui ne seront plus modifiés, mais ce n'est pas adapté aux éléments fréquemment modifiés, comme les bases de données.
Les données fréquemment écrites doivent être stockées dans une base de données relationnelle distincte et faire l'objet d'instantanés réguliers, ou stockées dans une autre base de données distribuée.
--- p.161
Par ailleurs, les données événementielles analysées dans cet ouvrage, telles que les messages envoyés depuis des millions de smartphones, ne peuvent être utilisées directement.
Dans le chapitre précédent, nous avons abordé le flux de données centré sur le flux de messages en tant que méthode de livraison de messages en temps réel.
Si le traitement par lots commence par le stockage des données reçues de cette manière dans un stockage distribué, le traitement en flux continu poursuit le traitement sans passer par un stockage distribué.
--- p.210
SPÉCIFICATIONS DES PRODUITS
- Date de publication : 5 novembre 2018
- Nombre de pages, poids, dimensions : 312 pages | 170 × 225 × 21 mm
- ISBN13 : 9791188621439
- ISBN10 : 1188621432
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne