Passer aux informations sur le produit
Étincelle en marche
Étincelle en marche
Description
Introduction au livre
Le livre d'introduction définitif à Spark, recommandé par le fondateur de Spark, Matei Zaharia !

Cette édition mise à jour, qui inclut Spark 3.x, explique aux ingénieurs et aux scientifiques des données pourquoi l'architecture et l'intégration de Spark sont importantes.
Nous réalisons des analyses de données, des plus simples aux plus complexes, et expliquons systématiquement comment utiliser les algorithmes d'apprentissage automatique.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
Préface du traducteur x
Avis du lecteur bêta xii
Recommandation 14
À partir de XV
À propos de la couverture xxi

CHAPITRE 1 : Présentation d'Apache Spark : un moteur d'analyse unifié

Le début de Spark 1
Qu'est-ce qu'Apache Spark ? 4
Analyse intégrée 7
Expérience développeur 15

CHAPITRE 2 Téléchargement et démarrage d'Apache Spark 19

Étape 1 : Télécharger Apache Spark 19
Étape 2 : Utilisation du shell Scala ou PySpark 22
Utilisation d'une machine locale 24
Étape 3 : Comprendre les concepts d’application Spark 26
Transformation, action et évaluation différée 29
Spark UI 31
Première application autonome 34
Résumé 42

CHAPITRE 3 API formalisée d'Apache Spark 43

Spark : Que se cache-t-il sous un RDD ? 44
Établissement de la structure de Spark 45
API DataFrame 48
API de jeu de données 71
DataFrames vs. DataSets 77
Spark SQL et le moteur sous-jacent 79
Résumé 85

CHAPITRE 4 Spark SQL et DataFrames : Introduction aux sources de données intégrées 86

Utilisation de Spark SQL dans les applications Spark 87
Tables et vues SQL 93
Sources de données pour les DataFrames et les tables SQL 98
Résumé 119

CHAPITRE 5 Spark SQL et DataFrames : Interaction avec des sources de données externes 120

Spark SQL et Apache Hive 120
Interrogation avec Spark SQL Shell, Beeline et Tableau 126
Source de données externe 134
PostgreSQL 137
Fonctions d'ordre supérieur dans les DataFrames et Spark SQL 144
150 opérations courantes sur les DataFrames et Spark SQL
Résumé 163

CHAPITRE 6 Spark SQL et les jeux de données 164

Une API unique pour Java et Scala 164
Utilisation des ensembles de données 167
Gestion de la mémoire pour les ensembles de données et les dataframes 175
Encodeur de jeu de données 176
Coût d'utilisation de l'ensemble de données : 178
Résumé 180

CHAPITRE 7 Optimisation et réglage des applications Spark 181

Optimisation et réglage efficaces de l'allumage 181
Mise en cache et persistance des données 191
Types de jointure Spark 196
Aperçu de l'interface utilisateur Spark 206
Résumé 213

CHAPITRE 8 : Normalisation du streaming 214

Évolution du moteur de traitement de flux d'Apache Spark 214
Modèle de programmation pour le streaming formaté 218
Principes fondamentaux des requêtes de flux structurées 220
Fonctionnement interne d'une requête de flux en cours d'exécution 227
Sources et destinations de données en flux continu 233
Transformation des données 243
Agrégation de flux avec informations d'état 246
Rejoignez le streaming 255
Opérations arbitraires de maintenance de l'État 263
Réglage de performance 272
Résumé 274

CHAPITRE 9 Création d'un lac de données fiable avec Apache Spark 275

L'importance des solutions de stockage optimales 275
Base de données 277
Lac de données 279
Lakehouse : La prochaine étape dans l’évolution des solutions de stockage 282
Construction d'une maison au bord d'un lac avec Apache Spark et Delta Lake 285
Résumé 296

CHAPITRE 10 Apprentissage automatique avec MLlib 298

Qu'est-ce que l'apprentissage automatique ? 299
Conception de pipelines d'apprentissage automatique 302
Réglage des hyperparamètres 322
Résumé 338

CHAPITRE 11 : Gestion, déploiement et mise à l’échelle des pipelines d’apprentissage automatique avec Apache Spark 339

Gestion des modèles 339
Options de déploiement de modèles avec MLlib 346
Exploiter Spark pour les modèles non-MLlib 352
Résumé 358

CHAPITRE 12 Épilogue : Apache Spark 3.0 359

Spark Core et Spark SQL 359
Jeonghyeonghwa Streaming 368
PySpark, UDF Pandas, API des fonctions Pandas 370
Fonctionnalités modifiées 373
Résumé 376

Recherche 379

Image détaillée
Image détaillée 1

Dans le livre
En 2013, Spark était devenu si largement utilisé que ses auteurs et chercheurs d'origine (Matej Zaharia, Ali Ghosh, Reynolds Shin, Patrick Wendell, Ion Stojka et Andy Konvinski) ont transféré le projet Spark à la Fondation Apache Software (ASF) et ont formé une société appelée Databricks.
Les développeurs de Databricks et de la communauté open source ont publié Apache Spark 1.010 en mai 2014 sous l'égide de l'ASF.
Cette première version majeure ouvre la voie à des mises à jour fréquentes et à des fonctionnalités remarquables de la part de Databricks et de plus de 100 partenaires commerciaux.

--- p.4

Vous pouvez écrire une seule application Spark et tout s'exécute dessus, sans avoir à déployer des moteurs distincts pour des tâches complètement différentes ni à apprendre des API séparées.
Avec Spark, vous disposez d'un moteur de traitement unique et unifié pour gérer votre charge de travail.

--- p.5

De tous les plaisirs qu'un développeur peut éprouver, l'un des plus attrayants est un ensemble d'API bien structuré qui accroît la productivité, est facile à utiliser et facile à comprendre.
L'un des principes d'Apache Spark est de séduire les développeurs grâce à une API facile à utiliser dans plusieurs langages, notamment Scala, Java, Python, SQL et R, quelle que soit la taille des données.

--- p.15

L'une des auteures de ce livre est une spécialiste des données qui adore faire des biscuits avec des M&M's, et elle les offre souvent en guise de prix aux étudiants de différents États inscrits à ses cours d'apprentissage automatique et de science des données.
Mais comme elle est une personne qui se base sur les données, elle veut s'assurer que les élèves des différents États reçoivent la bonne couleur de M&M's.
Écrivons un programme Spark qui lit un fichier contenant plus de 100 000 points de données (chaque ligne contient un état, une couleur et un nombre de M&M's) et les agrège par couleur et par état.
Ces résultats agrégés vous indiqueront la couleur préférée des M&M's que les élèves de chaque État préfèrent.
Le programme Python complet se trouve dans l'exemple 2-1.

--- p.35

Quelle est la différence entre la mise en cache des données et la persistance ? Dans Spark, les deux termes sont synonymes.
Deux appels d'API, cache() et persist(), fournissent ces fonctionnalités.
Cette dernière option permet de paramétrer plus précisément l'emplacement et la manière dont les données sont stockées : en mémoire ou sur disque, et si elles sont sérialisées ou non.
--- p.191

Avis de l'éditeur
Le livre d'introduction définitif à Spark, recommandé par le fondateur de Spark, Matei Zaharia !

La deuxième édition de Running Spark : Analyse de données ultra-rapide est parue.
À mesure que le volume des données augmente, qu'elles sont générées plus rapidement et qu'elles sont disponibles dans une variété de formats, un traitement à grande échelle pour l'analyse et l'apprentissage automatique devient également nécessaire.
Apache Spark est une alternative capable de gérer efficacement ces charges de travail à grande échelle.

Cette édition mise à jour, qui inclut Spark 3.x, explique aux ingénieurs et aux scientifiques des données pourquoi l'architecture et l'intégration de Spark sont importantes.
Nous expliquons de manière systématique comment effectuer une analyse de données, des plus simples aux plus complexes, et comment utiliser les algorithmes d'apprentissage automatique.
Des exercices pas à pas, des exemples de code, des carnets de notes et bien plus encore vous aident :

■ Apprentissage des API structurées de haut niveau en utilisant Python, SQL, Scala et Java
■ Comprendre les tâches Spark et le moteur SQL
■ Inspectez, optimisez et déboguez les tâches Spark à l'aide de la configuration Spark et de l'interface utilisateur Spark.
■ Se connecter à des sources de données telles que JSON, Parque, CSV, Avro, ORC, Hive, S3 et Kafka
■ Effectuer des analyses sur des données par lots et en flux continu à l'aide du flux structuré
■ Création d'un pipeline de données stable avec les technologies open source Delta Lake et Spark
■ Développer des pipelines d'apprentissage automatique à l'aide de MLlib et reproduire et déployer des modèles à l'aide de MLflow.
SPÉCIFICATIONS DES PRODUITS
- Date de publication : 24 juin 2022
Nombre de pages, poids, dimensions : 404 pages | 788 g | 188 × 257 × 20 mm
- ISBN13 : 9791191600889
- ISBN10 : 1191600882

Vous aimerez peut-être aussi

카테고리