Passer aux informations sur le produit
Tout ce que les analystes de données doivent savoir
Tout ce que les analystes de données doivent savoir
Description
Introduction au livre
Approfondissons chaque étape de l'analyse des données et de l'apprentissage automatique !

Ce livre aborde tous les sujets, des statistiques, que l'on peut considérer comme le fondement de l'analyse des données, aux techniques d'apprentissage automatique d'un point de vue pratique.
De la définition des problèmes commerciaux à l'analyse exploratoire des données (EDA), en passant par le prétraitement des données et la création de variables dérivées, la modélisation de l'apprentissage automatique et l'évaluation des performances, et même la narration, ce livre couvre tout ce qu'un analyste de données doit savoir.
Nous avons minimisé les formules et théories inutiles afin que les praticiens puissent les appliquer immédiatement dans leurs entreprises, et organisé les concepts clés de manière facile à comprendre.
Vous apprendrez à bien comprendre les données et à en tirer des enseignements commerciaux pertinents grâce à une formation pratique basée sur des mini-projets d'analyse de données et d'apprentissage automatique.
  • Vous pouvez consulter un aperçu du contenu du livre.
    Aperçu

indice
[Partie 1] Principes fondamentaux de la construction de données

▣ Chapitre 1 : Comprendre les statistiques

1.1 Pourquoi devrions-nous connaître les statistiques ?
1.2 Différences entre l'apprentissage automatique et les statistiques traditionnelles
1.3 Définition et origine des statistiques
1.4 Statistiques descriptives Statistiques inférentielles
___1.4.1 Statistiques techniques
1.4.2 Statistiques inférentielles

▣ Chapitre 2 : Population et échantillonnage

2.1 Population et échantillon, recensement et enquête par sondage
2.2 Pourquoi réalisons-nous des enquêtes par sondage et comment appliquons-nous la science des données ?
2.3 Types de biais dans l'échantillonnage
2.4 Types de biais cognitifs
2.4.1 Biais de confirmation
2.4.2 Biais d'ancrage
___2.4.3 Biais favorisant le choix
___2.4.4 Biais du dénominateur
___2.4.5 Biais de survie
2.5 Biais et variance dans les modèles d'apprentissage automatique
2.6 Méthodes d'échantillonnage pour minimiser le biais d'échantillonnage

▣ Chapitre 3 : Variables et échelles

3.1 Types de variables
3.2 Types de relations entre variables
3.3 Types d'échelles

▣ Chapitre 4 : Mesures statistiques descriptives des données

4.1 Mesure de la tendance centrale
4.2 Variance et écart type
4.3 Diagramme de dispersion, étendue, quartiles et coefficient de variation
4.4 Asymétrie et aplatissement
___4.4.1 Asymétrie
___4.4.2 Kurtosis
4.5 Règle empirique pour l'écart type

▣ Chapitre 5 : Probabilités et variables aléatoires

5.1 Concepts de base des probabilités
5.2 Types de probabilité
5.3 Segmentation et théorie bayésienne
___5.3.1 Division
___5.3.2 Théorie bayésienne
5.4 Concept et types de variables aléatoires
5.5 Le paradoxe des Simpson

▣ Chapitre 6 : Distributions de probabilité

6.1 Définition et types de distributions de probabilité
6.2 Distributions de probabilité discrètes
___6.2.1 Répartition uniforme
6.2.2 Distribution binomiale
6.2.3 Distribution hypergéométrique
___6.2.4 Distribution de Poisson
6.3 Distribution de probabilité continue
6.3.1 Distribution normale
6.3.2 Distribution exponentielle
6.4 Théorème central limite

▣ Chapitre 7 : Tests d'hypothèses

7.1 Hypothèses nulle et alternative
7.2 Procédures de test d'hypothèses
7.3 Niveau de signification et valeur p des tests d'hypothèse
7.4 Erreurs de type 1 et de type 2

[Partie 2] Préparation de l'analyse des données

▣ Chapitre 8 : Préparation et planification du projet d'analyse


8.1 Processus global d'analyse des données
8.1.1 Les trois étapes de l'analyse des données
8.1.2 Méthodologie CRISP-DM
___8.1.3 Méthodologie SAS SEMMA
8.2 Définition du problème commercial et définition des objectifs d'analyse
8.3 Changement d'objectif de l'analyse
8.4 Connaissances du domaine
8.5 Collecte et exploration de données externes

▣ Chapitre 9 : Mise en place de l’environnement d’analyse

9.1 Quel langage d'analyse de données dois-je utiliser ?
9.2 Comprendre le processus de traitement des données
9.3 Traitement distribué des données
___9.3.1 HDFS
___9.3.2 Apache Spark
9.4 Jointures de tables, définitions et diagrammes ER
___9.4.1 Jointures de tables
___9.4.2 Dictionnaire de données
___9.4.3 Définition du tableau
___9.4.4 ERD

▣ Chapitre 10 : Exploration et visualisation des données

10.1 Analyse exploratoire des données
___10.1.1 Analyse exploratoire des données (EDA) avec Excel
___10.1.2 Exercices pratiques d'analyse exploratoire des données
10.2 Analyse de covariance et de corrélation
___10.2.1 Covariance
___10.2.2 Coefficient de corrélation
___10.2.3 Exercices pratiques d'analyse de covariance et de corrélation
10.3 Visualisation du temps
___10.3.1 Exercices de visualisation du temps
10.4 Visualisation comparative
___10.4.1 Exercices de visualisation comparative
10.5 Visualisation de la distribution
___10.5.1 Exercice de visualisation de la distribution
10.6 Visualisation des relations
___10.6.1 Exercice de visualisation des relations
10.7 Visualisation spatiale
___10.7.1 Exercices de visualisation spatiale
10.8 Diagramme en boîte
___10.8.1 Exercices sur les diagrammes en boîte

▣ Chapitre 11 : Prétraitement des données et création de variables dérivées

11.1 Gestion des valeurs manquantes
___11.1.1 Exercices de gestion des valeurs manquantes
11.2 Gestion des valeurs aberrantes
___11.2.1 Pratique de gestion des valeurs aberrantes
11.3 Regroupement des variables
___11.3.1 Exercice de regroupement de variables
11.4 Standardisation et normalisation des données
___11.4.1 Pratique de normalisation et de mise à l'échelle des données
11.5 Création de variables dérivées pour améliorer les performances du modèle
___11.5.1 Exercice de création de variables dérivées
11.6 Traitement des données par fenêtre glissante
___11.6.1 Exercices sur les fenêtres coulissantes
11.7 Traitement des variables indicatrices des variables catégorielles
___11.7.1 Exercice pratique sur la manipulation des variables indicatrices de variables catégorielles
11.8 Sous-échantillonnage et suréchantillonnage pour résoudre les problèmes de déséquilibre des classes
___11.8.1 Exercices de sous-échantillonnage et de sur-échantillonnage
11.9 Comment mesurer la distance de données
11.9.1 Méthodes de mesure de distance représentatives
___11.9.2 Exercices de mesure de distance

[Partie 3] Analyse des données

▣ Chapitre 12 : Méthodologie d'analyse statistique


12.1 Aperçu du modèle d'analyse
12.2 Analyse en composantes principales (ACP)
___12.2.1 Exercices pratiques d'analyse en composantes principales
12.3 Analyse factorielle commune (AFC)
___12.3.1 Pratique courante de l'analyse factorielle
12.4 Traitement de la multicolinéarité et analyse de la valeur de Shapley
12.5 Traitement des données et analyse à l'aveugle
___12.5.1 Massage des données
___12.5.2 Analyse à l'aveugle
12.6 Test Z et test T
___12.6.1 Exercices sur les tests Z et T
12.7 Analyse de la variance (ANOVA)
___12.7.1 Exercices d'ANOVA
12.8 Test du chi carré (tableau croisé)
___12.8.1 Exercices pratiques sur le test du chi carré

▣ Chapitre 13 : Méthodologie d’analyse de l’apprentissage automatique

13.1 Analyse de régression linéaire et Elastic Net (modèle prédictif)
___13.1.1 Origine et principes de l'analyse de régression
___13.1.2 Régression polynomiale
___13.1.3 Crête, Lasso et Filet élastique
13.1.4 Analyse de régression linéaire et exercices pratiques sur les réseaux élastiques
13.2 Analyse de régression logistique (modèle de classification)
___13.2.1 Exercices pratiques d'analyse de régression logistique
13.3 Arbres de décision et forêts aléatoires (modèles de prédiction/classification)
13.3.1 Arbres de classification et arbres de régression
___13.3.2 Avantages et inconvénients des modèles d'arbres de décision
13.3.3 Méthodes de prévention du surapprentissage des modèles d'arbres de décision
___13.3.4 Forêt aléatoire
___13.3.5 Exercices pratiques sur les arbres de décision et les forêts aléatoires
13.4 Analyse discriminante linéaire et analyse discriminante quadratique (modèles de classification)
13.4.1 Analyse discriminante linéaire
___13.4.2 Analyse discriminante du second ordre
___13.4.3 Exercices d'analyse discriminante linéaire et d'analyse discriminante quadratique
13.5 Machine à vecteurs de support (modèle de classification)
___13.5.1 Exercices pratiques sur les machines à vecteurs de support
13.6 KNN (Modèle de classification et de prédiction)
___13.6.1 Pratique KNN
13.7 Analyse des séries chronologiques (modèle de prévision)
13.7.1 Analyse des séries chronologiques par régression
___13.7.2 Modèle ARIMA
___13.7.3 Exercices pratiques d'analyse de séries chronologiques
13.8 Clustering k-means (modèle de clustering)
___13.8.1 Exercices de clustering k-means
13.9 Règles d'association et filtrage collaboratif (modèles de recommandation)
___13.9.1 Règles de l'association
___13.9.2 Filtrage basé sur le contenu et filtrage collaboratif
___13.9.3 Règles d'association et pratique du filtrage collaboratif
13.10 Réseaux de neurones artificiels (CNN, RNN, LSTM)
___13.10.1 CNN
___13.10.2 RNN et LSTM
___13.10.3 Exercices pratiques sur les réseaux de neurones artificiels

▣ Chapitre 14 : Évaluation du modèle

14.1 Ensemble d'entraînement, ensemble de validation, ensemble de test et surapprentissage
14.2 Principales méthodes de validation croisée
___14.2.1 Validation croisée k-fold
___14.2.2 LOOCV (Validation croisée Leave-One-Out)
___14.2.3 Validation croisée stratifiée à K plis
___14.2.4 Validation croisée imbriquée
14.2.5 Validation croisée par recherche sur grille
___14.2.6 Mise en pratique des principales méthodes de validation croisée
14.3 Indice d'évaluation des performances de régression
___14.3.1 R² et R² ajusté
___14.3.2 RMSE (Root Mean Square Error)
___14.3.3 MAE (Erreur absolue moyenne)
___14.3.4 MAPE (Erreur moyenne absolue en pourcentage)
___14.3.5 RMSLE (Root Mean Square Logarithmic Error)
___14.3.6 AIC et BIC
___14.3.7 Exercices pratiques d'évaluation des performances de régression
14.4 Indicateurs d'évaluation des performances de classification et de recommandation
___14.4.1 Matrice de confusion
14.4.2 Exactitude, taux d'erreur de classification, précision, sensibilité, spécificité et score F
14.4.3 Tableau d'amélioration, graphique d'amélioration et courbe d'amélioration
___14.4.4 Courbe ROC et AUC
___14.4.5 Courbe de profit
___14.4.6 Précision à k, rappel à K et MAP
___14.4.7 Classification, Recommandation, Indicateur d'évaluation des performances, Pratique
14.5 Tests A/B et MAB
___14.5.1 Tests A/B
___14.5.2 MAB
14.6 Pièges de la probabilité de signification
14.7 Jugement subjectif et narration de l'analyste

Image détaillée
Image détaillée 1

Avis de l'éditeur
★ Ce que ce livre aborde ★

◎ Concepts statistiques de base essentiels à l'analyse des données
◎ Biais des données et biais cognitifs
◎ Comment définir les problèmes commerciaux et en déduire l'objectif de l'analyse des données
◎ Configuration de l'environnement d'analyse des données
◎ Exploration et visualisation des données
◎ Prétraitement des données et création de variables dérivées
◎ Principaux algorithmes d'apprentissage automatique et techniques d'évaluation des performances des modèles
◎ Tests A/B et MAB
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 30 août 2024
- Nombre de pages, poids, dimensions : 640 pages | 188 × 240 × 29 mm
- ISBN13 : 9791158395483

Vous aimerez peut-être aussi

카테고리