
Guide pratique pour les architectes de systèmes de données et d'IA
Description
Introduction au livre
Toutes les connaissances et le savoir-faire pratique dont vous avez besoin pour devenir un expert en science des données, réunis dans un seul livre !
De nombreuses organisations souhaitent intégrer les technologies de données et d'IA à leurs services, mais leur mise en œuvre dans des environnements opérationnels réels et la garantie d'un fonctionnement stable sont loin d'être simples.
Cela nécessite la capacité de gérer de manière organique l'ensemble du processus, de la collecte, du stockage et du traitement des données au déploiement et à la gestion des modèles, et d'intégrer systématiquement et d'exploiter de manière cohérente diverses technologies.
Les professionnels sont souvent confrontés au défi de vouloir exploiter les données et l'IA, mais de ne pas savoir par où commencer ni comment les concevoir et les configurer.
Même si vous maîtrisez certaines technologies individuelles, vous avez souvent du mal à les connecter et à les utiliser dans une perspective systémique.
Cela conduit souvent à des essais et erreurs répétés à différentes étapes, depuis la conception initiale du projet jusqu'à son exploitation.
Ce livre couvre un large éventail de sujets, allant des principes fondamentaux de la science des données à l'ingénierie des données, en passant par le fonctionnement des modèles, la conception de l'architecture système et la stratégie opérationnelle.
Il présente des solutions pratiques axées sur l'architecture auxquelles les praticiens de divers rôles peuvent se référer, couvrant des sujets fréquemment rencontrés dans la pratique, tels que la conception des journaux, la transition vers les microservices, l'optimisation des performances, la sécurité et la gestion des coûts.
De nombreuses organisations souhaitent intégrer les technologies de données et d'IA à leurs services, mais leur mise en œuvre dans des environnements opérationnels réels et la garantie d'un fonctionnement stable sont loin d'être simples.
Cela nécessite la capacité de gérer de manière organique l'ensemble du processus, de la collecte, du stockage et du traitement des données au déploiement et à la gestion des modèles, et d'intégrer systématiquement et d'exploiter de manière cohérente diverses technologies.
Les professionnels sont souvent confrontés au défi de vouloir exploiter les données et l'IA, mais de ne pas savoir par où commencer ni comment les concevoir et les configurer.
Même si vous maîtrisez certaines technologies individuelles, vous avez souvent du mal à les connecter et à les utiliser dans une perspective systémique.
Cela conduit souvent à des essais et erreurs répétés à différentes étapes, depuis la conception initiale du projet jusqu'à son exploitation.
Ce livre couvre un large éventail de sujets, allant des principes fondamentaux de la science des données à l'ingénierie des données, en passant par le fonctionnement des modèles, la conception de l'architecture système et la stratégie opérationnelle.
Il présente des solutions pratiques axées sur l'architecture auxquelles les praticiens de divers rôles peuvent se référer, couvrant des sujets fréquemment rencontrés dans la pratique, tels que la conception des journaux, la transition vers les microservices, l'optimisation des performances, la sécurité et la gestion des coûts.
- Vous pouvez consulter un aperçu du contenu du livre.
Aperçu
indice
[PARTIE 01] Principes fondamentaux de la science des données
▣ Chapitre 1 : Comprendre les données
1.1 Définition et types de données
___1.1.1 Types de données
___1.1.2 Propriétés des données
1.2 Analyse des données
___1.2.1 Modélisation statistique
1.2.2 Processus d'analyse des données
___1.2.3 Exemple d'analyse de données
1.3 Visualisation des données
___1.3.1 Types de visualisation
1.3.2 Principes de visualisation
1.4 Analyse exploratoire des données
___1.4.1 Liste de contrôle pour l'analyse exploratoire des données
1.4.2 Exemple d'analyse exploratoire des données
▣ Chapitre 2 : Principes fondamentaux de l’apprentissage automatique
2.1 Concepts d'apprentissage automatique
___2.1.1 Objectifs commerciaux et considérations relatives à la mise en œuvre de l'apprentissage automatique
___2.1.2 Définition et prise en compte des problèmes pouvant être résolus par l'apprentissage automatique
2.1 Principes d'apprentissage automatique
___2.1.1 Propagation directe
___2.2.2 Fonction d'activation
2.2.3 Fonction de perte
___2.2.4 Algorithme d'optimisation
___2.2.5 Rétropropagation
2.3 Amélioration et évaluation des performances du modèle
___2.3.1 Surajustement et sous-ajustement
___2.3.2 Techniques de normalisation
___2.3.4 Métriques d'évaluation du modèle
___2.3.5 Sélection du modèle et réglage des hyperparamètres
2.4 Exemples d'applications de modèles d'apprentissage automatique
___2.4.1 Principales approches de l'apprentissage automatique
___2.4.2 Cas d'application de l'apprentissage automatique
___2.4.3 Considérations relatives à l'application du modèle
▣ Chapitre 3 : Le cœur de l'apprentissage profond
3.1 Modèle de réseau neuronal de base
___3.1.1 Perceptron multicouche
___3.1.2 Réseaux neuronaux convolutifs
___3.1.3 Réseaux de neurones récurrents
3.2 Modèles d'apprentissage génératifs et de représentation
___3.2.1 Auto-encodeur
___3.2.2 Réseaux antagonistes génératifs
3.3 Modèles de réseaux neuronaux spécifiques à un domaine
___3.3.1 Réseaux neuronaux graphiques
___3.3.2 Réseau Q profond
3.4 Derniers modèles d'apprentissage profond
3.4.1 Transformateur
3.4.2 Modèle de diffusion
___3.4.3 Modèles de langage à grande échelle
___3.4.4 Modèle du ministère de l'Éducation
▣ Chapitre 4 : Applications de l’apprentissage profond
4.1 Traitement automatique du langage naturel
___4.1.1 Prétraitement des données
4.1.2 Architecture du modèle
4.1.3 Formation et évaluation du modèle
___4.1.4 Modèle de base
___4.1.5 Documents requis
___4.1.6 Bibliothèques et outils clés
4.2 Traitement audio
___4.2.1 Prétraitement des données
4.2.2 Architecture du modèle
4.2.3 Formation et évaluation du modèle
___4.2.4 Modèle de base
___4.2.5 Documents requis
___4.2.6 Bibliothèques et outils clés
4.3 Vision par ordinateur
___4.3.1 Prétraitement des données
4.3.2 Architecture du modèle
4.3.3 Formation et évaluation du modèle
___4.3.4 Modèle de base
___4.3.5 Documents requis
___4.3.6 Bibliothèques et outils clés
4.4 Apprentissage par renforcement
___4.4.1 Prétraitement des données
4.4.2 Architecture du modèle
4.4.3 Formation et évaluation du modèle
___4.4.4 Modèle de base
___4.4.5 Documents requis
___4.4.6 Bibliothèques et outils clés
4.5 Système de recommandation
___4.5.1 Prétraitement des données
4.5.2 Architecture du modèle
4.5.3 Formation et évaluation du modèle
___4.5.4 Modèle de base
___4.5.5 Documents requis
___4.5.6 Bibliothèques et outils clés
4.6 Feuille de route pour la science des données
___4.6.1 Traitement automatique du langage naturel
___4.6.2 Traitement audio
___4.6.3 Vision par ordinateur
4.6.4 Apprentissage par renforcement
___4.6.5 Système de recommandation
___4.6.6 Pile technologique étendue
[PARTIE 02] Science des données pratique
▣ Chapitre 5 : Ingénierie des données
5.1 Collecte des données
5.1.1 Méthode de collecte des données
___5.1.2 Pipeline de collecte de données
5.1.3 Considérations relatives à la conception des pipelines
5.2 Prétraitement des données
5.2.3 Nettoyage des données
5.2.2 Conversion des données
5.2.3 Ingénierie des fonctionnalités
5.2.4 Gestion des déséquilibres de données
___5.2.5 Exemple de prétraitement des données
5.3 Gouvernance des données
___5.3.1 Composantes de la gouvernance des données
___5.3.2 Outils de gouvernance des données
___5.3.3 Calendrier de l'introduction de l'outil de gouvernance des données
▣ Chapitre 6 : Stockage et conception des données
6.1 Stockage et gestion des données
6.1.1 Système de gestion de bases de données relationnelles
___6.1.2 NoSQL
___6.1.3 Base de données vectorielles
___6.1.4 Stratégies pour maintenir la cohérence et l'intégrité des données
6.2 Modèles d'architecture de données
6.2.1 Architecture de stockage et de gestion des données
___6.2.2 Techniques de modélisation des données
6.2.3 Systèmes OLAP et OLTP
6.2.4 Entrepôt de données basé sur le cloud
6.3 Conception du pipeline de données
6.3.1 ETL et ELT
6.3.2 Principes de conception des étapes de collecte, de transformation et de stockage des données
___6.3.3 Considérations relatives à la conception du pipeline de données
___6.3.4 Optimisation des pipelines de données dans les environnements de données distribués
▣ Chapitre 7 : Fonctionnement et gestion du modèle
7.1 Principes de conception des API
___7.1.1 API RESTful
___7.1.2 Conception et implémentation d'API RESTful
___7.1.3 Introduction à GraphQL
___7.1.4 Rôles et fonctions de la passerelle API
7.2 Déploiement du modèle
___7.2.1 Critères de sélection d'un environnement de déploiement modèle
___7.2.2 Méthodes et scénarios de déploiement du modèle
___7.2.3 Gestion des versions de modèles et stratégies de restauration
7.3 Surveillance des performances du modèle
7.3.1 Surveillance du modèle et analyse des performances
___7.3.2 Méthodes de détection de la dérive du modèle
___7.3.3 Stratégie de réentraînement du modèle
7.4 CI/CD et MLOps
___7.4.1 Pipeline CI/CD
___7.4.2 MLOps
Plateforme MLOps ___7.4.3
___7.4.4 Stratégie de conception et de construction des pipelines MLOps
▣ Chapitre 8 : Pipeline de traitement des données
8.1 Conception du flux de travail
___8.1.1 Définition des exigences et fixation des objectifs
___8.1.2 Conception étape par étape du flux de travail
8.1.3 Sélection d'une pile technologique
8.1.4 Suivi et amélioration des flux de travail
8.2 Traitement par lots
8.2.1 Concepts et fonctionnalités du traitement par lots
8.2.2 Introduction et comparaison des ordonnanceurs de lots
8.2.3 Concevoir et implémenter un flux de travail par lots
___8.2.4 Optimisation du traitement par lots
8.3 Traitement en temps réel
8.3.1 Concepts et fonctionnalités du traitement en temps réel
8.3.2 Introduction et comparaison des plateformes de streaming
___8.3.3 Conception et construction d'un pipeline de données en temps réel
8.3.4 Optimisation du traitement en temps réel
8.4 Traitement par lots vs. Traitement en temps réel
8.4.1 Principales différences entre le traitement par lots et le traitement en temps réel
___8.4.2 Guide de sélection d'une méthode de traitement en fonction des exigences du système
8.4.3 Architecture hybride
[PARTIE 03] Conception de l'architecture système
▣ Chapitre 9 : Conception et exploitation des grumes
9.1 Collecte, stockage, analyse et visualisation des journaux
___9.1.1 Le rôle des bûches
___9.1.2 Types de journaux
___9.1.3 Méthodes et outils de collecte des journaux
___9.1.4 Stratégies efficaces de stockage des journaux
9.2 Format des journaux et stratégie de gestion
___9.2.1 L'importance de la normalisation du format des journaux
___9.2.2 Types de formats de journalisation et critères de sélection
___9.2.3 Définition et utilisation du niveau de journalisation
___9.2.4 Directives pour la rédaction des messages de journalisation
9.3 Elastic Stack
___9.3.1 Qu'est-ce que la pile élastique ?
___9.3.2 Elasticsearch
___9.3.3 Logstash
___9.3.4 Kibana
___9.3.5 Rythmes
9.4 Tests A/B et conception expérimentale
___9.4.1 Qu'est-ce qu'un test A/B ?
___9.4.2 Principes de la conception expérimentale
___9.4.3 Test de signification statistique et interprétation des résultats
___9.4.4 Procédures et outils pour la réalisation de tests A/B
▣ Chapitre 10 : Architecture système
10.1 Considérations relatives à la conception de l'architecture système
___10.1.1 Méthode d'analyse des exigences non fonctionnelles
___10.1.2 Identification et gestion des contraintes de conception
___10.1.3 Introduction aux modèles architecturaux
10.2 Architecture monolithique vs. microservices
___10.2.1 Architecture monolithique
10.2.2 Architecture des microservices
___10.2.3 Analyse comparative des architectures monolithiques et de microservices
___10.2.4 Stratégie de transition vers les microservices
10.3 Principes de conception des systèmes distribués
___10.3.1 Comprendre les compromis des systèmes distribués
___10.3.2 Considérations relatives à la conception de systèmes distribués
___10.3.3 Conception de la tolérance aux pannes des systèmes distribués
10.4 Stratégies d'identification et de résolution des goulots d'étranglement
___10.4.1 Méthodologie d'identification des goulots d'étranglement de performance
___10.4.2 Types de goulots d'étranglement
___10.4.3 Outils de mesure et d'analyse des performances du système
___10.4.4 Stratégies de résolution des goulots d'étranglement
▣ Chapitre 11 : Optimisation et évolutivité du système
11.1 Équilibrage de charge
___11.1.1 Nécessité et types d'équilibrage de charge
___11.1.2 Algorithme d'équilibrage de charge
___11.1.3 Considérations relatives à l'introduction d'un équilibreur de charge
___11.1.4 Équilibreurs de charge dans les environnements cloud
11.2 Mise en cache
___11.2.1 Principes de base et effets de la mise en cache
___11.2.2 Stratégie de mise en cache
___11.2.3 Comment maintenir la cohérence des données du cache
11.3 Orchestration de conteneurs
___11.3.1 Concepts de conteneurs Docker
___11.3.2 Création et gestion d'images de conteneurs
___11.3.3 Orchestration de conteneurs avec Kubernetes
___11.3.4 Présentation des services de conteneurs basés sur le cloud
11.4 Mise à l'échelle automatique
___11.4.1 Échelle horizontale vs. Échelle verticale
___11.4.2 Définition des politiques et règles de mise à l'échelle automatique
___11.4.3 Considérations relatives à la mise à l'échelle automatique
11.5 Méthodes de mesure et d'analyse des performances
___11.5.1 Sélection des indicateurs de performance
___11.5.2 Utilisation des outils d'analyse des performances
___11.5.3 Identification des goulots d'étranglement et stratégies d'amélioration
___11.5.4 Création d'un environnement de test de performance et conception de scénarios
▣ Chapitre 12 : Construction d’un système de modélisation du langage à grande échelle
12.1 Sélection et configuration des composants de recherche
___12.1.1 Aperçu du LLM basé sur la recherche
___12.1.2 Comparaison de la recherche vectorielle et de la recherche par mots-clés
___12.1.3 Comparaison des outils de recherche
___12.1.4 Optimisation des performances de recherche et stratégies de mise à l'échelle
12.2 Sélection et configuration des composants de génération
___12.2.1 Comparaison des types et des caractéristiques des modèles génératifs
12.2.2 Comparaison des principaux LLM tels que GPT, LLaMA et Claude
___12.2.3 Critères de sélection d'un modèle de génération
___12.2.4 Stratégie d'optimisation LLM
12.3 Stratégie de configuration de l'architecture système LLM
___12.3.1 Comparaison des invites, des contextes et du réglage fin
___12.3.2 Conception combinée monomodèle vs multimodèle
___12.3.3 Principes de conception des API pour les applications basées sur LLM
___12.3.4 Protocole de contexte de modèle (MCP)
___12.3.5 Stratégies d'optimisation de l'efficacité pour la réduction des coûts
12.4 Stratégie de configuration de l'architecture système RAG
___12.4.1 Vue d'ensemble du système RAG
___12.4.2 Processus de construction architecturale RAG
___12.4.3 Stratégies d'évaluation et d'amélioration des performances du système RAG
[PARTIE 04] Directives relatives au fonctionnement du service
▣ Chapitre 13 : Sécurité et protection
13.1 Droit et réglementation de l'IA
___13.1.1 Aperçu des principales lois et réglementations relatives à l'IA
___13.1.2 Responsabilité et risques juridiques des systèmes d'IA
___13.1.3 Politique de confidentialité
___13.1.4 Procédures opérationnelles pour la conformité à l'IA
13.2 Stratégie de sécurité des données
13.2.1 Principes de protection des données et modèle de sécurité
13.2.2 Chiffrement des données et contrôle d'accès
___13.2.3 Méthodes de partage et de transfert de données
___13.2.4 Surveillance et audit de la sécurité des données
13.3 Processus de réponse et de récupération en cas d'incident de sécurité des données
13.3.1 Types d'incidents de violation de données et analyse des cas
___13.3.2 Cadre de réponse aux incidents de sécurité des données
13.3.3 Détection et réponse automatisées aux violations de données
___13.3.4 Stratégies de récupération des données et de prévention des récidives
13.4 Politique de confidentialité
13.4.1 Techniques d'anonymisation et de pseudonymisation des données
___13.4.2 Établir une politique de collecte et d'utilisation des données
___13.4.3 Mesures techniques pour protéger les informations personnelles
▣ Chapitre 14 : Gestion des coûts
14.1 Optimisation des coûts du cloud
___14.1.1 Structure des coûts des services cloud
___14.1.2 Stratégies de réduction des coûts de formation des modèles
___14.1.3 Économies de coûts à long terme
___14.1.4 Suivi des coûts et notifications
14.2 Établissement des accords de niveau de service
___14.2.1 Qu'est-ce qu'un SLA ?
___14.2.2 Plan de conception et d'exploitation du SLA
___14.2.3 Politique de pénalités et d'indemnisation en cas de violation du SLA
14.3 Stratégies de gestion et d'optimisation des coûts
14.3.1 Collecte et intégration des données de coûts
___14.3.2 Analyse et prévision des coûts du cloud
___14.3.3 Optimisation des ressources et amélioration de leur utilisation
▣ Chapitre 15 : Conception de la reprise après sinistre et de la haute disponibilité
15.1 Scénarios de défaillance et stratégies de récupération
___15.1.1 Identification et réponse aux défaillances du pipeline de données
___15.1.2 Modèle de processus de reprise après interruption de service
___15.1.3 Stratégie de récupération du système de traitement par lots
___15.1.4 Stratégie de récupération du système de traitement en temps réel
___15.1.5 Isolation des pannes dans les environnements informatiques distribués
15.2 Stratégies de sauvegarde et de restauration des données
___15.2.1 Architecture de sauvegarde des grands ensembles de données
___15.2.2 Gestion et restauration des points de contrôle du modèle
___15.2.3 Optimisation des sauvegardes incrémentielles et complètes
___15.2.4 Méthodes de récupération des métadonnées et du magasin de fonctionnalités
15.3 Modèles de conception à haute disponibilité
___15.3.1 Configuration d'une infrastructure ML multi-cluster
___15.3.2 Garantir la disponibilité du lac de données/de l'entrepôt de données
___15.3.3 Conception de la redondance de la couche de service du modèle
___15.3.4 Mécanisme de récupération des pannes du système d'analyse en temps réel
▣ Annexe A
A.1 Guide pratique de l'API RESTful
A.2 Guide pratique Redis
Guide pratique A.3 SGBDR
A.4 Guide pratique OpenSearch
Guide pratique d'Elastic Stack A.5
A.6 Grafana + Loki + Promtail/Agent Guide Pratique
Guide pratique Docker A.7
A.8 Guide pratique Kubernetes
A.9 Guide pratique d'Apache Kafka
Guide pratique A.10 Apache Flink
Guide pratique A.11 Apache Airflow
A.12 Guide pratique d'Apache Spark (PySpark)
▣ Annexe B
B.1 Architecture de traitement en temps réel
B.2 Architecture de traitement par lots
B.3 Architecture RAG
B.4 Architecture Lambda
B.5 Architecture du lac de données
▣ Annexe C
C.1 Caractéristiques des projets de science des données
C.2 Stratégie de gestion de phase de projet
C.3 Application des méthodologies agiles
C.4 Documentation relative aux résultats et à la gestion
C.5_ Gestion des risques liés aux projets de science des données
▣ Chapitre 1 : Comprendre les données
1.1 Définition et types de données
___1.1.1 Types de données
___1.1.2 Propriétés des données
1.2 Analyse des données
___1.2.1 Modélisation statistique
1.2.2 Processus d'analyse des données
___1.2.3 Exemple d'analyse de données
1.3 Visualisation des données
___1.3.1 Types de visualisation
1.3.2 Principes de visualisation
1.4 Analyse exploratoire des données
___1.4.1 Liste de contrôle pour l'analyse exploratoire des données
1.4.2 Exemple d'analyse exploratoire des données
▣ Chapitre 2 : Principes fondamentaux de l’apprentissage automatique
2.1 Concepts d'apprentissage automatique
___2.1.1 Objectifs commerciaux et considérations relatives à la mise en œuvre de l'apprentissage automatique
___2.1.2 Définition et prise en compte des problèmes pouvant être résolus par l'apprentissage automatique
2.1 Principes d'apprentissage automatique
___2.1.1 Propagation directe
___2.2.2 Fonction d'activation
2.2.3 Fonction de perte
___2.2.4 Algorithme d'optimisation
___2.2.5 Rétropropagation
2.3 Amélioration et évaluation des performances du modèle
___2.3.1 Surajustement et sous-ajustement
___2.3.2 Techniques de normalisation
___2.3.4 Métriques d'évaluation du modèle
___2.3.5 Sélection du modèle et réglage des hyperparamètres
2.4 Exemples d'applications de modèles d'apprentissage automatique
___2.4.1 Principales approches de l'apprentissage automatique
___2.4.2 Cas d'application de l'apprentissage automatique
___2.4.3 Considérations relatives à l'application du modèle
▣ Chapitre 3 : Le cœur de l'apprentissage profond
3.1 Modèle de réseau neuronal de base
___3.1.1 Perceptron multicouche
___3.1.2 Réseaux neuronaux convolutifs
___3.1.3 Réseaux de neurones récurrents
3.2 Modèles d'apprentissage génératifs et de représentation
___3.2.1 Auto-encodeur
___3.2.2 Réseaux antagonistes génératifs
3.3 Modèles de réseaux neuronaux spécifiques à un domaine
___3.3.1 Réseaux neuronaux graphiques
___3.3.2 Réseau Q profond
3.4 Derniers modèles d'apprentissage profond
3.4.1 Transformateur
3.4.2 Modèle de diffusion
___3.4.3 Modèles de langage à grande échelle
___3.4.4 Modèle du ministère de l'Éducation
▣ Chapitre 4 : Applications de l’apprentissage profond
4.1 Traitement automatique du langage naturel
___4.1.1 Prétraitement des données
4.1.2 Architecture du modèle
4.1.3 Formation et évaluation du modèle
___4.1.4 Modèle de base
___4.1.5 Documents requis
___4.1.6 Bibliothèques et outils clés
4.2 Traitement audio
___4.2.1 Prétraitement des données
4.2.2 Architecture du modèle
4.2.3 Formation et évaluation du modèle
___4.2.4 Modèle de base
___4.2.5 Documents requis
___4.2.6 Bibliothèques et outils clés
4.3 Vision par ordinateur
___4.3.1 Prétraitement des données
4.3.2 Architecture du modèle
4.3.3 Formation et évaluation du modèle
___4.3.4 Modèle de base
___4.3.5 Documents requis
___4.3.6 Bibliothèques et outils clés
4.4 Apprentissage par renforcement
___4.4.1 Prétraitement des données
4.4.2 Architecture du modèle
4.4.3 Formation et évaluation du modèle
___4.4.4 Modèle de base
___4.4.5 Documents requis
___4.4.6 Bibliothèques et outils clés
4.5 Système de recommandation
___4.5.1 Prétraitement des données
4.5.2 Architecture du modèle
4.5.3 Formation et évaluation du modèle
___4.5.4 Modèle de base
___4.5.5 Documents requis
___4.5.6 Bibliothèques et outils clés
4.6 Feuille de route pour la science des données
___4.6.1 Traitement automatique du langage naturel
___4.6.2 Traitement audio
___4.6.3 Vision par ordinateur
4.6.4 Apprentissage par renforcement
___4.6.5 Système de recommandation
___4.6.6 Pile technologique étendue
[PARTIE 02] Science des données pratique
▣ Chapitre 5 : Ingénierie des données
5.1 Collecte des données
5.1.1 Méthode de collecte des données
___5.1.2 Pipeline de collecte de données
5.1.3 Considérations relatives à la conception des pipelines
5.2 Prétraitement des données
5.2.3 Nettoyage des données
5.2.2 Conversion des données
5.2.3 Ingénierie des fonctionnalités
5.2.4 Gestion des déséquilibres de données
___5.2.5 Exemple de prétraitement des données
5.3 Gouvernance des données
___5.3.1 Composantes de la gouvernance des données
___5.3.2 Outils de gouvernance des données
___5.3.3 Calendrier de l'introduction de l'outil de gouvernance des données
▣ Chapitre 6 : Stockage et conception des données
6.1 Stockage et gestion des données
6.1.1 Système de gestion de bases de données relationnelles
___6.1.2 NoSQL
___6.1.3 Base de données vectorielles
___6.1.4 Stratégies pour maintenir la cohérence et l'intégrité des données
6.2 Modèles d'architecture de données
6.2.1 Architecture de stockage et de gestion des données
___6.2.2 Techniques de modélisation des données
6.2.3 Systèmes OLAP et OLTP
6.2.4 Entrepôt de données basé sur le cloud
6.3 Conception du pipeline de données
6.3.1 ETL et ELT
6.3.2 Principes de conception des étapes de collecte, de transformation et de stockage des données
___6.3.3 Considérations relatives à la conception du pipeline de données
___6.3.4 Optimisation des pipelines de données dans les environnements de données distribués
▣ Chapitre 7 : Fonctionnement et gestion du modèle
7.1 Principes de conception des API
___7.1.1 API RESTful
___7.1.2 Conception et implémentation d'API RESTful
___7.1.3 Introduction à GraphQL
___7.1.4 Rôles et fonctions de la passerelle API
7.2 Déploiement du modèle
___7.2.1 Critères de sélection d'un environnement de déploiement modèle
___7.2.2 Méthodes et scénarios de déploiement du modèle
___7.2.3 Gestion des versions de modèles et stratégies de restauration
7.3 Surveillance des performances du modèle
7.3.1 Surveillance du modèle et analyse des performances
___7.3.2 Méthodes de détection de la dérive du modèle
___7.3.3 Stratégie de réentraînement du modèle
7.4 CI/CD et MLOps
___7.4.1 Pipeline CI/CD
___7.4.2 MLOps
Plateforme MLOps ___7.4.3
___7.4.4 Stratégie de conception et de construction des pipelines MLOps
▣ Chapitre 8 : Pipeline de traitement des données
8.1 Conception du flux de travail
___8.1.1 Définition des exigences et fixation des objectifs
___8.1.2 Conception étape par étape du flux de travail
8.1.3 Sélection d'une pile technologique
8.1.4 Suivi et amélioration des flux de travail
8.2 Traitement par lots
8.2.1 Concepts et fonctionnalités du traitement par lots
8.2.2 Introduction et comparaison des ordonnanceurs de lots
8.2.3 Concevoir et implémenter un flux de travail par lots
___8.2.4 Optimisation du traitement par lots
8.3 Traitement en temps réel
8.3.1 Concepts et fonctionnalités du traitement en temps réel
8.3.2 Introduction et comparaison des plateformes de streaming
___8.3.3 Conception et construction d'un pipeline de données en temps réel
8.3.4 Optimisation du traitement en temps réel
8.4 Traitement par lots vs. Traitement en temps réel
8.4.1 Principales différences entre le traitement par lots et le traitement en temps réel
___8.4.2 Guide de sélection d'une méthode de traitement en fonction des exigences du système
8.4.3 Architecture hybride
[PARTIE 03] Conception de l'architecture système
▣ Chapitre 9 : Conception et exploitation des grumes
9.1 Collecte, stockage, analyse et visualisation des journaux
___9.1.1 Le rôle des bûches
___9.1.2 Types de journaux
___9.1.3 Méthodes et outils de collecte des journaux
___9.1.4 Stratégies efficaces de stockage des journaux
9.2 Format des journaux et stratégie de gestion
___9.2.1 L'importance de la normalisation du format des journaux
___9.2.2 Types de formats de journalisation et critères de sélection
___9.2.3 Définition et utilisation du niveau de journalisation
___9.2.4 Directives pour la rédaction des messages de journalisation
9.3 Elastic Stack
___9.3.1 Qu'est-ce que la pile élastique ?
___9.3.2 Elasticsearch
___9.3.3 Logstash
___9.3.4 Kibana
___9.3.5 Rythmes
9.4 Tests A/B et conception expérimentale
___9.4.1 Qu'est-ce qu'un test A/B ?
___9.4.2 Principes de la conception expérimentale
___9.4.3 Test de signification statistique et interprétation des résultats
___9.4.4 Procédures et outils pour la réalisation de tests A/B
▣ Chapitre 10 : Architecture système
10.1 Considérations relatives à la conception de l'architecture système
___10.1.1 Méthode d'analyse des exigences non fonctionnelles
___10.1.2 Identification et gestion des contraintes de conception
___10.1.3 Introduction aux modèles architecturaux
10.2 Architecture monolithique vs. microservices
___10.2.1 Architecture monolithique
10.2.2 Architecture des microservices
___10.2.3 Analyse comparative des architectures monolithiques et de microservices
___10.2.4 Stratégie de transition vers les microservices
10.3 Principes de conception des systèmes distribués
___10.3.1 Comprendre les compromis des systèmes distribués
___10.3.2 Considérations relatives à la conception de systèmes distribués
___10.3.3 Conception de la tolérance aux pannes des systèmes distribués
10.4 Stratégies d'identification et de résolution des goulots d'étranglement
___10.4.1 Méthodologie d'identification des goulots d'étranglement de performance
___10.4.2 Types de goulots d'étranglement
___10.4.3 Outils de mesure et d'analyse des performances du système
___10.4.4 Stratégies de résolution des goulots d'étranglement
▣ Chapitre 11 : Optimisation et évolutivité du système
11.1 Équilibrage de charge
___11.1.1 Nécessité et types d'équilibrage de charge
___11.1.2 Algorithme d'équilibrage de charge
___11.1.3 Considérations relatives à l'introduction d'un équilibreur de charge
___11.1.4 Équilibreurs de charge dans les environnements cloud
11.2 Mise en cache
___11.2.1 Principes de base et effets de la mise en cache
___11.2.2 Stratégie de mise en cache
___11.2.3 Comment maintenir la cohérence des données du cache
11.3 Orchestration de conteneurs
___11.3.1 Concepts de conteneurs Docker
___11.3.2 Création et gestion d'images de conteneurs
___11.3.3 Orchestration de conteneurs avec Kubernetes
___11.3.4 Présentation des services de conteneurs basés sur le cloud
11.4 Mise à l'échelle automatique
___11.4.1 Échelle horizontale vs. Échelle verticale
___11.4.2 Définition des politiques et règles de mise à l'échelle automatique
___11.4.3 Considérations relatives à la mise à l'échelle automatique
11.5 Méthodes de mesure et d'analyse des performances
___11.5.1 Sélection des indicateurs de performance
___11.5.2 Utilisation des outils d'analyse des performances
___11.5.3 Identification des goulots d'étranglement et stratégies d'amélioration
___11.5.4 Création d'un environnement de test de performance et conception de scénarios
▣ Chapitre 12 : Construction d’un système de modélisation du langage à grande échelle
12.1 Sélection et configuration des composants de recherche
___12.1.1 Aperçu du LLM basé sur la recherche
___12.1.2 Comparaison de la recherche vectorielle et de la recherche par mots-clés
___12.1.3 Comparaison des outils de recherche
___12.1.4 Optimisation des performances de recherche et stratégies de mise à l'échelle
12.2 Sélection et configuration des composants de génération
___12.2.1 Comparaison des types et des caractéristiques des modèles génératifs
12.2.2 Comparaison des principaux LLM tels que GPT, LLaMA et Claude
___12.2.3 Critères de sélection d'un modèle de génération
___12.2.4 Stratégie d'optimisation LLM
12.3 Stratégie de configuration de l'architecture système LLM
___12.3.1 Comparaison des invites, des contextes et du réglage fin
___12.3.2 Conception combinée monomodèle vs multimodèle
___12.3.3 Principes de conception des API pour les applications basées sur LLM
___12.3.4 Protocole de contexte de modèle (MCP)
___12.3.5 Stratégies d'optimisation de l'efficacité pour la réduction des coûts
12.4 Stratégie de configuration de l'architecture système RAG
___12.4.1 Vue d'ensemble du système RAG
___12.4.2 Processus de construction architecturale RAG
___12.4.3 Stratégies d'évaluation et d'amélioration des performances du système RAG
[PARTIE 04] Directives relatives au fonctionnement du service
▣ Chapitre 13 : Sécurité et protection
13.1 Droit et réglementation de l'IA
___13.1.1 Aperçu des principales lois et réglementations relatives à l'IA
___13.1.2 Responsabilité et risques juridiques des systèmes d'IA
___13.1.3 Politique de confidentialité
___13.1.4 Procédures opérationnelles pour la conformité à l'IA
13.2 Stratégie de sécurité des données
13.2.1 Principes de protection des données et modèle de sécurité
13.2.2 Chiffrement des données et contrôle d'accès
___13.2.3 Méthodes de partage et de transfert de données
___13.2.4 Surveillance et audit de la sécurité des données
13.3 Processus de réponse et de récupération en cas d'incident de sécurité des données
13.3.1 Types d'incidents de violation de données et analyse des cas
___13.3.2 Cadre de réponse aux incidents de sécurité des données
13.3.3 Détection et réponse automatisées aux violations de données
___13.3.4 Stratégies de récupération des données et de prévention des récidives
13.4 Politique de confidentialité
13.4.1 Techniques d'anonymisation et de pseudonymisation des données
___13.4.2 Établir une politique de collecte et d'utilisation des données
___13.4.3 Mesures techniques pour protéger les informations personnelles
▣ Chapitre 14 : Gestion des coûts
14.1 Optimisation des coûts du cloud
___14.1.1 Structure des coûts des services cloud
___14.1.2 Stratégies de réduction des coûts de formation des modèles
___14.1.3 Économies de coûts à long terme
___14.1.4 Suivi des coûts et notifications
14.2 Établissement des accords de niveau de service
___14.2.1 Qu'est-ce qu'un SLA ?
___14.2.2 Plan de conception et d'exploitation du SLA
___14.2.3 Politique de pénalités et d'indemnisation en cas de violation du SLA
14.3 Stratégies de gestion et d'optimisation des coûts
14.3.1 Collecte et intégration des données de coûts
___14.3.2 Analyse et prévision des coûts du cloud
___14.3.3 Optimisation des ressources et amélioration de leur utilisation
▣ Chapitre 15 : Conception de la reprise après sinistre et de la haute disponibilité
15.1 Scénarios de défaillance et stratégies de récupération
___15.1.1 Identification et réponse aux défaillances du pipeline de données
___15.1.2 Modèle de processus de reprise après interruption de service
___15.1.3 Stratégie de récupération du système de traitement par lots
___15.1.4 Stratégie de récupération du système de traitement en temps réel
___15.1.5 Isolation des pannes dans les environnements informatiques distribués
15.2 Stratégies de sauvegarde et de restauration des données
___15.2.1 Architecture de sauvegarde des grands ensembles de données
___15.2.2 Gestion et restauration des points de contrôle du modèle
___15.2.3 Optimisation des sauvegardes incrémentielles et complètes
___15.2.4 Méthodes de récupération des métadonnées et du magasin de fonctionnalités
15.3 Modèles de conception à haute disponibilité
___15.3.1 Configuration d'une infrastructure ML multi-cluster
___15.3.2 Garantir la disponibilité du lac de données/de l'entrepôt de données
___15.3.3 Conception de la redondance de la couche de service du modèle
___15.3.4 Mécanisme de récupération des pannes du système d'analyse en temps réel
▣ Annexe A
A.1 Guide pratique de l'API RESTful
A.2 Guide pratique Redis
Guide pratique A.3 SGBDR
A.4 Guide pratique OpenSearch
Guide pratique d'Elastic Stack A.5
A.6 Grafana + Loki + Promtail/Agent Guide Pratique
Guide pratique Docker A.7
A.8 Guide pratique Kubernetes
A.9 Guide pratique d'Apache Kafka
Guide pratique A.10 Apache Flink
Guide pratique A.11 Apache Airflow
A.12 Guide pratique d'Apache Spark (PySpark)
▣ Annexe B
B.1 Architecture de traitement en temps réel
B.2 Architecture de traitement par lots
B.3 Architecture RAG
B.4 Architecture Lambda
B.5 Architecture du lac de données
▣ Annexe C
C.1 Caractéristiques des projets de science des données
C.2 Stratégie de gestion de phase de projet
C.3 Application des méthodologies agiles
C.4 Documentation relative aux résultats et à la gestion
C.5_ Gestion des risques liés aux projets de science des données
Image détaillée

Avis de l'éditeur
★ Ce que ce livre aborde ★
◎ Théories fondamentales de la science des données, y compris l'analyse des données, la visualisation et l'analyse exploratoire.
◎ Aperçu de la conception de modèles d'apprentissage automatique et d'apprentissage profond et introduction aux principaux domaines d'application
◎ Pratiques d'ingénierie des données telles que la collecte, le prétraitement, l'intégration et la gouvernance des données
◎ Conception du stockage des données, modèles d'architecture et construction du pipeline de données
◎ Conception et comparaison des flux de travail, du traitement par lots et des systèmes de traitement en temps réel
◎ Concepts de conception d'API, de déploiement de modèles, d'intégration continue et de déploiement continu (CI/CD), de surveillance des performances et de MLOps
◎ Principes de conception de l'architecture des journaux, d'Elastic Stack et de conception expérimentale (tests A/B)
◎ Stratégies de conception de systèmes telles que les microservices, les systèmes distribués, l'analyse des goulots d'étranglement et l'amélioration
◎ Technologies d'optimisation et d'exploitation du système telles que la mise en cache, l'équilibrage de charge et la mise à l'échelle automatique
◎ Études de cas des architectures d'IA les plus récentes, y compris les stratégies de configuration des systèmes LLM et RAG
◎ Guide de conception pour la sécurité des données, la protection de la vie privée, la réponse aux sinistres, la sauvegarde/restauration et la haute disponibilité
◎ Stratégies d'optimisation des coûts du cloud, de définition des SLA et de gestion des coûts opérationnels
◎ Théories fondamentales de la science des données, y compris l'analyse des données, la visualisation et l'analyse exploratoire.
◎ Aperçu de la conception de modèles d'apprentissage automatique et d'apprentissage profond et introduction aux principaux domaines d'application
◎ Pratiques d'ingénierie des données telles que la collecte, le prétraitement, l'intégration et la gouvernance des données
◎ Conception du stockage des données, modèles d'architecture et construction du pipeline de données
◎ Conception et comparaison des flux de travail, du traitement par lots et des systèmes de traitement en temps réel
◎ Concepts de conception d'API, de déploiement de modèles, d'intégration continue et de déploiement continu (CI/CD), de surveillance des performances et de MLOps
◎ Principes de conception de l'architecture des journaux, d'Elastic Stack et de conception expérimentale (tests A/B)
◎ Stratégies de conception de systèmes telles que les microservices, les systèmes distribués, l'analyse des goulots d'étranglement et l'amélioration
◎ Technologies d'optimisation et d'exploitation du système telles que la mise en cache, l'équilibrage de charge et la mise à l'échelle automatique
◎ Études de cas des architectures d'IA les plus récentes, y compris les stratégies de configuration des systèmes LLM et RAG
◎ Guide de conception pour la sécurité des données, la protection de la vie privée, la réponse aux sinistres, la sauvegarde/restauration et la haute disponibilité
◎ Stratégies d'optimisation des coûts du cloud, de définition des SLA et de gestion des coûts opérationnels
SPÉCIFICATIONS DES PRODUITS
- Date d'émission : 27 août 2025
- Nombre de pages, poids, dimensions : 880 pages | 175 × 235 × 36 mm
- ISBN13 : 9791158396213
Vous aimerez peut-être aussi
카테고리
Langue coréenne
Langue coréenne