Super bouquin, en espérant des mises à jour car Microsoft Fabric évolue très vite
Yann D- Livres & vidéos
- Microsoft Fabric - De l’analyse à la mise en place d’une plateforme de données unifiée
Microsoft Fabric De l’analyse à la mise en place d’une plateforme de données unifiée
1 avis
Consulter des extraits du livre en ligne
Aperçu de la version papier
Les points forts du livre :
- Une approche complète du cycle de vie des données, de l’ingestion à la visualisation,
- Un guide structurant pour la mise en œuvre d’une plateforme de données unifiée,
- Une expertise collective issue du terrain et des meilleures pratiques
- Niveau Confirmé à Expert
- Nombre de pages 782 pages
- Parution décembre 2024
- Niveau Confirmé à Expert
- Parution décembre 2024
Organisé en deux parties, ce livre commence par introduire Microsoft Fabric et les étapes pour y accéder. Les premiers chapitres vous guideront pour passer d’une donnée existante à un rapport, en couvrant toutes les étapes du flux de données : création d’un lakehouse, ingestion de données et création de rapports.
Dans la seconde partie, vous apprendrez à mettre en place Microsoft Fabric pour votre équipe ou votre entreprise. Vous approfondirez vos connaissances sur l’architecture de la solution, incluant l’organisation de votre datalake et de vos entrepôts de données. Vous découvrirez des fonctionnalités avancées telles que l’analyse de données en temps réel, la data science et la collaboration en équipe. Pour ceux qui jouent un rôle clé dans l’implémentation de Fabric, des chapitres sont dédiés à l’administration, à la sécurisation de la plateforme de données et à l’optimisation des coûts, vous fournissant toutes les clés pour un déploiement réussi.
Ce livre est écrit par un collectif d’auteurs issus du groupe produit Azure, des équipes clients chez Microsoft, ainsi que des membres de la communauté française “Club Power BI” et de partenaires experts.
Caractéristiques
- Livre (broché) - 17 x 21 cm
- ISBN : 978-2-409-04644-5
- EAN : 9782409046445
- Ref. ENI : EIMICFAB
Caractéristiques
- HTML
- ISBN : 978-2-409-04645-2
- EAN : 9782409046452
- Ref. ENI : LNEIMICFAB
Téléchargements
Avant-propos
- Introduction
Introduction à Microsoft Fabric
- Qu'est-ce que Microsoft Fabric ?
- 1. Un changement de paradigme dans les équipesdata
- 2. Un produit jeune mais basé sur l’expérience
- 3. Les principes de Microsoft Fabric
- L'architecture de Fabric
- 1. Une solution Software as a Service - SaaS
- 2. Architecture de Fabric
- 3. Les expériences Fabric
- 4. Les expériences partenaires
- Les scénarios d'utilisation de Microsoft Fabric
- 1. Quels sont les métiers/rôlesqui utilisent Fabric ?
- 2. Fabric pour les utilisateurs de Power BI
Démarrer avec Fabric
- Accéder à Microsoft Fabric
- 1. Tenant professionnel
- 2. Premier accès à Microsoft Fabric
- 3. Les expériences dans Fabric
- 4. Activer Fabric sur votre Tenant
- 5. Collaboration entre Tenants
- S'organiser dans Microsoft Fabric
- 1. Espaces de travail
- 2. Mon espace de travail
- 3. Dossiers et domaines
- 4. Bonnes pratiques d’organisation
- Naviguer dans Microsoft Fabric
- 1. Le Portail Microsoft Fabric
- 2. Recherche et navigation
- 3. Autres éléments du portail
- a. Panneau central
- b. Bandeau supérieur
- c. Barre latérale
- 1. Mon premier rapport avec Microsoft Fabric
- 2. Analyser un fichier de données en 3 clics
- 3. Option : utiliser le modèle sémantiquepar défaut
Du Lakehouse à la première analyse
- Évolution des architectures de données
- 1. Entrepôt de données
- 2. Lac de données
- 3. Data Lakehouse
- Le stockage des données dans Fabric
- 1. OneLake
- 2. Delta Lake
- 3. Unifier les données
- Le Lakehouse dans Microsoft Fabric
- 1. Exploiter Spark
- 2. Point de terminaison analytique SQL
- 3. Modèle sémantique
- 4. Gérer la sécurité et lepartage
- Cas d’usages
- 1. Première analyse
- a. Création d’un espace de travail
- b. Création d’un Lakehouse
- c. Récupération des données
- d. Chargement des données dans une table
- e. Première analyse visuelle
- f. Première analyse en SQL
- g. Création manuelle d’un rapport
- h. Création automatique d’un rapport
- i. Création avec Copilot
- 1. Première analyse
- 2. Architecture Médaillon
- a. Ingestion
- b. Transformation
- c. Chargement incrémentiel
- d. Création de tables d’agrégat
- e. Analyse
- f. Orchestration
- g. Maintenance
- 3. Hub and Spokes
Unifier des données dans OneLake
- Introduction
- Organisation et gouvernance autour de OneLake
- 1. OneLake, le OneDrive des données
- 2. Les stratégies d’organisation d’unData Lake
- Implémenter une approche Data Mesh au travers de Microsoft Fabric
- 1. Le Data Mesh
- 2. L’organisation des données par domainesfonctionnels dans Fabric
- Structuration de la donnée au sein de OneLake
- 1. La Data virtualisation au travers des raccourcis (Shortcuts)
- 2. Le fonctionnement des raccourcis
- 3. La structuration des données dans OneLake
- Gouvernance et sécurité des fichiers dans Fabric
- 1. Accéder aux données de OneLake
- 2. La gouvernance des données dans OneLake
- a. Promotion des items grâce aux labels Promu,Certifié et Master data
- b. Labélisation des items au travers des étiquettesde confidentialité (sensitivity labels)
- c. Gouvernance des données via le MicrosoftPurview Hub
Ingérer des données dans Fabric
- Introduction
- Les différents types d'ingestion de données
- Ingestion en mode ETL vs ELT
- Les méthodes d'ingestion de données dans Fabric
- Ingérer de la donnée manuellement dans OneLake
- Les passerelles (data gateway)
- 1. L’On-premises data gateway
- 2. La Virtual Network (VNet) data gateway
- Ingérer des données avec les flux de données Gen2 - Dataflows Gen2
- 1. Utilisation des flux de données Gen2 (DataflowGen2) pour l’import de données dans Fabric
- 2. Dataflow Gen1 vs Dataflow Gen2
- Ingérer des données avec des Pipelines de données (Data Pipelines)
- 1. Utilisation des Pipelines pour intégrer desdonnées dans Fabric
- 2. Fabric Data Pipelines, les Pipelines Azure Data Factoryet les Synapse Pipelines
- Intégrer des données en direct vers un Warehouse Fabric
- Ingérer des données via des Notebooks Spark
- Ingérer des données temps réel
- Utilisation de Copilot pour ingérer et transformer des données
- Ingestion de données avec Apache Airflow
- 1. Qu’est-ce que Apache AirFlow ?
- 2. Intégrer des données avec un fluxde travail de données (Data workflow) (Preview)
- Quelle fonctionnalité choisir pour ingérer mes données ?
- Ingérer des données dans Fabric depuis un outil externe
Transformation avancée des données
- Les transformations de données dans le cycle de vie de la donnée
- 1. La création de valeur de l’étapede transformation
- a. Un travail nécessaire pour exploiter lesdonnées
- b. La place de la transformation de données
- c. Les rôles et responsabilités
- 1. La création de valeur de l’étapede transformation
- 2. Les différents moments de la transformationde données
- a. Transformer des données brutes en nettoyées
- b. Transformer des données nettoyéesen curées
- c. Transformer des données curées enexploitables
- 3. Choisir le bon outil pour la transformation de données
- 1. Création d’un dataflow
- a. Créer et gérer ses sources de données
- b. Conception d’un dataflow
- c. Sauvegarder et publier
- d. Programmer l’exécution
- a. Enregistrer dans un lakehouse ou un warehouse
- b. Reverse ETL vers Azure SQL
- c. Azure Data Explorer
- 1. Introduction aux transformations SQL
- a. Avantages des transformations SQL
- b. Les transformations avec T-SQL
- c. Les transformations avec Spark SQL
- a. Manipulation des données avec les fonctionsconditionnelles
- b. Classement et numérotation des lignes
- c. Fonctions de fenêtrage pour l’analyse avancée
- d. Sauvegarder les résultats de la transformation
- a. Création de requêtes paramétriséeset de procédures stockées
- b. Planification avec les Data Pipelines
- 1. Introduction à Apache Spark
- a. Les déclinaisons du moteur dans MicrosoftFabric
- b. Approche cluster « à lademande »
- c. Approche cluster dédié
- d. Comportement du moteur Spark, concurrence et filed’attente
- e. La notion d’environnement
- f. Native Execution Engine
- a. Création et utilisation
- b. Utilisation de PySpark
- c. Transformations faciles avec Data Wrangler
- d. Utiliser les ressources de Notebooks
- e. Préparer les Notebooks pour la production
- 1. Pipelines
- 2. Notebooks
- a. Exécuter un Notebook depuis un autre
- b. Orchestrer l’exécution de plusieurs Notebooks
- c. Interagir avec Fabric depuis un Notebook
- a. Introduction aux Apache Airflow Jobs
- b. Création d’un Apache Airflow Job
Organiser ses données
- Introduction
- Un peu d'histoire : OLTP, OLAP et Big Data
- 1. Deux univers inconciliables : OLTP et OLAP
- 2. Naissance du concept de Data Lake
- Le Data Warehouse : un entrepôt de données structurées et optimisées pour l'analytique
- Le Data Lakehouse : un Data Lake structuré et optimisé pour l'analytique
- Le Data Warehouse : les avantages de la maturité ?
- 1. Instructions DDL
- 2. Instructions DML
- 3. Sécurité plus fine dans un DataWarehouse
- Différences et convergences
- 1. Faire du SQL sur un Lakehouse
- 2. L’impact du stockage physique
- 3. Interactions entre Lakehouse et Warehouse dans Fabric
- 4. Accès concurrents
- 5. Accès aux Lakehouse et Warehouse entre espacesde travail
- Comment choisir ?
- 1. Points forts de chacun des services
- 2. Performances
- 3. Critères non fonctionnels
- a. Historique et existant
- b. Compétences de vos équipes
- c. Impact du choix
- 4. Notre point de vue
- 1. Quel est l’usage des bases de donnéesen miroir ?
- 2. Comment fonctionne une base en miroir ?
- 3. Démonstration pas à pas
- 4. Chaîne de connexion et sécurité
Traiter et analyser des données en temps réel
- De multiples définitions du « temps réel » et leurs applications
- Du temps réel à l’analytique
- Qu’est-ce que le Complex Event Processing (CEP) ?
- 1. Présentation
- 2. Comprendre la notion de fenêtre temporelle
- a. Tumbling Windows (Fenêtre à bascule)
- b. Hopping Windows (Fenêtre récurrente)
- c. Session Windows (Fenêtre de session)
- d. Sliding Windows (Fenêtre glissante)
- e. Snapshot Windows (Fenêtre d’instantané)
- 1. Création du workspace lié au tempsréel
- 2. Les Hubs d’évènements ensource
- a. Source externe : Azure Event Hubs
- b. Source externe : Azure IoT Hub
- c. Point de terminaison personnalisé
- d. Exemples de données
- 1. Comprendre les bases de données orientées évènements temporels
- 2. Les bases de données Data Explorer (Eventhouse)dans Microsoft Fabric
- a. Qu’est-ce qu’une base de données KQL ?
- b. Création d’un Eventhouse et d’unebase de données KQL
- c. Le concept d’eventhouse
- d. Le concept de dossier OneLake et de copie unique
- a. Interaction native KQL via les « jeuxde requêtes KQL » et Power BI
- b. Interaction via un « shortcut » detable
- 1. Qu’est-ce qu’une alerte et pourquoi ?
- 2. Comprendre Data Activator dans Microsoft Fabric
- 3. La définition des alertes sur les flux d’évènements
Concevoir des modèles sémantiques
- Introduction
- Donnée, Information et Connaissance
- Modélisation
- 1. Les différentes étapes
- 2. Modélisations adaptées à laBI
- 3. D’autres techniques de modélisation
- Modèle sémantique
- Architecture tabulaire
- 1. VertiPaq
- 2. DAX
- Mode d’accès aux données
- 1. Import
- 2. Direct Query
- 3. Live Connection
- 4. Composite
- 5. Direct Lake
- Création d’un modèle
- 1. Type de données
- 2. Relations
- 3. Table de date
- 4. Propriétés
- 5. Hiérarchie
- 6. Perspective
- 7. Table et colonne calculée
- 8. Mesure
- 9. Groupe de calcul
- 10. Traduction
- 11. Sécurité
- Optimisations
- 1. Intégrité référentielle
- 2. Query Folding
- 3. Direct Query
- 4. Indice d’encodage
- 5. Hiérarchies d’attributs
- 6. Modèles sémantiques volumineux
- 7. Date/heure automatique
- 8. Partition
- 9. Rafraîchissement incrémentiel
- 10. Table hybride
- 11. Scale-Out
- 12. Agrégation
- 13. Agrégation automatique
- 14. Mise en cache des requêtes
- 15. Comportement de secours
- 16. Variables DAX
- 17. DAX Pattern
- 18. Gestion des erreurs
- 19. Management
- 20. Outils tiers
- Copilot
Analyse et reporting d'entreprise
- Appréhender un jeu de données
- 1. Quick Insights
- 2. L’Explorateur de données
- Créer des rapports interactifs
- 1. Introduction à Power BI
- a. Power BI Desktop
- b. Power BI Service
- 1. Introduction à Power BI
- 2. Conception d’un rapport interactif
- a. Présentation de l’interface
- b. Ajouter une visualisation
- c. Personnaliser l’apparence d’unevisualisation
- d. Gérer les interactions
- 3. Ajouter des filtres et segments
- a. Utiliser des filtres
- b. Utiliser des segments
- 4. Publier un rapport
- 1. Copilot
- a. Générer un rapport
- b. Utiliser le visuel Narrative
- a. Créer des modèles de rapport personnalisés
- b. Utiliser les modèles
- a. Des rapports à la mise en page précise
- b. Création de rapports paginés
- a. Définir et créer des KPI dans PowerBI
- b. Mesurer la performance
- c. Suivre l’évolution des métriques
- a. Avantages des tableaux de bord
- b. Création d’un tableau de bord
- 1. Souscriptions
- 2. Alerte
- 1. L’accessibilité des rapports
- 2. Bonnes pratiques de construction des rapports
- 3. Storytelling
- 4. Information sur les données
Utiliser l'IA dans Fabric
- Une brève introduction à l'IA et les outils Microsoft associés
- 1. Microsoft, du Data Mining à la générativeIA, un peu d’histoire
- 2. L’impact de l’IA sur les plateformes de données
- 3. Le langage Python
- 4. Introduction aux outils Microsoft
- a. Microsoft Fabric Data Science persona
- b. Microsoft AI Studio
- c. Microsoft Azure Machine Learning
- 5. La librairie Synapse Machine Learning (SynapseML)
- 1. Introduction aux Microsoft AI Services
- 2. Les AI services dans Microsoft Fabric
- a. Text Analytics
- b. Azure AI translator
- c. Azure Open AI service
- a. Préparation de l’environnement d’analyse
- b. Analyse des données de commentaires à l’aidedes AI Services
- c. Création d’un rapport sur les commentairesenrichis
- 1. Comprendre les modèles LLM
- 2. Comprendre les modèles SLM
- 3. Utiliser un modèle LLM dans Microsoft Fabricen appel interne
- 4. Utiliser un modèle LLM dans Microsoft Fabricen appel externe
- a. Mise en place de l’environnement Azure
- b. Catégorisation des commentaires à l’aidedu modèle gpt-35-turbo
- c. Création d’un rapport sur les commentairespar catégories
- 1. Préparation des données
- 2. Entraînement des modèles de MachineLearning
- 3. Évaluation du modèle
- 4. Exemple Customer churn prediction
- 1. Comprendre l’interaction entre les modèlessémantique et le persona de Data Science
- 2. Introduction à la librairie de Semantic LinkLabs
- 3. Exemple d’implémentation
Collaborer en équipe
- Introduction
- Collaborer pendant le développement
- 1. Les fondamentaux : DevOps & DataOps
- a. DevOps à l’origine
- b. DataOps, une même philosophie mais des pratiquesdifférentes
- 1. Les fondamentaux : DevOps & DataOps
- 2. Contrôle de code source
- a. Le code dans Fabric
- b. Développer ensemble en même temps
- c. Configurer le contrôle de code source
- 3. Environnements et gestion des branches
- a. Environnements
- b. Modèles Git
- c. Avantages et inconvénients
- d. En synthèse
- 4. Déployer
- a. Environnements et Pipelines de déploiement
- b. Déployer des éléments
- c. Paramètres et règles de déploiement
- d. Pour aller plus loin
- 5. Synthèse
- 1. Les fondamentaux du partage
- a. Qui, Quoi, Comment, Où, Pourquoi
- b. RBAC
- c. Comment partager ?
- a. Utilisateurs externes à votre entreprise
- b. Groupes
- c. Applications
- a. Les espaces de travail
- b. Les données
- c. Les rapports
- d. Une application
- a. API GraphQL
- b. S’abonner aux données
- c. Teams
- d. Power Point
- e. Power BI Mobile App
Architecture
- Les tendances des architectures analytiques
- Le concept d'architecture autour de Microsoft Fabric
- 1. Les différents modèles d’architectures
- a. Monolithique
- b. Plusieurs groupes de travail avec une capacité unique
- c. Plusieurs groupes de travail et différentescapacités
- d. Plusieurs tenants
- 1. Les différents modèles d’architectures
- 2. Le Hub de données autour du OneLake
- 3. Les architectures logiques des flux de tâches
- 1. Qu’est-ce que le concept d’architecture de Data Mesh ?
- a. Les produits (Data Products)
- b. Les domaines (Domains)
- c. La plateforme de données (Self-serve datainfrastructure as a platform)
- d. La gouvernance fédérée(Federated governance)
- e. Une architecture logique et unifiée
- 1. Well architected framework for Industry
- 2. Les verticaux par industries
- 3. Déploiement du modèle industrieRetail
- 1. Les questions avant la mise en production
- 2. Une démarche standardisée
- 3. Les scénarios à envisager pour vosprojets
- 4. Que sont TPC et TPC-H 3.0.1 ?
- 5. Génération de données avecTPCH et Spark
- 6. Génération de données avecTPCH et DBgen
- a. Compilation de l’outil DBgen
- b. Génération de données avecDBgen
Sécuriser sa plateforme de données
- Introduction
- Software as a Service
- Microsoft Fabric
- Authentification
- Sécurité du réseau
- 1. Sécurité des réseaux entrants
- 2. Sécurité des réseaux sortants
- Sécurité multicouches
- 1. Rôles d’administration
- 2. OneLake
- 3. Capacité
- 4. Domaines
- 5. Espace de travail
- 6. Objet
- 7. Recommandation et approbation
- Sécurité par expériences
- 1. Power BI
- 2. GraphQL
- 3. Warehouse
- 4. Eventhouse
- 5. Sécurité des développements
- Partage et gestion des autorisations
- Supervision
- 1. Statut du service
- 2. Log d’activités
- 3. Espace de travail Monitoring de l’administrateur
- 4. Microsoft Purview
Administrer Fabric
- Introduction à l'administration Fabric
- 1. Vue d’ensemble de l’administration
- a. Activer Fabric pour votre organisation
- b. Gérer les utilisateurs
- 1. Vue d’ensemble de l’administration
- 2. Les interfaces d’administration
- a. Console d’administration Microsoft 365
- b. La console d’administration Fabric
- c. Le portail Azure
- d. Les autres outils et consoles d’administration
- 3. Planifier les rôles et responsabilités
- a. Qui crée et administre les capacitésFabric ?
- b. Qui a le droit de créer des espaces de travail ?
- c. Qui va associer les espaces de travail aux capacités ?
- 1. Gérer les fonctionnalités au niveaudu tenant
- 2. Déléguer des droits d’administration
- 3. Supporter les espaces de travail
- a. Restaurer un espace de travail supprimé
- b. Accéder à un espace de travail personnel
- 1. Créer une capacité
- 2. Associer une capacité à un espacede travail
- a. Associer en tant qu’administrateur de la plateforme
- b. Associer en tant que propriétaire d’espacede travail
- 1. Gérer les connexions à Azure
- 2. Utiliser une identité d’espace de travail
- 3. Gérer les paramètres Spark
Maîtriser et optimiser les coûts de la plateforme
- Comprendre l'utilisation des ressources de la plateforme Fabric
- 1. Je suis un utilisateur
- 2. Je suis un développeur ou data engineer
- 3. Je suis un administrateur ou un architecte
- Comprendre le business model de Fabric
- 1. La notion de CU/s et la mesure de la consommation
- 2. Qu’est-ce que le Bursting ?
- 3. Qu’est-ce que le Smoothing ?
- 4. Qu’est-ce que le Throttling ?
- 5. Qu’est-ce que le Queueing ?
- 6. Comprendre la scalabilité d’une capacité Fabric
- 7. Le OneLake
- 8. Le réseau
- 9. La réplication de données
- 10. Résumé des vecteurs de coûtsMicrosoft Fabric
- L'application métriques de capacité
- 1. Installation de l’application Microsoft Fabric CapacityMetrics
- 2. Compréhension de l’application MicrosoftFabric Capacity Metrics
- a. Section Compute
- b. Section Storage
- 1. Profil développeur
- 2. Profil architecte
- 3. Profil administrateur
- 4. Optimisation des achats
- 5. Calculette Microsoft Fabric
Conclusion
- Conclusion
Emilie BEAU
Emilie BEAU est spécialiste technique sur les technologies du traitement de la donnée. Chez Microsoft depuis 15 ans, elle prend plaisir à partager ses connaissances et à s’engager dans des discussions sur la manière dont les avancées en matière de BI, de Big Data et d’Intelligence Artificielle peuvent aider les industries à relever de nouveaux défis.
LinkedIn : Emilie BEAU | LinkedIn
En savoir plusLinkedIn : Emilie BEAU | LinkedIn
Romain CASTERES
Romain CASTERES est un architecte de solution cloud chez Microsoft, passionné par la musique, les nouvelles technologies, les voyages … et la Data. Ancien MVP (Microsoft Most Valuable Professional) avec plus de 15 ans d'expériences dans le domaine de la Data, il aime résoudre les défis en exploitant la valeur des données, apprendre et partager des connaissances.
LinkedIn : Romain Casteres | LinkedIn
Blog : https://pulsweb.fr/
YouTube : https://www.youtube.com/@DataChouette
En savoir plusLinkedIn : Romain Casteres | LinkedIn
Blog : https://pulsweb.fr/
YouTube : https://www.youtube.com/@DataChouette
Frédéric GISBERT
Frédéric GISBERT est un architecte solution cloud chez Microsoft depuis près de 17 ans. Il a intégré diverses entités, passant de Microsoft Professional Services aux divisions clients, et évolue depuis 4 ans dans la division partenaires. Passionné par les nouvelles technologies, il traite des sujets allant des bases de données à l’IA générative et Microsoft Fabric aujourd'hui.
LinkedIn : Frederic Gisbert | LinkedIn
En savoir plusLinkedIn : Frederic Gisbert | LinkedIn
Jean-Pierre RIEHL
Jean-Pierre RIEHL est un leader technologique qui conjugue Data, innovation et valeur métier. Passionné par les données, fan de Power BI et Fabric, guidé par l'innovation mais orienté par le business, artificiellement intelligent, il travaille depuis plus de 25 ans sur des projets stimulants, allant du web à l'IoT en passant par beaucoup de données et d'IA. Reconnu MVP (Microsoft Most Valuable Professional) Data Platform depuis 2008, il a toujours été très impliqué dans les communautés en France, en tant qu’organisateur et conférencier. Il pilote la communauté Data Microsoft en France au travers notamment du Club Power BI et du Club Fabric.
En savoir plusChristopher MANEU
Christopher MANEU est ingénieur Cloud et Principal Data Advocate chez Microsoft. Sa mission est d’aider tous les "tech" à réussir, en se concentrant sur les données et l’équipe "data" chargée des données derrière les applications.
LinkedIn: https://linkedin.com/in/cmaneu
En savoir plusLinkedIn: https://linkedin.com/in/cmaneu
