Glossary
Concepts d'architecture
- Data Warehouse : entrepôt de données centralisé, structuré et optimisé pour l'analyse (BI, reporting). Données nettoyées et modélisées.
- Data Lake : stockage massif de données brutes (structurées ou non) dans leur format d'origine, à faible coût.
- Data Lakehouse : hybride combinant la flexibilité du data lake et les garanties transactionnelles/performances du warehouse (ex : Databricks, Delta Lake).
- Data Mesh : approche décentralisée où chaque domaine métier possède et expose ses données comme des "produits", avec une gouvernance fédérée.
- Data Fabric : couche d'intégration unifiée et automatisée (souvent via métadonnées) qui connecte des sources hétérogènes sans les déplacer.
- Architecture Médaillon : organisation des données en couches Bronze (brut), Silver (nettoyé), Gold (agrégé, prêt pour le métier). Popularisée par Databricks.
- Data Mart : sous-ensemble d'un warehouse dédié à un domaine métier précis (finance, marketing…).
- Architecture Lambda : combine un traitement batch et un traitement temps réel en parallèle.
- Architecture Kappa : tout en streaming, un seul pipeline (simplification de Lambda).
- ODS (Operational Data Store) : zone intermédiaire contenant des données opérationnelles quasi temps réel, avant le warehouse.
Modélisation
- Modèle en étoile (Star Schema) : table de faits centrale entourée de tables de dimensions.
- Modèle en flocon (Snowflake Schema) : variante avec dimensions normalisées.
- Data Vault : méthode de modélisation (hubs, links, satellites) conçue pour l'historisation et l'auditabilité à grande échelle.
- SCD (Slowly Changing Dimensions) : techniques pour gérer l'évolution des dimensions dans le temps (Type 1 : écrasement, Type 2 : historisation…).
- OLTP vs OLAP : transactionnel (écritures rapides, ex : base d'une app) vs analytique (requêtes lourdes en lecture).
Gouvernance et gestion
- Data Catalogue : inventaire des actifs data avec métadonnées, permettant la découverte et la documentation (ex : DataHub, Collibra, Alation).
- Data Lineage : traçabilité du parcours d'une donnée, de sa source à sa consommation.
- Data Governance : ensemble des règles, rôles et processus garantissant qualité, sécurité et conformité des données.
- MDM (Master Data Management) : gestion des données de référence (clients, produits) pour avoir une version unique de la vérité.
- Data Quality : mesure et amélioration de la fiabilité des données (complétude, cohérence, fraîcheur).
- Data Contract : accord formel entre producteur et consommateur de données définissant schéma, SLA et qualité attendue.
Traitement et pipelines
- ETL / ELT : Extract-Transform-Load vs Extract-Load-Transform (la transformation se fait dans le warehouse, approche moderne).
- dbt (data build tool) : outil de transformation SQL dans le warehouse (le "T" de ELT), avec versioning, tests et documentation.
- Apache Spark : moteur de calcul distribué en mémoire pour le traitement de gros volumes (batch et streaming).
- Apache Kafka : plateforme de streaming distribuée pour l'ingestion et la diffusion d'événements en temps réel.
- Apache Airflow : orchestrateur de pipelines (DAGs) pour planifier et superviser les workflows data.
- CDC (Change Data Capture) : capture des modifications d'une base source pour les propager en aval sans tout recharger.
- Streaming vs Batch : traitement continu au fil de l'eau vs traitement par lots planifiés.
- Reverse ETL : renvoi des données du warehouse vers les outils opérationnels (CRM, marketing).
Moteurs de requête et stockage
- Impala : moteur SQL massivement parallèle (MPP) pour requêter directement les données Hadoop/HDFS à faible latence.
- Presto / Trino : moteur SQL distribué capable de requêter plusieurs sources hétérogènes (fédération).
- Hive : couche SQL historique au-dessus de Hadoop, orientée batch.
- HDFS : système de fichiers distribué de Hadoop.
- Parquet / ORC : formats de fichiers colonnaires optimisés pour l'analytique.
- Delta Lake / Iceberg / Hudi : formats de tables transactionnels (ACID) au-dessus du data lake.
- MPP (Massively Parallel Processing) : architecture où les requêtes sont réparties sur plusieurs nœuds (Snowflake, BigQuery, Redshift).
Divers
- Data Product : jeu de données packagé, documenté et consommable comme un produit (concept central du data mesh).
- Semantic Layer : couche d'abstraction qui traduit les données techniques en métriques métier cohérentes (ex : "chiffre d'affaires" défini une seule fois).
- Sandbox / Staging : environnements d'expérimentation ou de préparation avant production.
- Data Observability : monitoring de la santé des pipelines et des données (fraîcheur, volume, schéma).
No Comments