Skip to main content

Glossary

Concepts d'architecture

  • Data Warehouse : entrepôt de données centralisé, structuré et optimisé pour l'analyse (BI, reporting). Données nettoyées et modélisées.
  • Data Lake : stockage massif de données brutes (structurées ou non) dans leur format d'origine, à faible coût.
  • Data Lakehouse : hybride combinant la flexibilité du data lake et les garanties transactionnelles/performances du warehouse (ex : Databricks, Delta Lake).
  • Data Mesh : approche décentralisée où chaque domaine métier possède et expose ses données comme des "produits", avec une gouvernance fédérée.
  • Data Fabric : couche d'intégration unifiée et automatisée (souvent via métadonnées) qui connecte des sources hétérogènes sans les déplacer.
  • Architecture Médaillon : organisation des données en couches Bronze (brut), Silver (nettoyé), Gold (agrégé, prêt pour le métier). Popularisée par Databricks.
  • Data Mart : sous-ensemble d'un warehouse dédié à un domaine métier précis (finance, marketing…).
  • Architecture Lambda : combine un traitement batch et un traitement temps réel en parallèle.
  • Architecture Kappa : tout en streaming, un seul pipeline (simplification de Lambda).
  • ODS (Operational Data Store) : zone intermédiaire contenant des données opérationnelles quasi temps réel, avant le warehouse.

Modélisation

  • Modèle en étoile (Star Schema) : table de faits centrale entourée de tables de dimensions.
  • Modèle en flocon (Snowflake Schema) : variante avec dimensions normalisées.
  • Data Vault : méthode de modélisation (hubs, links, satellites) conçue pour l'historisation et l'auditabilité à grande échelle.
  • SCD (Slowly Changing Dimensions) : techniques pour gérer l'évolution des dimensions dans le temps (Type 1 : écrasement, Type 2 : historisation…).
  • OLTP vs OLAP : transactionnel (écritures rapides, ex : base d'une app) vs analytique (requêtes lourdes en lecture).

Gouvernance et gestion

  • Data Catalogue : inventaire des actifs data avec métadonnées, permettant la découverte et la documentation (ex : DataHub, Collibra, Alation).
  • Data Lineage : traçabilité du parcours d'une donnée, de sa source à sa consommation.
  • Data Governance : ensemble des règles, rôles et processus garantissant qualité, sécurité et conformité des données.
  • MDM (Master Data Management) : gestion des données de référence (clients, produits) pour avoir une version unique de la vérité.
  • Data Quality : mesure et amélioration de la fiabilité des données (complétude, cohérence, fraîcheur).
  • Data Contract : accord formel entre producteur et consommateur de données définissant schéma, SLA et qualité attendue.

Traitement et pipelines

  • ETL / ELT : Extract-Transform-Load vs Extract-Load-Transform (la transformation se fait dans le warehouse, approche moderne).
  • dbt (data build tool) : outil de transformation SQL dans le warehouse (le "T" de ELT), avec versioning, tests et documentation.
  • Apache Spark : moteur de calcul distribué en mémoire pour le traitement de gros volumes (batch et streaming).
  • Apache Kafka : plateforme de streaming distribuée pour l'ingestion et la diffusion d'événements en temps réel.
  • Apache Airflow : orchestrateur de pipelines (DAGs) pour planifier et superviser les workflows data.
  • CDC (Change Data Capture) : capture des modifications d'une base source pour les propager en aval sans tout recharger.
  • Streaming vs Batch : traitement continu au fil de l'eau vs traitement par lots planifiés.
  • Reverse ETL : renvoi des données du warehouse vers les outils opérationnels (CRM, marketing).

Moteurs de requête et stockage

  • Impala : moteur SQL massivement parallèle (MPP) pour requêter directement les données Hadoop/HDFS à faible latence.
  • Presto / Trino : moteur SQL distribué capable de requêter plusieurs sources hétérogènes (fédération).
  • Hive : couche SQL historique au-dessus de Hadoop, orientée batch.
  • HDFS : système de fichiers distribué de Hadoop.
  • Parquet / ORC : formats de fichiers colonnaires optimisés pour l'analytique.
  • Delta Lake / Iceberg / Hudi : formats de tables transactionnels (ACID) au-dessus du data lake.
  • MPP (Massively Parallel Processing) : architecture où les requêtes sont réparties sur plusieurs nœuds (Snowflake, BigQuery, Redshift).

Divers

  • Data Product : jeu de données packagé, documenté et consommable comme un produit (concept central du data mesh).
  • Semantic Layer : couche d'abstraction qui traduit les données techniques en métriques métier cohérentes (ex : "chiffre d'affaires" défini une seule fois).
  • Sandbox / Staging : environnements d'expérimentation ou de préparation avant production.
  • Data Observability : monitoring de la santé des pipelines et des données (fraîcheur, volume, schéma).