Workflows

Dataflow Gen2 vs notebooks Fabric : choisir la voie ETL avant que le lac déborde

fabricdataflowsparketllakehouse

Les équipes arrivent dans Fabric et clonent le même load trois fois : Dataflow Gen2, notebook Spark, copy activity. Les fenêtres de refresh se marchent dessus.

Affectation par défaut

Charges Power Query légères → Dataflow Gen2. Joins lourds, SCD2, Python → notebook. Orchestration → pipeline (chef d’orchestre, pas transformeur).

Dataflow Gen2

Sortie vers une table lakehouse certifiable. Fast copy si la source le permet. Un dataflow par domaine borné. Paramètres d’environnement.

Un mur de M custom = vous vouliez déjà un notebook.

Notebooks

Un notebook = un job. Delta vers Silver/Gold avec clés de merge. Contrôles de row count que le pipeline peut faire échouer. Git + revue.

Pipeline

  1. Déclenche dataflow ou notebook, pas les deux sur la même table
  2. Succès → refresh du modèle sémantique
  3. Échec → owner nommé, pas une DL de 40

Inventoriez les tables. Deux items qui écrivent silver_customer : un gagnant, un perdant, ce sprint.

RACI ingest vs modèle ? Réservez un appel de 30 minutes.