Dataflow Gen2 vs notebooks Fabric : choisir la voie ETL avant que le lac déborde
Les équipes arrivent dans Fabric et clonent le même load trois fois : Dataflow Gen2, notebook Spark, copy activity. Les fenêtres de refresh se marchent dessus.
Affectation par défaut
Charges Power Query légères → Dataflow Gen2. Joins lourds, SCD2, Python → notebook. Orchestration → pipeline (chef d’orchestre, pas transformeur).
Dataflow Gen2
Sortie vers une table lakehouse certifiable. Fast copy si la source le permet. Un dataflow par domaine borné. Paramètres d’environnement.
Un mur de M custom = vous vouliez déjà un notebook.
Notebooks
Un notebook = un job. Delta vers Silver/Gold avec clés de merge. Contrôles de row count que le pipeline peut faire échouer. Git + revue.
Pipeline
- Déclenche dataflow ou notebook, pas les deux sur la même table
- Succès → refresh du modèle sémantique
- Échec → owner nommé, pas une DL de 40
Inventoriez les tables. Deux items qui écrivent silver_customer : un gagnant, un perdant, ce sprint.
RACI ingest vs modèle ? Réservez un appel de 30 minutes.