# Importer et surveiller de grands référentiels de données publics

> Des traitements qui importent et contrôlent de grands référentiels publics, les déposent dans l'entrepôt puis dans les bases applicatives, avec une surveillance mensuelle.

- Client : Cabinet d’études, 20 personnes
- Secteur : Géomarketing et implantation
- Période : 2026
- Résultat clé : Mensuelle (vérification automatique que chaque chaîne d'import tourne encore)
- Source : https://www.praedic.com/realisations/pipelines-referentiels

Un outil métier ne vaut que ce que valent les données qu'il consomme. Pour un cabinet d'études d'implantation, ces données sont des référentiels : les entreprises immatriculées en France, les lieux et commerces recensés, la cartographie des voies et des équipements.

Ces référentiels sont publics, volumineux, et mis à jour régulièrement par leurs producteurs. Les intégrer une fois est un travail de quelques jours. Les maintenir à jour pendant trois ans est un autre métier, et c'est celui qui décide si l'outil sera encore fiable.

## Ce que fait la chaîne

Pour chaque référentiel, un traitement automatisé télécharge la nouvelle version, la contrôle, la dépose dans l'entrepôt de données, puis alimente les bases applicatives qui servent les outils métier.

Le contrôle est la partie qui compte. Un fichier public peut arriver tronqué, changer de format sans prévenir, perdre une colonne ou voir son volume chuter de moitié à cause d'un incident chez le producteur. Sans vérification, ces anomalies se propagent silencieusement jusqu'aux études rendues aux clients.

Les traitements appliquent donc des contrôles bloquants avant toute mise à disposition : volumétrie comparée à la version précédente, structure attendue, cohérence des identifiants, taux de valeurs manquantes. Une version qui échoue au contrôle n'est pas publiée, et l'ancienne reste en service.

## Le versionnement plutôt que l'écrasement

Chaque import conserve la version précédente. Cela paraît anodin et cela résout deux problèmes concrets.

D'abord, on peut revenir en arrière si un défaut est découvert après coup, sans attendre la publication suivante du producteur. Ensuite, on peut comparer deux versions, ce qui rend visibles les mouvements réels : les créations, les fermetures, les déménagements. Cette comparaison devient une information en soi, parfois plus utile que le référentiel lui-même.

## La surveillance mensuelle

Toute la chaîne tourne seule sur le cloud. Un contrôle mensuel vérifie que chaque traitement s'est exécuté, que les volumes sont cohérents, et qu'aucune étape n'est restée en échec. Une anomalie déclenche une alerte nominative.

C'est une discipline modeste et c'est ce qui sépare une automatisation utile d'une automatisation dangereuse. Un traitement qui s'arrête sans prévenir laisse croire que les données sont à jour alors qu'elles ont six mois. Le jour où quelqu'un s'en aperçoit, il faut refaire la confiance en plus du travail.

## Ce qui est transposable

La même architecture vaut pour n'importe quelle source de données régulière : un fichier reçu d'un partenaire, un export d'un logiciel métier, un catalogue fournisseur, un flux tarifaire.

La règle utile est simple. Une donnée qui alimente une décision doit avoir un traitement qui la rafraîchit, des contrôles qui la refusent si elle est douteuse, et une alerte qui prévient quelqu'un quand la chaîne s'arrête. Sans ces trois éléments, ce n'est pas un pipeline, c'est une dette.