Appliquer le contrat avant que les données n’entrent dans le pipeline

Le filtrage des données ne suffit pas si le pipeline lui-même continue de se briser, et un pipeline brisé entraîne son propre coût. Lorsque plusieurs systèmes en aval lisent le même flux et qu’un nom de champ change sans avertissement, tout ce qui est construit au-dessus de ce flux s’interrompt en même temps. Vous finissez par passer du temps à corriger les systèmes au lieu d’améliorer les modèles, créant ainsi une taxe d’intégration.

Pour résoudre ce problème, considérez les contrats de données comme une infrastructure et non comme de la documentation. Avant qu’un événement n’entre dans un flux partagé, il doit être validé par rapport à un schéma. Si cela ne correspond pas, il est rejeté. Un registre de schéma qui versionne automatiquement chaque modification permet à la source de faire évoluer un champ sans forcer tous les systèmes en aval à se déconnecter.

Cela est encore plus important avec les pipelines d’IA. Un agent n’a pas l’intuition nécessaire pour repérer un champ erroné comme le ferait un humain regardant un tableau de bord. L’agent agit sur tout ce qu’il reçoit, transformant un mauvais dossier en amont en une mauvaise décision qui peut alors nuire à l’entreprise.

A lire également