Distinguer les données brutes, les données vérifiées et les validations
Nous concevons des couches de traitement distinctes avec des transitions traçables. Chaque entrée est dotée d'une origine, d'un horodatage de chargement et d'un schéma ; des règles de qualité déterminent quelles données poursuivent le traitement et lesquelles sont mises de côté pour clarification. Des processus de chargement reproductibles évitent qu'un redémarrage ne duplique les chiffres. Les rôles sont rattachés aux domaines de données, les accès de développement sont restreints et les règles de conservation sont prises en compte techniquement. Les décisions d'architecture concernant les formats de fichiers, le partitionnement et la capacité de calcul sont testées à partir de vos requêtes et de vos volumes de données, afin qu'un stockage bon marché ne conduise pas à des analyses démesurément coûteuses.


