Distinguere dati grezzi, dati verificati e approvazioni
Progettiamo livelli di elaborazione separati, con passaggi tracciabili. Gli input ricevono provenienza, momento di caricamento e uno schema; le regole di qualità decidono quali dati vengono elaborati ulteriormente e quali richiedono un chiarimento. Processi di caricamento ripetibili evitano che un riavvio duplichi i valori. I ruoli vengono associati ai domini di dati, gli accessi di sviluppo vengono limitati e le regole di conservazione vengono considerate a livello tecnico. Le decisioni architetturali su formati dei file, partizionamento e capacità di calcolo vengono testate sulla base delle vostre query e dei volumi di dati, in modo che uno storage economico non porti ad analisi sproporzionatamente costose.


