生データ、検証済みデータ、承認済みデータを区別する
処理層を分けて設計し、層と層の間の受け渡しを追跡できるようにします。取り込んだデータには、出所、読み込み時刻、スキーマを付与します。品質ルールにより、どのデータを後続の処理に回し、どのデータを確認プロセスへ回すかを判断します。再現可能なロード処理により、再実行によって数値が二重に計上されることを防ぎます。ロールはデータドメインに紐づけ、開発環境からのアクセスは制限し、保持ルールは技術的な仕組みとして組み込みます。ファイル形式、パーティショニング、演算能力に関するアーキテクチャ上の判断は、貴社のクエリとデータ量に照らして検証し、安価なストレージが不釣り合いに高額な分析につながらないようにします。


