分析データ処理を調べる

完了

分析データ処理では、通常、膨大な量の履歴データまたはビジネス メトリックを格納する読み取り専用 (または読み取り中心) システムが使用されます。 分析は、特定の時点のデータのスナップショットまたは一連のスナップショットに基づいて行うことができます。

分析処理システムの具体的な詳細はソリューションによって異なる場合がありますが、エンタープライズ規模の分析の一般的なアーキテクチャは次のようになります。

以下で説明する番号付き要素を含む分析データベース アーキテクチャを示す図。

  1. 運用データは、分析のためにデータ レイクに抽出、変換、読み込み (ETL) されるか、または抽出されて最初に変換が適用されて読み込まれます。これは、最新の Lakehouse で一般的な ELT と呼ばれるパターンです。

  2. データはテーブルのスキーマに読み込まれます。通常は 、データ レイク 内のファイルに対する表形式の抽象化を備えた Data Lakehouse、または完全なリレーショナル SQL エンジンを備えた データ ウェアハウス に読み込まれます。

  3. データ ウェアハウス内のデータを集計して、オンライン分析処理 (OLAP) モデルに読み込むことができます。現在では、 セマンティック モデル (および従来は キューブ) と呼ばれます。 ファクトテーブルの集計数値(メジャー)は、ディメンションテーブルのディメンションの組み合わせに対して計算されます。 たとえば、売上収益は、日付、顧客、製品別に合計される場合があります。 Power BIセマンティック モデルは、最も一般的な例です。

  4. データ レイク、データ ウェアハウス、分析モデル内のデータに対してクエリを実行して、レポート、視覚化、ダッシュボードを生成することができます。

"データ レイク" は、大量のファイル ベースのデータを収集して分析する必要がある大規模データ分析処理シナリオで一般的です。

データ ウェアハウス は、読み取り操作用に最適化されたリレーショナル スキーマ (主にレポートとデータの視覚化をサポートするクエリ) にデータを格納するための確立された方法です。

Data Lakehouses は、データ レイクの柔軟でスケーラブルなストレージと、データ ウェアハウスのリレーショナル クエリ セマンティクスを組み合わせた、より新しいイノベーションです。 テーブル スキーマでは、OLTP データ ソース内のデータの非正規化が必要となる場合があります (クエリの実行を高速化するための複製の導入)。

OLAP モデル (または セマンティック モデル) は、分析ワークロード用に最適化された集計型のデータ ストレージです。 データ集計は異なるレベルのディメンション間で行われます。これにより、 ドリルダウンして 複数の階層レベルで集計を表示できます。たとえば、地域別、市区町村別、または個々の住所別の合計売上を検索する場合などです。 データは事前に集計されているため、データに含まれる概要を返すクエリをすばやく実行できます。

さまざまな種類のユーザーが、アーキテクチャ全体の異なるステージでデータ分析作業を実行する場合があります。 次に例を示します。

  • データ サイエンティストは、データ レイク内のデータ ファイルを直接使用して、データの探索とモデル化を行う場合があります。
  • データ アナリストは、複雑なレポートと視覚化を生成するために、データ ウェアハウス内のテーブルに直接クエリを実行できます。
  • ビジネス ユーザーは、レポートまたはダッシュボードの形式で分析モデルで事前集計データを使用する場合があります。

最新の分析プラットフォーム

Azureには、生データの取り込みから対話型レポートまで、完全な分析パイプラインをカバーするいくつかのマネージド サービスが用意されています。 2 つの "オールインワン" プラットフォームにより、これらの機能の大部分が 1 つのワークスペースにまとめられます。 Microsoft FabricAzure Databricks は、これら 2 つのプラットフォームです。3 つ目のサービスである Microsoft Purview では、すべてのソースのデータ ガバナンスに重点を置いています。 これらのサービスについてまだ理解している必要はありません。次の説明では、それぞれの機能の概要を説明します。

Microsoft Fabric は、ストレージ、データ エンジニアリング、データ ウェアハウス、レポート機能を 1 つのワークスペースにまとめる、サービスとしての統合ソフトウェア (SaaS) 分析プラットフォームです。 Azure Databricks は、Delta Lake - Parquet と、バージョン管理と ACID トランザクションを有効にするトランザクション ログを標準ストレージ形式として使用して、大規模なデータ エンジニアリングとデータ サイエンス用に構築されたクラウド分析プラットフォームです。 Microsoft Purview は、統合されたデータ セキュリティ、ガバナンス、コンプライアンスを提供し、すべてのデータ ソースのデータを検出、分類、保護、管理するのに役立ちます。

最新の分析プラットフォームである Microsoft Fabric、Azure Databricks、Microsoft Purview を示す図

メダリオン アーキテクチャによるデータの整理

レイクハウスでデータを整理するための一般的なパターンは、次の 3 つのレイヤーを使用する medallion アーキテクチャです。

  • Bronze: ソース システムから as-is 取り込まれた生データ。変換は適用されません。元のレコードは再処理用に保持されます。
  • Silver: クレンジングされたデータと準拠したデータ。重複が削除され、データ型が標準化されています。
  • Gold: 特定のレポートと分析のユース ケース用にモデル化された集計されたビジネス対応データ。

メダリオンアーキテクチャを示す図。

チームはこのパターンを使用します。これは、各レイヤーに明確な品質境界が作成され、要件が変更された場合に元のブロンズ レコードからいつでもデータを再処理できるためです。

Fabricと Databricks には、自然言語を使用してデータを探索できるCopilotエクスペリエンスが含まれています。