この記事では、Get data experienceを使ってイベントハウスにデータを取り込む方法の概要を提供します。
データ ソース
以下のソースからイベントハウスにデータを取り込むことができます:
- ローカル ファイル
- OneLake
- リアルタイム ハブ
- Eventstream
- Azure Storage
- Azure Event Hubs
- アマゾンS3
- Data Factory パイプラインのコピー
- Data Factory のデータフロー
- Eventhouse と Real-Time Dashboard のビジネス イベント
追加のデータ ソース
ソースが一覧にない場合は、Connect more data sources を選択して、Real-Time hub で利用できるコネクタを使用します。 Eventstreamにデータを取り込み、さらにEventhouseに持ち込むと、Get dataワークフローを離れずに済みます。 このような場合は、「 より多くのデータソースを接続 」オプションを選択してください。
大きなメッセージのサポート (プレビュー)
Important
この機能は プレビュー段階です。
イベントストリームやローカルファイルからデータを取得する場合、データプレビューにはstring列とdynamic列の「大きな値を許可」のチェックボックスが含まれています。 有効化すると、個々のデータセルに1MBから32MBまでの値を含めることができます。
この機能により、シナリオで必要なときに大量のペイロードを1セルにまとめることができます。
例えば、大規模なJSONドキュメントを単一のイベントハウス string または dynamic カラムに保存・処理する場合などです。 もしシナリオがより構造化されたデータモデルの恩恵を受けるなら、Eventstreamの Event Processing Editor を使って取り込み前にペイロードを別々の列に変換するか、取り込み後に eventhouseの更新ポリシー を使うことができます。
分析のシナリオでは、大きなメッセージをより小さく構造化された列に分割する方が一般的に効率的です。 この方法は、データの保存、インデックス、クエリ時のメモリ消費やI/O(入出力)操作を削減できます。
Important
インジェスションウィザードの一部として、スキーマ推論機構が受信したプレビューデータの最初の1,000件のレコードをスキャンします。 これらのレコードの中から大きな値を識別した場合、自動的にチェックボックスを選択し、大きな値が検出されたことを通知するメッセージが表示されます。 もしデータに大きな値が後で現れても、スキーマ推論エンジンは自動的にそれを検出せず、セルごとに1MBを超える値を取り込むためのチェックボックスを手動で選択する必要があります。
この設定ウィザード中、AVRO、Parquet、TXTフォーマットは大きなメッセージのスキャンはされません。 これらのフォーマットでは、セルあたりstringまたはdynamic値が1MBを超えると予想される場合は、「大きな値を許容」を選択してください。
Large Message Support は、ショートカット(外部テーブル)および OneLake ショートカット経由のクエリ高速化が有効なテーブルではサポートされていません。
OneLakeのデータ利用可能性は、大きな値列を持つテーブルの対象サイズ制限に依存します。
このオプションは既存のテーブルの列でも後で有効にできます。 詳細は「 列に大きな値を許す」をご覧ください。 この変更は今後取り込まれる新しいデータにのみ適用されます。以前取り込んだ string 値は制限まで切り詰められ(デフォルトポリシーの特性は1MBMaxValueSize )、 dynamic 値をnullに置き換えます。
有効化されると、カラムは BigObjectIndexed32 エンコーディングポリシーを使い、クエリ性能のために大きな値をインデックス化しますが、メモリ消費量は増加します。 カラムでポリシーが有効かどうかを確認するには、 エンコーディングポリシーを参照するか、「 KQLデータベーステーブルの管理と監視」のテーブル詳細サイドペインで確認してください。 ポリシーの詳細については、「 Encoding ポリシータイプ」をご覧ください。