擷取支持的資料格式

使用 版本 下拉選單切換服務。 了解更多關於導航的資訊
適用於: ✅ Microsoft Fabric ✅ Azure Data Explorer

資料擷取會將資料新增至資料表,並使其可供查詢。 若是透過查詢內嵌之外的擷取方法,資料必須是下列支援的格式: 下表列出並說明資料擷取支援的格式。

注意

內嵌資料前,請確定您的資料已正確格式化,並定義預期的欄位。 建議您使用慣用的驗證程式來確認格式是否有效。 例如,您可能看到下列驗證程式適合檢查 CSV 或 JSON 檔案:

若要瞭解擷取可能失敗的原因,請參閱 擷取失敗

擷取 Azure 資料總管中的錯誤碼。

格式 副檔名 描述
Avro .avro 一種 Avro 檔案格式。 支援的壓縮編解碼器:snappy、、 bzipzstandardxz和 。 該 avro 格式的閱讀器實現基於官方 Apache Avro 庫。 如需擷取事件中樞擷取 Avro 檔案的詳細資訊,請參閱 擷取事件中樞擷取 Avro 檔案
AzMonStream N/A Azure 監視器 會以此格式將資料匯出 至 Azure 事件中樞。 只有 Azure 事件中樞支援此格式。
CSV .csv 具有逗號分隔值的文字檔 (,)。 請參考RFC 4180:適用於逗點分隔值 (CSV) 檔案的一般格式和 MIME 類型。
JSON .json 具有以 \n\r\n 分隔的 JSON 文字檔。 請參閱 JSON 程式碼行 (JSONL)
MultiJSON .multijson 具有屬性包的 JSON 陣列的文字檔 (每個代表一筆記錄) ,或以空格、 \n\r\n分隔的任意數量的屬性包。 每個屬性包可以擁有多行內容。
ORC .orc ORC 檔案
Parquet .parquet Parquet 檔案
PSV .psv 具有分隔號分隔值 (|) 的文字檔。
RAW .raw 其整個內容是單一字串值的文字檔。
SCsv .scsv 具有分號分隔值 (;) 的文字檔。
SOHsv .sohsv 具有 SOH 分隔值的文字檔。 (SOH 是 ASCII 字碼指標 1;此格式是由 HDInsight 上的 Hive 使用)。
TSV .tsv 具有定位字元分隔值 (\t) 的文字檔。
TSVE .tsv 具有定位字元分隔值 (\t) 的文字檔。 反斜線字元 (\) 用於逸出。
TXT .txt 具有以 \n 分隔之程式碼行的文字檔。 會跳過空白行。
W3CLOGFILE .log W3C 標準化的 Web 記錄檔格式。

注意

  • 不支援從在一般 Parquet 格式檔案 (例如 Apache Iceberg、Apache Hudi 和 Delta Lake) 上提供 ACID 功能的資料儲存系統擷取。
  • 不支援無模式的 Avro。

如需使用 jsonmultijson 格式擷取資料的詳細資訊,請參閱 擷取 JSON 格式

支援的資料壓縮格式

使用下列演算法壓縮 blob 和檔案:

壓縮 副檔名
gzip .gz
zip .zip

將副檔名附加到 Blob 或檔案名稱,以指示已壓縮。

例如:

  • MyData.csv.zip 表示格式為 CSV 的 blob 或檔案,並使用 zip (封存或單一檔案) 壓縮。
  • MyData.json.gz 表示格式為 JSON 的 blob 或檔案,並使用 gzip 壓縮。

也支援僅包含壓縮副檔名的 Blob 或檔案名稱(例如 MyData.zip)。 在此情況下,請將檔案格式指定為擷取屬性,因為無法推斷。

注意

  • 某些壓縮格式將原始副檔名儲存在壓縮串流中。 當您決定檔案格式時,請忽略此副檔名。 如果您無法從壓縮的 Blob 或檔案名稱中判斷檔案格式,請使用 format 匯入屬性來指定格式。
  • 不要將它們與ParquetAVROORC格式使用的內部區塊層級壓縮編解碼器混淆。 內部壓縮名稱通常加在檔案格式副檔名之前(例如, file1.gz.parquetfile1.snappy.avro)。
  • 不支援 Deflate64/Enhanced Deflate zip 壓縮方法。 Windows 內建 zip 壓縮器可以在大於 2 GB 的檔案上使用此方法。