Параметры формата данных

Azure Databricks имеет встроенные привязки ключевых слов для всех форматов данных, поддерживаемых Apache Spark. Azure Databricks использует Delta Lake в качестве протокола по умолчанию для чтения и записи данных и таблиц, в то время как Apache Spark использует Parquet. В следующих разделах описываются опции и конфигурации, доступные при запросе каждого формата данных на Azure Databricks.

Большинство форматов поддерживают сжатие записи с помощью compression параметра. Для поддерживаемых значений для каждого формата см. DataFrameWriter опции. Azure Databricks также позволяет напрямую считывать уже сжатые файлы многих форматов, и при необходимости вы можете распаковать сжатые файлы в Azure Databricks.

Дополнительные сведения об источниках данных Apache Spark см. в статье Generic Load/Save Functions (Универсальные функции загрузки и сохранения) и Generic File Source Options (Универсальные параметры источников файлов).

Форматы открытых таблиц

Форматы таблиц, поддерживающие ACID-транзакции, эволюцию схем и совместимость между движками.

Format Description
Озеро Дельта Формат по умолчанию для чтения и записи данных и таблиц на Azure Databricks.
Айсберг Читайте и пишите таблицы Iceberg и взаимодействуйте с внешними движками Iceberg.
OpenSharing Читайте общие таблицы и данные с помощью протокола открытого совместного использования.

Форматы колонковый

Двоичные столбцовные форматы, оптимизированные для аналитической производительности чтения и сжатия.

Format Description
Паркет По умолчанию используется столбочный формат Apache Spark с эффективным сжатием и кодированием.
ОРК Колонковый формат с встроенным сжатием и поддержкой лёгких индексов.

Форматы на основе текста

Читаемые человеком форматы для обмена, конфигурации и записей с гибкими или развивающимися схемами.

Format Description
JSON Читать и записывать JSON-файлы, включая опции многолинейных записей и вывода схемы.
CSV Читайте и записывайте разделённые текстовые файлы с опциями для заголовков, разделителей и искажённых записей.
XML Читайте и записывайте XML-файлы, указывая тег строки и схему.
Текст Читайте и записывайте обычные текстовые файлы по одной строке или по одному файлу за раз.

Бинарные и специализированные форматы

Форматы бинарной сериализации и специализированные для Azure Databricks источники данных.

Format Description
Avro Читайте и записывайте файлы Avro и работайте с полезными нагрузками, закодированными в формате Avro, при потоковой обработке.
Эксперимент MLflow Загрузите данные запуска эксперимента MLflow с помощью пользовательского ключевого слова mlflow-experiment.

Неструктурированные данные

Форматы и типы для хранения и обработки документов, изображений, аудио и других неструктурированных файлов.

Format Description
Работа с неструктурированными данными Хранить, управлять и обрабатывать неструктурированные данные, такие как документы, изображения и аудио.
Бинарный Читайте файлы как необработанные двоичные записи, включая изображения и другие неструктурированные данные.
Образ Загрузка данных изображений для задач машинного обучения. Databricks рекомендует загружать изображения в формате binary данных.
ФАЙЛ Храните регулируемую ссылку на неструктурированный файл вместо использования BINARY или STRING.
Вводите файлы как тип FILE Загружайте неструктурированные файлы в таблицы как ссылки FILE с помощью SQL, табличных функций и Auto Loader.
Обработка файлов с помощью UDF Читайте байты файлов, извлекайте метаданные изображений и видео, а также генерируйте производные файлы с помощью UDF.
Функции FILE для быстрого запуска Начните с FILE типа и его функций в Databricks SQL и Databricks Runtime.

Полуструктурированные данные

Шаблоны и функции для работы с вложенными и полуструктурированными данными в lakehouse.

Format Description
Моделирование полуструктурированных данных Выбирайте между вариантами, JSON-строками, структурами и отображениями для хранения полуструктурированных данных.
Variant Храните полуструктурированные данные с помощью типа VARIANT для оптимизированных чтений и записи.
Преобразование сложных типов данных Работайте со структурами, массивами и картами в Apache Spark.
Функции высшего порядка Преобразуйте массивы и отображения с помощью встроенных функций высшего порядка.