Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Azure Databricks имеет встроенные привязки ключевых слов для всех форматов данных, поддерживаемых Apache Spark. Azure Databricks использует Delta Lake в качестве протокола по умолчанию для чтения и записи данных и таблиц, в то время как Apache Spark использует Parquet. В следующих разделах описываются опции и конфигурации, доступные при запросе каждого формата данных на Azure Databricks.
Большинство форматов поддерживают сжатие записи с помощью compression параметра. Для поддерживаемых значений для каждого формата см. DataFrameWriter опции. Azure Databricks также позволяет напрямую считывать уже сжатые файлы многих форматов, и при необходимости вы можете распаковать сжатые файлы в Azure Databricks.
Дополнительные сведения об источниках данных Apache Spark см. в статье Generic Load/Save Functions (Универсальные функции загрузки и сохранения) и Generic File Source Options (Универсальные параметры источников файлов).
Форматы открытых таблиц
Форматы таблиц, поддерживающие ACID-транзакции, эволюцию схем и совместимость между движками.
| Format | Description |
|---|---|
| Озеро Дельта | Формат по умолчанию для чтения и записи данных и таблиц на Azure Databricks. |
| Айсберг | Читайте и пишите таблицы Iceberg и взаимодействуйте с внешними движками Iceberg. |
| OpenSharing | Читайте общие таблицы и данные с помощью протокола открытого совместного использования. |
Форматы колонковый
Двоичные столбцовные форматы, оптимизированные для аналитической производительности чтения и сжатия.
| Format | Description |
|---|---|
| Паркет | По умолчанию используется столбочный формат Apache Spark с эффективным сжатием и кодированием. |
| ОРК | Колонковый формат с встроенным сжатием и поддержкой лёгких индексов. |
Форматы на основе текста
Читаемые человеком форматы для обмена, конфигурации и записей с гибкими или развивающимися схемами.
| Format | Description |
|---|---|
| JSON | Читать и записывать JSON-файлы, включая опции многолинейных записей и вывода схемы. |
| CSV | Читайте и записывайте разделённые текстовые файлы с опциями для заголовков, разделителей и искажённых записей. |
| XML | Читайте и записывайте XML-файлы, указывая тег строки и схему. |
| Текст | Читайте и записывайте обычные текстовые файлы по одной строке или по одному файлу за раз. |
Бинарные и специализированные форматы
Форматы бинарной сериализации и специализированные для Azure Databricks источники данных.
| Format | Description |
|---|---|
| Avro | Читайте и записывайте файлы Avro и работайте с полезными нагрузками, закодированными в формате Avro, при потоковой обработке. |
| Эксперимент MLflow | Загрузите данные запуска эксперимента MLflow с помощью пользовательского ключевого слова mlflow-experiment. |
Неструктурированные данные
Форматы и типы для хранения и обработки документов, изображений, аудио и других неструктурированных файлов.
| Format | Description |
|---|---|
| Работа с неструктурированными данными | Хранить, управлять и обрабатывать неструктурированные данные, такие как документы, изображения и аудио. |
| Бинарный | Читайте файлы как необработанные двоичные записи, включая изображения и другие неструктурированные данные. |
| Образ | Загрузка данных изображений для задач машинного обучения. Databricks рекомендует загружать изображения в формате binary данных. |
| ФАЙЛ | Храните регулируемую ссылку на неструктурированный файл вместо использования BINARY или STRING. |
| Вводите файлы как тип FILE | Загружайте неструктурированные файлы в таблицы как ссылки FILE с помощью SQL, табличных функций и Auto Loader. |
| Обработка файлов с помощью UDF | Читайте байты файлов, извлекайте метаданные изображений и видео, а также генерируйте производные файлы с помощью UDF. |
| Функции FILE для быстрого запуска | Начните с FILE типа и его функций в Databricks SQL и Databricks Runtime. |
Полуструктурированные данные
Шаблоны и функции для работы с вложенными и полуструктурированными данными в lakehouse.
| Format | Description |
|---|---|
| Моделирование полуструктурированных данных | Выбирайте между вариантами, JSON-строками, структурами и отображениями для хранения полуструктурированных данных. |
| Variant | Храните полуструктурированные данные с помощью типа VARIANT для оптимизированных чтений и записи. |
| Преобразование сложных типов данных | Работайте со структурами, массивами и картами в Apache Spark. |
| Функции высшего порядка | Преобразуйте массивы и отображения с помощью встроенных функций высшего порядка. |