Opcje formatowania danych

Usługa Azure Databricks ma wbudowane powiązania słów kluczowych dla wszystkich formatów danych natywnie obsługiwanych przez platformę Apache Spark. Usługa Azure Databricks używa usługi Delta Lake jako domyślnego protokołu do odczytywania i zapisywania danych i tabel, natomiast platforma Apache Spark używa języka Parquet. Poniższe sekcje opisują opcje i konfiguracje dostępne podczas zapytania każdego formatu danych w Azure Databricks.

Większość formatów obsługuje kompresję podczas zapisu przy użyciu opcji compression. Obsługiwane wartości dla każdego formatu można DataFrameWriter znaleźć w opcjach. Usługa Azure Databricks może również bezpośrednio odczytywać skompresowane pliki w wielu formatach, a w razie potrzeby można rozpakować skompresowane pliki w usłudze Azure Databricks.

Aby uzyskać więcej informacji na temat źródeł danych platformy Apache Spark, zobacz Funkcje ogólne ładowania/zapisywania i Opcje ogólne źródła pliku.

Formaty tabel otwartych

Formaty tabel wspierające transakcje ACID, ewolucję schematu oraz interoperacyjność między silnikami.

Format Description
Jezioro Delta Domyślny format do odczytu i zapisu danych oraz tabel w Azure Databricks.
góra lodowa Czytaj i zapisuj tabele Iceberg oraz współpracuj z zewnętrznymi silnikami Iceberg.
OpenSharing Odczytuj współdzielone tabele i dane za pomocą otwartego protokołu udostępniania.

Formaty kolumnowe

Binarne formaty kolumnowe zoptymalizowane pod kątem wydajności odczytu analitycznego i kompresji.

Format Description
Parkiet Domyślnie używa Apache Spark kolumnowego formatu, z efektywną kompresją i kodowaniem.
ORK Format kolumnowy z wbudowaną kompresją i obsługą lekkich indeksów.

Formaty oparte na tekście

Czytelne formaty do wymiany, konfiguracji i zapisów z elastycznymi lub ewoluującymi schematami.

Format Description
JSON Czytaj i zapisuj pliki JSON, w tym opcje dla wieloliniowych rekordów i wnioskowania schematów.
CSV Odczytuj i zapisuj pliki tekstowe rozdzielane separatorami, z opcjami dotyczącymi nagłówków, separatorów i nieprawidłowych rekordów.
XML Czytaj i zapisuj pliki XML poprzez określenie tagu wiersza i schematu.
Tekst Czytaj i zapisuj pliki tekstowe po jednej linii lub plikach na raz.

Formaty binarne i specjalistyczne

Formaty serializacji binarnej oraz źródła danych specyficzne dla platformy Azure Databricks.

Format Description
Avro Czytaj i zapisuj pliki Avro oraz pracuj z payloadami kodowanymi Avro w streamingu.
Eksperyment MLflow Pobierz dane eksperymentu MLflow za pomocą niestandardowego mlflow-experiment słowa kluczowego.

Dane bez struktury

Formaty i typy przechowywania i przetwarzania dokumentów, obrazów, dźwięku oraz innych plików nieustrukturyzowanych.

Format Description
Praca z danymi nieustrukturyzowanymi Przechowuj, zarządzaj i przetwarzaj dane nieustrukturyzowane, takie jak dokumenty, obrazy i dźwięki.
Binarny Czytaj pliki jako surowe rekordy binarne, w tym obrazy i inne dane nieustrukturyzowane.
Obraz Ładuj dane obrazowe dla obciążeń związanych z uczeniem maszynowym. Databricks zaleca wczytywanie obrazów jako danych binary.
PLIK Przechowuj uporządkowane odwołanie do pliku nieustrukturyzowanego zamiast używać BINARY lub STRING.
Importuj pliki jako typ FILE Pobieranie plików nieustrukturyzowanych do tabel jako FILE referencji za pomocą SQL, funkcji tabelowych i Auto Loadera.
Pliki procesowe z UDF-ami Czytaj bajty plików, wyodrębniaj metadane obrazów i wideo oraz generuj pliki pochodne za pomocą UDF-ów.
Krótkie wprowadzenie do funkcji FILE Zacznij od FILE typu i jego funkcji w Databricks SQL i Databricks Runtime.

Dane częściowo ustrukturyzowane

Wzorce i funkcje pracy z zagnieżdżonymi i półstrukturalnymi danymi w domku nad jeziorem.

Format Description
Modeluj dane półstrukturalne Wybierz spośród wariantów, łańcuchów JSON, struktur i map do przechowywania danych półstrukturalnych.
Wariant Przechowuj półstrukturalne dane przy użyciu typu VARIANT, aby zoptymalizować odczyty i zapisy.
Przekształcanie złożonych typów danych Pracuj ze strukturami, tablicami i mapami w Apache Spark.
Funkcje wyższego rzędu Przekształcaj tablice i mapy za pomocą wbudowanych funkcji wyższego rzędu.