Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Usługa Azure Databricks ma wbudowane powiązania słów kluczowych dla wszystkich formatów danych natywnie obsługiwanych przez platformę Apache Spark. Usługa Azure Databricks używa usługi Delta Lake jako domyślnego protokołu do odczytywania i zapisywania danych i tabel, natomiast platforma Apache Spark używa języka Parquet. Poniższe sekcje opisują opcje i konfiguracje dostępne podczas zapytania każdego formatu danych w Azure Databricks.
Większość formatów obsługuje kompresję podczas zapisu przy użyciu opcji compression. Obsługiwane wartości dla każdego formatu można DataFrameWriter znaleźć w opcjach. Usługa Azure Databricks może również bezpośrednio odczytywać skompresowane pliki w wielu formatach, a w razie potrzeby można rozpakować skompresowane pliki w usłudze Azure Databricks.
Aby uzyskać więcej informacji na temat źródeł danych platformy Apache Spark, zobacz Funkcje ogólne ładowania/zapisywania i Opcje ogólne źródła pliku.
Formaty tabel otwartych
Formaty tabel wspierające transakcje ACID, ewolucję schematu oraz interoperacyjność między silnikami.
| Format | Description |
|---|---|
| Jezioro Delta | Domyślny format do odczytu i zapisu danych oraz tabel w Azure Databricks. |
| góra lodowa | Czytaj i zapisuj tabele Iceberg oraz współpracuj z zewnętrznymi silnikami Iceberg. |
| OpenSharing | Odczytuj współdzielone tabele i dane za pomocą otwartego protokołu udostępniania. |
Formaty kolumnowe
Binarne formaty kolumnowe zoptymalizowane pod kątem wydajności odczytu analitycznego i kompresji.
| Format | Description |
|---|---|
| Parkiet | Domyślnie używa Apache Spark kolumnowego formatu, z efektywną kompresją i kodowaniem. |
| ORK | Format kolumnowy z wbudowaną kompresją i obsługą lekkich indeksów. |
Formaty oparte na tekście
Czytelne formaty do wymiany, konfiguracji i zapisów z elastycznymi lub ewoluującymi schematami.
| Format | Description |
|---|---|
| JSON | Czytaj i zapisuj pliki JSON, w tym opcje dla wieloliniowych rekordów i wnioskowania schematów. |
| CSV | Odczytuj i zapisuj pliki tekstowe rozdzielane separatorami, z opcjami dotyczącymi nagłówków, separatorów i nieprawidłowych rekordów. |
| XML | Czytaj i zapisuj pliki XML poprzez określenie tagu wiersza i schematu. |
| Tekst | Czytaj i zapisuj pliki tekstowe po jednej linii lub plikach na raz. |
Formaty binarne i specjalistyczne
Formaty serializacji binarnej oraz źródła danych specyficzne dla platformy Azure Databricks.
| Format | Description |
|---|---|
| Avro | Czytaj i zapisuj pliki Avro oraz pracuj z payloadami kodowanymi Avro w streamingu. |
| Eksperyment MLflow | Pobierz dane eksperymentu MLflow za pomocą niestandardowego mlflow-experiment słowa kluczowego. |
Dane bez struktury
Formaty i typy przechowywania i przetwarzania dokumentów, obrazów, dźwięku oraz innych plików nieustrukturyzowanych.
| Format | Description |
|---|---|
| Praca z danymi nieustrukturyzowanymi | Przechowuj, zarządzaj i przetwarzaj dane nieustrukturyzowane, takie jak dokumenty, obrazy i dźwięki. |
| Binarny | Czytaj pliki jako surowe rekordy binarne, w tym obrazy i inne dane nieustrukturyzowane. |
| Obraz | Ładuj dane obrazowe dla obciążeń związanych z uczeniem maszynowym. Databricks zaleca wczytywanie obrazów jako danych binary. |
| PLIK | Przechowuj uporządkowane odwołanie do pliku nieustrukturyzowanego zamiast używać BINARY lub STRING. |
| Importuj pliki jako typ FILE | Pobieranie plików nieustrukturyzowanych do tabel jako FILE referencji za pomocą SQL, funkcji tabelowych i Auto Loadera. |
| Pliki procesowe z UDF-ami | Czytaj bajty plików, wyodrębniaj metadane obrazów i wideo oraz generuj pliki pochodne za pomocą UDF-ów. |
| Krótkie wprowadzenie do funkcji FILE | Zacznij od FILE typu i jego funkcji w Databricks SQL i Databricks Runtime. |
Dane częściowo ustrukturyzowane
Wzorce i funkcje pracy z zagnieżdżonymi i półstrukturalnymi danymi w domku nad jeziorem.
| Format | Description |
|---|---|
| Modeluj dane półstrukturalne | Wybierz spośród wariantów, łańcuchów JSON, struktur i map do przechowywania danych półstrukturalnych. |
| Wariant | Przechowuj półstrukturalne dane przy użyciu typu VARIANT, aby zoptymalizować odczyty i zapisy. |
| Przekształcanie złożonych typów danych | Pracuj ze strukturami, tablicami i mapami w Apache Spark. |
| Funkcje wyższego rzędu | Przekształcaj tablice i mapy za pomocą wbudowanych funkcji wyższego rzędu. |