Adatformátum beállításai

Az Azure Databricks beépített kulcsszókötésekkel rendelkezik az Apache Spark által natív módon támogatott összes adatformátumhoz. Az Azure Databricks a Delta Lake protokollt használja az adatok és táblák olvasásához és írásához, míg az Apache Spark a Parquetet használja. Az alábbi szakaszok bemutatják azokat a lehetőségeket és konfigurációkat, amelyek elérhetők, amikor az egyes adatformátumokat lekérdezed az Azure Databricks-en.

A legtöbb formátum támogatja az írási tömörítést a compression beállítással. Az egyes formátumok támogatott értékeiért lásd DataFrameWriter az opciókat. Az Azure Databricks számos formátumban a már tömörített fájlokat is közvetlenül tudja olvasni, és szükség esetén az Azure Databricksben ki is csomagolhatja a tömörített fájlokat.

További információ az Apache Spark-adatforrásokról: Általános betöltési/mentési függvények és Általános forrásfájl-beállítások.

Nyitott táblázatformátumok

Táblázatformátumok, amelyek támogatják az ACID tranzakciókat, a séma fejlődését és a motorok közötti interoperabilitást.

Format Description
Delta-tó Az alapértelmezett formátum az adatok és táblák olvasásához és írásához az Azure Databricks-en.
Jéghegy Iceberg-táblák olvasása és írása, valamint együttműködés külső Iceberg-motorokkal.
OpenSharing Olvasd el a megosztott táblákat és adatokat a nyílt megosztási protokoll segítségével.

Oszlopos formátumok

Bináris oszlopos formátumok, amelyek analitikus olvasási teljesítményre és tömörítésre optimalizáltak.

Format Description
Parquet Az Apache Spark alapértelmezettségében oszlopos formátumot használ, hatékony tömörítéssel és kódolással.
ORK Egy oszlopos formátum beépített tömörítéssel és könnyű indexek támogatásával.

Szövegalapú formátumok

Ember által olvasható formátumok cseréhez, konfigurációhoz és rekordokhoz rugalmas vagy fejlődő sémáikkal.

Format Description
JSON JSON fájlokat olvassanak és írjanak, beleértve a többsoros rekordok és séma következtetések lehetőségeit.
CSV Tagolt szövegfájlok olvasása és írása, a fejlécekre, az elválasztójelekre és a hibás rekordokra vonatkozó beállításokkal.
XML XML fájlokat olvass és írj a sorcímke és séma megadásával
Szöveg Olvass és írj egyszerű szöveges fájlokat soronként, vagy fájlonként.

Bináris és speciális formátumok

Binary serializációs formátumok és Azure Databricks-specifikus adatforrások.

Format Description
Avro Olvass és írj Avro fájlokat, és dolgozz Avro-kódolt rakományokkal streamingben.
MLflow-kísérlet Töltsd be az MLflow kísérleti futtatási adatokat az egyedi mlflow-experiment kulcsszóval.

Strukturálatlan adatok

Formátumok és típusok dokumentumok, képek, hangok és egyéb strukturálatlan fájlok tárolására és feldolgozására.

Format Description
Dolgozzon strukturálatlan adatokkal Tárolja, irányítja és feldolgozza a strukturálatlan adatokat, például dokumentumokat, képeket és hangokat.
Bináris Olvass fájlokat nyers bináris rekordokként, beleértve a képeket és egyéb strukturálatlan adatokat.
Image Képadatok betöltése gépi tanulási feladatokhoz. A Databricks azt javasolja, hogy a képeket adatként binary töltsd be.
FÁJL Tároljon egy strukturálatlan fájlra mutató szabályozott referenciát a(z) BINARY vagy STRING használata helyett.
Fájlok felvétele FILE típusként Strukturálatlan fájlokat juttassa be táblákba hivatkozásként FILE SQL-vel, táblázatértékű függvényekkel és Auto Loaderrel.
Fájlok feldolgozása UDF-ekkel Fájlbájtokat olvas, kép- és videómetaadatokat kinyerni, valamint UDF-ekkel generálni származtatott fájlokat.
FILE funkciók gyorsindítása Kezdd el a FILE típust és funkcióit a Databricks SQL-ben és a Databricks Runtime-ban.

Részben strukturált adatok

Minták és függvények a lakehouse-ban lévő egymásba ágyazott és félig strukturált adatokkal való munkához.

Format Description
Modell félig strukturált adatok Válassz a Variant, JSON stringek, structok és map-ok között félig strukturált adatok tárolására.
Változat Tárold félig strukturált adatokat a VARIANT típus segítségével optimalizált olvasáshoz és íráshoz.
Összetett adattípusok átalakítása Dolgozz szerkezetekkel, tömbökkel és térképekkel az Apache Sparkban.
Magasabb rendű függvények A tömböket és térképeket beépített, magasabb rendű függvényekkel alakítsd át.