Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Az Azure Databricks beépített kulcsszókötésekkel rendelkezik az Apache Spark által natív módon támogatott összes adatformátumhoz. Az Azure Databricks a Delta Lake protokollt használja az adatok és táblák olvasásához és írásához, míg az Apache Spark a Parquetet használja. Az alábbi szakaszok bemutatják azokat a lehetőségeket és konfigurációkat, amelyek elérhetők, amikor az egyes adatformátumokat lekérdezed az Azure Databricks-en.
A legtöbb formátum támogatja az írási tömörítést a compression beállítással. Az egyes formátumok támogatott értékeiért lásd DataFrameWriter az opciókat. Az Azure Databricks számos formátumban a már tömörített fájlokat is közvetlenül tudja olvasni, és szükség esetén az Azure Databricksben ki is csomagolhatja a tömörített fájlokat.
További információ az Apache Spark-adatforrásokról: Általános betöltési/mentési függvények és Általános forrásfájl-beállítások.
Nyitott táblázatformátumok
Táblázatformátumok, amelyek támogatják az ACID tranzakciókat, a séma fejlődését és a motorok közötti interoperabilitást.
| Format | Description |
|---|---|
| Delta-tó | Az alapértelmezett formátum az adatok és táblák olvasásához és írásához az Azure Databricks-en. |
| Jéghegy | Iceberg-táblák olvasása és írása, valamint együttműködés külső Iceberg-motorokkal. |
| OpenSharing | Olvasd el a megosztott táblákat és adatokat a nyílt megosztási protokoll segítségével. |
Oszlopos formátumok
Bináris oszlopos formátumok, amelyek analitikus olvasási teljesítményre és tömörítésre optimalizáltak.
| Format | Description |
|---|---|
| Parquet | Az Apache Spark alapértelmezettségében oszlopos formátumot használ, hatékony tömörítéssel és kódolással. |
| ORK | Egy oszlopos formátum beépített tömörítéssel és könnyű indexek támogatásával. |
Szövegalapú formátumok
Ember által olvasható formátumok cseréhez, konfigurációhoz és rekordokhoz rugalmas vagy fejlődő sémáikkal.
| Format | Description |
|---|---|
| JSON | JSON fájlokat olvassanak és írjanak, beleértve a többsoros rekordok és séma következtetések lehetőségeit. |
| CSV | Tagolt szövegfájlok olvasása és írása, a fejlécekre, az elválasztójelekre és a hibás rekordokra vonatkozó beállításokkal. |
| XML | XML fájlokat olvass és írj a sorcímke és séma megadásával |
| Szöveg | Olvass és írj egyszerű szöveges fájlokat soronként, vagy fájlonként. |
Bináris és speciális formátumok
Binary serializációs formátumok és Azure Databricks-specifikus adatforrások.
| Format | Description |
|---|---|
| Avro | Olvass és írj Avro fájlokat, és dolgozz Avro-kódolt rakományokkal streamingben. |
| MLflow-kísérlet | Töltsd be az MLflow kísérleti futtatási adatokat az egyedi mlflow-experiment kulcsszóval. |
Strukturálatlan adatok
Formátumok és típusok dokumentumok, képek, hangok és egyéb strukturálatlan fájlok tárolására és feldolgozására.
| Format | Description |
|---|---|
| Dolgozzon strukturálatlan adatokkal | Tárolja, irányítja és feldolgozza a strukturálatlan adatokat, például dokumentumokat, képeket és hangokat. |
| Bináris | Olvass fájlokat nyers bináris rekordokként, beleértve a képeket és egyéb strukturálatlan adatokat. |
| Image | Képadatok betöltése gépi tanulási feladatokhoz. A Databricks azt javasolja, hogy a képeket adatként binary töltsd be. |
| FÁJL | Tároljon egy strukturálatlan fájlra mutató szabályozott referenciát a(z) BINARY vagy STRING használata helyett. |
| Fájlok felvétele FILE típusként | Strukturálatlan fájlokat juttassa be táblákba hivatkozásként FILE SQL-vel, táblázatértékű függvényekkel és Auto Loaderrel. |
| Fájlok feldolgozása UDF-ekkel | Fájlbájtokat olvas, kép- és videómetaadatokat kinyerni, valamint UDF-ekkel generálni származtatott fájlokat. |
| FILE funkciók gyorsindítása | Kezdd el a FILE típust és funkcióit a Databricks SQL-ben és a Databricks Runtime-ban. |
Részben strukturált adatok
Minták és függvények a lakehouse-ban lévő egymásba ágyazott és félig strukturált adatokkal való munkához.
| Format | Description |
|---|---|
| Modell félig strukturált adatok | Válassz a Variant, JSON stringek, structok és map-ok között félig strukturált adatok tárolására. |
| Változat | Tárold félig strukturált adatokat a VARIANT típus segítségével optimalizált olvasáshoz és íráshoz. |
| Összetett adattípusok átalakítása | Dolgozz szerkezetekkel, tömbökkel és térképekkel az Apache Sparkban. |
| Magasabb rendű függvények | A tömböket és térképeket beépített, magasabb rendű függvényekkel alakítsd át. |