Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Ezen a lapon javaslatokat talál a rendszergazdák és a power-felhasználók számára, akik Azure Databricks és külső adatforrások és szolgáltatások közötti kapcsolatokat konfigurálják.
A Azure Databricks-fiókját olyan adatforrásokhoz csatlakoztathatja, mint a felhőalapú objektumtárolás, a relációs adatbázis-kezelő rendszerek, a streamelési adatszolgáltatások és a vállalati platformok, például a CRM-ek. A Azure Databricks-fiókját nem tároló külső szolgáltatásokhoz is csatlakoztathatja.
A felhőobjektum-tárolóval létesített kapcsolatok konfigurálása
Az Azure Databricks számítási feladatok által használt adatok többsége felhőalapú objektumtárolóban van tárolva, például Azure Data Lake Storage vagy AWS S3. A felhőobjektum-tárolóhoz való hozzáférést az alábbiak egyikével kezelheti:
Unity Catalog (ajánlott), amely a strukturált és strukturálatlan adatokhoz is biztosít adatszabályozást a felhőobjektum-tárolókban. Lásd : Csatlakozás a felhőobjektum-tárolóhoz a Unity Catalog használatával.
Régi összekötők és kapcsolati minták. Tekintse meg a Konfigurálás felhőobjektum-tárolóhoz való hozzáférését a Azure Databricks régi minták használatával.
Unity Catalog-kapcsolatok
A Unity Catalog-kapcsolat egy biztonságos objektum, amely tárolja a külső rendszer eléréséhez szükséges végpontot és hitelesítő adatokat. A kapcsolatok szabályozott módon kezelik a külső adatrendszerek hitelesítését és konfigurációját, beleértve az összevonást, a felügyelt betöltési módot, a JDBC-t és a HTTP-t. Az összes kapcsolattípus áttekintéséért és azok kiválasztásáért tekintse meg a Unity Catalog kapcsolatait.
Külső adatrendszerek kapcsolatainak konfigurálása
A Databricks számos lehetőséget kínál a külső adatrendszerekhez való kapcsolatok konfigurálására. Az alábbi táblázat az alábbi lehetőségek magas szintű áttekintését tartalmazza:
| Option | Description |
|---|---|
| Lekérdezési federációs csatlakozók | A lekérdezések összevonása csak olvasható hozzáférést biztosít a külső relációs adatbázisokhoz a Unity Catalog-lekérdezések JDBC-n keresztüli leküldésével. A támogatott források közé tartozik a PostgreSQL, a MySQL, a SQL Server, a Snowflake stb. |
| Katalógus-föderációs csatlakozók | A katalógusösszevonás külső katalógusplatformokat, például Hive Metastore-t vagy Snowflake Horizon-katalógust kapcsol össze, így adataikat közvetlenül a fájltárolóban kérdezheti le adatáthelyezés nélkül. |
| Kezelt adatbetöltési csatlakozók | A Lakeflow Connect lehetővé teszi az adminisztrátorok számára, hogy a adatbeviteli felületen egyidejűleg létrehozzanak egy kapcsolatot és egy kezelt adatbefolyásolási folyamatot. Lásd: Felügyelt összekötők a Lakeflow Connectben. Ha a folyamatokat létrehozó felhasználók nem rendszergazdai felhasználók, vagy a Databricks API-k, a Databricks SDK-k, a Databricks parancssori felület vagy a Deklaratív automatizálási csomagok használatát tervezik, a rendszergazdának először létre kell hoznia a kapcsolatot a Catalog Explorerben. Ezek a felületek megkövetelik, hogy a felhasználók meglévő kapcsolatot adjanak meg egy csővezeték létrehozásakor. Lásd : Csatlakozás felügyelt betöltési forrásokhoz. |
| Stream-csatlakozók | Azure Databricks optimalizált összekötőket biztosít számos streamelési adatrendszerhez. Minden streamelési adatforráshoz olyan hitelesítő adatokat kell létrehoznia, amelyek hozzáférést biztosítanak, és ezeket a hitelesítő adatokat be kell tölteni az Azure Databricksba. A Databricks azt javasolja, hogy a hitelesítő adatokat titkok segítségével tároljuk, mivel titkokat használhat minden konfigurációs beállításhoz és minden hozzáférési mód esetében. Minden adatcsatlakozó tartalomforrásokhoz támogatja a hitelesítő adatok átadását opciók használatával, amikor streaming lekérdezéseket definiál. Lásd: Standard összekötők a Lakeflow Connectben. |
| Külső integrációk | Használjon harmadik fél által készített eszközöket, hogy kapcsolódjon külső adatforrásokhoz és automatizálja az adatok bevitelét a lakehouse-ba. Néhány megoldás tartalmazza a fordított ETL-t és a külső rendszerek számára közvetlen hozzáférést a lakehouse adatokhoz. Lásd : Mi az a Databricks Partner Connect?. |
| Spark adatszolgáltató API | A Spark Data Source API-val olvashat és írhat külső adatbázisokba. A Databricks Runtime beépített csatlakozókat tartalmaz a gyakori forrásokhoz. Unity Catalog-kapcsolatot is használhat saját JDBC-illesztő JAR-jával, külső összekötőket telepíthet dedikált fürtökre, vagy egyéni összekötőket hozhat létre a PySpark DataSource API-val. Lásd: Spark-adatforrások. Csak olvasható hozzáféréshez a Databricks a Lakehouse Federation használatát javasolja. |
| JDBC | Csatlakozás külső adatbázisokhoz JDBC használatával, Unity Catalog-kapcsolattal a szabályozott hozzáféréshez, a hitelesítő adatok elkülönítéséhez és a számításközi támogatáshoz. Lásd : JDBC-kapcsolat. A Unity Catalog szabályozása nélküli örökölt JDBC-konfigurációkról lásd a JDBC-t használó adatbázisok lekérdezését. Írásvédett lekérdezések esetén mindig a Lakehouse Federation az előnyben részesített megoldás. |
Nem tárolási felhőszolgáltatások kapcsolatainak konfigurálása
A Unity Catalog a nem tárolási felhőszolgáltatásokhoz való hozzáférést egy szolgáltatás hitelesítő adatainak nevű biztonságos objektummal szabályozza. A szolgáltatás hitelesítő adata egy hosszú távú felhőalapú hitelesítő adatot foglal magában, amely hozzáférést biztosít egy nem tárolási célú felhőszolgáltatáshoz, amelyhez a felhasználóknak az Azure Databricksből kell csatlakozniuk. Lásd: Csatlakozás külső felhőszolgáltatásokhoz a Unity Catalog használatával.
Adatforrásokhoz és külső szolgáltatásokhoz való hozzáférés kezelése és kérése
A legtöbb kapcsolati módszer emelt szintű jogosultságokat igényel mind a külső adatforráson vagy szolgáltatáson, mind a Azure Databricks munkaterületen. A tipikus szervezetekben kevés felhasználó rendelkezik elegendő jogosultsággal Azure Databricks vagy külső adat- és társzolgáltatókban az adatkapcsolatok konfigurálásához.
Előfordulhat, hogy a szervezet már konfigurálta az adatforráshoz vagy szolgáltatáshoz való hozzáférést az ezen a lapon hivatkozott cikkekben ismertetett minták egyikével. Ha a szervezet jól meghatározott folyamattal rendelkezik az adatokhoz és külső szolgáltatásokhoz való hozzáférés kéréséhez, a Databricks azt javasolja, hogy kövesse ezt a folyamatot. Ha nem tudja, hogyan férhet hozzá egy adatforráshoz, ez az eljárás segíthet:
- A Katalóguskezelővel megtekintheti az elérhető táblákat és köteteket. Lásd : Mi az a Katalóguskezelő?.
- Kérdezd meg a csapattársaidat vagy a vezetőidet az általuk hozzáférhető adatforrásokról.
- A legtöbb szervezet az identitásszolgáltatótól szinkronizált csoportokat (például okta vagy Microsoft Entra ID) használja a munkaterület-felhasználók engedélyeinek kezeléséhez. Ha a csapat más tagjai hozzáférhetnek azokhoz az adatforrásokhoz, amelyekhez hozzáférésre van szüksége, a munkaterület rendszergazdája adja hozzá Önt a megfelelő csoporthoz a hozzáférés biztosításához.
- Ha egy adott táblát, kötetet vagy adatforrást egy munkatárs állított be, az adott személynek hozzáférést kell biztosítania az adatokhoz.
Egyes szervezetek adathozzáférési engedélyeket csatolnak adott számítási fürtökhöz és SQL-raktárakhoz. Ez egy örökölt szabályozási modell, de ha a szervezet használja, és meg szeretné tudni, hogy mely adatforrások érhetők el egy adott számítási erőforráson, lépjen kapcsolatba a Számítás lapon felsorolt számítási létrehozóval.