Csatlakozás adatforrásokhoz és külső szolgáltatásokhoz

Ezen a lapon javaslatokat talál a rendszergazdák és a power-felhasználók számára, akik Azure Databricks és külső adatforrások és szolgáltatások közötti kapcsolatokat konfigurálják.

A Azure Databricks-fiókját olyan adatforrásokhoz csatlakoztathatja, mint a felhőalapú objektumtárolás, a relációs adatbázis-kezelő rendszerek, a streamelési adatszolgáltatások és a vállalati platformok, például a CRM-ek. A Azure Databricks-fiókját nem tároló külső szolgáltatásokhoz is csatlakoztathatja.

A felhőobjektum-tárolóval létesített kapcsolatok konfigurálása

Az Azure Databricks számítási feladatok által használt adatok többsége felhőalapú objektumtárolóban van tárolva, például Azure Data Lake Storage vagy AWS S3. A felhőobjektum-tárolóhoz való hozzáférést az alábbiak egyikével kezelheti:

Unity Catalog-kapcsolatok

A Unity Catalog-kapcsolat egy biztonságos objektum, amely tárolja a külső rendszer eléréséhez szükséges végpontot és hitelesítő adatokat. A kapcsolatok szabályozott módon kezelik a külső adatrendszerek hitelesítését és konfigurációját, beleértve az összevonást, a felügyelt betöltési módot, a JDBC-t és a HTTP-t. Az összes kapcsolattípus áttekintéséért és azok kiválasztásáért tekintse meg a Unity Catalog kapcsolatait.

Külső adatrendszerek kapcsolatainak konfigurálása

A Databricks számos lehetőséget kínál a külső adatrendszerekhez való kapcsolatok konfigurálására. Az alábbi táblázat az alábbi lehetőségek magas szintű áttekintését tartalmazza:

Option Description
Lekérdezési federációs csatlakozók A lekérdezések összevonása csak olvasható hozzáférést biztosít a külső relációs adatbázisokhoz a Unity Catalog-lekérdezések JDBC-n keresztüli leküldésével. A támogatott források közé tartozik a PostgreSQL, a MySQL, a SQL Server, a Snowflake stb.
Katalógus-föderációs csatlakozók A katalógusösszevonás külső katalógusplatformokat, például Hive Metastore-t vagy Snowflake Horizon-katalógust kapcsol össze, így adataikat közvetlenül a fájltárolóban kérdezheti le adatáthelyezés nélkül.
Kezelt adatbetöltési csatlakozók A Lakeflow Connect lehetővé teszi az adminisztrátorok számára, hogy a adatbeviteli felületen egyidejűleg létrehozzanak egy kapcsolatot és egy kezelt adatbefolyásolási folyamatot. Lásd: Felügyelt összekötők a Lakeflow Connectben.
Ha a folyamatokat létrehozó felhasználók nem rendszergazdai felhasználók, vagy a Databricks API-k, a Databricks SDK-k, a Databricks parancssori felület vagy a Deklaratív automatizálási csomagok használatát tervezik, a rendszergazdának először létre kell hoznia a kapcsolatot a Catalog Explorerben. Ezek a felületek megkövetelik, hogy a felhasználók meglévő kapcsolatot adjanak meg egy csővezeték létrehozásakor. Lásd : Csatlakozás felügyelt betöltési forrásokhoz.
Stream-csatlakozók Azure Databricks optimalizált összekötőket biztosít számos streamelési adatrendszerhez.
Minden streamelési adatforráshoz olyan hitelesítő adatokat kell létrehoznia, amelyek hozzáférést biztosítanak, és ezeket a hitelesítő adatokat be kell tölteni az Azure Databricksba. A Databricks azt javasolja, hogy a hitelesítő adatokat titkok segítségével tároljuk, mivel titkokat használhat minden konfigurációs beállításhoz és minden hozzáférési mód esetében.
Minden adatcsatlakozó tartalomforrásokhoz támogatja a hitelesítő adatok átadását opciók használatával, amikor streaming lekérdezéseket definiál. Lásd: Standard összekötők a Lakeflow Connectben.
Külső integrációk Használjon harmadik fél által készített eszközöket, hogy kapcsolódjon külső adatforrásokhoz és automatizálja az adatok bevitelét a lakehouse-ba. Néhány megoldás tartalmazza a fordított ETL-t és a külső rendszerek számára közvetlen hozzáférést a lakehouse adatokhoz. Lásd : Mi az a Databricks Partner Connect?.
Spark adatszolgáltató API A Spark Data Source API-val olvashat és írhat külső adatbázisokba. A Databricks Runtime beépített csatlakozókat tartalmaz a gyakori forrásokhoz. Unity Catalog-kapcsolatot is használhat saját JDBC-illesztő JAR-jával, külső összekötőket telepíthet dedikált fürtökre, vagy egyéni összekötőket hozhat létre a PySpark DataSource API-val. Lásd: Spark-adatforrások.
Csak olvasható hozzáféréshez a Databricks a Lakehouse Federation használatát javasolja.
JDBC Csatlakozás külső adatbázisokhoz JDBC használatával, Unity Catalog-kapcsolattal a szabályozott hozzáféréshez, a hitelesítő adatok elkülönítéséhez és a számításközi támogatáshoz. Lásd : JDBC-kapcsolat.
A Unity Catalog szabályozása nélküli örökölt JDBC-konfigurációkról lásd a JDBC-t használó adatbázisok lekérdezését.
Írásvédett lekérdezések esetén mindig a Lakehouse Federation az előnyben részesített megoldás.

Nem tárolási felhőszolgáltatások kapcsolatainak konfigurálása

A Unity Catalog a nem tárolási felhőszolgáltatásokhoz való hozzáférést egy szolgáltatás hitelesítő adatainak nevű biztonságos objektummal szabályozza. A szolgáltatás hitelesítő adata egy hosszú távú felhőalapú hitelesítő adatot foglal magában, amely hozzáférést biztosít egy nem tárolási célú felhőszolgáltatáshoz, amelyhez a felhasználóknak az Azure Databricksből kell csatlakozniuk. Lásd: Csatlakozás külső felhőszolgáltatásokhoz a Unity Catalog használatával.

Adatforrásokhoz és külső szolgáltatásokhoz való hozzáférés kezelése és kérése

A legtöbb kapcsolati módszer emelt szintű jogosultságokat igényel mind a külső adatforráson vagy szolgáltatáson, mind a Azure Databricks munkaterületen. A tipikus szervezetekben kevés felhasználó rendelkezik elegendő jogosultsággal Azure Databricks vagy külső adat- és társzolgáltatókban az adatkapcsolatok konfigurálásához.

Előfordulhat, hogy a szervezet már konfigurálta az adatforráshoz vagy szolgáltatáshoz való hozzáférést az ezen a lapon hivatkozott cikkekben ismertetett minták egyikével. Ha a szervezet jól meghatározott folyamattal rendelkezik az adatokhoz és külső szolgáltatásokhoz való hozzáférés kéréséhez, a Databricks azt javasolja, hogy kövesse ezt a folyamatot. Ha nem tudja, hogyan férhet hozzá egy adatforráshoz, ez az eljárás segíthet:

  1. A Katalóguskezelővel megtekintheti az elérhető táblákat és köteteket. Lásd : Mi az a Katalóguskezelő?.
  2. Kérdezd meg a csapattársaidat vagy a vezetőidet az általuk hozzáférhető adatforrásokról.
    • A legtöbb szervezet az identitásszolgáltatótól szinkronizált csoportokat (például okta vagy Microsoft Entra ID) használja a munkaterület-felhasználók engedélyeinek kezeléséhez. Ha a csapat más tagjai hozzáférhetnek azokhoz az adatforrásokhoz, amelyekhez hozzáférésre van szüksége, a munkaterület rendszergazdája adja hozzá Önt a megfelelő csoporthoz a hozzáférés biztosításához.
    • Ha egy adott táblát, kötetet vagy adatforrást egy munkatárs állított be, az adott személynek hozzáférést kell biztosítania az adatokhoz.

Egyes szervezetek adathozzáférési engedélyeket csatolnak adott számítási fürtökhöz és SQL-raktárakhoz. Ez egy örökölt szabályozási modell, de ha a szervezet használja, és meg szeretné tudni, hogy mely adatforrások érhetők el egy adott számítási erőforráson, lépjen kapcsolatba a Számítás lapon felsorolt számítási létrehozóval.