Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Důležité
Tato funkce je ve verzi Public Preview.
StreamSets vám pomůže spravovat a monitorovat tok dat po celý jeho životní cyklus. Nativní integrace StreamSets s Azure Databricks a Delta Lake umožňuje snadno načíst data z různých zdrojů a spravovat vaše kanály.
Pro obecnou ukázku StreamSets se podívejte na následující video YouTube (10 minut).
Tady je postup použití StreamSets s Azure Databricks.
Krok 1: Vygenerování osobního přístupového tokenu Databricks
StreamSets se ověřuje v Azure Databricks pomocí osobního přístupového tokenu Azure Databricks.
Poznámka:
Osvědčeným bezpečnostním postupem, při ověřování pomocí automatizovaných nástrojů, systémů, skriptů a aplikací, je doporučení společnosti Databricks používat místo uživatelů pracovního prostoru osobní přístupové tokeny náležící služebním účtům. Pokud chcete vytvořit tokeny pro instanční objekty, přečtěte si téma Správa tokenů instančního objektu.
Krok 2: Nastavení clusteru pro podporu potřeb integrace
StreamSets bude zapisovat data do cesty Azure Data Lake Storage a integrační cluster Azure Databricks bude číst data z daného umístění. Proto integrační cluster vyžaduje zabezpečený přístup k cestě Azure Data Lake Storage.
Zabezpečený přístup k cestě Azure Data Lake Storage
Pro zabezpečení přístupu k datům v Azure Data Lake Storage (ADLS) můžete využít přístupový klíč účtu úložiště Azure (doporučeno) nebo služební objekt Microsoft Entra ID.
Použití přístupového klíče účtu úložiště Azure
Přístupový klíč účtu úložiště můžete nakonfigurovat v integračním clusteru jako součást konfigurace Sparku. Ujistěte se, že má účet úložiště přístup ke kontejneru ADLS a systému souborů, který se používá pro přípravná data a kontejner ADLS a systém souborů, do kterého chcete zapisovat tabulky Delta Lake. Pokud chcete nakonfigurovat cluster integrace tak, aby používal klíč, postupujte podle kroků v Připojení ke službě Azure Data Lake Storage a službě Blob Storage.
Použijte principál služby Microsoft Entra ID
Služební principál můžete nakonfigurovat v integračním clusteru Azure Databricks jako součást konfigurace Sparku. Ujistěte se, že má služební objekt přístup ke kontejneru ADLS pro ukládání dat a ke kontejneru ADLS, do kterého chcete zapisovat tabulky Delta. Chcete-li nakonfigurovat integrační cluster tak, aby používal služební hlavní jméno, postupujte podle kroků v části Přístup k ADLS se služebním hlavním jménem.
Specifikovat konfiguraci clusteru
Nastavte režim clusteru na standardní .
Nastavte Databricks Runtime verze na prostředí: 6.3 nebo vyšší.
Povolte optimalizované zápisy a automatické komprimace přidáním následujících vlastností do konfigurace Sparku:
spark.databricks.delta.optimizeWrite.enabled true spark.databricks.delta.autoCompact.enabled trueNakonfigurujte cluster v závislosti na potřebách integrace a škálování.
Podrobnosti o konfiguraci clusteru najdete v referenčních informacích ke konfiguraci výpočetních prostředků.
Viz Získání podrobností o připojení pro výpočetní zdroj Azure Databricks pro kroky, jak získat adresu URL JDBC a cestu HTTP.
Krok 3: Získání podrobností o připojení JDBC a ODBC pro připojení ke clusteru
Pokud chcete připojit cluster Azure Databricks ke StreamSets, potřebujete následující vlastnosti připojení JDBC/ODBC:
- JDBC URL
- Cesta HTTP
Krok 4: Získání streamsetů pro Azure Databricks
Pokud ještě nemáte účet StreamSets, zaregistrujte se do Služby StreamSets pro Databricks. Až budete připraveni, můžete začít zdarma a upgradovat. Viz Ceny platformy StreamSets DataOps.
Krok 5: Naučte se používat StreamSets k načtení dat do Delta Lake
Začněte ukázkovou datovou linkou nebo se podívejte na Načítání dat do Databricks Delta Lake a zjistěte, jak vytvořit datovou linku, která zpracovává data do Delta Lake.