Lakehouse v reálném čase

Important

Tato funkce je v beta verzi. Spojte se s týmem účtu Databricks a povolte tuto funkci ve vašem účtu.

Lakehouse//RT je v aktivním vývoji. Charakteristiky výkonu a podporovaná sada funkcí se před obecnou dostupností změní.

Lakehouse Real-Time (Lakehouse//RT) je bezserverová výpočetní prostředí vytvořená pro případy použití s nízkou latencí a vysokou souběžností, jako je poskytování analytických dat vlastním aplikacím, spouštění provozních analýz nebo spouštění řídicích panelů BI, které vyžadují subsekundové odpovědi pro stovky až tisíce souběžných uživatelů.

Lakehouse//RT nabízí u čtecích dotazů SQL nad vašimi tabulkami v Unity Catalogu latenci kratší než jednu sekundu, pokud používají formáty Delta Lake nebo Apache Iceberg v cloudovém úložišti. Lakehouse///RT vytváříte a spravujete podobně jako ostatní sklady SQL. Správce pracovního prostoru nebo privilegovaný uživatel vytvoří jeden nebo více pracovních prostorů a přiřadí uživatelům oprávnění.

Požadavky

Pokud chcete použít Lakehouse//RT, musíte:

Povolení Lakehouse//RT v pracovním prostoru

Správci pracovního prostoru můžou ve vašem pracovním prostoru povolit beta verzi Lakehouse//RT:

  1. V nabídce pracovního prostoru (v pravém horním rohu) přejděte na Náhledy.
  2. Vyhledejte Lakehouse RT.
  3. Povolte náhled.

Po povolení verze Preview se typ skladu v reálném čase zpřístupní v toku vytváření SQL Warehouse pro váš pracovní prostor.

Vytvoření skladu Lakehouse//RT

Vytvoření skladu Lakehouse//RT:

  1. Přejděte na Compute>SQL Warehouses>Create SQL Warehouse.
  2. Vyberte možnost Real-Time.
  3. Vyberte velikost dotazu: Malý, Střední, Velký nebo X-Velký, podle toho, jaký výkon vaše dotazy vyžadují.
  4. Nakonfigurujte automatické škálování tak, abyste určili maximální počet DBU, které můžete účtovat za hodinu.
  5. Nastavte automatické zastavení tak, aby ovládalo, kdy se zastaví nečinný sklad.
  6. Zadejte název skladu.
  7. Klikněte na Vytvořit.

Pokud chcete přiřadit oprávnění, udělte možnost Může používat, Může monitorovat nebo Může spravovat uživatelům a skupinám, stejně jako SQL Warehouse.

Note

V současné době není možné upgradovat existující sql warehouse na Lakehouse//RT nebo downgradovat existující sklad Lakehouse//RT na jiný typ skladu.

Nastavení velikosti a škálování datového skladu Lakehouse//RT

Lakehouse//RT má nastavení, která ovlivňují výkon a cenu:

  • Velikost dotazu řídí výpočetní kapacitu dostupnou pro jeden dotaz.
  • Automatické škálování ovládá, jak moc se sklad rozšíří, aby sloužil současným dotazům.
  • Automatické zastavení ovládá, jak dlouho sklad běží v klidu, než se zastaví.

Velikost dotazu a automatické škálování fungují jinak než nastavení velikosti a škálování v serverless SQL skladu.

Velikost dotazu

Velikost dotazu určuje maximální výpočetní kapacitu, kterou může jeden dotaz použít, což určuje, jak rychle může jednotlivý dotaz běžet. Také nastavuje minimální výpočetní kapacitu, na které sklad běží, a minimum, za které vám účtujete, dokud je sklad aktivní.

Velikost dotazu nastavíte při vytváření skladu. Vyberte malou, střední, velkou nebo extra velkou. Větší velikost dává každému dotazu větší výpočetní kapacitu pro rychlejší výsledky a zároveň vyšší minimální náklady.

Toto nastavení je konceptuálně podobné velikosti serverless SQL skladu, který také nastavuje výpočetní kapacitu dostupnou pro jeden dotaz.

Autoscaling

Automatické škálování umožňuje skladu přidat výpočetní prostředky pro obsluhu více současných dotazů a pak je uvolnit, když poptávka klesne. Nastavíte maximální výpočetní kapacitu, na kterou může sklad škálovat, měřenou v DBU.

Automatické škálování na Lakehouse//RT se liší od škálování clusterů v serverless SQL skladu v několika ohledech:

  • Měří se v DBU, ne v clusterech.
  • Maximální je nezávislé na velikosti dotazu. Můžete spárovat malou velikost dotazu s vysokým maximem, abyste získali vysokou souběžnost, aniž byste každému dotazu dávali větší výpočetní výkon.
  • Automatické škálování v Lakehouse//RT přidává a odebírá jen potřebný výpočetní výkon namísto škálování po celých clusterech.

Chcete-li zjistit, jak moc sklad škáluje, použijte jeho monitorovací stránku.

Automatické zastavení

Automatické zastavení ukončí sklad po určitém počtu minut nečinnosti, takže nečinný sklad nehromadí další poplatky. Časový limit nečinnosti nastavíte při vytváření skladu.

Automatické zastavení u Lakehouse//RT funguje stejně jako u serverless SQL skladu. Pro výchozí a minimální hodnoty viz Nastavení SQL skladu.

Monitorování aktivity Lakehouse//RT

Dotazy Lakehouse//RT můžete monitorovat stejně jako jakýkoli dotaz spuštěný ve službě SQL Warehouse:

Osvědčené postupy

Pokud chcete získat nejlepší výsledky z Lakehouse//RT, připravte úlohy před jejich přesunutím:

  • Nejprve ověřte bezserverový SQL. Spusťte dotazy v bezserverovém SQL Warehouse a ověřte, že běží během několika sekund.
  • Používejte spravované tabulky Unity Catalog. Spravované tabulky s prediktivní optimalizací a clusteringem liquid zajišťují, že jsou vaše data dobře clusterovaná pro vaše vzory úloh.
  • Ověřte, že dotazy jsou selektivní. V případě podsekundové latence ověřte, že vaše dotazy prohledávají menší objemy dat. Filtrujte co nejdříve pomocí klauzulí WHERE, vybírejte pouze sloupce, které potřebujete, a využívejte agregace. Spojení mezi tabulkami je podporované, ale pokud zjistíte, že dotaz je složitý nebo pomalý, zvažte použití materializovaných zobrazení, která předem agregují vaše data, aby se zrychlila latence.
  • Zkontrolujte pokrytí SQL. Lakehouse//RT podporuje pouze dotazy na čtení kompatibilní se standardem ANSI. Ověřte, že vaše úlohy jsou kompatibilní se standardem ANSI , a vyhněte se nepodporovaným příkazům, funkcím a datovým typům uvedeným v části Omezení.

Podporované funkce

Nástroje a rozhraní

V nástroji pro výběr výpočetních prostředků můžete vybrat Lakehouse//RT v kterékoli z následujících funkcí Azure Databricks:

  • SQL Editor
  • Poznámkové bloky SQL
  • Řídicí panely AI/BI
  • Průzkumník katalogu
  • Alerts

Typy tabulek

Lakehouse//RT dotazuje pouze data katalogu Unity. Pro dosažení nejlepšího výkonu používejte spravované tabulky Unity Catalog, které enginu poskytují uspořádání dat potřebné pro nízkou latenci.

Lakehouse//RT podporuje následující typy tabulek:

  • Spravované tabulky (tabulky Delta Lake a Apache Iceberg)
  • Materializovaná zobrazení a streamované tabulky
  • Zobrazení metrik

Connectivity

Lakehouse//RT přijímá pouze připojení, která používají rozhraní API pro spouštění příkazů. Nepodporuje starší protokol Thrift, takže ovladač, který se připojuje bez explicitního použití rozhraní API pro spouštění příkazů, obdrží 501 chybu.

K skladu Lakehouse//RT se můžete připojit následujícími způsoby:

Pricing

Informace o cenách najdete na stránce s cenami služby Lakehouse Real-Time .

Limitations

Pokud dotaz používá nepodporovanou funkci, vrátí Lakehouse//RT chybu při pojmenování funkce. Pokud chcete úspěšně spustit dotaz, použijte místo toho bezserverový SQL Warehouse.

Nástroje a funkce

Lakehouse//RT zatím nepodporuje následující funkce:

  • Džin
  • Agenti Genie
  • Úlohy

Typy tabulek

Následující typy tabulek se zatím nepodporují:

  • Systémové tabulky
  • Tabulky služby Delta Sharing
  • Tabulky ve výchozím úložišti Unity Catalog
  • Externí tabulky v katalogu Unity

Lakehouse//RT nepodporuje následující typy tabulek:

  • Tabulky metastore Hive (spravované nebo externí)
  • Cizí tabulky a federace dotazů (Lakehouse Federation)
  • Dočasné tabulky
  • Tabulky, které používají jiné formáty dat (CSV, JSON, Avro, Parquet, ORC a text)

Ovladače a konektory

Lakehouse//RT nepodporuje následující ovladače a konektory:

  • ADBC
  • rozhraní ODBC

Jazyk SQL

Lakehouse//RT spouští dotazy SQL pro čtení pouze v režimu ANSI . Vyhodnotí všechny implicitní převody a přetypování typu podle striktních pravidel ANSI SQL a toto chování nelze vypnout. Při použití sémantiky ANSI mohou dotazy, které spoléhaly na ne‑ANSI chování,ः

  • Vyvolání chyby za běhu místo tichého vytváření NULL. Například přetypování nečíselného řetězce na číslo.
  • Vyvolání chyby v době analýzy, pokud neexistuje bezpečný běžný typ. Například , COALESCE, CASEINnebo nastavit operace napříč nekompatibilními typy.
  • Vrátí jiný typ výsledku než legacy režim, protože rozšíření řetězců ANSI a rozšíření číselných typů volí bezpečné bezeztrátové datové typy.

Pokud chcete získat předvídatelné výsledky, použijte explicitní CAST výrazy, pokud implicitní převody režimu ANSI nevyvolávají očekávané chování.

Lakehouse//RT nepodporuje následující:

  • Datové typy: Datové typy GEOGRAPHY a GEOMETRY.
  • Funkce: Funkce AI, Python UDF, prostorové funkce SQL a funkce XPath a XML.
  • Správy: Řízení přístupu na základě atributů (ABAC), včetně zabezpečení na úrovni řádků a maskování sloupců

Lakehouse//RT je určen pouze pro dotazy určené ke čtení (SELECT). Příkazy pro zápis a ETL se nepodporují, včetně následujících:

  • Operace zápisu:INSERT, UPDATE, DELETE, MERGEa CREATE TABLE AS SELECT (CTAS).
  • DDL:CREATE, , ALTER, DROPa další příkazy, které vytvářejí nebo upravují objekty.
  • Bezpečnostní příkazy:GRANT a REVOKE.
  • Skriptování, uložené procedury, dočasné tabulky a transakce s více příkazy
  • Údržba Delta Lake:OPTIMIZE, ANALYZE, VACUUMa REFRESH.

Zabezpečení sítě

Important

Lakehouse//RT běží na Azure Databricks serverless compute. Chcete-li pro své cloudové úložiště vytvořit firewall a zároveň povolit přístup z bezserverového výpočetního prostředí, viz Konfigurace firewallu pro přístup z bezserverového výpočetního prostředí. Starší metody konfigurace firewallu byly nedávno zrušeny. Pokud jsou stále v provozu, serverless compute může při pokusu o přístup k úložišti vrátit chybu 403 Forbidden .

Lakehouse//RT zatím nepodporuje následující konfigurace sítě:

Compliance

Profily zabezpečení dodržování předpisů se v současné době nepodporují.