Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
SQL analytický endpoint je čteně-optimalizovaný T-SQL povrch nad Delta daty ve Fabric. Tento článek vysvětluje pracovní zátěž Fabric datového warehousingu s SQL analytickým endpointem lakehouse a scénáře využití lakehouse v datovém warehousingu.
Co je to endpoint pro SQL analytiku v Lakehouse?
SQL analytický endpoint vám umožňuje dotazovat data v lakehouse pomocí jazyka T-SQL a protokolu TDS.
- SQL analytics endpoint zpřístupňuje tabulky Delta z jezera jako SQL tabulky, které můžete dotazovat pomocí T-SQL.
- Každý Delta stůl z jezerního domu je reprezentován jako jeden stůl. Data by měla být ve formátu delta.
- Každý lakehouse má jeden SQL analytický endpoint a každý pracovní prostor může mít více než jeden lakehouse. Další položky Fabric – včetně skladů, zrcadlených databází, SQL databází a Azure Cosmos DB – také automaticky zřizují SQL analytics endpoint, takže pracovní prostor může mít více SQL analytických endpointů než lakehouse položek.
Nemusíte vytvářet SQL analytics endpoint ve Fabric. Koncový bod analýzy SQL se automaticky vytvoří pro každou lakehouse, databázi nebo zrcadlenou databázi. Koncový bod analýzy SQL funguje jako jednoduchá funkce datového skladu pro nadřazené položky, která doplňuje architekturu skladu lakehouse. Tato architektura umožňuje Sparku nebo zrcadlení ve Fabric spravovat data ve struktuře složek v lakehouse, kterou může zobrazit koncový bod pro analýzu SQL.
Note
Koncový bod analýzy SQL na pozadí používá stejný modul jako Sklad k poskytování dotazů SQL s vysokým výkonem a nízkou latencí.
Automatické zjišťování metadat
Bezproblémový proces čte protokoly Delta ze /Tables složky a zajišťuje, aby metadata SQL pro tabulky, jako jsou statistiky, byla vždy aktuální. Není potřeba žádná akce uživatele a nemusíte importovat, kopírovat data ani nastavovat infrastrukturu. Další informace najdete v tématu Automaticky generované schéma v koncovém bodu analýzy SQL.
Scénáře, které lakehouse umožňuje pro datové skladování
V Fabric nabízíme jeden sklad.
Lakehouse se svým SQL analytickým endpointem, poháněným skladem, může zjednodušit tradiční rozhodovací strom vzorů architektury batch útoků, streamování nebo lambda. Společně se skladem umožňuje lakehouse mnoho scénářů s doplňkovými analýzami. Tato sekce zkoumá, jak využít jezerní dům spolu se skladem pro nejlepší analytickou strategii.
Analytika s vrstvou zlata vašeho jezerního domu
Známou strategií pro organizaci dat v datovém jezeře je medailonová architektura. Tato strategie uspořádá soubory do nezpracovaných (bronzových), konsolidovaných (stříbrných) a zpřesněných (zlatých) vrstev. Koncový bod analýzy SQL můžete použít k analýze dat ve zlaté vrstvě architektury medallionu, pokud jsou soubory uložené ve formátu Delta Lake, i když jsou uložené mimo Microsoft Fabric OneLake.
Používejte zkratky v OneLake pro odkazování na zlaté složky v externích úložných účtech Azure Data Lake, které spravují enginy Azure Synapse Spark nebo Azure Databricks.
Sklady můžete také přidat jako předmětná nebo doménově orientovaná řešení pro konkrétní předměty, které můžou mít požadavky na analýzu.
Pokud se rozhodnete data uchovávat v Fabric, je aly otevřené a přístupné prostřednictvím rozhraní API, formátu Delta a samozřejmě T-SQL.
Dotazujte se jako služba na vaše Delta tabulky z Lakehouse a další položky z OneLake
Analytici, datoví vědci a datoví inženýři můžou potřebovat dotazovat data v datovém jezeře. Ve Fabricu toto komplexní prostředí funguje plně jako SaaS.
OneLake je jedno jednotné logické datové jezero pro celou organizaci. OneLake je OneDrive pro data. OneLake může obsahovat několik pracovních prostorů, například v rámci organizačních divizí. Každá položka v Fabric zpřístupňuje data přes OneLake.
Data v jezerním domku ve Fabric jsou fyzicky uložena v OneLake s následující strukturou složek:
- Složka
/Filesobsahuje nezpracované a nekonsolidované (bronzové) soubory, které by datoví inženýři měli zpracovat před analýzou. Soubory můžou být v různých formátech, jako jsou CSV, Parquet, různé typy obrázků a další. - Složka
/Tablesobsahuje zpřesněná a konsolidovaná (zlatá) data, která jsou připravená pro obchodní analýzu. Konsolidovaná data jsou ve formátu Delta Lake.
Koncový bod analýzy SQL může číst data ve složce /tables v OneLake. Analýza je tak jednoduchá, jako dotazovat SQL analytický endpoint jezerního domu. Spolu se skladem získáte také dotazy napříč databázemi a možnost plynule přecházet z dotazů pouze pro čtení na vytváření další obchodní logiky nad daty OneLake pomocí Fabric Data Warehouse.
Datové inženýrství se Sparkem a využitím SQL
Podniky řízené daty potřebují udržovat back-endové a analytické systémy v téměř reálném čase synchronizované s aplikacemi orientovanými na zákazníky. Dopad transakcí musí přesně odrážet komplexní procesy, související aplikace a systémy OLTP (Online Transaction Processing).
V prostředí Fabric můžete ke správě svých dat použít Spark Streaming nebo data engineering. Lakehouse SQL analytics endpoint můžete použít k ověření kvality dat a pro stávající T-SQL procesy. To lze provést v medailonové architektuře nebo ve více vrstvách vašeho jezerního domu, kde se poskytují bronzová, stříbrná, zlatá nebo sceničně vybraná a zdokonalená data. Složky a tabulky vytvořené prostřednictvím Sparku můžete přizpůsobit tak, aby splňovaly vaše požadavky na přípravu dat a obchodní požadavky. Až bude sklad připraven, může sloužit všem vašim downstream business intelligence aplikacím a dalším analytickým aplikacím bez kopírování dat, používání Views nebo zpřesňování dat pomocí CREATE TABLE AS SELECT (CTAS), uložených procedur a dalších příkazů DML / DDL.
Integrace se zlatou vrstvou vašeho otevřeného jezerního domu
SQL analytický endpoint není omezen jen na datovou analytiku v Lakehouse ve Fabric. Použitím SQL analytics endpointu můžete analyzovat data z jezera v jakémkoli lakehouse pomocí Azure Synapse Spark, Azure Databricks nebo jakéhokoli jiného datového inženýrství zaměřeného na jezero. Data můžete uložit do Azure Data Lake Storage nebo Amazon S3.
K této těsné, obousměrné integraci s Lakehouse v Fabric můžete vždy přistupovat přes jakýkoli engine pomocí otevřených API, formátu Delta a samozřejmě T-SQL.
Virtualizace dat z externích datových jezer pomocí zkratek
Použijte zkratky OneLake k odkazování na zlaté složky v externích úložných účtech Azure Data Lake, které spravují enginy Azure Synapse Spark nebo Azure Databricks, stejně jako v jakékoli Delta tabulce uložené v Amazon S3.
Můžete analyzovat libovolnou složku, na kterou odkazuje zástupce z koncového bodu SQL Analytics, a vytvořit tabulku SQL pro data, na která je odkazováno. Pomocí tabulky SQL můžete zpřístupnit data v externě spravovaných datových jezerech a povolit jejich analýzu.
Tato zkratka funguje jako virtuální sklad, který můžete využít z skladu pro další požadavky na podřízenou analýzu nebo dotazovat se přímo.
Pokud chcete analyzovat data v externích účtech data Lake Storage, postupujte takto:
- Vytvořte zástupce, který odkazuje na složku v úložišti Azure Data Lake nebo v účtu Amazon S3. Po zadání kontaktních údajů a přihlašovacích údajů se v jezerním domku zobrazí zkratka.
- Přepněte na SQL analytický endpoint Lakehouse a najděte SQL tabulku, která má jméno odpovídající názvu zkratky. Tato tabulka SQL odkazuje na složku v ADLS nebo S3.
- Dotaz na tabulku SQL, která odkazuje na data v ADLS nebo S3 Tabulku použijte stejně jako jakoukoli jinou tabulku v koncovém bodu analýzy SQL. Tabulky, které odkazují na data v různých účtech úložiště, můžete spojit.
Note
Pokud se tabulka SQL okamžitě nezobrazuje v koncovém bodu analýzy SQL, počkejte několik minut. Tabulka SQL, která odkazuje na data v účtu externího úložiště, se vytvoří se zpožděním.
Analýza archivovaných nebo historických dat v datovém jezeře
Dělení dat je dobře známá technika optimalizace přístupu k datům v datovýchjezerch Ukládejte dělené datové sady do hierarchických složek ve formátu /year=<year>/month=<month>/day=<day>, kde , yearkde month, a day jsou sloupce dělení. Tato struktura uchovává historická data logicky oddělená a umožňuje výpočetním modulům číst data podle potřeby pomocí výkonného filtrování, a ne číst celý adresář a všechny složky a soubory v rámci.
Dělená data umožňují rychlejší přístup, pokud dotazy filtrují predikáty, které porovnávají sloupce predikátu s hodnotou.
Koncový bod analýzy SQL může snadno číst tento typ dat bez nutnosti konfigurace. Můžete například použít libovolnou aplikaci k archivaci dat do datového jezera, včetně SQL Serveru 2022 nebo spravované instance Azure SQL. Jakmile data rozdělíte do jezera pro účely archivace pomocí externích tabulek, koncový bod analýzy SQL může číst dělené tabulky Delta Lake jako tabulky SQL a umožnit vaší organizaci jejich analýzu. Tento přístup snižuje celkové náklady na vlastnictví, omezuje duplicitu dat a umožňuje scénáře pro zpracování velkých objemů dat, AI a další analytické scénáře.
K rychlému dotazování na předchozí verze dat můžete také použít dotazy na časové cestování . Cestování v čase je cenově nenáročná a efektivní možnost, jak pomocí dotazů T-SQL zjišťovat předchozí stavy dat. Pro SQL analytický endpoint v Lakehouse je cestování časem omezeno nastavením vakuové retence. Pokud chcete začít, přečtěte si téma Postupy: Dotazování pomocí časového cestování na úrovni příkazu.
Virtualizace dat prostředků infrastruktury pomocí klávesových zkratek
Ve Fabric umožňují pracovní prostory oddělit data na základě složitých obchodních, geografických nebo regulačních požadavků.
SQL analytický endpoint vám umožňuje ponechat data na místě a zároveň analyzovat data ve skladu nebo u jezera, dokonce i v jiných pracovních prostorech Fabric, díky plynulé virtualizaci. Každý jezerní dům ve Fabric ukládá data v OneLake.
Klávesové zkratky umožňují odkazovat na složky v libovolném umístění OneLake.
Každý sklad ve Fabric uchovává data o tabulkách v OneLake. Pokud je tabulka pouze pro připojování, data tabulky se v OneLake zpracovávají jako data Delta Lake. Zkratky vám umožní odkazovat na složky v jakémkoli OneLake, kde jsou tabulky skladu vystavené.
Sdílení a provádění dotazů napříč pracovními prostory
Zatímco pracovní prostory umožňují oddělit data na základě složitých obchodních, geografických nebo regulačních požadavků, někdy potřebujete usnadnit sdílení napříč těmito řádky pro konkrétní potřeby analýzy.
Lakehouse SQL analytics endpoint umožňuje snadné sdílení dat mezi odděleními a uživateli, kde si uživatel může přinést vlastní kapacitu a sklad. Pracovní prostory organizují oddělení, obchodní jednotky nebo analytické oblasti. Pomocí zkratek mohou uživatelé najít data z jakéhokoli skladu nebo jezera. Uživatelé můžou okamžitě provádět vlastní přizpůsobené analýzy ze stejných sdílených dat. Kromě podpory interního přeúčtování nákladů mezi odděleními a alokace využití představuje tento přístup podobu dat bez kopírování.
Koncový bod analýzy SQL umožňuje dotazování na libovolnou tabulku a snadné sdílení. Ovládací prvky můžete přidat pomocí rolí pracovního prostoru a rolí zabezpečení, abyste splnili další obchodní požadavky.
Pokud chcete povolit analýzu dat mezi pracovními prostory, postupujte takto:
- Vytvořte zástupce OneLake, který odkazuje na tabulku nebo složku v pracovním prostoru, k němuž máte přístup.
- Vyberte si jezerní dům nebo sklad, který obsahuje tabulku nebo složku Delta Lake, kterou chcete analyzovat. Když vyberete tabulku nebo složku, v jezerním domku se objeví zkratka.
- Přepněte na SQL analytický endpoint v lakehouse a najděte SQL tabulku, která má jméno odpovídající názvu zkratky. Tato tabulka SQL odkazuje na složku v jiném pracovním prostoru.
- Dotazujte tabulku SQL, která odkazuje na data v jiném pracovním prostoru. Tabulku můžete použít stejně jako jakoukoli jinou tabulku v koncovém bodu analýzy SQL. Tabulky, které odkazují na data v různých pracovních prostorech, můžete spojit.
Další informace o zabezpečení v koncovém bodu analýzy SQL najdete v tématu Zabezpečení OneLake pro koncové body analýzy SQL.
Note
Pokud se tabulka SQL nezobrazí okamžitě v koncovém bodu analýzy SQL, počkejte několik minut. Tabulka SQL, která odkazuje na data v jiném pracovním prostoru, se vytvoří se zpožděním.
Analýza dělených dat
Dělení dat je dobře známá technika optimalizace přístupu k datům v datovýchjezerch Datové sady rozdělené do oddílů ukládáte v hierarchické struktuře složek ve formátu /year=<year>/month=<month>/day=<day>, kde year, month a day jsou sloupce pro dělení. Dělené datové sady umožňují rychlejší přístup k datům, pokud dotazy používají predikáty, které filtrují data porovnáním sloupců predikátu s hodnotou.
Koncový bod analýzy SQL může představovat dělené datové sady Delta Lake jako tabulky SQL a umožňuje je analyzovat.
Další informace a příklady dotazování externích dat najdete v tématu Dotazování externích souborů Data Lake pomocí služby Fabric Data Warehouse nebo koncového bodu sql Analytics. Příklad a případ použití pro dotazování partitovaných souborů Parquet najdete v tématu Dotazování partitovaných dat.
Analyzujte data v jezerním domě, skladu nebo eventhouse
Hlavní stránky Lakehouse a Warehouse zahrnují endpoint Eventhouse jako součást nabídky Analyzovat data s. Koncový bod Eventhouse poskytuje prostředí pro dotazy poháněné Eventhousem přímo na datech z Lakehouse a Warehouse, bez duplikace dat nebo manuální synchronizace.
Když povolíte koncový bod Eventhouse, Eventhouse a KQL databáze se automaticky vytvoří jako podřízené položky zdrojového Lakehouse nebo skladu, přičemž synchronizace schématu je zpracovávána na pozadí. Koncový bod vždy odráží aktuální schéma zdrojových dat a umožňuje téměř v reálném čase analytický přístup.
Díky této integraci je Eventhouse přirozeným rozšířením zdroje dat, nikoli samostatným systémem, který potřebujete nastavit a spravovat. Další informace o koncovém bodu Eventhouse najdete v článku Povolení koncového bodu Eventhouse pro Lakehouse a Warehouse.
Související obsah
- Co je jezerní dům v Fabricu?
- Průvodce rozhodováním o Fabric: Vyberte si mezi skladem a domem u jezera
- Přineste svá data do OneLake s lakehouse
- Power BI sémantické modely ve Fabric
- Možnosti, jak dostat data do jezerního domu ve Fabric
- Jak kopírovat data pomocí aktivity kopírování
- Přesouvej data z Azure SQL DB do lakehouse pomocí kopírovacího asistenta
- Propojení s datovými sklady ve Fabric
- Koncový bod analýzy SQL lakehouse
- Dotazujte se na SQL analytický endpoint nebo sklad ve Fabric