Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Datursprung visar var data i Azure Databricks kommer från och vart de går: vilka frågor och filer som fyller en tabell med data, vilka jobb och notebooks som omvandlar den och vilka dashboards som använder resultaten.
Unity Catalog fångar automatiskt datalinjer för frågor som körs i Azure Databricks, ända ner till kolumnnivå, och sammanställer dem över alla arbetsytor som är anslutna till metastoret. Datahärkomst i Unity Catalog gör att du kan:
- Utför effektanalys: Identifiera de underordnade tabeller, jobb och instrumentpaneler som är beroende av den innan du ändrar eller tar bort en tabell eller kolumn.
- Undersök grundorsakerna: När en rapport längre nedströms visar oväntade resultat, spåra uppströmskällor för att hitta var data började avvika.
- Spåra känsligt dataflöde: För efterlevnadsgranskningar, se var reglerade data kommer, hur de transformeras och vilka underordnade tillgångar som använder dem.
- Förstå beroenden mellan team: Identifiera vilka team som äger de överordnade källor som du förlitar dig på eller vilka team som använder dina tabeller.
Extern härkomst utökar ursprungsdiagrammet bortom Azure Databricks. Registrera överordnade källor som Salesforce eller MySQL och underordnade verktyg som Tableau eller Power BI som externa tillgångar i Unity Catalog, och de visas tillsammans med dina Unity Catalog-tabeller i en enda graf. Se Extern härkomst.
Följande bild är ett exempel på ett härstamningsdiagram. Noder kan representera tabeller och vyer, ML-modellversioner, externa tillgångar och filsökvägar.
Krav
Så här spårar du datahärkomst med Unity Catalog.
- Tabeller måste registreras i ett Unity Catalog-metaarkiv.
- Externa tillgångar (de som inte är registrerade i Unity Catalog-metaarkivet) måste läggas till som externa metadataobjekt i Unity Catalog, konfigurerade för att ha relationer med andra skyddsbara objekt registrerade i unity catalog-metaarkivet. Se Extern härkomst.
- Frågor måste använda sig av Spark DataFrame (till exempel Spark SQL-funktioner som returnerar en DataFrame) eller Databricks SQL-gränssnitt som notebooks eller SQL-frågeredigeraren.
Så här visar du data stam:
- Du måste ha minst privilegium
BROWSEför den överordnade katalogen för tabellen eller vyn. Den överordnade katalogen måste också vara tillgänglig från arbetsytan. Se Bindning av arbetsytekatalog. - För notebook-filer, jobb eller instrumentpaneler måste du ha behörighet för dessa objekt enligt definitionen i inställningarna för åtkomstkontroll på arbetsytan. Mer information finns i Behörigheter.
- För en Unity Catalog-aktiverad pipeline måste du ha CAN VIEW-behörighet för pipelinen.
Beräkningskrav:
- Släktskaps- eller härstamningsspårning av strömning mellan Delta-tabeller kräver Databricks Runtime 11.3 LTS eller senare.
- Kolumnspårning för Lakeflow-pipelinearbetsbelastningar kräver Databricks Runtime 13.3 LTS eller senare.
Nätverkskrav:
- Du kan behöva uppdatera dina regler för utgående brandvägg för att tillåta anslutning till Event Hubs-slutpunkten i Azure Databricks kontrollplanet. Detta gäller vanligtvis om din Azure Databricks arbetsyta distribueras i ditt eget virtuella nätverk (kallas även VNet-inmatning). Information om hur du hämtar Event Hubs-slutpunkten för din arbetsyteregion finns i IP-adresser för metaarkiv, bloblagring för artefakter, systemtabeller, loggbloblagring och Event Hubs-slutpunkt. Information om hur du konfigurerar användardefinierade vägar (UDR) för Azure Databricks finns i Användardefinierade väginställningar för Azure Databricks.
Visa härkomst i Katalogutforskaren
Så här använder du Katalogutforskaren för att visa tabellursprung:
På din Azure Databricks arbetsyta klickar du på
Catalog.
Sök eller bläddra efter tabellen.
Välj fliken Ursprung . Ursprungspanelen visas och visar relaterade tabeller.
Om du vill visa ett interaktivt diagram över data härstamningen klickar du på Visa ursprungsdiagram.
Som standard visas en nivå i diagrammet.
Klicka på ikonen på en nod för att visa fler anslutningar om de är tillgängliga.Klicka på ikonen på en anslutningskant i ursprungsdiagrammet för att öppna panelen Ursprungsinformation .
Panelen Ursprungsinformation visar information om anslutningen, inklusive käll- och måltabeller.
Om du vill visa en tillgång som är associerad med en tabell väljer du tillgången i panelen Ursprungsinformation . Du kan filtrera efter anteckningsböcker, jobb, pipelines och frågor.
Om du vill visa ursprung på kolumnnivå klickar du på en kolumn i diagrammet för att visa länkar till relaterade kolumner. Om du till exempel klickar på
revenuekolumnen i det här exempeldiagrammet visas de överordnade kolumner som kolumnen härleddes från:
Visa jobbets ursprung
Om du vill visa jobbets ursprung går du till tabellens fliken Ursprung , väljer Jobb och väljer Nedströms. Jobbnamnet visas under Jobbnamn som en användare av tabellen.
Visa instrumentpanelens ursprung
Om du vill visa instrumentpanelens härkomst går du till tabellens flik Ursprung och klickar på Instrumentpaneler. Instrumentpanelen visas under Instrumentpanelens namn som konsument av tabellen.
Hämta ursprung med Genie Code
Genie Code kan besvara ursprungsfrågor på naturligt språk.
Så här hämtar du ursprungsinformation med Genie Code:
- I sidofältet på arbetsytan klickar du på
Katalog.
- Bläddra eller sök efter katalogen, klicka på katalognamnet och klicka sedan på
Genie Code-ikonen i det övre högra hörnet.
- I Genie Code-prompten skriver du:
-
/getTableLineagesför att visa uppströms- och nedströmsberoenden. -
/getTableInsightsför att få åtkomst till metadatadrivna insikter, till exempel användaraktivitet och frågemönster.
-
Dessa frågor gör det möjligt för Genie Code att svara på frågor som "visa mig underordnade ursprung" eller "vem som frågar den här tabellen oftast".
Fråga ursprung med systemtabeller
Du kan använda ursprungssystemtabellerna för att programmatiskt fråga efter ursprungsdata. Detaljerade anvisningar finns i Referens för systemtabeller och Referens för härkomstsystemtabeller.
Permissions
Härstamningsdiagram delar samma behörighetsmodell som Unity Catalog. Tabeller och andra dataobjekt som registrerats i Unity Catalog-metaarkivet är endast synliga för användare som har minst BROWSE behörigheter för dessa objekt. Om en användare inte har BROWSE eller SELECT behörighet på en tabell kan de inte utforska dess ursprung.
Datalinjering aggregeras över alla arbetsytor som är kopplade till ett Unity Catalog-metastore, så datalinjering som registreras i en arbetsyta är synlig i alla andra arbetsytor som delar det metastoret, så länge användaren har tillräckliga behörigheter för objektet. Detaljerad information om objekt på arbetsytenivå, som anteckningsböcker och instrumentpaneler, i andra arbetsytor döljs. Se Begränsningar.
Kör till exempel följande kommandon för userA:
GRANT USE SCHEMA on lineage_data.lineagedemo to `userA@company.com`;
GRANT SELECT on lineage_data.lineagedemo.menu to `userA@company.com`;
När userA tittar på härkomstdiagrammet för tabellen lineage_data.lineagedemo.menu ser de tabellen menu. De kan inte se information om associerade tabeller, till exempel den underordnade lineage_data.lineagedemo.dinner tabellen. Tabellen dinner visas som en masked nod till userAoch userA kan inte expandera diagrammet för att visa underordnade tabeller från tabeller som de inte har behörighet att komma åt.
Om du kör följande kommando för att ge behörigheten BROWSE till userBkan användaren visa ursprungsdiagrammet för valfri tabell i lineage_data schemat:
GRANT BROWSE on lineage_data to `userB@company.com`;
Lineage-användare måste också ha specifika behörigheter för att kunna visa arbetsyteobjekt som notebooks, jobb och instrumentpaneler. Detaljerad information om dessa objekt visas endast på arbetsytan där de skapades.
Mer information om hur du hanterar åtkomst till skyddsbara objekt i Unity Catalog finns i Hantera privilegier i Unity Catalog. Mer information om hur du hanterar åtkomst till arbetsyteobjekt som notebook-filer, jobb och instrumentpaneler finns i Åtkomstkontrollistor.
Retention
Ursprungsdata som visas i Katalogutforskaren behålls på obestämd tid. Alla ursprungsdata som samlas in efter den 1 september 2024 är tillgängliga. För metastores som skapats efter det datumet har Catalog Explorer alternativet All time i listrutan för tidsintervall för dataursprung. För äldre metaarkiv innehåller listrutan alternativet Alla tillgängliga som börjar från 1 september 2024. Standardvalet är 1 år.
Lineage-systemtabeller (system.access.table_lineage och system.access.column_lineage) lagrar ett rullande datafönster på ett år. Se Referens för härkomstsystemtabeller.
Limitations
Data härkomst har följande begränsningar. Dessa begränsningar gäller även för ursprungssystemtabeller:
- Härkomstdata som samlats in före den 1 september 2024 är inte tillgängliga.
- Jobb som använder Jobs API-begäran
runs submiteller uppgiftstypenspark submitär inte tillgängliga i ursprungsvyer. Härledning på tabell- och kolumnnivå samlas fortfarande in för dessa processer, men länken till jobbkörningen fångas inte upp. - Ursprung bevaras inte för omdöpta kataloger, scheman, tabeller, vyer eller kolumner.
- Om du använder kontrollpunkter för Spark SQL-dataset sparas inte datahistoriken.
- Unity Catalog samlar in ursprung från Lakeflow-pipelines i de flesta fall, men täckningen är ofullständig för pipelines som använder PRIVATE-tabeller.
- Elastiska distribuerade datamängder (RDD:er) ingår inte i släktträd.
- Globala temporära vyer fångas inte upp i härkomsten.
- Transaktioner genererar härledning när varje läsning och skrivning sker. Linjehändelser kvarstår även om transaktionen ångras.
- Tabeller under
system.information_schemafångas inte upp i datahärkomsten. - Unity Catalog samlar in härledning till kolumnnivån i så stor utsträckning som möjligt. Det finns dock vissa fall då det inte går att samla in ursprung på kolumnnivå. Dessa inkluderar:
Det går inte att avbilda kolumn härkomsten om källan eller målet refereras till som sökväg (exempel:
select * from delta."s3://<bucket>/<path>"). Kolumnhärkomst stöds endast när både källan och målet refereras till med tabellnamnet (exempel:select * from <catalog>.<schema>.<table>).Användning av användardefinierade funktioner (UDF: er), som kan dölja mappningen mellan käll- och målkolumner.
Ytterligare resurser
- Demo: Unity Catalog - Datalinjage
- ML-modellursprung: Information om hur du spårar ursprung för en maskininlärningsmodell finns i Spåra dataursprunget för en modell i Unity Catalog.
- Tabellinsikter: Fliken Insikter i Katalogutforskaren visar användningstrender för en tabell: frågemönster, toppanvändare och instrumentpaneler som läser den. Se Visa tabellinsikter och popularitet.