Ursprung i Unity-katalogen

Datursprung visar var data i Azure Databricks kommer från och vart de går: vilka frågor och filer som fyller en tabell med data, vilka jobb och notebooks som omvandlar den och vilka dashboards som använder resultaten.

Unity Catalog fångar automatiskt datalinjer för frågor som körs i Azure Databricks, ända ner till kolumnnivå, och sammanställer dem över alla arbetsytor som är anslutna till metastoret. Datahärkomst i Unity Catalog gör att du kan:

  • Utför effektanalys: Identifiera de underordnade tabeller, jobb och instrumentpaneler som är beroende av den innan du ändrar eller tar bort en tabell eller kolumn.
  • Undersök grundorsakerna: När en rapport längre nedströms visar oväntade resultat, spåra uppströmskällor för att hitta var data började avvika.
  • Spåra känsligt dataflöde: För efterlevnadsgranskningar, se var reglerade data kommer, hur de transformeras och vilka underordnade tillgångar som använder dem.
  • Förstå beroenden mellan team: Identifiera vilka team som äger de överordnade källor som du förlitar dig på eller vilka team som använder dina tabeller.

Extern härkomst utökar ursprungsdiagrammet bortom Azure Databricks. Registrera överordnade källor som Salesforce eller MySQL och underordnade verktyg som Tableau eller Power BI som externa tillgångar i Unity Catalog, och de visas tillsammans med dina Unity Catalog-tabeller i en enda graf. Se Extern härkomst.

Följande bild är ett exempel på ett härstamningsdiagram. Noder kan representera tabeller och vyer, ML-modellversioner, externa tillgångar och filsökvägar.

Släktlinjeöversikt.

Krav

Så här spårar du datahärkomst med Unity Catalog.

  • Tabeller måste registreras i ett Unity Catalog-metaarkiv.
  • Externa tillgångar (de som inte är registrerade i Unity Catalog-metaarkivet) måste läggas till som externa metadataobjekt i Unity Catalog, konfigurerade för att ha relationer med andra skyddsbara objekt registrerade i unity catalog-metaarkivet. Se Extern härkomst.
  • Frågor måste använda sig av Spark DataFrame (till exempel Spark SQL-funktioner som returnerar en DataFrame) eller Databricks SQL-gränssnitt som notebooks eller SQL-frågeredigeraren.

Så här visar du data stam:

  • Du måste ha minst privilegium BROWSE för den överordnade katalogen för tabellen eller vyn. Den överordnade katalogen måste också vara tillgänglig från arbetsytan. Se Bindning av arbetsytekatalog.
  • För notebook-filer, jobb eller instrumentpaneler måste du ha behörighet för dessa objekt enligt definitionen i inställningarna för åtkomstkontroll på arbetsytan. Mer information finns i Behörigheter.
  • För en Unity Catalog-aktiverad pipeline måste du ha CAN VIEW-behörighet för pipelinen.

Beräkningskrav:

  • Släktskaps- eller härstamningsspårning av strömning mellan Delta-tabeller kräver Databricks Runtime 11.3 LTS eller senare.
  • Kolumnspårning för Lakeflow-pipelinearbetsbelastningar kräver Databricks Runtime 13.3 LTS eller senare.

Nätverkskrav:

  • Du kan behöva uppdatera dina regler för utgående brandvägg för att tillåta anslutning till Event Hubs-slutpunkten i Azure Databricks kontrollplanet. Detta gäller vanligtvis om din Azure Databricks arbetsyta distribueras i ditt eget virtuella nätverk (kallas även VNet-inmatning). Information om hur du hämtar Event Hubs-slutpunkten för din arbetsyteregion finns i IP-adresser för metaarkiv, bloblagring för artefakter, systemtabeller, loggbloblagring och Event Hubs-slutpunkt. Information om hur du konfigurerar användardefinierade vägar (UDR) för Azure Databricks finns i Användardefinierade väginställningar för Azure Databricks.

Visa härkomst i Katalogutforskaren

Så här använder du Katalogutforskaren för att visa tabellursprung:

  1. På din Azure Databricks arbetsyta klickar du på Data icon.Catalog.

  2. Sök eller bläddra efter tabellen.

  3. Välj fliken Ursprung . Ursprungspanelen visas och visar relaterade tabeller.

  4. Om du vill visa ett interaktivt diagram över data härstamningen klickar du på Visa ursprungsdiagram.

    Som standard visas en nivå i diagrammet. Plusteckenikon Klicka på ikonen på en nod för att visa fler anslutningar om de är tillgängliga.

  5. Klicka på ikonen på en anslutningskant i ursprungsdiagrammet för att öppna panelen Ursprungsinformation .

    Panelen Ursprungsinformation visar information om anslutningen, inklusive käll- och måltabeller.

    Härstamningsdiagram.

  6. Om du vill visa en tillgång som är associerad med en tabell väljer du tillgången i panelen Ursprungsinformation . Du kan filtrera efter anteckningsböcker, jobb, pipelines och frågor.

  7. Om du vill visa ursprung på kolumnnivå klickar du på en kolumn i diagrammet för att visa länkar till relaterade kolumner. Om du till exempel klickar på revenue kolumnen i det här exempeldiagrammet visas de överordnade kolumner som kolumnen härleddes från:

    Fullständig kolumnhistorik för menyn.

Visa jobbets ursprung

Om du vill visa jobbets ursprung går du till tabellens fliken Ursprung , väljer Jobb och väljer Nedströms. Jobbnamnet visas under Jobbnamn som en användare av tabellen.

Visa instrumentpanelens ursprung

Om du vill visa instrumentpanelens härkomst går du till tabellens flik Ursprung och klickar på Instrumentpaneler. Instrumentpanelen visas under Instrumentpanelens namn som konsument av tabellen.

Hämta ursprung med Genie Code

Genie Code kan besvara ursprungsfrågor på naturligt språk.

Så här hämtar du ursprungsinformation med Genie Code:

  1. I sidofältet på arbetsytan klickar du på dataikonen.Katalog.
  2. Bläddra eller sök efter katalogen, klicka på katalognamnet och klicka sedan på färgikonen Genie-kod. Genie Code-ikonen i det övre högra hörnet.
  3. I Genie Code-prompten skriver du:
    • /getTableLineages för att visa uppströms- och nedströmsberoenden.
    • /getTableInsights för att få åtkomst till metadatadrivna insikter, till exempel användaraktivitet och frågemönster.

Dessa frågor gör det möjligt för Genie Code att svara på frågor som "visa mig underordnade ursprung" eller "vem som frågar den här tabellen oftast".

Genie Code tillhandahåller tabellursprung och insikter.

Fråga ursprung med systemtabeller

Du kan använda ursprungssystemtabellerna för att programmatiskt fråga efter ursprungsdata. Detaljerade anvisningar finns i Referens för systemtabeller och Referens för härkomstsystemtabeller.

Permissions

Härstamningsdiagram delar samma behörighetsmodell som Unity Catalog. Tabeller och andra dataobjekt som registrerats i Unity Catalog-metaarkivet är endast synliga för användare som har minst BROWSE behörigheter för dessa objekt. Om en användare inte har BROWSE eller SELECT behörighet på en tabell kan de inte utforska dess ursprung.

Datalinjering aggregeras över alla arbetsytor som är kopplade till ett Unity Catalog-metastore, så datalinjering som registreras i en arbetsyta är synlig i alla andra arbetsytor som delar det metastoret, så länge användaren har tillräckliga behörigheter för objektet. Detaljerad information om objekt på arbetsytenivå, som anteckningsböcker och instrumentpaneler, i andra arbetsytor döljs. Se Begränsningar.

Kör till exempel följande kommandon för userA:

GRANT USE SCHEMA on lineage_data.lineagedemo to `userA@company.com`;
GRANT SELECT on lineage_data.lineagedemo.menu to `userA@company.com`;

När userA tittar på härkomstdiagrammet för tabellen lineage_data.lineagedemo.menu ser de tabellen menu. De kan inte se information om associerade tabeller, till exempel den underordnade lineage_data.lineagedemo.dinner tabellen. Tabellen dinner visas som en masked nod till userAoch userA kan inte expandera diagrammet för att visa underordnade tabeller från tabeller som de inte har behörighet att komma åt.

Om du kör följande kommando för att ge behörigheten BROWSE till userBkan användaren visa ursprungsdiagrammet för valfri tabell i lineage_data schemat:

GRANT BROWSE on lineage_data to `userB@company.com`;

Lineage-användare måste också ha specifika behörigheter för att kunna visa arbetsyteobjekt som notebooks, jobb och instrumentpaneler. Detaljerad information om dessa objekt visas endast på arbetsytan där de skapades.

Mer information om hur du hanterar åtkomst till skyddsbara objekt i Unity Catalog finns i Hantera privilegier i Unity Catalog. Mer information om hur du hanterar åtkomst till arbetsyteobjekt som notebook-filer, jobb och instrumentpaneler finns i Åtkomstkontrollistor.

Retention

Ursprungsdata som visas i Katalogutforskaren behålls på obestämd tid. Alla ursprungsdata som samlas in efter den 1 september 2024 är tillgängliga. För metastores som skapats efter det datumet har Catalog Explorer alternativet All time i listrutan för tidsintervall för dataursprung. För äldre metaarkiv innehåller listrutan alternativet Alla tillgängliga som börjar från 1 september 2024. Standardvalet är 1 år.

Lineage-systemtabeller (system.access.table_lineage och system.access.column_lineage) lagrar ett rullande datafönster på ett år. Se Referens för härkomstsystemtabeller.

Limitations

Data härkomst har följande begränsningar. Dessa begränsningar gäller även för ursprungssystemtabeller:

  • Härkomstdata som samlats in före den 1 september 2024 är inte tillgängliga.
  • Jobb som använder Jobs API-begäran runs submit eller uppgiftstypen spark submit är inte tillgängliga i ursprungsvyer. Härledning på tabell- och kolumnnivå samlas fortfarande in för dessa processer, men länken till jobbkörningen fångas inte upp.
  • Ursprung bevaras inte för omdöpta kataloger, scheman, tabeller, vyer eller kolumner.
  • Om du använder kontrollpunkter för Spark SQL-dataset sparas inte datahistoriken.
  • Unity Catalog samlar in ursprung från Lakeflow-pipelines i de flesta fall, men täckningen är ofullständig för pipelines som använder PRIVATE-tabeller.
  • Elastiska distribuerade datamängder (RDD:er) ingår inte i släktträd.
  • Globala temporära vyer fångas inte upp i härkomsten.
  • Transaktioner genererar härledning när varje läsning och skrivning sker. Linjehändelser kvarstår även om transaktionen ångras.
  • Tabeller under system.information_schema fångas inte upp i datahärkomsten.
  • Unity Catalog samlar in härledning till kolumnnivån i så stor utsträckning som möjligt. Det finns dock vissa fall då det inte går att samla in ursprung på kolumnnivå. Dessa inkluderar:
    • Det går inte att avbilda kolumn härkomsten om källan eller målet refereras till som sökväg (exempel: select * from delta."s3://<bucket>/<path>"). Kolumnhärkomst stöds endast när både källan och målet refereras till med tabellnamnet (exempel: select * from <catalog>.<schema>.<table>).

    • Användning av användardefinierade funktioner (UDF: er), som kan dölja mappningen mellan käll- och målkolumner.

Ytterligare resurser