Övervakning av datakvalitet

Datakvalitetsövervakning hjälper dig att säkerställa kvaliteten på alla dina datatillgångar i Unity Catalog. Övervakning av datakvalitet innehåller följande funktioner:

  • Avvikelseidentifiering. Avvikelseidentifiering möjliggör skalbar datakvalitetsövervakning med ett klick. Den övervakar alla tabeller i ett schema med intelligent genomsökning som prioriterar viktiga tabeller och hoppar över lågpåverkande tabeller. Databricks utvärderar automatiskt datakvaliteten genom att analysera historiska datamönster för att utvärdera varje tabells färskhet och fullständighet. Se Avvikelseidentifiering.
  • Dataprofilering. Dataprofilering ger sammanfattningsstatistik över data i en tabell. Du kan också använda den för att spåra prestanda för AI-appar, maskininlärningsmodeller och modellbetjäningsslutpunkter genom att övervaka slutsatsdragningstabeller som innehåller modellindata och förutsägelser. Se Dataprofilering.

Dataprofilering kallades tidigare Lakehouse Monitoring.

Konto- och metaarkivadministratörer kan granska hälsotillståndet för datakvalitet, till exempel procentandelen felfria tabeller, på sidan Data i Styrningshubben.

Varför ska du använda avvikelseidentifiering?

För att få användbara insikter från dina data måste du ha förtroende för kvaliteten på dina data. Anomalidetektion övervakar aktiverade tabeller för aktualitet och fullständighet.

Färskhet avser hur nyligen en tabell har uppdaterats. Avvikelsedetektering analyserar historiken av incheckningar till en tabell och skapar en tabellspecifik modell för att förutsäga när nästa incheckning sker. Om en incheckning är ovanligt sent markeras tabellen som inaktuell.

Fullständighet avser antalet rader som förväntas skrivas till tabellen under de senaste 24 timmarna. Avvikelseidentifiering analyserar det historiska radantalet och förutsäger ett intervall med förväntat antal rader baserat på dessa data. Om antalet rader som har bekräftats under de senaste 24 timmarna är mindre än den nedre gränsen för det här intervallet, markeras en tabell som ofullständig.

Varför ska du använda dataprofilering?

Dataprofilering ger kvantitativa mått som hjälper dig att spåra och bekräfta datakvaliteten och konsekvensen över tiden. Dataprofilering samlar in historiska mått för en tabells datadistribution eller motsvarande modells prestanda, som kan användas för snabbsammanfattningsstatistik. Du kan använda dessa mått för att övervaka en tabell och skicka aviseringar om ändringar.

Dataprofilering hjälper dig att besvara frågor som följande:

  • Hur ser dataintegriteten ut och hur ändras den över tid? Till exempel, vad är fraktionen av null- eller nollvärden i aktuella data och har den ökat?
  • Hur ser den statistiska fördelningen av data ut och hur ändras den över tid? Vad är till exempel den 90:e percentilen i en numerisk kolumn? Eller vad är fördelningen av värden i en kategorisk kolumn, och hur skiljer det sig från igår?
  • Finns det en avvikelse mellan aktuella data och en känd baslinje, eller mellan efterföljande tidsfönster för data?
  • Hur ser den statistiska fördelningen eller avvikelsen för en delmängd eller sektor av data ut?
  • Hur skiftar ML-modellindata och förutsägelser över tid?
  • Hur trendar modellprestanda över tid? Presterar modellversion A bättre än version B?

Dessutom kan du med dataprofilering styra tidskornigheten för observationer och konfigurera anpassade mått.

Övervakningen av datakvaliteten ändrar inte några tabeller som övervakas och lägger inte heller till omkostnader för jobb som fyller i dessa tabeller.

Cost

Övervakning av datakvalitet körs på serverlösa beräkningar och faktureras som serverlösa DBU:er inom faktureringsprodukten DATA_QUALITY_MONITORING. Kostnaden beror på antalet och storleken på de övervakade tabellerna och hur ofta de utvärderas. För avvikelseidentifiering hjälper intelligent genomsökning till att styra kostnaderna genom att prioritera viktiga tabeller och hoppa över lågpåverkande tabeller.

Information om hur du visar och spårar dina kostnader för datakvalitetsövervakning finns i Visa kostnader för övervakning av datakvalitet.