Analytische gegevensverwerking verkennen

Voltooid

Analytische gegevensverwerking maakt doorgaans gebruik van alleen-leessystemen (of meestal-leessystemen) die grote hoeveelheden historische gegevens of bedrijfsstatistieken opslaan. Analyses kunnen worden gebaseerd op een momentopname van de gegevens op een bepaald moment, of een reeks momentopnamen.

De specifieke details voor een analyseverwerkingssysteem kunnen variëren tussen oplossingen, maar een algemene architectuur voor analyse op ondernemingsniveau ziet er als volgt uit:

Diagram met een analytische databasearchitectuur met de genummerde elementen die hieronder worden beschreven.

  1. Operationele gegevens worden geëxtraheerd, getransformeerd en geladen (ETL) in een data lake voor analyse, of eerst geëxtraheerd en geladen met transformaties die daarna worden toegepast, een patroon genaamd ELT dat gebruikelijk is in moderne lakehouses.

  2. Gegevens worden geladen in een schema van tabellen, meestal in een data lakehouse met tabellaire abstracties over bestanden in de data lake of een datawarehouse met een volledig relationele SQL-engine.

  3. Gegevens in het datawarehouse kunnen worden samengevoegd en geladen in een OLAP-model (Online Analytical Processing), dat tegenwoordig een semantisch model (en historisch een kubus) wordt genoemd. Geaggregeerde numerieke waarden (metingen) uit feitentabellen worden berekend voor snijpunten van dimensietabellen uit dimensietabellen. De omzet kan bijvoorbeeld worden opgeteld op datum, klant en product. Power BI semantische modellen zijn het meest voorkomende voorbeeld dat u zult ontmoeten.

  4. De gegevens in het data lake- en datawarehouse- en analytische model kunnen worden opgevraagd om rapporten, visualisaties en dashboards te produceren.

Data Lakes zijn gebruikelijk in grootschalige scenario's voor gegevensverwerking, waarbij een groot aantal op bestanden gebaseerde gegevens moet worden verzameld en geanalyseerd.

Datawarehouses zijn een tot stand gebrachte manier om gegevens op te slaan in een relationeel schema dat is geoptimaliseerd voor leesbewerkingen, met name query's ter ondersteuning van rapportage en gegevensvisualisatie.

Data Lakehouses zijn een recentere innovatie die de flexibele en schaalbare opslag van een data lake combineert met de relationele query's op semantiek van een datawarehouse. Het tabelschema vereist mogelijk enige denormalisatie van gegevens in een OLTP-gegevensbron (waarbij een aantal duplicaties worden ingevoerd om query's sneller uit te voeren).

Een OLAP-model (of semantisch model) is een geaggregeerd type gegevensopslag dat is geoptimaliseerd voor analytische workloads. Gegevensaggregaties bevinden zich in verschillende dimensies op verschillende niveaus, zodat u kunt in- en uitzoomen om aggregaties op meerdere hiërarchische niveaus weer te geven; Als u bijvoorbeeld de totale verkoop per regio, per plaats of voor een afzonderlijk adres wilt zoeken. Omdat de gegevens vooraf zijn samengevoegd, kunnen query's om de samenvattingen te retourneren die deze bevat, snel worden uitgevoerd.

Verschillende typen gebruikers kunnen gegevensanalysewerk uitvoeren in verschillende fasen van de algehele architectuur. Voorbeeld:

  • Gegevenswetenschappers werken mogelijk rechtstreeks met gegevensbestanden in een data lake om gegevens te verkennen en te modelleren.
  • Gegevensanalist s kunnen rechtstreeks in het datawarehouse query's uitvoeren op tabellen om complexe rapporten en visualisaties te produceren.
  • Zakelijke gebruikers kunnen vooraf samengevoegde gegevens in een analytisch model gebruiken in de vorm van rapporten of dashboards.

Moderne analyseplatforms

Azure biedt verschillende beheerde services die betrekking hebben op de volledige analysepijplijn, van het opnemen van onbewerkte gegevens tot interactieve rapporten. Twee 'all-in-one'-platforms brengen de meeste van deze mogelijkheden samen in één werkruimte. Microsoft Fabric en Azure Databricks zijn deze twee platforms; een derde service, Microsoft Purview, richt zich op gegevensbeheer in al uw bronnen. U hoeft nog niet bekend te zijn met een van deze services. De volgende beschrijvingen geven u een algemeen beeld van wat elke service doet.

Microsoft Fabric is een geïntegreerd SaaS-analyseplatform (Software as a Service) dat opslag-, data engineering-, datawarehousing- en rapportagemogelijkheden samenbrengt in één werkruimte. Azure Databricks is een cloudanalyseplatform dat is gebouwd voor grootschalige data engineering en data science, met behulp van Delta Lake- Parquet plus een transactielogboek dat versiebeheer en ACID-transacties mogelijk maakt, als standaardopslagindeling. Microsoft Purview biedt geïntegreerde gegevensbeveiliging, governance en naleving, zodat u gegevens in al uw gegevensbronnen kunt detecteren, classificeren, beveiligen en beheren.

Diagram met moderne analyseplatforms Microsoft Fabric, Azure Databricks en Microsoft Purview.

Data organiseren met de medallion-architectuur

Een gebruikelijk patroon voor het organiseren van gegevens in een lakehouse is de medallion-architectuur, die gebruikmaakt van drie lagen:

  • Brons: onbewerkte gegevens die zijn opgenomen as-is uit bronsystemen, zonder dat er transformaties zijn toegepast, waarbij de oorspronkelijke records voor herverwerking behouden blijven.
  • Zilver: opgeschoonde en conforme gegevens, waarbij duplicaten zijn verwijderd en gestandaardiseerde gegevenstypen.
  • Goud: geaggregeerde, zakelijke gegevens die zijn gemodelleerd voor specifieke gebruiksscenario's voor rapportage en analyse.

Diagram van een medallionarchitectuur.

Teams gebruiken dit patroon omdat er duidelijke kwaliteitsgrenzen worden gemaakt op elke laag en u kunt altijd gegevens van de oorspronkelijke Bronsrecords opnieuw verwerken als de vereisten veranderen.

Zowel Fabric als Databricks bevatten Copilot ervaringen waarmee u gegevens kunt verkennen met natuurlijke taal.