Wat zijn pipelines?

Een pipeline is de belangrijkste eenheid voor de ontwikkeling en uitvoering van Apache Spark™ Declarative Pipelines (SDP) in Lakeflow. Een pijplijn is een verzameling broncodebestanden en een configuratie. De bronbestanden definiëren datasets (streaming-tabellen, gematerialiseerde weergaven en weergaven), samen met de query's en datastromen waarmee deze worden geproduceerd. De configuratie geeft aan hoe de pijplijn wordt uitgevoerd en waar gegevens worden opgeslagen.

Een pipeline is de container voor de flows, streamingtabellen, gematerialiseerde weergaven en sinks die u definieert. Terwijl de pijplijn wordt uitgevoerd, worden de afhankelijkheden tussen deze objecten geanalyseerd en wordt de volgorde van uitvoering en parallelle uitvoering automatisch ingedeeld. Zie Wat zijn Lakeflow-pijplijnen? voor meer informatie over de objecten die een pijplijn bevat. Zie Apache Spark-declaratieve pijplijnen voor een vergelijking van Lakeflow-pijplijnen en Apache Spark-declaratieve™ pijplijnen.

Broncode van pijplijn

De broncode van de pijplijn is geschreven in Python of SQL. Eén pijplijn kan Python en SQL-bronbestanden combineren, maar elk bestand kan slechts één taal bevatten. Omdat de pijplijn afhankelijkheden van gegevenssets in alle bronbestanden analyseert, kunt u de broncode in elke volgorde indelen in alle bestanden.

Zie Pijplijncode ontwikkelen met Python en Code ontwikkelen voor Lakeflow-pijplijnen met SQL voor taalspecifieke richtlijnen.

Pijplijngrafiek

Pijplijnen stellen automatisch afhankelijkheden tussen gegevenssets uit en rangschikken ze in een gerichte acyclische grafiek (DAG). De grafiek bepaalt de evaluatievolgorde: upstream-gegevenssets worden berekend vóór downstreamgegevenssets. U kunt de pijplijngrafiek bekijken en ermee werken in de Lakeflow Pipelines Editor.

Pijplijnupdates

Een pijplijnupdate berekent de huidige status van elke gegevensset door:

  1. Een cluster starten met de juiste configuratie.
  2. Bronbestanden analyseren en de afhankelijkheidsgrafiek bouwen.
  3. Het berekenen of het incrementeel bijwerken van elke gegevensverzameling in volgorde van afhankelijkheid.

Pijplijnen worden uitgevoerd in twee modi:

  • Geactiveerd: de pijplijn wordt één keer uitgevoerd en stopt wanneer alle datasets actueel zijn.
  • Doorlopend: De pijplijn blijft draaien en verwerkt nieuwe gegevens zodra die binnenkomt.

Updates die u interactief vanuit de editor activeert, zijn geoptimaliseerd voor snelle iteraties, waarbij het cluster wordt hergebruikt en automatische herhalingspogingen worden uitgeschakeld. Zie Gedrag van updateuitvoering.

Pijplijntypen

De lijst Jobs & Pipelines omvat meer dan alleen pijplijnen die met Lakeflow Pipelines zijn gemaakt. Azure Databricks voert meerdere verschillende typen pijplijnen uit, en in de lijst Jobs & Pipelines en op de pagina voor pijplijnbewaking wordt elk type aangeduid, zodat u kunt zien wat wat is. De volgende tabel wijst elk pijplijntype toe aan de pipeline_type waarde die is vastgelegd in het gebeurtenislogboek:

Typ Jobs & Pipelines pipeline_type in gebeurtenislogboek Description
ETL WORKSPACE Een Lakeflow-pijplijn. Zie Spark Declarative Pipelines.
Ingestie MANAGED_INGESTION Een beheerde opnamepijplijn die is gemaakt met Lakeflow Connect. Zie Managed connectors in Lakeflow Connect.
MV/ST DBSQL Een zelfstandige pijplijn. Zie zelfstandige pijplijnen.
Databasetabelsynchronisatie DATABASE_TABLE_SYNC Een pijplijn waarmee een tabel wordt gesynchroniseerd met een Lakebase-database. Zie Bedien lakehouse-gegevens met gesynchroniseerde tabellen (Lakebase beschikbaar).

Zelfstandige pijplijnen

U kunt streamingtabellen en gerealiseerde weergaven buiten een Lakeflow-pijplijn maken en beheren als zelfstandige pijplijnen. U kunt Databricks SQL of Python gebruiken om zelfstandige streamingtabellen en gerealiseerde weergaven te maken en vernieuwen. Ze worden uitgevoerd op dezelfde Azure Databricks infrastructuur en hebben dezelfde verwerkingssemantiek als in een Lakeflow-pijplijn. Wanneer u een zelfstandige streamingtabel of gerealiseerde weergave definieert, worden stromen impliciet gedefinieerd als onderdeel van de definitie van de streamingtabel of gerealiseerde weergave.

Zie Zelfstandige pijplijnen voor meer informatie.

Lakeflow Pijplijn-Editor

De Lakeflow Pipelines Editor is een IDE die is gebouwd voor pijplijnontwikkeling. Het biedt:

  • Een code-editor voor meerdere bestanden voor Python- en SQL-bronbestanden
  • Een browser voor pijplijnassets voor het ordenen van bestanden en mappen
  • Een interactieve pijplijngrafiek met afhankelijkheden en status van gegevensset
  • Voorbeelden van gegevens voor streaming-tabellen en gematerialiseerde weergaven
  • Uitvoeringsinzichten en een deelvenster met problemen met resultaten van de meest recente uitvoering
  • Selectieve uitvoering om afzonderlijke bestanden of tabellen te vernieuwen zonder de volledige pijplijn uit te voeren

De editor kan worden geïntegreerd met het Azure Databricks-platform en ondersteunt versiebeheer via Git-mappen. Zie ETL-pijplijnen ontwikkelen en fouten opsporen met de Lakeflow Pipelines Editor voor stapsgewijze instructies.

Aanvullende bronnen