Tietojen suoratoisto Lakehouseen ja käyttö SQL-analytiikan päätepisteen avulla

Tämä pikakäynnistys selittää, miten luodaan Spark-työn määritelmä, joka sisältää Python-koodia Spark Structured Streaming -toiminnolla, jotta data saadaan järvimajaan ja toimitetaan sitten SQL-analytiikkapäätepisteen kautta. Kun tämä pikakäynnistys on suoritettu, sinulla on jatkuvasti käynnissä oleva Spark-työmääritelmä, ja SQL-analytiikan päätepiste voi tarkastella saapuvaa dataa.

Python-komentosarjan luominen

Seuraavan Python-komentosarjan avulla voit luoda suoratoisto-Delta-taulukon Lakehousessa Apache Sparkin avulla. Komentosarja lukee luotujen tietojen virran (yksi rivi sekunnissa) ja kirjoittaa sen liittämistilassa Delta-taulukkoon nimeltä streamingtable. Se tallentaa tiedot ja tarkistuspisteen tiedot määritettyyn lakehouse-järjestelmään.

  1. Käytä seuraavaa Python-koodia, joka käyttää Spark-jäsennettyä suoratoistoa tietojen noutamiseen Lakehouse-taulukosta.

    from pyspark.sql import SparkSession
    
    if __name__ == "__main__":
     # Start Spark session
     spark = SparkSession.builder \
         .appName("RateStreamToDelta") \
         .getOrCreate()
    
     # Table name used for logging
     tableName = "streamingtable"
    
     # Define Delta Lake storage path
     deltaTablePath = f"Tables/{tableName}"
    
     # Create a streaming DataFrame using the rate source
     df = spark.readStream \
         .format("rate") \
         .option("rowsPerSecond", 1) \
         .load()
    
     # Write the streaming data to Delta
     query = df.writeStream \
         .format("delta") \
         .outputMode("append") \
         .option("path", deltaTablePath) \
         .option("checkpointLocation", f"{deltaTablePath}/_checkpoint") \
         .start()
    
     # Keep the stream running
     query.awaitTermination()
    
  2. Tallenna komentosarja Python-tiedostona (.py) paikallisessa tietokoneessa.

Luo lakehouse

Voit luoda Lakehousen seuraavien vaiheiden avulla:

  1. Kirjaudu Fabric-portaaliin.

  2. Siirry haluamaasi työtilaan tai luo uusi tarvittaessa.

  3. Jos haluat luoda lakehousen, valitse työtilasta Uusi kohde ja valitse sitten avautuvasta paneelista Lakehouse .

    Näyttökuva, jossa näkyy uusi Lakehouse-valintaikkuna.

  4. Kirjoita lakehousen nimi ja valitse Luo.

Spark-työn määrityksen luominen

Käytä seuraavia vaiheita luodaksesi Spark-työn määritelmän:

  1. Valitse samasta työtilasta, jossa loit lakehousen, Uusi kohde.

  2. Valitse avautuvan paneelin Nouda tiedot -kohdassa Spark-työn määritys.

  3. Syötä Spark-työtehtävämäärittelysi nimi ja valitse Luo.

  4. Valitse Lataa ja valitse edellisessä vaiheessa luomasi Python-tiedosto.

  5. Valitse Lakehouse-viite-kohdasta luomasi lakehouse.

Aseta uudelleenyrittämiskäytäntö Spark-työn määrittelylle

Määritä Uudelleenyritysten käytäntö Spark-työmääritykselle seuraavien vaiheiden avulla:

  1. Valitse ylävalikosta Asetus-kuvake .

    Näyttökuva, jossa näkyy Spark Job Definition -asetuskuvake.

  2. Avaa Optimointi-välilehti ja aseta Yritä uudelleen -käytäntökäynnistimentilalle Käytössä.

    Näyttökuva, jossa näkyy Spark-työn määrityksen optimointi -välilehti.

  3. Määritä uudelleenyritysten enimmäismäärä tai valitse Salli rajoittamattomat yritykset.

  4. Määritä kunkin uudelleenyrityksen välinen aika ja valitse Käytä.

Note

Uudelleenyritysten käytännön määrityksen elinkaarirajoitus on 90 päivää. Kun uudelleenyritysten käytäntö on käytössä, työ käynnistetään uudelleen käytännön mukaisesti 90 päivän kuluessa. Tämän jakson jälkeen uudelleenyritysten käytäntö lakkaa automaattisesti toimimasta, ja työ lopetetaan. Käyttäjien on sen jälkeen käynnistettävä työ manuaalisesti uudelleen, jolloin uudelleenyritysten käytäntö otetaan uudelleen käyttöön.

Suorita ja valvo Spark-työn määrittelyä

  1. Valitse ylävalikosta Suorita-kuvake .

    Näyttökuva, jossa näkyy Spark-työn määrityksen suorituskuvake.

  2. Varmista, että Spark Job - määritys on lähetetty onnistuneesti ja että sen suorittaminen onnistui.

Tietojen tarkasteleminen SQL-analytiikan päätepisteen avulla

Kun komentosarja on suoritettu, lakehouseen luodaan taulukko nimeltä streamingtable, jossa on aikaleima- ja arvosarakkeet . Voit tarkastella tietoja SQL-analytiikan päätepisteen avulla:

  1. Työtilasta avaa järvimajasi.

  2. Vaihda SQL Analytics -päätepisteeseen oikeasta yläkulmasta.

  3. Laajenna vasemmassa siirtymisruudussa Rakenteet-dbo-taulukot >>, valitse streamingtable tietojen esikatselua varten.