OneLake'i Azure Synapse Analytics ile tümleştirme

Azure Synapse, kurumsal veri ambarı ve Büyük Veri analizini bir araya getiren sınırsız bir analiz hizmetidir. Bu öğreticide, Azure Synapse Analytics kullanarak OneLake'e bağlanma gösterilmektedir.

Önkoşullar

Başlamadan önce aşağıdaki öğelere sahip olduğunuzdan emin olun:

  • Apache Spark havuzu oluşturabileceğiniz veya kullanabileceğiniz ve SQL betiklerini çalıştırabileceğiniz bir Azure Synapse çalışma alanına erişim.
  • Fabric'da bir göl evi erişimi.
  • Lakehouse Tables klasörünün veya sorgulamak istediğiniz tablonun ABFS yolu.

Apache Spark kullanarak Azure Synapse'dan veri yazma

Apache Spark'ı kullanarak Azure Synapse Analytics'dan OneLake'e örnek veriler yazmak için bu adımları izleyin.

  1. Azure Synapse çalışma alanınızı açın ve tercih ettiğiniz parametrelerle bir Apache Spark havuzu oluşturun.

    Apache Spark havuzu ekranında Yeni'nin seçileceği yeri gösteren ekran görüntüsü.

  2. Yeni bir Apache Spark not defteri oluşturun.

  3. Not defterini açın, dili PySpark (Python) olarak ayarlayın ve yeni oluşturduğunuz Spark havuzuna bağlayın.

  4. Ayrı bir sekmede Fabric lakehouse'unuza gidin ve en üst düzey Tablolar klasörünü bulun.

  5. Tablolar klasörüne sağ tıklayın ve Özellikler'i seçin.

    Lakehouse gezgininde Özellikler bölmesinin açılacağı yeri gösteren ekran görüntüsü.

  6. Özellikler bölmesinden ABFS yolunu kopyalayın.

    ABFS yolunun kopyalandığı yeri gösteren ekran görüntüsü.

  7. Azure Synapse not defterine geri dönerek ilk yeni kod hücresinde lakehouse yolunu belirtin. Bu yol, daha sonra örnek verileri yazdığınız göl evindeki Tablolar klasörünü gösterir. Hücreyi çalıştırın.

    # Replace the path below with the ABFS path to your lakehouse Tables folder. 
    oneLakePath = 'abfss://WorkspaceName@onelake.dfs.fabric.microsoft.com/LakehouseName.lakehouse/Tables'
    
  8. Yeni bir kod hücresinde, açık bir Azure veri kümesindeki verileri bir veri çerçevesine yükleyin. Bu veri kümesi, göl kutunuza yüklediğiniz veri kümesidir. Hücreyi çalıştırın.

    yellowTaxiDf = spark.read.parquet('wasbs://nyctlc@azureopendatastorage.blob.core.windows.net/yellow/puYear=2018/puMonth=2/*.parquet')
    display(yellowTaxiDf.limit(10))
    
  9. Yeni bir kod hücresinde verilerinizi filtreleyin, dönüştürün veya hazırlayın. Bu senaryoda daha hızlı yükleme yapmak, diğer veri kümeleriyle birleştirmek veya belirli sonuçlara göre filtreleme yapmak için veri kümenizi kırpabilirsiniz. Hücreyi çalıştırın.

    filteredTaxiDf = yellowTaxiDf.where(yellowTaxiDf.tripDistance>2).where(yellowTaxiDf.passengerCount==1)
    display(filteredTaxiDf.limit(10))
    
  10. Yeni bir kod hücresinde, OneLake yolunuzu kullanarak filtrelenmiş veri çerçevenizi Fabric lakehouse'unuzda yeni bir Delta-Parquet tablosuna yazın. Hücreyi çalıştırın.

    filteredTaxiDf.write.format("delta").mode("overwrite").save(oneLakePath + '/Taxi/')
    
  11. Son olarak, yeni bir kod hücresinde, OneLake'den yeni Delta tablosunu okuyarak verilerinizin başarıyla yazıldığını test edin. Hücreyi çalıştırın.

    lakehouseRead = spark.read.format('delta').load(oneLakePath + '/Taxi/')
    display(lakehouseRead.limit(10))
    

Tebrikler. Artık Azure Synapse Analytics Apache Spark kullanarak OneLake'te veri okuyabilir ve yazabilirsiniz.

SQL kullanarak Azure Synapse verilerini okuma

Azure Synapse Analytics'dan OneLake'ten veri okumak için SQL sunucusuz kullanmak için bu adımları izleyin.

  1. Fabric lakehouse'u açın ve Azure Synapse'ten sorgulamak istediğiniz bir tabloyu belirleyin.

  2. Tabloya sağ tıklayın ve Özellikler'i seçin.

  3. Tablonun ABFS yolunu kopyalayın.

    ABFS yolunun kopyalandığı yeri gösteren ekran görüntüsü.

  4. Azure Synapse Studio'da Azure Synapse çalışma alanınızı açın.

  5. Yeni bir SQL betiği oluşturun.

  6. SQL sorgu düzenleyicisinde aşağıdaki sorguyu girin ve yerine ABFS_PATH_HERE daha önce kopyaladığınız yolu girin.

    SELECT TOP 10 *
    FROM OPENROWSET(
    BULK 'ABFS_PATH_HERE',
    FORMAT = 'delta') as rows;
    
  7. Tablonuzun ilk 10 satırını görüntülemek için sorguyu çalıştırın.

Tebrikler. Artık Azure Synapse Analytics'de SQL sunucusuz kullanarak OneLake'den veri okuyabilirsiniz.

  • OneLake'i Azure Depolama Gezgini