Azure Machine Learning ile veri çözümleme

Tip

Microsoft Fabric Data Warehouse geleceğe hazır mimariye, yerleşik yapay zekaya ve yeni özelliklere sahip data lake foundation üzerinde kurumsal ölçekli ilişkisel bir ambardır. Veri ambarı konusunda yeniyseniz Fabric Data Warehouse ile başlayın. Mevcut özel SQL havuzu iş yükleri, veri bilimi, gerçek zamanlı analiz ve raporlama genelinde yeni özelliklere erişmek için Fabric yükseltilebilir.

Bu öğreticide tahmine dayalı bir makine öğrenmesi modeli oluşturmak için Azure Machine Learning tasarımcısı kullanılmaktadır. Model, Azure Synapse'te depolanan verileri temel alır. Öğreticinin senaryosu, bir müşterinin bisiklet satın alma olasılığını tahmin etmek ve böylece bisiklet mağazası Adventure Works'ün hedeflenen bir pazarlama kampanyası oluşturabilmesini sağlamaktır.

Önkoşullar

Bu öğreticide ilerleyebilmeniz için şunlar gereklidir:

  • AdventureWorksDW örnek verileriyle önceden yüklenmiş bir SQL havuzu. Bu SQL Havuzunu sağlamak için Create a SQL pool başlığına bakın ve örnek verileri yükleme seçeneğini seçin. Zaten bir veri ambarı varsa ancak örnek verileriniz yoksa, örnek verileri el ile yükleyebilirsiniz.
  • Bir Azure Machine Learning çalışma alanı. Yeni bir tane oluşturmak için bu öğreticiyi izleyin.

Verileri alma

Kullanılan veriler AdventureWorksDW'daki dbo.vTargetMail görünümündedir. Bu öğreticide Datastore kullanmak için veriler ilk olarak Azure Data Lake Storage hesabına aktarılır çünkü Azure Synapse şu anda veri kümelerini desteklememektedir. Azure Data Factory, kopyalama etkinliğini kullanarak verileri veri ambarından Azure Data Lake Storage'a aktarmak için kullanılabilir. İçeri aktarma için aşağıdaki sorguyu kullanın:

SELECT [CustomerKey]
  ,[GeographyKey]
  ,[CustomerAlternateKey]
  ,[MaritalStatus]
  ,[Gender]
  ,cast ([YearlyIncome] as int) as SalaryYear
  ,[TotalChildren]
  ,[NumberChildrenAtHome]
  ,[EnglishEducation]
  ,[EnglishOccupation]
  ,[HouseOwnerFlag]
  ,[NumberCarsOwned]
  ,[CommuteDistance]
  ,[Region]
  ,[Age]
  ,[BikeBuyer]
FROM [dbo].[vTargetMail]

Veriler Azure Data Lake Storage'da kullanılabildikten sonra Azure Machine Learning'deki Veri Depoları, Azure depolama hizmetlerine bağlanmak için kullanılır. Veri deposu ve karşılık gelen Veri Kümesi oluşturmak için aşağıdaki adımları izleyin:

  1. Azure Portal'dan Azure Machine Learning Stüdyosunu başlatın veya Azure Machine Learning Stüdyosunda oturum açın.

  2. Yönet bölümündeki sol bölmede Veri Depoları'nave ardından Yeni Veri Deposu'na tıklayın.

    Azure Machine Learning arabiriminin sol bölmesinin ekran görüntüsü

  3. Veri deposu için bir ad girin, türü 'Azure Blob Depolama' olarak seçin, konum ve kimlik bilgilerini sağlayın. Sonra, Oluştur’a tıklayın.

  4. Ardından, Varlıklar bölümündeki sol bölmede Veri Kümeleri'ne tıklayın. Veri deposundan seçeneğiyle Veri kümesi oluştur'u seçin.

  5. Veri kümesinin adını belirtin ve türü Tablolu olarak seçin. Ardından ileri gitmek için İleri'ye tıklayın.

  6. Veri deposu seçin veya oluşturun bölümünde Daha önce oluşturulmuş veri deposu seçeneğini belirleyin. Daha önce oluşturulan veri depolarını seçin. İleri'ye tıklayın ve yol ve dosya ayarlarını belirtin. Dosyalar bir sütun başlığı içeriyorsa sütun üst bilgisini belirttiğinizden emin olun.

  7. Son olarak, veri kümesini oluşturmak için Oluştur'a tıklayın.

Tasarımcının deneyini yapılandırma

Ardından tasarımcı yapılandırması için aşağıdaki adımları izleyin:

  1. Yazar bölümündeki sol bölmede Tasarımcı sekmesine tıklayın.

  2. Yeni bir işlem hattı oluşturmak için Kullanımı kolay önceden oluşturulmuş bileşenler'i seçin.

  3. Sağdaki ayarlar bölmesinde işlem hattının adını belirtin.

  4. Ayrıca, önceden sağlanan bir kümeye ayarlar düğmesinde denemenin tamamı için bir hedef işlem kümesi seçin. Ayarlar bölmesini kapatın.

Verileri içeri aktarma

  1. Arama kutusunun altındaki sol bölmede Veri kümeleri alt sekmesini seçin.

  2. Daha önce oluşturduğunuz veri kümesini tuvale sürükleyin.

    Tuvaldeki veri kümesi bileşeninin ekran görüntüsü.

Verileri temizleme

Verileri temizlemek için modelle ilgili olmayan sütunları bırakın. Aşağıdaki adımları izleyin:

  1. Sol bölmede Bileşenler alt sekmesini seçin.

  2. Veri Dönüştürme Manipülasyonu altında < bileşenini tuval üzerine sürükleyin. Bu bileşeni Veri Kümesi bileşenine bağlayın.

    Tuvaldeki sütun seçimi bileşeninin ekran görüntüsü.

  3. Özellikler bölmesini açmak için bileşene tıklayın. Hangi sütunları bırakmak istediğinizi belirtmek için Sütunu düzenle'ye tıklayın.

  4. Şu iki sütunu dışlayın: CustomerAlternateKey ve GeographyKey. Kaydet’e tıklayın

    Kaldırılan sütunları gösteren ekran görüntüsü.

Modeli oluşturma

Veriler 80-20 arasında bölünür: makine öğrenmesi modelini eğitmek için %80 ve modeli test etmek için %20. Bu ikili sınıflandırma sorununda "İki Sınıflı" algoritmalar kullanılır.

  1. Split Data bileşenini tuvale sürükleyin.

  2. Özellikler bölmesinde, ilk çıkış veri kümesindeki satırların kesir oranı için 0,8 girin.

    0,8'in bölme oranını gösteren ekran görüntüsü.

  3. İki Sınıflı Artırılmış Karar Ağacı bileşenini tuvale sürükleyin.

  4. Model Eğitme bileşenini tuvale sürükleyin. Girişleri, İki Sınıflı Artırılmış Karar Ağacı (ML algoritması) ve Veri Bölme (algoritmayı eğitmek için veriler) bileşenlerine bağlayarak belirtin.

  5. Modeli Eğit seçeneği için Özellikler bölmesindeki Etiket sütunu seçeneğinde Sütunu düzenle'yi seçin. Tahmin edilecek sütun olarak BikeBuyer sütununu seçin ve Kaydet'i seçin.

    BikeBuyer etiket sütununu gösteren ekran görüntüsü.

    İki Sınıflı Artırılmış Karar Ağacı ve Bölünmüş Veri bileşenlerine bağlı Modeli Eğit bileşenini gösteren ekran görüntüsü.

Modeli puanlama

Şimdi modelin test verileri üzerinde nasıl performans sergilediğini test edin. Hangisinin daha iyi performans sergilediğini görmek için iki farklı algoritma karşılaştırılır. Aşağıdaki adımları izleyin:

  1. Model Puan bileşenini tuvale sürükleyin ve Modeli Eğitme ile Verileri Bölme bileşenlerine bağlayın.

  2. İki Sınıflı Bayes Ortalama Algılayıcısı'nı deney tuvaline sürükleyin. İki Sınıflı Artırılmış Karar Ağacı ile karşılaştırıldığında bu algoritmanın performansını karşılaştıracaksınız.

  3. Tuvale Modeli Eğit ve Modeli Puanla bileşenlerini kopyalayıp yapıştırın.

  4. İki algoritmayı karşılaştırmak için Modeli Değerlendir bileşenini tuvale sürükleyin.

  5. İşlem hattı çalışmasını başlatmak için Gönder'e tıklayın.

    Tuvalde kalan tüm bileşenlerin ekran görüntüsü.

  6. Çalıştırma tamamlandıktan sonra Modeli Değerlendir bileşenine sağ tıklayın ve Değerlendirme sonuçlarını görselleştir'e tıklayın.

    Sonuçların ekran görüntüsü.

Sağlanan ölçümler ROC eğrisi, duyarlık yakalama diyagramı ve lift eğrisidir. İlk modelin ikinci modelden daha iyi performans sergilediğini görmek için bu ölçümlere bakın. İlk modelin tahminlerine bakmak için Model Puanla bileşenine sağ tıklayın ve tahmin edilen sonuçları görmek için Puanlanan veri kümesini görselleştir'e tıklayın.

Test veri kümenize iki sütun daha eklendiğini göreceksiniz.

  • Puanlanmış Olasılıklar: müşterinin bir bisiklet alıcısı olma olasılığı.
  • Puanlanmış Etiketler: modelin gerçekleştirdiği sınıflandırma – bisiklet alıcısı (1) veya değil (0). Etiketlemeye ilişkin bu olasılık eşiği %50 olarak belirlenmiş olup ayarlanabilir.

Modelin ne kadar iyi performans sergilediğini görmek için BikeBuyer (gerçek) sütununu Puanlanmış Etiketler (tahmin) ile karşılaştırın. Ardından, yeni müşteriler için tahminlerde bulunmak için bu modeli kullanabilirsiniz. Bu modeli web hizmeti olarak yayımlayabilir veya sonuçları Azure Synapse'e geri yazabilirsiniz.

Sonraki adımlar

Azure Machine Learning hakkında daha fazla bilgi edinmek için bkz. Azure'da Machine Learning'e giriş.

Veri ambarında yerleşik puanlama hakkında buradan bilgi edinin.