Veri bilimi sürecini anlama

Tamamlandı

Verilerden içgörü ayıklamanın yaygın yollarından biri, verileri görselleştirmektir. Karmaşık veri kümeleriniz olduğunda daha derine inip verilerdeki karmaşık desenleri bulmaya çalışabilirsiniz.

Veri bilimcisi olarak, verilerinizdeki desenleri bulmak için makine öğrenmesi modellerini eğitebilirsiniz. Yeni içgörüler veya tahminler oluşturmak için bu desenleri kullanabilirsiniz. Örneğin, önümüzdeki hafta satmayı beklediğiniz ürün sayısını tahmin edebilirsiniz.

Modeli eğitme önemli olsa da, veri bilimi projesindeki tek görev bu değildir. Tipik bir veri bilimi sürecini keşfetmeden önce eğitebileceğiniz yaygın makine öğrenmesi modellerini inceleyelim.

Yaygın makine öğrenmesi modellerini keşfetme

Makine öğrenmesinin amacı, büyük miktarda verideki desenleri tanımlayabilen modeller eğitmektir. Ardından, üzerinde işlem yapabileceğiniz yeni içgörüler sağlayan tahminler yapmak için desenleri kullanabilirsiniz.

Makine öğrenmesiyle ilgili olasılıklar sonsuz görünebilir, bu nedenle dört yaygın makine öğrenmesi modeli türünü anlayarak başlayalım:

Dört yaygın makine öğrenmesi modeli türünün diyagramı.

  1. Sınıflandırma: Müşterinin değişim sıklığına sahip olup olmadığı gibi kategorik bir değeri tahmin edin.
  2. Regresyon: Bir ürünün fiyatı gibi sayısal bir değeri tahmin edin.
  3. Kümeleme: Benzer veri noktalarını kümeler veya gruplar halinde gruplandırın.
  4. Tahmin: Gelecek ay için beklenen satışlar gibi zaman serisi verilerine göre gelecekteki sayısal değerleri tahmin edin.

Eğitmek istediğiniz makine öğrenmesi modeli türüne karar vermek için öncelikle iş sorununu ve kullanabileceğiniz verileri anlamanız gerekir.

Veri bilimi sürecini anlama

Makine öğrenmesi modelini eğitmek için süreç genellikle aşağıdaki adımları içerir:

Veri bilimi sürecindeki sıralı adımların diyagramı.

  1. Sorunu tanımlayın: İş kullanıcıları ve analistlerle birlikte modelin neyi tahmin etmesi gerektiğine ve ne zaman başarılı olacağına karar verin.
  2. Verileri alma: Veri kaynaklarını bulun ve verilerinizi bir Lakehouse'da depolayarak erişim elde edin.
  3. Verileri hazırlayın: Verileri bir Lakehouse'dan bir not defterine okuyarak inceleyin. Modelin gereksinimlerine göre verileri temizleyin ve dönüştürün.
  4. Modeli eğitme: Denemelerinizi MLflow ile izleyerek deneme ve hata temelinde bir algoritma ve hiper parametre değerleri seçin.
  5. İçgörü oluşturma: İstenen tahminleri oluşturmak için model toplu puanlama kullanın.

Veri bilimcisi olarak zamanınızın çoğu verileri hazırlamak ve modeli eğiterek harcanıyor. Verileri nasıl hazırladığınız ve modeli eğitmeyi seçtiğiniz algoritma modelinizin başarısını etkileyebilir.

İstediğiniz dilde kullanılabilen açık kaynak kitaplıkları kullanarak modeli hazırlayabilir ve eğitebilirsiniz. Örneğin Python ile çalışıyorsanız Pandas ve Numpy ile verileri hazırlayabilir ve Scikit-Learn, PyTorch veya SynapseML gibi kitaplıklarla model eğitebilirsiniz.

Deneme yaparken, eğittiğiniz tüm farklı modellere genel bir bakış sağlamak istiyorsunuz. Seçimlerinizin modelin başarısını nasıl etkilediğini anlamak istiyorsunuz. Microsoft Fabric'te MLflow ile denemelerinizi izleyerek eğitmiş olduğunuz modelleri kolayca yönetebilir ve dağıtabilirsiniz.