Yapay Zeka Fonksiyonları kullanarak yapılandırılmamış verileri dönüştürün

AI Fonksiyonları, Azure Databricks'te depolanan verilere LLM'ler veya son teknoloji araştırma teknikleri uygulayarak veri dönüşümü ve analizi için kullanabileceğiniz yerleşik fonksiyonlardır. Databricks SQL, not defterleri, Lakeflow işlem hatları ve İş Akışları'ndan çalıştırılabilirler.

Yapay Zeka İşlevleri kullanımı kolaydır, hızlı ve ölçeklenebilirdir. Analistler bunları kendi özel verilerine veri zekası uygulamak için kullanırken, veri mühendisleri, veri bilimcileri ve makine öğrenmesi mühendisleri bunları üretim sınıfı toplu işlem hatları oluşturmak için kullanabilir.

Bir AI Fonksiyonu çağırdığınızda, sorgunuz gönderdiğiniz hesaplama sisteminde çalışır; örneğin SQL deposu, defter, küme veya boru hattı. Fonksiyona bağlı olarak, model çıkarımı ayrı Databricks tarafından yönetilen ve bu hesaplamaya ek olarak faturalandırılan altyapıda çalışabilir. Bkz . Yapay Zeka Fonksiyonu iş yükleri için maliyetleri görüntüleyin.

Requirements

  • Yapay Zeka Fonksiyonları Klasik SQL depolarında mevcut değildir.
  • Databricks Runtime 15.4 LTS veya üzeri gereklidir. Databricks Runtime 18.2 veya üzeri en iyi performans ve en son özelliklere erişim için önerilir.

Göreve özgü ve genel amaçlı

AI İşlevleri göreve özgü ve genel amaçlı işlevlere sahiptir:

  • Göreve özgü Yapay Zeka İşlevleri — Belge ayrıştırma, varlık ayıklama, sınıflandırma ve yaklaşım analizi gibi belirli bir görev için iyileştirilmiş amaca yönelik işlevler. Bu işlevler, Azure Databricks tarafından yönetilen, araştırma geri sistemleriyle desteklenir. Bazı işlevler kullanıcı arabirimi deneyimlerini içerir. Desteklenen işlevler ve modeller için bkz. Göreve özgü yapay zeka işlevleri .
  • ai_query — Görev ve model esnekliği için genel amaçlı işlev. Bir istem sağlayın ve desteklenen Temel Model API'lerini seçin. Bkz . kullanma ai_query.

Göreve özgü yapay zeka işlevleri ve ai_query için karar ağacı

Kuruluşunuzun erişebileceği göreve özgü yapay zeka işlevlerini kısıtlamak için bkz. AI İşlevleri Unity Kataloğu izinleri.

İşlevlere özgü yapay zeka

Göreve özgü işlevlerin kapsamı belirli bir görev için belirlenmiştir, böylece varlık ayıklama, çeviri ve sınıflandırma gibi rutin dönüştürmeleri otomatikleştirebilirsiniz. Databricks, Databricks tarafından sürdürülen ve özelleştirme gerektirmeyen en son düzey araştırma tekniklerini çağırdığı için bu işlevleri kullanmaya başlamanızı önerir.

Bir örnek için bkz. AI İşlevlerini kullanarak müşteri incelemelerini analiz etme .

Aşağıdaki işlevler göreve göre gruplandırılır.

Akıllı belge işleme:

İşlev Açıklama
ai_parse_document En son düzey araştırma tekniklerini kullanarak yapılandırılmamış belgelerden yapılandırılmış içeriği (metin, tablolar, şekil açıklamaları) ve düzeni ayrıştırın.
ai_extract Tanımladığınız şemayı kullanarak belgelerden veya metinlerden yapılandırılmış alanları ayıklayın.
ai_classify En son düzey araştırma tekniklerini kullanarak giriş metnini sağladığınız etiketlere göre sınıflandırın.
ai_prep_search (Beta) Ayrıştırılmış belgeleri veya düz metin ve markdown'ı, AI Arama ve RAG pipeline'ları için optimize edilmiş arama hazır parçalara dönüştürün.
ai_search (Beta) Bir veya daha fazla bilgi kaynağından, doğal dildeki bir sorgu için sıralanmış, tekilleştirilmiş belgeleri ve bu kaynaklara dayalı bir yanıtı alın.
ai_enrich (Beta) Tanımladığınız bir şemadan her satır için yeni sütunlar oluşturun, isteğe bağlı olarak yapay zeka arama indeksleri veya web araması temelinde.

Metni dönüştürme:

İşlev Açıklama
ai_fix_grammar Metindeki dilbilgisi hatalarını en son teknoloji yapay zeka modeliyle düzeltin.
ai_translate Metni en son teknoloji bir yapay zeka modeli kullanarak belirli bir hedef dile çevirin.
ai_summarize SQL ve son teknoloji bir yapay zeka modeli kullanarak metin özeti oluşturun.
ai_mask Metinde belirtilen varlıkları en son teknoloji bir yapay zeka modeli kullanarak maskeleyin.

Metni analiz etme:

İşlev Açıklama
ai_duyguları_analiz_et Giriş metni üzerinde en son teknoloji yapay zeka modeli kullanarak duygusal analiz yapın.
ai_similarity İki diziyi karşılaştırın ve son teknoloji bir yapay zeka modeliyle anlamsal benzerlik puanını hesaplayın.

İçerik oluşturma. Özel istemler veya belirli bir model için Kullan ai_query'a bakın.

İşlev Açıklama
ai_gen Kullanıcı tarafından sağlanan bir soruyu son teknoloji bir yapay zeka modeliyle yanıtlayın.

Tahmin zaman serisi:

İşlev Açıklama
ai_forecast Verileri belirtilen ufka kadar tahmin etme. Bu tablo değerli işlev, zaman serisi verilerini geleceğe yönelik tahmin etmek için tasarlanmıştır.

Ölçüm değişikliklerini analiz etme:

İşlev Açıklama
ai_top_drivers (Beta) Ölçümde denetim grubuyla test grubu arasındaki değişikliğe en çok katkıda bulunan boyut değerlerini derecelendirme.

Yapay Zeka Arama eklemeleriyle arama:

İşlev Açıklama
vector_search Son teknoloji bir yapay zeka modeli kullanarak bir AI Arama indeksi arayın ve sorgulayın.

Üretim iş akışlarında yapay zeka işlevlerini kullanma

Büyük ölçekli toplu çıkarım için, göreve özgü Yapay Zeka İşlevlerini veya genel amaçlı işlevi ai_query Lakeflow işlem hatları, Databricks iş akışları ve Yapılandırılmış Akış gibi üretim iş akışlarınızla tümleştirebilirsiniz. Bu, büyük ölçekte üretim sınıfı işlemeyi etkinleştirir.

Üretimdeki yapay zeka işlevleri için en iyi yöntemler:

Yapay Zeka İşlevlerinin iş yükünüzü büyük ölçekte işlemesine izin verin: Yapay Zeka İşlevleri paralelleştirmeyi, yeniden denemeleri ve ölçeklendirmeyi otomatik olarak yönetir. Veri kümenizin tamamını el ile küçük gruplara bölmek yerine tek bir sorguda göndermeniz tavsiye edilir. Performans çok küçük iş yüklerinden büyük ölçekli iş yüklerine doğrusal olarak ölçeklendirilmeyebilir.

Databricks tarafından barındırılan temel modelleri kullanın: ai_query AI İşlevini kullanırken, önceden sağlanmış aktarım hızı yerine Databricks tarafından barındırılan temel modelleri (databricks- ön ekli) kullanın. Bu hazır olmayan uç noktalar tam olarak yönetilir ve toplu işlem için en iyi şekilde çalışır.

Örnekler ve ayrıntılar için bkz. Toplu çıkarım işlem hatlarını dağıtma .

AI İşlevlerinin ilerleme durumunu izleme

Kaç çıkarım tamamlandığını veya başarısız olduğunu anlamak ve performans sorunlarını gidermek için sorgu profili özelliğini kullanarak yapay zeka işlevlerinin ilerleme durumunu izleyebilirsiniz.

Databricks Runtime 16.1 ML ve üzeri sürümleri için çalışma alanınızdaki SQL düzenleyicisi sorgu penceresinden:

  1. Ham sonuçlar penceresinin alt kısmındaki Çalışıyor--- bağlantısını seçin. Sağ tarafta performans penceresi görüntülenir.
  2. Performans ayrıntılarını görüntülemek için Sorgu profilini görüntüle'ye tıklayın.
  3. Tamamlanan ve başarısız çıkarımların sayısı ve isteğin tamamlanması için geçen toplam süre de dahil olmak üzere ilgili sorgunun ölçümlerini görmek için AI Sorgu tıklayın.

AI İşlevi iş yüklerinin maliyetlerini görüntüleme

Sorunuzu çalıştıran hesaplama her zaman faturalandırılır, örneğin bir SQL deposu veya iş kümesi. Ek bir model çıkarımı maliyeti olup olmaması fonksiyona bağlıdır:

  • Göreve özgü fonksiyonlar (örneğin, ai_classify, ai_summarize, ai_translate), Model Serving aracılığıyla Databricks tarafından yönetilen sunucusuz GPU altyapısında çıkarım yapar. Bu altyapıyı siz oluşturmazsınız, ancak bunun ücreti sorgu işlem kaynaklarınıza ek olarak faturalandırılır.
  • ai_query belirttiğiniz Model Hizmet uç noktası için faturalandırılır. Databricks tarafından barındırılan temel model uç noktaları, göreve özel işlevler gibi faturalandırılır; özel model ve ayrılmış aktarım kapasitesine sahip uç noktalar, kendilerine ayrılmış sunum işlem kaynaklarında çalışır ve buna göre faturalandırılır.
  • ai_forecast ve ai_top_drivers tamamen gönderdiğiniz hesaplama üzerinde çalışır, ayrı çıkarım maliyeti yoktur.
  • vector_search Databricks tarafından yönetilen AI Arama hizmeti aracılığıyla AI Arama indeksinizi sorgular.

AI İşlevi maliyetleri, MODEL_SERVING ürünün bir parçası olarak BATCH_INFERENCE teklif türü altında kaydedilir. Örnek sorgu için bkz. Toplu çıkarım iş yüklerinin maliyetlerini görüntüleme .

Uyarı

ai_parse_document, ai_extract, ve ai_classify maliyetleri, AI_FUNCTIONS ürünün bir parçası olarak kaydedilir. ai_parse_document örnek sorgusu için bkz.

Toplu çıkarım iş yüklerinin maliyetlerini görüntüleme

Aşağıdaki örneklerde iş, işlem, SQL ambarları ve Lakeflow işlem hatlarına göre toplu çıkarım iş yüklerinin nasıl filtreleneceği gösterilmektedir.

AI İşlevleri kullanan toplu çıkarım iş yüklerinizin maliyetlerini görüntüleme hakkında genel örnekler için bkz. Model sunma maliyetlerini izleme .

İşler

Aşağıdaki sorgu, sistem tablosu kullanılarak system.workflow.jobs toplu çıkarım için hangi işlerin kullanıldığını gösterir. Bkz . Sistem tablolarıyla iş maliyetlerini ve performansını izleme.


SELECT *
FROM system.billing.usage u
  JOIN system.workflow.jobs x
    ON u.workspace_id = x.workspace_id
    AND u.usage_metadata.job_id = x.job_id
  WHERE u.usage_metadata.workspace_id = <workspace_id>
    AND u.billing_origin_product = "MODEL_SERVING"
    AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";

Compute

Aşağıda, sistem tablosu kullanılarak toplu çıkarım için hangi kümelerin system.compute.clusters kullanıldığı gösterilmektedir.

SELECT *
FROM system.billing.usage u
  JOIN system.compute.clusters x
    ON u.workspace_id = x.workspace_id
    AND u.usage_metadata.cluster_id = x.cluster_id
  WHERE u.usage_metadata.workspace_id = <workspace_id>
    AND u.billing_origin_product = "MODEL_SERVING"
    AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";

Lakeflow Spark Deklaratif İşlem Hatları

Aşağıda, sistem tablosu kullanılarak system.lakeflow.pipelines toplu çıkarım için hangi Lakeflow işlem hatlarının kullanıldığı gösterilmektedir.

SELECT *
FROM system.billing.usage u
  JOIN system.lakeflow.pipelines x
    ON u.workspace_id = x.workspace_id
    AND u.usage_metadata.dlt_pipeline_id = x.pipeline_id
  WHERE u.usage_metadata.workspace_id = <workspace_id>
    AND u.billing_origin_product = "MODEL_SERVING"
    AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";

SQL ambarı

Aşağıda, sistem tablosu kullanılarak system.compute.warehouses toplu çıkarım için hangi SQL ambarlarının kullanıldığı gösterilmektedir.

SELECT *
FROM system.billing.usage u
  JOIN system.compute.clusters x
    ON u.workspace_id = x.workspace_id
    AND u.usage_metadata.cluster_id = x.cluster_id
  WHERE u.workspace_id = <workspace_id>
    AND u.billing_origin_product = "MODEL_SERVING"
    AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";

Çalıştırma maliyetlerini ai_parse_document görüntüle

Aşağıdaki örnekte çalıştırma maliyetlerini görüntülemek için ai_parse_document faturalama sistemi tablolarının nasıl sorgu yapılacağı gösterilmektedir.


SELECT *
FROM system.billing.usage u
WHERE u.workspace_id = <workspace_id>
  AND u.billing_origin_product = "AI_FUNCTIONS"
  AND u.product_features.ai_functions.ai_function = "AI_PARSE_DOCUMENT";