Dil algılamayı kullanma

Dil Algılama özelliği metni değerlendirebilir ve belgenin yazıldığı dili gösteren bir dil tanımlayıcısı döndürebilir.

Dil algılama, dilin bilinmediği rastgele metinleri toplayan içerik depoları için kullanışlıdır. Giriş belgesinde hangi dilin kullanıldığını belirlemek için bu analizin sonuçlarını ayrıştırabilirsiniz. Yanıt ayrıca modelin güvenilirliğini yansıtan 0 ile 1 arasında bir puan döndürür.

Dil Algılama özelliği çok çeşitli dilleri, varyantları, diyalektleri ve bazı bölgesel veya kültürel dilleri algılayabilir.

Dağıtım seçenekleri

Dil algılamayı kullanmak için analiz için ham yapılandırılmamış metin gönderir ve uygulamanızdaki API çıkışını işlersiniz. Analiz, verilerinizde kullanılan modelde ek özelleştirme yapılmadan olduğu gibi gerçekleştirilir. Dil algılamayı kullanmanın üç yolu vardır:

Geliştirme seçeneği Açıklama
Microsoft Foundry (yeni) portalı Foundry (yeni), Foundry projeleri aracılığıyla Foundry modellerine, aracılarına ve araçlarına kolay erişim sağlayan bulut tabanlı bir yapay zeka platformudur.
Dökümhane (klasik) portalı Foundry (klasik), merkez tabanlı projeleri ve diğer kaynak türlerini destekleyen bulut tabanlı bir platformdur. Kaydolduğunuzda, kendi verilerinizi kullanarak 100'den fazla dili ana yazı sistemlerinde algılayabilirsiniz.
REST API veya İstemci kitaplığı (Azure SDK) REST API'yi veya çeşitli dillerde kullanılabilen istemci kitaplığını kullanarak dil algılamayı uygulamalarınızla tümleştirin.
Docker kapsayıcısı Bu özelliği şirket içinde dağıtmak için kullanılabilir Docker kapsayıcısını kullanın. Docker kapsayıcıları uyumluluk, güvenlik veya diğer operasyonel konular için hizmeti verilerinize yaklaştırmanızı sağlar.

Verilerin nasıl işleneceğini belirleme (isteğe bağlı)

Dil algılama modelini belirtme

Varsayılan olarak, dil algılama metninizde en son kullanılabilir yapay zeka modelini kullanır. API isteklerinizi belirli bir model sürümünü kullanacak şekilde de yapılandırabilirsiniz.

Giriş dilleri

Değerlendirilecek belgeleri gönderdiğinizde dil algılama, metnin desteklenen dillerden birinde yazıp yazılmadığını belirlemeye çalışır.

Daha az kullanılan bir dilde ifade edilen içeriğiniz varsa, bir kod döndürip döndürmediğini görmek için Azure Dil Algılama özelliğini deneyebilirsiniz. Algılanamıyor diller için yanıt: unknown.

Veri gönderme

İpucu

Dil algılama için bir Docker kapsayıcısıkullanabilirsiniz, böylece şirket içi API'yi kullanabilirsiniz.

İstek alındığında analiz gerçekleştirilir. Dil algılama özelliğinin senkronize bir şekilde kullanılması durumsuzdur. Hesabınızda hiçbir veri depolanmaz ve sonuçlar yanıtta hemen döndürülür.

Bu özelliği zaman uyumsuz olarak kullanırken, API sonuçları isteğin alındığı zamandan itibaren 24 saat boyunca kullanılabilir ve yanıtta belirtilir. Bu zaman aralığından sonra sonuçlar temizlenir ve artık alınamayacaktır.

Dil algılama sonuçlarını alma

Dil algılamadan sonuç aldığınızda, sonuçları bir uygulamaya akışla aktarabilir veya çıkışı yerel sistemdeki bir dosyaya kaydedebilirsiniz.

Dil algılama, gönderdiğiniz her belge için ISO 639-1 adı, insan tarafından okunabilir bir ad, güvenilirlik puanı, betik adı ve ISO 15924 standardına göre betik koduyla birlikte bir baskın dil döndürür. 1 pozitif puan, analizin mümkün olan en yüksek güvenilirlik düzeyini gösterir.

Belirsiz içerik

Bazı durumlarda girişi temel alarak dilleri netleştirmek zor olabilir. countryHint bir ISO 3166-1 alfa-2 ülke/bölge kodu belirtmek için kullanabilirsiniz. Varsayılan olarak API, varsayılan ülke ipucu olarak "ABD" kullanır. Bu davranışı kaldırmak için, bu değeri boş dize countryHint = "" olarak ayarlayarak bu parametreyi sıfırlayabilirsiniz.

Örneğin, "iletişim" hem İngilizce hem de Fransızca için ortaktır ve sınırlı bağlamla verilirse yanıt "ABD" ülke/bölge ipucunu temel alır. Metnin kaynağının Fransa'dan geldiği biliniyorsa, bu bir ipucu olarak verilebilir.

Dikkat

Belirsiz içerik güvenilirlik puanlarının daha düşük olmasını sağlayabilir. countryHint yanıttaki yalnızca güvenilirlik puanı 0,8'den küçükse geçerlidir.

Girdi

{
    "documents": [
        {
            "id": "1",
            "text": "communication"
        },
        {
            "id": "2",
            "text": "communication",
            "countryHint": "fr"
        }
    ]
}

İkinci belge ile dil algılama modeli, yukarıdaki girişteki countryHint özelliğini içerdiği için daha iyi bir karar verebilmek adına ek bağlama sahiptir. Bu, aşağıdaki çıkışı döndürür.

Çıktı

{
    "documents":[
        {
            "detectedLanguage":{
                "confidenceScore":0.62,
                "iso6391Name":"en",
                "name":"English"
            },
            "id":"1",
            "warnings":[
                
            ]
        },
        {
            "detectedLanguage":{
                "confidenceScore":1.0,
                "iso6391Name":"fr",
                "name":"French"
            },
            "id":"2",
            "warnings":[
                
            ]
        }
    ],
    "errors":[
        
    ],
    "modelVersion":"2022-10-01"
}

Çözümleyici girişi ayrıştıramıyorsa döndürür (Unknown). Örnek olarak yalnızca sayılardan oluşan bir metin dizesi gönderirsiniz.

{
    "documents": [
        {
            "id": "1",
            "detectedLanguage": {
                "name": "(Unknown)",
                "iso6391Name": "(Unknown)",
                "confidenceScore": 0.0
            },
            "warnings": []
        }
    ],
    "errors": [],
    "modelVersion": "2023-12-01"
}

Karma dil içeriği

Aynı belgedeki karma dil içeriği, içerikte en büyük temsili olan ancak daha düşük pozitif derecelendirmeye sahip olan dili döndürür. Derecelendirme, değerlendirmenin marjinal gücünü yansıtır. Aşağıdaki örnekte giriş, İngilizce, İspanyolca ve Fransızca dillerinin birleşimidir. Çözümleyici, hakim dili belirlemek için her bir kesimdeki karakterleri sayar.

Girdi

{
    "documents": [
        {
            "id": "1",
            "text": "Hello, I would like to take a class at your University. ¿Se ofrecen clases en español? Es mi primera lengua y más fácil para escribir. Que diriez-vous des cours en français?"
        }
    ]
}

Çıktı

Sonuçta elde edilen çıkış, daha zayıf bir güvenilirlik düzeyine işaret eden 1,0'dan az puana sahip baskın dilden oluşur.

{
    "kind": "LanguageDetectionResults",
    "results": {
        "documents": [
            {
                "id": "1",
                "detectedLanguage": {
                    "name": "Spanish",
                    "iso6391Name": "es",
                    "confidenceScore": 0.97,
                    "script": "Latin",
                    "scriptCode": "Latn"
                },
                "warnings": []
            }
        ],
        "errors": [],
        "modelVersion": "2023-12-01"
    }
}

Betik adı ve betik kodu

Dikkat

  • Betik algılama şu anda belirli dillerle sınırlıdır.
  • Betik algılama yalnızca 12 karakterden uzun metin girişi için kullanılabilir.

Dil algılama, ISO 15924 standardına göre dil başına birden fazla betik algılama olanağı sunar. Özellikle, Dil Algılama betikle ilgili iki özellik döndürür:

  • script: Tanımlanan betiğin insan tarafından okunabilir adı
  • scriptCode: Tanımlanan yazı sistemi için ISO 15924 kodu

API'nin çıktısı, en az 12 karakter uzunluğundaki ve desteklenen dil ve betik listesine uygun belgeler için scriptCode özelliğinin değerini içerir. Betik algılama, dili transliterasyona tabi tutulabilen veya Kazakça dili veya Hintçe dili gibi birden fazla betikte yazılabilen kullanıcılara fayda sağlamak için tasarlanmıştır.

Daha önce, dil algılama, belgelerin dilini çok çeşitli diller, diyalektler ve bölgesel çeşitlemelerle algılamak için tasarlanmıştı, ancak "Romanlaştırma" ile sınırlıydı. Romanlaştırma, metnin bir yazı sisteminden Roma (Latin) betiğine dönüştürülmesi anlamına gelir ve birçok Indo-Avrupa dilini algılamak için gereklidir. Ancak, Kiril, Perso-Arapça ve Latin betiklerinde yazabilen Kazakça gibi birden çok betikte yazılmış başka diller de vardır. Ayrıca, Devanagari betiğini destekleyen klavyelerin sınırlı kullanılabilirliği nedeniyle kullanıcıların dillerini birden fazla betikte (Latin betikte çevrilmiş Hintçe gibi) çevirmeyi seçebileceği veya zorunlu kıldığı başka durumlar da vardır.

Sonuç olarak, dil algılamanın betik algılama için genişletilmiş desteği aşağıdaki gibi davranır:

Girdi

{ 
    "kind": "LanguageDetection", 
    "parameters": { 
        "modelVersion": "latest" 
    }, 
    "analysisInput": { 
        "documents": [ 
            { 
                "id": "1", 
                "text": "आप कहाँ जा रहे हैं?" 
            }, 
            { 
                "id": "2", 
                "text": "Туған жерім менің - Қазақстаным" 
            } 
        ] 
    } 
} 

Çıktı

Sonuçta elde edilen çıkış, bir betik adı, betik kodu ve güvenilirlik puanıyla birlikte baskın dilden oluşur.

{ 
    "kind": "LanguageDetectionResults", 
    "results": { 
        "documents": [ 
            { 
                "id": "1", 
                "detectedLanguage": { 
                    "name": "Hindi", 
                    "iso6391Name": "hi", 
                    "confidenceScore": 1.0, 
                    "script": "Devanagari", 
                    "scriptCode": "Deva" 
                }, 
                "warnings": [] 
            }, 
            { 
                "id": "2", 
                "detectedLanguage": { 
                    "name": "Kazakh", 
                    "iso6391Name": "kk", 
                    "confidenceScore": 1.0, 
                    "script": "Cyrillic",  
                    "scriptCode": "Cyrl" 
                }, 
                "warnings": [] 
            } 
        ], 
        "errors": [], 
        "modelVersion": "2023-12-01" 
    } 
}

Hizmet ve veri sınırları

Dakika ve saniye başına gönderebileceğiniz isteklerin boyutu ve sayısı hakkında bilgi için hizmet sınırları makalesine bakın.

Ayrıca bkz.