ตรวจหาภาษา
Tip
ดูแท็บ ข้อความและรูปภาพ สําหรับรายละเอียดเพิ่มเติม!
API การตรวจหาภาษา Azure จะประเมินการป้อนข้อความ และสําหรับแต่ละเอกสารที่ส่ง จะส่งคืนตัวระบุภาษาพร้อมคะแนนที่ระบุความแข็งแกร่งของการวิเคราะห์
ความสามารถนี้มีประโยชน์สําหรับร้านค้าเนื้อหาที่รวบรวมข้อความตามอําเภอใจที่ไม่รู้จักภาษา อีกสถานการณ์หนึ่งอาจเกี่ยวข้องกับแอปพลิเคชันแชท หากผู้ใช้เริ่มเซสชันกับแอปพลิเคชัน สามารถใช้การตรวจหาภาษาเพื่อกําหนดภาษาที่พวกเขากําลังใช้ และอนุญาตให้คุณกําหนดค่าการตอบสนองของแอปพลิเคชันของคุณในภาษาที่เหมาะสม
คุณสามารถแยกวิเคราะห์ผลลัพธ์ของการวิเคราะห์นี้เพื่อกําหนดภาษาที่ใช้ในเอกสารอินพุตได้ การตอบสนองจะส่งกลับคะแนนซึ่งสะท้อนถึงความเชื่อมั่นของแบบจําลอง (ค่าระหว่าง 0 และ 1)
การตรวจหาภาษาสามารถทํางานกับเอกสารหรือวลีเดียวได้ สิ่งสําคัญคือต้องทราบว่าขนาดเอกสารต้องไม่เกิน 5,120 อักขระ ขีดจํากัดขนาดสําหรับแต่ละเอกสาร และแต่ละคอลเลกชันจะถูกจํากัดไว้ที่ 1,000 รายการ (รหัส) ตัวอย่างของส่วนข้อมูล JSON ที่จัดรูปแบบอย่างถูกต้องที่คุณอาจส่งไปยังบริการในเนื้อความคําขอจะแสดงที่นี่ รวมถึงคอลเลกชันของเอกสาร แต่ละรายการประกอบด้วย รหัส ที่ไม่ซ้ํากันและข้อความ วิเคราะห์
ตัวอย่างเช่น โค้ด Python ต่อไปนี้จะวิเคราะห์เอกสาร (สั้น) สองฉบับเพื่อตรวจหาภาษาที่ใช้เขียน
# Assumes code to create TextAnalyticsClient is above...
# Example text to analyze
documents = ["Hello World!", "Bonjour le monde!"]
# Detect language
response = client.detect_language(documents=documents)
for doc in response:
print(f"Document: {doc.id}")
print(f"\tPrimary Language: {doc.primary_language.name}")
print(f"\tISO6391 Name: {doc.primary_language.iso6391_name}")
print(f"\tConfidence Score: {doc.primary_language.confidence_score}")
การตอบกลับประกอบด้วยผลลัพธ์สําหรับ แต่ละเอกสาร ในคําขอ รวมถึงภาษาที่คาดการณ์และค่าที่ระบุระดับความเชื่อมั่นของการคาดคะเน ระดับความเชื่อมั่นเป็นค่าตั้งแต่ 0 ถึง 1 ที่มีค่าใกล้เคียงกับ 1 ซึ่งเป็นระดับความเชื่อมั่นที่สูงกว่า นี่คือตัวอย่างการตอบกลับจากโค้ดก่อนหน้า
Document: 0
Primary Language: English
ISO6391 Name: en
Confidence Score: 0.9
Document: 1
Primary Language: French
ISO6391 Name: fr
Confidence Score: 0.98
ในตัวอย่างของเราทั้งสองภาษาแสดงค่าความเชื่อมั่นสูงส่วนใหญ่เป็นเพราะข้อความค่อนข้างเรียบง่ายและง่ายต่อการระบุภาษา
หากคุณพยายามตรวจหาภาษาของเอกสารที่มีเนื้อหา I know a cool AI developer. He has a certain je ne sais quoi!หลายภาษา เช่น การตอบกลับอาจสะท้อนถึงความคลุมเครือบางอย่าง เนื้อหาภาษาผสมภายในเอกสารเดียวกันจะส่งกลับภาษาที่มีการแทนค่ามากที่สุดในเนื้อหา แต่ด้วยคะแนนเชิงบวกที่ต่ํากว่า ซึ่งสะท้อนถึงความแข็งแกร่งของการประเมินนั้น
เงื่อนไขสุดท้ายที่ต้องพิจารณาคือเมื่อมีความคลุมเครือเกี่ยวกับเนื้อหาภาษา สถานการณ์สมมติอาจเกิดขึ้นหากคุณส่งเนื้อหาที่เป็นข้อความที่ตัววิเคราะห์ไม่สามารถแยกวิเคราะห์ได้ เช่น เนื่องจากปัญหาการเข้ารหัสอักขระเมื่อแปลงข้อความเป็นตัวแปรสตริง ด้วยเหตุนี้ การตอบกลับสําหรับชื่อภาษาและรหัส ISO จะถูกส่งคืนเป็น (unknown) และค่าคะแนนจะถูกส่งคืนเป็น0