Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Siklus hidup aplikasi AI memerlukan kerangka kerja evaluasi yang kuat untuk memastikan sistem AI memberikan output yang akurat, relevan, dan andal. Tanpa penilaian yang ketat, sistem AI berisiko menghasilkan respons yang tidak akurat, tidak konsisten, kurang membumi, atau berpotensi berbahaya. Pengamatan memungkinkan tim mengukur dan meningkatkan kualitas dan keamanan output AI sepanjang siklus hidup pengembangan - dari pemilihan model melalui pemantauan produksi.
Apa itu pengamatan?
Pengamatan AI mengacu pada kemampuan untuk memantau, memahami, dan memecahkan masalah sistem AI sepanjang siklus hidupnya. Anda dapat melacak, mengevaluasi, mengintegrasikan gerbang kualitas otomatis ke dalam alur CI/CD, dan mengumpulkan sinyal seperti metrik evaluasi, log, jejak, dan output model untuk mendapatkan visibilitas ke dalam performa, kualitas, keamanan, dan kesehatan operasional.
Kemampuan pengamatan inti
Microsoft Foundry menyediakan tiga kemampuan inti yang bekerja sama untuk memberikan pengamatan komprehensif di seluruh siklus hidup aplikasi AI:
Evaluasi
Evaluator mengukur kualitas, keamanan, dan keandalan respons AI sepanjang pengembangan. Microsoft Foundry menyediakan evaluator bawaan yang mencakup metrik kualitas tujuan umum (koherensi, kefasihan), metrik khusus RAG (kedalaman informasi, relevansi), serta aspek keselamatan dan keamanan (kebencian/ketidakadilan, kekerasan, materi yang dilindungi), dan metrik khusus agen (akurasi panggilan alat, penyelesaian tugas), di antara lainnya. Anda juga dapat membangun evaluator kustom yang disesuaikan dengan persyaratan khusus domain Anda.
Untuk daftar lengkap evaluator bawaan, lihat Referensi evaluator bawaan.
Pemantauan
Pemantauan produksi memastikan aplikasi AI yang Disebarkan menjaga kualitas dan performa dalam kondisi dunia nyata. Terintegrasi dengan Azure Monitor Application Insights, Microsoft Foundry memberikan dasbor real time yang melacak metrik operasional, konsumsi token, latensi, tingkat kesalahan, dan skor kualitas. Anda dapat menyiapkan pemberitahuan saat output gagal ambang kualitas atau menghasilkan konten berbahaya, memungkinkan penyelesaian masalah yang cepat.
Untuk detail tentang menyiapkan pemantauan produksi, lihat Dasbor Pemantauan Agen.
Menelusuri
Pelacak terdistribusi menangkap alur eksekusi aplikasi AI, memberikan visibilitas terhadap panggilan LLM, invokasi alat, keputusan agen, dan dependensi antar layanan. Dibangun berdasarkan standar OpenTelemetry dan terintegrasi dengan Azure Monitor Application Insights, pelacakan memungkinkan penelusuran kesalahan perilaku agen yang kompleks, mengidentifikasi hambatan performa, dan memahami rantai penalaran multi-langkah. Microsoft Foundry mendukung pelacakan kerangka kerja populer termasuk LangChain, LangGraph, OpenAI Agents SDK, dan Microsoft Agent Framework.
Untuk panduan tentang menerapkan pelacakan, lihat Gambaran umum agen pelacakan.
Apa itu evaluator?
Evaluator adalah alat khusus yang mengukur kualitas, keamanan, dan keandalan respons AI sepanjang siklus hidup pengembangan.
Untuk daftar lengkap evaluator bawaan, lihat Referensi evaluator bawaan.
Evaluator terintegrasi ke dalam setiap tahap siklus hidup AI untuk memastikan keandalan, keamanan, dan efektivitas.
Tiga tahap evaluasi siklus hidup aplikasi AI
Pemilihan model dasar
Pilih model fondasi yang tepat dengan membandingkan kualitas, performa tugas, pertimbangan etika, dan profil keamanan di berbagai model.
Tools tersedia: Microsoft Foundry benchmark untuk membandingkan model pada himpunan data publik atau data Anda sendiri, dan SDK Evaluasi AI Azure untuk endpoint model tertentu.
Evaluasi pra-produksi
Sebelum penyebaran, pengujian menyeluruh memastikan agen atau aplikasi AI Anda siap produksi. Tahap ini memvalidasi performa melalui himpunan data evaluasi, mengidentifikasi kasus tepi, menilai ketahanan, dan mengukur metrik utama termasuk kepatuhan tugas, groundedness, relevansi, dan keamanan. Untuk membangun agen siap produksi dengan percakapan multi-giliran, panggilan alat, dan pengelolaan status sistem, lihat Foundry Agent Service.
Alat dan pendekatan evaluasi:
Bawa data Anda sendiri: Evaluasi aplikasi AI menggunakan data Anda sendiri dengan kualitas, keamanan, atau evaluator kustom. Gunakan wizard evaluasi portal Foundry atau Foundry SDK serta lihat hasil di portal Foundry.
AI red teaming agent: Agen tim merah AI menyimulasikan serangan kompleks menggunakan kerangka kerja PyRIT Microsoft untuk mengidentifikasi kerentanan keamanan dan keselamatan sebelum penyebaran. Paling baik digunakan dengan proses human-in-the-loop.
Pemantauan pasca-produksi
Setelah penyebaran, pemantauan berkelanjutan memastikan aplikasi AI Anda mempertahankan kualitas dalam kondisi dunia nyata:
- Metrik operasional: Pengukuran rutin metrik operasional agen AI utama
- Evaluasi berkelanjutan: Evaluasi kualitas dan keamanan lalu lintas produksi pada tingkat pengambilan sampel
- Evaluasi terjadwal: Evaluasi kualitas dan keamanan terjadwal menggunakan himpunan data pengujian untuk mendeteksi penyimpangan sistem
- Pengujian red teaming terjadwal: Pengujian advesarial terjadwal untuk memeriksa kerentanan keselamatan dan keamanan
- Azure Monitor pemberitahuan: Pemberitahuan saat output gagal dalam ambang kualitas atau menghasilkan konten berbahaya
Terintegrasi dengan Azure Monitor Application Insights, dasbor Foundry Observability memberikan wawasan real time tentang metrik performa, keamanan, dan kualitas, memungkinkan resolusi masalah yang cepat dan mempertahankan kepercayaan pengguna.
Referensi evaluasi cepat
| Tujuan | Proses | Parameter, panduan, dan sampel |
|---|---|---|
| Bagaimana cara mengatur pelacakan? | Mengonfigurasi pelacakan terdistribusi |
Gambaran umum jejak Melacak dengan Agen SDK |
| Apa yang sedang Anda evaluasi? | Mengidentifikasi atau membangun evaluator yang relevan |
Evaluator bawaan Evaluator kustom Python sampel SDK C# sampel SDK |
| Data apa yang harus Anda gunakan? | Mengunggah atau menghasilkan himpunan data yang relevan | Pilih sumber data |
| Bagaimana cara menjalankan evaluasi? | Jalankan evaluasi |
Evaluasi agen dijalankan Eksekusi cloud jarak jauh |
| Bagaimana performa aplikasi model/AI saya? | Menganalisis hasil |
Lihat hasil evaluasi Analisis kluster |
| Bagaimana cara meningkatkan? | Menganalisis hasil dan mengoptimalkan agen | Menganalisis kegagalan evaluasi dengan analisis kluster. Optimalkan agen dan evaluasi ulang. Tinjau hasil evaluasi. |
Dukungan wilayah, batas tarif, dan dukungan jaringan virtual
Untuk mempelajari wilayah mana yang mendukung evaluator yang dibantu AI, batas tarif yang berlaku untuk eksekusi evaluasi, dan cara mengonfigurasi dukungan jaringan virtual untuk isolasi jaringan, lihat dukungan wilayah, batas tarif, dan dukungan jaringan virtual untuk evaluasi.
Harga
Fitur observabilitas seperti evaluasi risiko dan keselamatan serta evaluasi di agent playground ditagihkan berdasarkan penggunaan, seperti yang tercantum di halaman harga Azure.
Penting
Evaluasi di taman bermain agen diaktifkan secara default untuk semua proyek Foundry dan disertakan dalam penagihan berbasis konsumsi. Untuk menonaktifkan evaluasi playground, pilih pengukuran di kanan atas playground agen dan batalkan pilihan semua evaluator.