Apa itu pengoptimal agen? (pratinjau)

Important

Agent Optimizer saat ini berada dalam pratinjau. Pratinjau ini disediakan tanpa adanya perjanjian tingkat layanan, dan kami tidak menyarankan penggunaannya untuk beban kerja produksi. Fitur tertentu mungkin tidak didukung atau mungkin memiliki kemampuan terbatas. Untuk informasi lebih lanjut, lihat Supplemental Terms of Use for Microsoft Azure Previews.

Pengoptimal agen di Foundry Agent Service secara otomatis mengoptimalkan agen prompt dan agen terhosting dengan mengevaluasi perilakunya dan menghasilkan konfigurasi yang lebih baik. Bergantung pada jenis agen, konfigurasi ini dapat mencakup instruksi, keterampilan, deskripsi alat, dan pemilihan model yang ditingkatkan.

Membangun agen AI yang efektif memerlukan prompt engineering yang mendalam. Anda menyebarkan agen dengan instruksi kerajinan tangan, mengujinya terhadap skenario nyata, mengidentifikasi kelemahan, merevisi perintah, dan mengulanginya. Proses berulang ini lambat, subjektif, dan tidak dapat diskalakan. Pengoptimal agen mengotomatiskan siklus ini sehingga Anda dapat fokus pada logika inti agen Anda.

Jenis agen yang didukung

Pengoptimal menggunakan perulangan peningkatan berbasis evaluasi yang sama untuk kedua jenis agen, tetapi penyiapan, target pengoptimalan, dan pengalaman penyebaran berbeda.

Jenis agen Apa yang dapat ditingkatkan oleh pengoptimal Cara memulai menjalankan
Penjawab otomatis Instruksi, deskripsi alat untuk pemanggilan fungsi, dan pemilihan model Gunakan panduan pengoptimalan di portal Foundry. Tidak diperlukan perubahan kode.
Agen yang dihosting Instruksi, keterampilan, deskripsi alat pemanggilan fungsi, dan pemilihan model Gunakan Foundry Toolkit, yang secara otomatis menyiapkan dukungan pengoptimalan, atau jadikan agen siap untuk pengoptimal dan gunakan Azure Developer CLI.

Agen pemicu

Untuk agen berbasis prompt, pengoptimal mengevaluasi versi agen yang dipilih dan menghasilkan instruksi alternatif. Ini juga dapat meningkatkan deskripsi untuk alat panggilan fungsi dan membandingkan perintah di beberapa penyebaran model kandidat.

Alat prompt-agent untuk pemanggilan fungsi berjalan di sisi klien. Pengoptimal dapat meningkatkan deskripsi alat dan parameter yang memandu panggilan fungsi model, tetapi tidak dapat mengevaluasi eksekusi alat selama pengoptimalan deskripsi alat.

Mulai panduan pengoptimalan dari tab Optimalkan pada agen di portal Foundry. Wizard memandu Anda memilih versi agen, himpunan data, kriteria evaluasi, dan model pengoptimalan sebelum Anda mengirimkan eksekusi. Anda dapat membuat himpunan data dari jejak agen, memilih himpunan data Foundry yang ada, atau mengunggah himpunan data dalam wizard.

Saat proses berjalan selesai, bandingkan perubahan skor, tinjau prompt sebelum dan sesudah, dan periksa hasil tiap evaluator. Anda kemudian dapat mempromosikan kandidat yang dipilih ke versi prompt-agent baru dari pengoptimalan yang dijalankan.

Untuk pengalaman portal secara menyeluruh, lihat Mulai cepat: Mengoptimalkan agen prompt.

Agen yang Dihosting

Untuk agen yang di-host, pengoptimal menyempurnakan konfigurasi yang dimuat oleh kode Anda saat waktu proses. Agen membutuhkan paket pengoptimalan dan konfigurasi garis besar yang mengekspos instruksi dan, secara opsional, keterampilan dan definisi alat pemanggilan fungsi. Foundry Toolkit dapat secara otomatis membuat perancah integrasi ini. Untuk alur kerja CLI Pengembang Azure, tambahkan integrasi sebelum Anda menjalankan pengoptimal. Pengoptimal kemudian dapat menghasilkan dan mengevaluasi konfigurasi kandidat tanpa mengubah logika inti agen Anda.

Pengoptimalan agen terhosting mendukung dataset JSONL lokal dan dataset yang terdaftar di proyek Foundry Anda, termasuk dataset evaluasi yang dihasilkan dari jejak. Setelah dijalankan, terapkan kandidat yang dipilih ke konfigurasi lokal Anda, tinjau perubahan, dan sebarkan ulang agen.

Untuk pengalaman end-to-end menggunakan agen terhosting, lihat Mulai cepat: Mengoptimalkan agen terhosting.

Alur kerja pengoptimalan

Kedua jenis agen mengikuti jalur tingkat tinggi yang sama:

  1. Pilih garis besar agen. Pilih versi prompt-agent atau konfigurasi hosted-agent yang digunakan untuk membandingkan kandidat.
  2. Pilih himpunan data evaluasi. Gunakan tugas perwakilan dari himpunan data yang sudah ada atau yang diunggah. Anda juga dapat menggunakan himpunan data terdaftar yang dihasilkan dari jejak agen.
  3. Pilih kriteria evaluasi. Pilih evaluator bawaan atau kustom yang mengukur perilaku yang ingin Anda tingkatkan.
  4. Jalankan pengoptimal. Pilih target dan model pengoptimalan yang tersedia, lalu hasilkan dan evaluasi kandidat. Untuk agen prompt, tinjau perkiraan biaya di portal sebelum Anda mengirimkan proses.
  5. Tinjau hasilnya. Bandingkan skor kandidat dengan garis besar Anda, lalu pilih kandidat terbaik. Jika tersedia, tinjau penggunaan token terukur pasca-eksekusi. Lihat Memahami hasil pengoptimalan.
  6. Terapkan kandidat yang dipilih. Promosikan kandidat prompt-agent ke versi agen baru, atau terapkan konfigurasi dan penyebaran ulang agen yang dihosting.

Agen yang dihosting memerlukan integrasi kode siap pengoptimal. Foundry Toolkit secara otomatis membuat perancah integrasi ini saat Anda memulai pengoptimalan. Untuk alur kerja CLI Pengembang Azure, tambahkan paket pengoptimalan dan konfigurasi garis besar sebelum Anda mulai. Lihat Menyiapkan agen Anda untuk pengoptimalan. Agen prompt tidak memerlukan integrasi kode ini.

Cara kerja pengoptimal agen

Pengoptimal agen menjalankan evaluasi perulangan tertutup dan siklus peningkatan:

  1. Mengevaluasi garis besar. Pengoptimal memanggil agen Anda terhadap himpunan data tugas dan menilai setiap respons terhadap kriteria yang Anda tentukan atau set default bawaan. Skor dasar adalah skor agen Anda sebelum ada perubahan.
  2. Hasilkan kandidat. Pengoptimal menghasilkan konfigurasi alternatif yang disebut kandidat, seperti instruksi yang ditulis ulang, keterampilan yang ditemukan, deskripsi alat yang ditingkatkan, atau pilihan model yang berbeda. Jenis kandidat yang tersedia bergantung pada jenis agen.
  3. Mengevaluasi kandidat. Pengoptimal menguji setiap kandidat terhadap himpunan data yang sama.
  4. Beri peringkat dan rekomendasikan. Pengoptimal memberi peringkat hasil dengan skor komposit, nilai antara 0,0 dan 1,0 yang mewakili performa agregat, dan menandai kandidat terbaik dengan ★ . Anda kemudian menerapkan dan meluncurkan versi yang menang.

Seluruh proses berjalan di cloud. Durasi tergantung pada ukuran himpunan data, jumlah kandidat, dan model yang dipilih.

Untuk agen yang dihosting, setelah Anda membuat agen Anda siap untuk pengoptimal, tidak diperlukan perubahan kode lebih lanjut di antara proses yang dijalankan. load_config() mengembalikan garis besar Anda secara normal dan memasok konfigurasi yang dioptimalkan selama eksekusi tanpa bendera fitur atau logika kondisional.

Warning

Selama pengoptimalan, pengoptimal mengevaluasi agen Anda dengan memanggilnya terhadap setiap tugas dalam himpunan data Anda. Jika agen Anda memanggil alat eksternal—seperti API, database, atau layanan pihak ketiga—panggilan tersebut dijalankan selama setiap evaluasi dijalankan. Untuk menghindari efek samping yang tidak diinginkan (biaya, mutasi status, atau pembatasan tarif), pertimbangkan untuk menggunakan titik akhir pengujian atau implementasi alat tiruan selama pengoptimalan.

Target pengoptimalan

Sasaran pengoptimalan adalah aspek tertentu dari konfigurasi agen Anda yang dapat ditingkatkan oleh pengoptimal. Target yang tersedia tergantung pada jenis agen. Untuk agen yang di-host, pengoptimal secara otomatis mengaktifkan target yang berlaku dari konfigurasi dasar dan pengaturan eval.yaml.

Target Apa yang ditingkatkan oleh pengoptimal Agen prompt Agen yang dihosting
Penyetelan instruksi Menulis ulang dan menyempurnakan prompt sistem agar memperoleh skor yang lebih tinggi. Menggunakan versi prompt-agent yang dipilih sebagai dasar. Diaktifkan ketika baseline berisi file instructions.md.
Peningkatan keterampilan Menyempurnakan isi setiap skill yang dapat digunakan kembali tanpa mengubah tujuannya. Tidak didukung. Diaktifkan saat baseline memiliki direktori skills/ dengan berkas SKILL.md.
Pengoptimalan alat Meningkatkan alat pemanggilan fungsi dan deskripsi parameter sehingga model memanggil alat dengan lebih akurat. Ini tidak mengubah jenis, nilai bawaan, atau bidang yang diperlukan. Tersedia untuk alat pemanggilan fungsi. Karena klien menjalankan alat-alat ini, eksekusi alat tidak dievaluasi selama pengoptimalan. Diaktifkan ketika baseline memiliki file tools.json. Hanya alat pemanggilan fungsi yang didukung.
Pemilihan model Mengevaluasi agen di berbagai penerapan model untuk menemukan keseimbangan terbaik antara kualitas dan biaya. Pilih model kandidat dalam panduan optimasi. Tambahkan penyebaran kandidat ke model_search_space dalam eval.yaml.

Untuk input dasar agen yang dihosting, lihat Buat agen Anda siap untuk pengoptimal. Untuk menjalankan dan mengonfigurasi target agen yang dihosting, lihat Mengoptimalkan instruksi agen, keterampilan, alat, dan model.

Models

Pengoptimal agen menggunakan dua model selama proses pengoptimalan. Keduanya harus di-deploy di proyek Foundry Anda.

Model Kunci konfigurasi agen yang dihosting Bendera CLI agen yang dihosting Peran Model yang didukung
Model evaluasi eval_model --eval-model Menilai respons agen terhadap kriteria dalam himpunan data Model penyelesaian chat apa pun (misalnya, gpt-4.1-mini)
Model pengoptimalan optimization_model --optimize-model Menghasilkan konfigurasi kandidat (instruksi, keterampilan, alat, pemilihan model) gpt-5, gpt-5.1, gpt-5.2, gpt-5.4, gpt-5.5, DeepSeek-V4-Pro, DeepSeek-V-3.2

Model evaluasi berjalan sekali untuk setiap evaluator, tugas, dan evaluasi kandidat. Ini membaca respons agen dan setiap kriteria, lalu mengembalikan skor biner. Model pengoptimalan menganalisis hasil dasar dan menghasilkan kandidat yang ditingkatkan di seluruh target yang dikonfigurasi, termasuk instruksi, keterampilan, alat, dan model. Karena melakukan penalaran terhadap seluruh kumpulan data, model optimisasi yang lebih canggih biasanya menghasilkan kandidat yang lebih baik.

Untuk agen prompt, pilih model evaluasi dan model kandidat di wizard pengoptimalan. Untuk agen yang dihosting, tentukan model di eval.yaml atau dengan bendera CLI. Pengaturan optimization_model diperlukan untuk eksekusi agen yang dihosting. Untuk langkah-langkah konfigurasi, lihat Memilih model evaluasi dan pengoptimalan.

Memahami hasil pengoptimalan

Bagian ini menjelaskan tabel hasil, bagaimana skor komposit dihitung, dan cara menafsirkan peningkatan.

Tip

Lihat hasil pengoptimalan di portal Foundry. Navigasi ke proyek Anda, pilih Agen, pilih agen Anda, lalu pilih tab Optimalkan untuk melihat perbandingan skor, permintaan atau perubahan konfigurasi, dan detail evaluator.

Untuk agen prompt, proses yang selesai menampilkan skor baseline dan kandidat, perbandingan prompt sebelum dan sesudah, model, serta deskripsi alat, dan skor tiap evaluator.

Untuk agen yang dihosting, CLI juga menampilkan tabel hasil:

Results:
  Candidate              Score  Eval  Strategy
  ──────────────────── ───────  ────  ────────
  baseline                0.93  View
  candidate_1             0.90  View  skill_policy-reviewer
  candidate_2 ★           0.94  View  skill_policy-reviewer, tools
  candidate_3             0.94  View  skill_policy-reviewer, system_prompt, tools
  candidate_4             0.93  View  skill_policy-reviewer, tools

  Candidate IDs:
      baseline             cand_a8a951...
      candidate_1          cand_8d5c85...
    ★ candidate_2          cand_a0ea2e...
      candidate_3          cand_2ae7bb...
      candidate_4          cand_0f6485...

  Apply the best candidate locally, then deploy:
    azd ai agent optimize apply --candidate cand_a0ea2e...
    azd deploy

Kolom tabel hasil

Column Description
Kandidat Nama konfigurasi. baseline adalah agen Anda saat ini sebelum pengoptimalan.
Skor Skor komposit di semua tugas dan kriteria, mulai dari 0,0 hingga 1,0.
Eval Tautan ke tugas evaluasi di portal Foundry.
Strategi Target mutasi yang disertakan dalam kandidat, seperti skill_policy-reviewer, tools.

Tanda ★ menandai kandidat dengan skor komposit tertinggi. Ini adalah kandidat yang direkomendasikan untuk diterapkan.

Bagaimana skor dihitung

Setiap evaluator dalam himpunan data Anda menghasilkan skor mentah untuk respons agen. Pengoptimal memproses skor ini untuk menghasilkan skor komposit yang ditunjukkan dalam hasil:

  • Skala ulang: Setiap skor mentah evaluator diskalakan kembali menjadi 0–1.
  • Balik jika diperlukan: Jika evaluator dikonfigurasi sehingga lebih rendah lebih baik, skor dibalik sehingga semua evaluator menggunakan semantik "lebih tinggi lebih baik".
  • Rata-rata: Skor yang diskalakan ulang di semua evaluator dan tugas dirata-ratakan untuk menghasilkan skor komposit.

Skor komposit: Rata-rata semua skor evaluator yang diskalakan kembali di semua tugas.

Menginterpretasikan peningkatan skor

Penyempurnaan Penafsiran
Kurang dari 0,03 Kebisingan. Bukan perbaikan yang bermakna.
0,03 hingga 0,10 Peningkatan sedang. Layak diterapkan.
0,10 hingga 0,20 Peningkatan yang signifikan.
Lebih besar dari 0,20 Peningkatan besar. Kemungkinan dari garis besar yang buruk.

Kompromi token

Instruksi yang dioptimalkan seringkali lebih panjang dan lebih rinci, yang dapat meningkatkan penggunaan token respons. Pertimbangkan faktor-faktor ini:

  • Apakah peningkatan token sebanding dengan peningkatan skor
  • Apakah peningkatan biaya sesuai dengan anggaran Anda
  • Apakah respons terlalu panjang tanpa perlu atau justru memberikan nilai tambah berkat panjangnya

Untuk detail selengkapnya tentang rentang biaya sebelum dijalankan dan penggunaan terukur setelah dijalankan, lihat Perkiraan biaya pengoptimalan agen dan penggunaan token.

Batasan dan ketersediaan

  • Pengoptimal agen mendukung agen prompt dan agen yang dihosting selama pratinjau.
  • Proses pengoptimalan prompt-agent dimulai di portal Foundry. Anda dapat mempromosikan kandidat yang dipilih ke versi agen baru dari proses yang telah selesai.
  • Pengoptimalan agen yang dihosting tersedia di semua wilayah tempat agen yang dihosting tersedia, kecuali Norwegia Timur.
  • Pengoptimalan agen yang dihosting memerlukan protokol Respons.