Lacak penggunaan model

Halaman ini menjelaskan cara memantau penggunaan untuk layanan Unity AI Gateway menggunakan tabel sistem pelacakan penggunaan.

Tabel pelacakan penggunaan secara otomatis mengambil detail permintaan dan respons untuk layanan model, mencatat metrik penting seperti penggunaan dan latensi token. Anda dapat menggunakan data dalam tabel ini untuk memantau pengguna, melacak biaya, dan mendapatkan wawasan tentang performa dan konsumsi layanan model.

Pelacakan penggunaan juga mencatat permintaan ai_query ke layanan model yang disediakan oleh Databricks.

Admin akun dan ruang kerja dapat melihat gambaran umum konsolidasi penggunaan AI di halaman AI di Governance Hub.

Requirements

Pricing

Pelacakan penggunaan adalah fitur Unity AI Gateway yang ditagih. Azure Databricks mengenakan biaya untuk penggunaan yang dicatat ke system.ai_gateway.usage tabel. Lihat harga Unity AI Gateway.

Mengkueri tabel penggunaan

Unity AI Gateway mencatat data penggunaan ke system.ai_gateway.usage tabel sistem. Anda bisa menampilkan tabel di UI, atau mengkueri tabel dari Databricks SQL atau buku catatan.

Note

Baik peran admin akun maupun metastore secara default diperlukan untuk melihat atau melakukan query pada system.ai_gateway.usage tabel. Admin dapat mengelola akses ke tabel sistem untuk mengontrol izin pengguna, grup, dan prinsipal layanan.

Untuk menampilkan tabel di UI, klik tautan tabel pelacakan penggunaan di halaman layanan model untuk membuka tabel di Catalog Explorer.

Untuk mengkueri tabel dari Databricks SQL atau buku catatan:

SELECT * FROM system.ai_gateway.usage;

Tip

Genie Code (mode Agen) dapat melakukan ini untuk Anda. Coba perintah contoh ini:

Query the system.ai_gateway.usage table to analyze AI Gateway usage showing request count and total tokens, grouped by endpoint name for the last 7 days.

Dasbor penggunaan bawaan

Note

Beberapa ruang kerja belum menampilkan menu dropdown Tata Kelola . Di ruang kerja tersebut, gunakan tombol Buat Dasbor mandiri, Lihat Dasbor, dan Perbarui di halaman Gateway AI Unity sebagai gantinya.

Buat dashboard penggunaan bawaan

Admin akun dapat membuat dasbor penggunaan Unity AI Gateway bawaan untuk memantau penggunaan, melacak biaya, dan mendapatkan wawasan tentang performa dan konsumsi layanan model. Dari halaman Unity AI Gateway, klik Kelola di kanan atas, lalu klik Buat Dasbor Penggunaan. Gudang data yang menjalankan kueri untuk dasbor akan dipilih secara otomatis.

Note

Pembuatan dasbor hanya untuk admin akun karena memerlukan izin SELECT pada tabel system.ai_gateway.usage. Data dasbor tunduk pada usage kebijakan retensi tabel. Lihat Tabel sistem apa yang tersedia?.

Saat versi dasbor penggunaan bawaan yang lebih baru tersedia, admin akun dapat mengklik Perbarui pada baris versi dasbor di menu dropdown Tata Kelola di halaman Gateway AI Unity.

Anda dapat menggunakan opsi konfigurasi dasbor berikut untuk mengelola dasbor:

  • Cakupan: Pilih apakah cakupan dasbor ditetapkan untuk akun atau ruang kerja.
  • Izin: Pilih apakah kueri berjalan menggunakan izin pemilik dasbor atau izin setiap penampil. Lihat Apa itu izin data bersama?.
  • Pembaruan otomatis: Saat Anda mengaktifkan opsi ini, dasbor diperbarui secara otomatis setiap kali versi yang lebih baru tersedia dan administrator akun mengunjungi halaman Gateway AI Unity.

opsi dasbor pembaruan ai-gateway

Saat dasbor diperbarui ke versi 0.3 atau yang lebih tinggi, jadwal secara otomatis dibuat untuk me-refresh dasbor setiap 6 jam. Jika diperlukan, jadwal ini dapat dinonaktifkan di dasbor Lakeview. Lihat Buat jadwal.

Menampilkan dasbor penggunaan

Untuk melihat dasbor, klik Kelola di kanan atas halaman Gateway Unity AI, lalu klik Dasbor Penggunaan. Dasbor terbuka di tab baru. Dasbor bawaan memiliki visibilitas komprehensif ke dalam penggunaan, performa, dan biaya layanan model Unity AI Gateway. Ini termasuk beberapa permintaan pelacakan halaman, konsumsi token, metrik latensi, tingkat kesalahan, perincian biaya, lalu lintas server MCP eksternal, dan aktivitas agen pengkodian.

dasbor penggunaan ai-gateway

Dasbor menyediakan analitik lintas ruang kerja secara default. Semua halaman dasbor dapat difilter menurut rentang tanggal dan ID ruang kerja.

  • Tab Gambaran Umum: Menampilkan metrik penggunaan tingkat tinggi termasuk volume permintaan harian, tren penggunaan token dari waktu ke waktu, pengguna teratas berdasarkan konsumsi token, dan jumlah pengguna unik total. Gunakan tab ini untuk mendapatkan rekam jepret cepat dari keseluruhan aktivitas Unity AI Gateway dan mengidentifikasi pengguna dan model yang paling aktif.
  • Tab Performa: Melacak metrik performa utama termasuk persentil latensi (P50, P90, P95, P99), waktu untuk byte pertama, tingkat kesalahan, dan distribusi kode status HTTP. Gunakan tab ini untuk memantau kesehatan layanan model dan mengidentifikasi hambatan performa atau masalah keandalan.
  • Tab Penggunaan: Menampilkan perincian konsumsi terperinci berdasarkan layanan model, ruang kerja, dan pemohon. Tab ini menunjukkan pola penggunaan token, distribusi permintaan, dan rasio hit cache.
  • Tab Pengamatan Biaya: Menampilkan perincian biaya berdasarkan layanan model, model target, pengguna, tag layanan, dan tag permintaan. Tab ini juga mencakup perkiraan biaya untuk model eksternal. Lihat Analisis biaya Unity AI Gateway.
  • Tab Server MCP eksternal: Menampilkan volume permintaan, tingkat kesalahan, pengguna dan koneksi, dan tren penggunaan harian untuk lalu lintas server MCP eksternal.
  • Tab Agen Pengodean: Melacak aktivitas dari agen pengodean terintegrasi termasuk Kursor, Kode Claude, Gemini CLI, dan Codex CLI. Tab ini menunjukkan metrik seperti hari aktif, sesi pengodean, penerapan, dan baris kode yang ditambahkan atau dihapus untuk memantau penggunaan alat pengembang. Lihat Dasbor agen coding untuk detail lebih lengkap.

Skema tabel penggunaan

Tabel system.ai_gateway.usage memiliki skema berikut:

Nama kolom Type Description Example
account_id string ID akun. 11d77e21-5e05-4196-af72-423257f74974
workspace_id string ID ruangkerja. 1653573648247579
request_id string Identifikasi unik untuk permintaan. b4a47a30-0e18-4ae3-9a7f-29bcb07e0f00
invocation_id string Pengidentifikasi unik untuk setiap panggilan inferensi individu. Beberapa pemanggilan dapat menggunakan request_id yang sama, seperti pada pemeriksaan guardrail atau panggilan agen multi-turn. Gunakan invocation_id untuk membedakannya. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
schema_version INTEGER Versi skema catatan pemakaian. 1
endpoint_id string ID unik layanan model Unity AI Gateway. 43addf89-d802-3ca2-bd54-fe4d2a60d58a
endpoint_name string Nama layanan model Unity AI Gateway. databricks-gpt-5-2
endpoint_tags MAP Tag yang dikonfigurasi pada layanan model pada waktu pembuatan atau pembaruan. Mereka berlaku untuk semua permintaan ke layanan model dan berguna untuk mengategorikan layanan berdasarkan tim, pusat biaya, atau proyek. {"team": "engineering"}
endpoint_metadata STRUCT Metadata layanan model termasuk creator, , creation_time, last_updated_timedestinations, inference_table, dan fallbacks. {"creator": "user.name@email.com", "creation_time": "2026-01-06T12:00:00.000Z", ...}
event_time TIMESTAMP Tanda waktu saat permintaan diterima. 2026-01-20T19:48:08.000+00:00
latency_ms LONG Total latensi dalam milidetik. 300
time_to_first_byte_ms LONG Waktu respons byte pertama dalam milidetik. 300
destination_type string Jenis tujuan (misalnya, model eksternal atau model fondasi). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name string Nama model atau penyedia tujuan. databricks-gpt-5-2
destination_id string ID unik tujuan. 507e7456151b3cc89e05ff48161efb87
destination_model string Model tertentu yang digunakan dalam permintaan. GPT-5.2
requester string ID pengguna atau perwakilan layanan yang membuat permintaan. user.name@email.com
requester_type string Jenis pemohon (pengguna, perwakilan layanan, atau grup pengguna). USER
ip_address string Alamat IP pemohon. 1.2.3.4
url string URL permintaan. https://<workspace-url>/ai-gateway/mlflow/v1/chat/completions
user_agent string Agen pengguna dari pengirim permintaan. OpenAI/Python 2.13.0
api_type string Jenis panggilan API (misalnya, obrolan, penyelesaian, atau penyematan). mlflow/v1/chat/completions
request_tags MAP Tag yang disediakan pengguna dikirim dengan permintaan individual menggunakan Databricks-Ai-Gateway-Request-Tags header HTTP. Gunakan tag permintaan untuk mengaitkan penggunaan ke proyek, tim, lingkungan, atau pengguna akhir tertentu. Lihat Permintaan tag untuk pelacakan penggunaan dan Permintaan tag untuk pelacakan penggunaan. {"project": "chatbot", "team": "ml-platform"}
invocation_metadata STRUCT Metadata yang dihasilkan oleh sistem tentang panggilan inferensi. Berisi source, layanan atau jalur yang memulai panggilan. {"source": "EXTERNAL_CLIENT"}
input_tokens LONG Jumlah token input. 100
output_tokens LONG Jumlah token output. 100
total_tokens LONG Jumlah total token (input + output). 200
token_details STRUCT Perincian token terperinci termasuk cache_read_input_tokens, , cache_creation_input_tokensdan output_reasoning_tokens. {"cache_read_input_tokens": 100, ...}
response_content_type string Jenis konten respons. application/json
status_code INT Kode status HTTP dari respons. 200
routing_information STRUCT Rincian pengarahan untuk upaya fallback. attempts Berisi array dengan priority, action, destination, destination_id, status_code, error_code, latency_ms, start_time, dan end_time untuk setiap model yang dicoba selama permintaan. {"attempts": [{"priority": "1", ...}]}

Permintaan tag untuk pelacakan penggunaan

tag permintaan adalah pasangan kunci-nilai kustom yang dilampirkan oleh pemanggil pada masing-masing permintaan. Gunakan tag permintaan untuk mengaitkan penggunaan berdasarkan proyek, tim, lingkungan, pengguna akhir, atau dimensi lain yang relevan dengan organisasi Anda. Tag permintaan dicatat ke system.ai_gateway.usage tabel dan dapat digunakan untuk memfilter, mengagregasi, dan menganalisis data penggunaan.

Untuk menandai setiap permintaan, sertakan header HTTP Databricks-Ai-Gateway-Request-Tags yang berisi objek JSON yang memetakan kunci string ke nilai string. Tag permintaan dicatat dalam kolom request_tags pada tabel penggunaan dan dalam tabel inferensi.

Untuk contoh yang menunjukkan cara menetapkan tag permintaan dengan REST API, OpenAI SDK, dan Anthropic SDK, lihat Tag permintaan untuk pelacakan penggunaan.

Misalnya, Anda dapat mengagregasi penggunaan berdasarkan proyek menggunakan tag permintaan:

SELECT
  request_tags['project'] AS project,
  COUNT(*) AS request_count,
  SUM(total_tokens) AS total_tokens
FROM system.ai_gateway.usage
WHERE request_tags['project'] IS NOT NULL
GROUP BY request_tags['project']
ORDER BY total_tokens DESC;

Keterbatasan

  • Unity AI Gateway tidak melacak penggunaan token untuk respons non-streaming dan non-penyematan yang lebih besar dari 1 MiB.

Sumber daya tambahan