Lernprogramm: Steuern des Modellzugriffs eines Codierungs-Agents mit Unity AI Gateway

In diesem Lernprogramm verbinden Sie einen externen Codierungs-Agent, z. B. Codex, Gemini CLI oder Cursor, mit großen Sprachmodellen (LLMs), die von Unity AI Gateway gesteuert werden. Sie steuern dann, wer auf diese Modelle zugreifen kann und wie viel der Agent verbrauchen und ausgeben kann. Anstatt jeder Entwickler einen Anbieter-API-Schlüssel in ihr Tool einzufügen, leitet jede Anforderung über einen Unity AI Gateway-Modelldienst weiter. Unity Catalog steuert, wer welche Modelle verwenden kann, und Unity AI Gateway setzt Grenzwerte durch und zeichnet die Nutzung und die Kosten auf.

Am Ende dieses Lernprogramms haben Sie Folgendes:

  • Ein Programmieragent, der jede Anfrage an ein Modell über Unity AI Gateway unter Verwendung Ihrer Azure-Databricks-Anmeldeinformationen sendet, ohne dass sich auf dem Rechner des Entwicklers ein API-Schlüssel des Anbieters befindet.
  • Zentrale Aufzeichnungen der Nutzung und Kosten des Agenten, vorbehaltlich der Ratenbegrenzungen und Berechtigungen, die Sie für den Modelldienst festgelegt haben.

Prerequisites

Schritt 1: Verbinden Ihres Codierungs-Agents

Sie können den Agent auf eine von zwei Arten verbinden:

  • ucode (empfohlen): Ein Open-Source-Startprogramm (Unity AI Gateway Coding CLI), das OAuth verarbeitet und die Konfigurationsdatei jedes Agents schreibt, einschließlich der Modelldienstbasis-URL und des Modells. Sie verwalten keine API-Schlüssel oder Endpunkte manuell.
  • Manuelle Konfiguration: Legen Sie die Basis-URL des Modelldiensts fest und modellieren Sie sich selbst in den integrierten Einstellungen des Tools (Cursor, Codex oder Gemini CLI). Siehe Integration mit Coding-Agenten.

Dieser Abschnitt verwendet ucode. Installieren Sie ihn, und führen Sie dann den gewünschten Agent aus:

uv tool install git+https://github.com/databricks/ucode

Kodex

ucode codex

Um den nicht interaktiven Modus zu verwenden, übergeben Sie das eigene Flag des Agenten über ucode:

ucode codex --full-auto

Gemini CLI

ucode gemini

OpenCode

ucode opencode

Copilot

ucode copilot

Beim ersten Start fordert ucode Sie zur Eingabe Ihrer Arbeitsbereichs-URL auf und authentifiziert sich; bei späteren Starts geht es direkt zum Agenten.

Schritt 2: Steuern des Modellzugriffs des Agents

Sie können einen Modelldienst wie jedes andere in Unity Catalog absicherbare Objekt verwalten: Erteilen Sie EXECUTE, um zu steuern, wer ihn verwenden kann, und nutzen Sie Unity AI Gateway, um Anfragevolumen und Ausgaben zu begrenzen. Richten Sie eine der folgenden Optionen ein:

  • Verwalten Sie, wer auf das Modell zugreifen kann: Öffnen Sie im Katalog-Explorer den Modelldienst, und gewähren EXECUTE Sie Benutzern oder Gruppen auf der Registerkarte "Berechtigungen" .
  • Anfragevolumen begrenzen: Klicken Sie im Catalog Explorer auf der Registerkarte Übersicht des Modelldiensts unter Ratenbegrenzungen auf Einrichten. Legen Sie ein Anfragen-pro-Minute- (QPM) oder Token-pro-Minute- (TPM) Ratenlimit für alle Anfragen am Endpunkt oder pro Benutzer fest.
  • Festlegen eines Ausgabenbudgets: Ein Kontoadministrator kann ein Budget für alle Unity AI Gateway-Endpunkte erstellen. Das Budget fasst die Ausgaben für Ihre Modelldienste zusammen; legen Sie eine Warnschwelle fest, um benachrichtigt zu werden oder die Nutzung zu blockieren, bevor die Kosten diese Schwelle überschreiten.

Schritt 3: Überprüfen Sie, ob der Datenverkehr gesteuert wird

Vergewissern Sie sich, dass die Anforderungen des Agents über das Unity AI-Gateway weitergeleitet werden und aufgezeichnet werden:

  • Vom Agenten: Senden Sie einen Prompt. Der Agent antwortet mithilfe des von Ihnen konfigurierten Modells ohne Anbieter-API-Schlüssel auf Ihrem Computer.

  • In der Systemtabelle zur Nutzung: Fragen Sie die Nutzungsverfolgung ab, um zu bestätigen, dass Ihr Modelldienst die Anfragen aufzeichnet:

    SELECT service_name, requester, status_code, COUNT(*) AS calls
    FROM system.ai_gateway.usage
    WHERE service_type = 'MODEL_SERVICE'
    GROUP BY service_name, requester, status_code
    ORDER BY calls DESC;
    

Um die Ausgaben genauer zu analysieren, siehe Analysieren der Kosten des Unity AI Gateways.

Nächste Schritte