이 튜토리얼에서는 Codex, Gemini CLI, Cursor와 같은 외부 코딩 에이전트를 Unity Gateway가 관리하는 대형 언어 모델(LLM)에 연결합니다. 그런 다음 해당 모델에 액세스할 수 있는 사용자와 에이전트가 사용하고 지출할 수 있는 금액을 제어합니다. 각 개발자가 제공자 API 키를 도구에 붙여넣는 대신, 모든 요청은 Unity Gateway 모델 서비스를 통해 라우팅됩니다. Unity 카탈로그는 누가 어떤 모델을 사용할 수 있는지 통제하며, Unity Gateway는 사용량과 비용을 제한하고 기록합니다.
이 자습서를 마치면 다음을 수행할 수 있습니다.
- 개발자 머신에는 제공자 API 키가 없고, Azure Databricks 자격 증명을 사용해 모든 모델 요청을 Unity Gateway를 통해 전송하는 코딩 에이전트입니다.
- 모델 서비스에 설정한 속도 제한 및 사용 권한에 따라 에이전트의 사용량 및 비용에 대한 중앙 레코드입니다.
Prerequisites
- Unity 카탈로그에 사용할 수 있는 작업 영역입니다. Unity 카탈로그 시작을 참조하세요.
- 트래픽을 라우팅할 모델 서비스, 그리고 그 위에서
EXECUTE. Azure Databricks 호스팅 모델은 즉시 사용할 수 있는 모델 서비스로 사용할 수 있습니다. Govern model API(모델 서비스)를 참조하세요. 직접 관리하는 모델을 관리하려면 먼저 모델을 만듭니다. 모델 API 생성 및 관리 (모델 서비스)을 참조하세요. - 작업 영역에 인증된 Azure Databricks CLI입니다.
- 다음 형식의 Azure Databricks 작업 영역 URL입니다:
https://<workspace-url>.
1단계: 코딩 에이전트 연결
다음 두 가지 방법 중 하나로 에이전트를 연결할 수 있습니다.
-
ucode(권장) 오픈 소스 런처(Unity Gateway Coding CLI)로, OAuth를 처리하고 각 에이전트의 구성 파일(모델 서비스 베이스 URL과 모델을 포함)을 작성합니다. API 키 또는 엔드포인트는 직접 관리하지 않습니다. - 수동 구성: 모델 서비스 기본 URL을 설정하고 도구의 기본 제공 설정(커서, Codex 또는 Gemini CLI)에서 직접 모델링합니다. 코딩 에이전트와 통합을 참조하세요.
이 섹션에서는 .를 사용합니다 ucode. 설치한 다음 원하는 에이전트를 실행합니다.
uv tool install git+https://github.com/databricks/ucode
코드엑스
ucode codex
비대화형 모드로 실행하려면 에이전트 자체 플래그를 ucode를 통해 전달하세요:
ucode codex --full-auto
Gemini CLI
ucode gemini
OpenCode
ucode opencode
Copilot
ucode copilot
처음 실행하면 ucode 작업 영역 URL을 묻는 메시지가 표시되고 인증됩니다. 나중에 실행하면 에이전트로 바로 이동합니다.
2단계: 에이전트의 모델 액세스 제어
다른 Unity 카탈로그처럼 모델 서비스를 관리할 수 있습니다: 누가 사용할 수 있는지 그랜트 EXECUTE 로 제어하고, Unity 게이트웨이를 사용해 요청량과 지출을 제한할 수 있습니다. 다음 중 하나를 설정하세요:
-
모델에 액세스할 수 있는 사용자 관리: 카탈로그 탐색기에서 모델 서비스를 열고
EXECUTE탭에서 사용자 또는 그룹에 부여 합니다. - 요청 볼륨 제한: 카탈로그 탐색기의 모델 서비스 개요 탭에서 속도 제한에서 설정을 클릭합니다. 엔드포인트 또는 사용자당 모든 요청에 대해 QPM(분당 요청) 또는 TPM(분당 토큰) 속도 제한을 설정합니다.
- 지출 예산 설정: 계정 관리자는 모든 Unity Gateway 엔드포인트에 적용된 예산 을 생성할 수 있습니다. 예산은 사용자의 모든 모델 서비스 전반의 지출을 합산합니다. 비용이 이 한도를 초과하기 전에 알림을 받거나 사용이 차단되도록 경고 임계값을 설정하세요.
3단계: 트래픽이 관리되는지 확인
에이전트의 요청이 Unity 게이트웨이를 통해 라우팅되고 기록되는지 확인하세요:
에이전트에서: 프롬프트를 보냅니다. 에이전트는 구성한 모델을 사용하여 응답하며 머신에 공급자 API 키가 없습니다.
사용 시스템 테이블: 사용량 추적 을 쿼리하여 모델 서비스에서 요청을 기록하는지 확인합니다.
SELECT service_name, requester, status_code, COUNT(*) AS calls FROM system.ai_gateway.usage WHERE service_type = 'MODEL_SERVICE' GROUP BY service_name, requester, status_code ORDER BY calls DESC;
지출 분석을 더 자세히 원하시면 'Unity Gateway 비용 분석'을 참고하세요.