Generování metrik pro spotřebu velkých tokenů jazykového modelu

PLATÍ PRO: Všechny úrovně služby API Management

Tato llm-emit-token-metric zásada odesílá vlastní metriky do Application Insights o spotřebě velkých tokenů jazykového modelu (LLM) prostřednictvím rozhraní API LLM.

Metriky počtu tokenů závisí na modelu a poskytovateli a mohou zahrnovat celkové, promptní a dokončené tokeny. V náhledu zahrnují metriky počtu tokenů cache, uvažování, myšlení a další kategorie tokenů.

Note

Nastavte prvky zásad a podřízené prvky v pořadí uvedeném v prohlášení o zásadách. Přečtěte si další informace o tom, jak nastavit nebo upravit zásady služby API Management.

Podporovaná rozhraní API modelu

Tato zásada funguje s rozhraními API LLM přidanými do služby API Management, která odpovídají jednomu z následujících schémat rozhraní API:

  • Rozhraní API pro dokončování chatu OpenAI nebo odpovědi
  • Anthropic rozhraní API pro zprávy (aktuálně podporované ve vrstvách SLUŽBY API Management v2)
  • Google Vertex AI API

Omezení pro vlastní metriky

Azure Monitor ukládá limity využití pro vlastní metriky, které můžou ovlivnit vaši schopnost generovat metriky ze služby API Management. Azure Monitor například v současné době nastavuje limit 10 klíčů dimenzí na metriku a limit 50 000 celkového počtu aktivních časových řad na oblast v předplatném (v rámci 12hodinového období). Ve službě API Management se pro výchozí dimenze používá 5 z nich, včetně následujících:

  • Region
  • ID služby
  • Název služby
  • Typ služby

Tato omezení mají následující důsledky pro konfiguraci vlastních metrik v zásadách služby API Management, například emit-metricazure-openai-emit-token-metric:

  • Pro každou zásadu můžete nakonfigurovat maximálně 5 vlastních dimenzí.

  • Počet aktivních časových řad generovaných politikou je součinem počtu unikátních hodnot každé konfigurované dimenze v každém jmenném prostoru. Pokud byly například v zásadách nakonfigurovány tři vlastní dimenze a každá dimenze měla v daném období 10 možných hodnot, zásada by přispěla 1 000 (10 x 10 x 10) aktivních časových řad.

  • API Management omezuje každou dimenzi na 100 unikátních hodnot a každý jmenný prostor metrik na 1 000 aktivních časových řad. Když je dosaženo kterékoli z těchto hranic, žádné nové hodnoty rozměrů nebo časové řady nejsou sledovány a odpovídající metrická data jsou tiše vyřazeny.

  • Pokud zásadu nakonfigurujete v několika instancích služby API Management, které jsou ve stejné oblasti v předplatném, můžou všechny instance přispívat k limitu regionálních aktivních časových řad.

Přečtěte si další informace o omezeních a aspektech návrhu pro vlastní metriky ve službě Azure Monitor.

Prerequisites

Prohlášení o zásadách

<llm-emit-token-metric
        namespace="metric namespace" >      
        <dimension name="dimension name" value="dimension value" />
        ...additional dimensions...
</llm-emit-token-metric>

Attributes

Attribute Description Required Výchozí hodnota
názvový prostor Řetězec. Obor názvů metriky Výrazy zásad nejsou povolené. No API Management

Elements

Element Description Required
dimension Přidejte jeden nebo více těchto prvků pro každou dimenzi, která je součástí metriky. Yes

Atributy dimenze

Attribute Description Required Výchozí hodnota
name Řetězcový výraz nebo výraz zásad. Název dimenze. Yes N/A
value Řetězcový výraz nebo výraz zásad. Hodnota dimenze Tuto možnost je možné vynechat, pouze pokud name odpovídá jedné z výchozích dimenzí. Pokud ano, je hodnota zadaná podle názvu dimenze. No N/A

Výchozí názvy dimenzí, které lze použít bez hodnoty

  • ID rozhraní API
  • ID operace
  • ID produktu
  • ID uživatele
  • ID předplatného
  • Location
  • ID brány
  • ID back-endu

Usage

Poznámky k využití

  • Tuto zásadu je možné použít vícekrát pro každou definici zásady.
  • Pro tuto zásadu můžete nakonfigurovat maximálně 5 vlastních dimenzí.
  • Hodnoty v sekci využití odpovědi z LLM API, pokud jsou k dispozici, se používají k určení tokenových metrik.
  • Některé koncové body LLM podporují streamování odpovědí. Pokud je stream nečekaně přerušen nebo ukončen, počty zachycených tokenů jsou nepřesné.
  • Některé modely OpenAI, zejména při streamování, ve výchozím nastavení nezahrnují počty tokenů v odpovědi. Pro přijetí počtu tokenů nastavte include_usage parametr na v true API požadavku.

Example

Následující příklad odešle metriky počtu tokenů LLM do Application Insights spolu s ID rozhraní API jako výchozí dimenze.

<policies>
  <inbound>
      <llm-emit-token-metric
            namespace="MyLLM">   
            <dimension name="API ID" />
        </llm-emit-token-metric> 
  </inbound>
  <outbound>
  </outbound>
</policies>

Další informace o práci se zásadami najdete v tématech: