Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Yapay zeka çıkarım iş yükleri geleneksel durum bilgisi olmayan HTTP uygulamaları gibi davranmaz. İstekler genellikle modele özgüdür, uzun sürer, işlenmesi maliyetlidir ve hızlandırıcı kullanılabilirliği, kuyruk derinliği, istek önceliği, belirteç bütçesi ve model sunucusu kapasitesi gibi çalışma zamanı sinyallerine duyarlı olabilir.
Kapsayıcılar için Application Gateway Çıkarım Ağ Geçidi, Gateway API modeline çıkarım farkındalığına sahip kaynaklar ekleyen Kubernetes Gateway API Çıkarım Uzantısı ile bütünleşerek bu iş yüklerini destekler. Çıkarım ağ geçidini kullanarak, kendi ortamınızda barındırdığınız model sunucularını, model farkındalığına ve yük farkındalığına sahip yönlendirme davranışıyla Application Gateway for Containers üzerinden yayımlayabilirsiniz.
Çıkarım ağ geçidi, büyük dil modellerine (LLM' ler) ve diğer çıkarım iş yüklerine hizmet etmek için tasarlanmıştır. İstekleri genel yük dengeleme yerine model sunucusu sinyallerine göre yönlendirir ve bu da ilk belirtecin (TTFT) süresini azaltır, yük altında zaman aşımlarını azaltır ve GPU verimliliğini artırır. Kapsayıcılar için Application Gateway'in giriş özelliklerine dayalı çıkarım ağ geçidi, model sunucularınıza ulaşmadan önce trafiğin güvenliğini sağlamak için yapay zeka iş yüklerini web uygulaması güvenlik duvarı (WAF) gibi özelliklerle eşleştirmenize de olanak tanır.
vLLM dahil olmak üzere birçok kurum içinde barındırılan çıkarım çalışma zamanı ortamı, OpenAI uyumlu HTTP API'lerini kullanıma sunar; bunlara /v1/chat/completions, /v1/completions ve /v1/models dahildir. OpenAI uyumlu, OpenAI tarafından barındırılan modellere yönelik bir kısıtlama değil API biçimini ifade eder. Bu biçimi kullanan bir çalışma zamanı veya ara sunucu aracılığıyla başka bir model ailesi sunuluyorsa, Application Gateway for Containers gövdeye dayalı yönlendirme yapmak için JSON istek gövdesindeki model alanını kullanabilir.
Important
Application Gateway for Containers çıkarım ağ geçidi şu anda önizleme sürümündedir.
Beta veya önizleme aşamasında olan ya da başka bir şekilde henüz genel kullanıma sunulmamış olan Azure özelliklerinde geçerli olan yasal koşullar için bkz. Microsoft Azure Önizlemeleri için Ek Kullanım Koşulları.
Ağ Geçidi API Çıkarımı Uzantısının sağladığı bilgiler
Ağ Geçidi API Çıkarım Uzantısı, çıkarıma özgü arka uç ve zamanlama kavramları ekleyerek ağ geçidi API'sini çıkarım ağ geçidine dönüştürür.
Uzantı şu birincil kaynakları ve bileşenleri tanıtır:
- InferencePool: Bir grup model sunucu podunu ve her çıkarım isteği için bir pod seçmek için kullanılan uç nokta seçiciyi temsil eden bir arka uç kaynağı.
- InferenceObjective: InferencePool’u paylaşan istekler için öncelik gibi istek işleme hedeflerini temsil eden bir kaynak.
- Uç Nokta Seçici (EPP): Kümenizde çalışan ve çıkarım zamanlaması uygulayan müşteri tarafından sağlanan bir uzantı. EPP istek meta verisini alır, yapılandırılabilir eklentiler kullanarak aday model sunucu pod’larını puanlar (örneğin, kuyruk derinliği, KV önbellek kullanımı ve önek önbelleği yakınlığına göre) ve seçilen uç noktayı döndürür. Uç nokta seçimi EPP'de çalıştığından, kullanılabilir yönlendirme davranışları EPP'nizin etkinleştirdiği puanlama eklentilerine bağlıdır.
-
Gövde tabanlı yönlendirme (BBR): OpenAI uyumlu bir istek gövdesini denetleyebilen, model adını ayıklayan ve model kullanan yönlendirme için üst bilgi olarak
X-Gateway-Model-Nameağ geçidinin kullanımına sunabilen bir istek işlemcisi.
Kapsayıcılar için Application Gateway BBR işlemcisini ağ geçidinin yönetilen bir parçası olarak çalıştırır, bu nedenle dağıtmak, ölçeklendirmek veya yama uygulamak için ayrı gövde tabanlı yönlendirme katmanı yoktur. İstek anındaki yönlendirme kararlarını desteklemek için müşterinin sağladığı bir EPP ile entegre olur. Çıkarım ağ geçidi, Gateway API Inference Extension API’yi destekler; bu nedenle bu yetenekleri standart Gateway API kaynakları üzerinden yapılandırabilir ve platform ekipleri, ayrı bir ingress yapılandırma modeli getirmek yerine, çıkarım trafiği için Kubernetes’e özgü yerel bir API modelini kullanabilir.
Kapsayıcılar için Application Gateway çıkarım kaynaklarını nasıl kullanır?
Application Gateway for Containers, giriş yapılandırması için standart Gateway API kaynaklarını kullanmaya devam ediyor. Bir HTTPRoute arka uç referansı, bir Kubernetes Service yerine bir InferencePool hedeflediğinde çıkarım davranışı etkinleştirilir.
Çıkarım olmayan rotalar için Application Gateway for Containers, mevcut Gateway API davranışını korur. Kubernetes Service arka uçlarını hedefleyen yollar çıkarım işlemcilerini çağırmaz ve çıkarıma özgü yönlendirme davranışı almaz.
Çıkarım yolları için, denetim düzlemi Ağ Geçidi API'sini ve çıkarım kaynaklarını mutabık tutar ve veri düzlemini şu şekilde programlar:
-
HTTPRoute,InferencePoolarka ucunu seçer. - ,
InferencePoolhavuza ait model sunucu podlarını seçer. - Uç nokta seçimi için havuzla ilişkili EPP çağrılır.
- Seçilen model sunucusu uç noktası isteği alır.
- İsteğe bağlı model kullanan yönlendirme, BBR tarafından ayıklanan istek modeli adını kullanır.
İstek akışı
Tipik bir çıkarım isteği bu yolu izler. Numaralandırılmış adımlar aşağıdaki diyagramdaki etiketlerle eşlenmiştir:
- İstemci isteği: İstemci, Kapsayıcılar için Application Gateway ön ucuna OpenAI uyumlu bir istek gönderir ve Ağ Geçidi dinleyicisi bunu kabul eder.
-
Gövde tabanlı yönlendirme (BBR): Model kullanan yollar için yönetilen BBR işlemcisi istek gövdesini inceler, model adını ayıklar ve üst bilgiyi ekler
X-Gateway-Model-Name.HTTPRouteardından uygunInferencePoolöğesini seçmek için bu değerle eşleşebilir. -
Uç nokta seçimi: Eşleşen yol bir
InferencePoolhedeflendiğinde Kapsayıcılar için Application Gateway, istek ve model sunucusu telemetrisini değerlendiren ve seçili uç noktayı döndüren EPP'yi çağırır. - InferencePool'a yönlendirme: Kapsayıcılar için Application Gateway isteği seçili model sunucusu pod'una iletir ve model sunucusunun yanıtı ağ geçidi üzerinden istemciye döner.
Yönlendirme özellikleri
Çıkarım ağ geçidi, kurum içinde barındırılan yapay zeka iş yükleri için şu yönlendirme düzenlerini destekler. Uç nokta seçimi EPP içinde gerçekleştiğinden, yük ve önbellek farkındalıklı davranışlar EPP’nizin etkinleştirdiği puanlayıcı eklentilerine bağlıdır.
- Model kullanan yönlendirme: Yönetilen BBR işlemcisinin ayıkladığı OpenAI uyumlu istek gövdelerindeki model adına göre istekleri yönlendirin.
-
Trafik bölme ve dağıtımlar: Kanarya veya mavi-yeşil model dağıtımları için trafiği arka uçlar arasında
HTTPRoutebölmek için standartbackendRefsağırlıklıInferencePoolkullanın. - Yük kullanan ve önbelleğe duyarlı uç nokta seçimi: EPP, kuyruk derinliği ve KV önbellek kullanımı gibi model sunucusu telemetrisini kullanarak uç noktaları puanlar. EPP, ön ek önbelleğinden haberdar olan puanlamayı etkinleştirdiğinde, aynı istem önekini paylaşan istekler, önbellek isabet oranını artırmak ve TTFT'yi düşürmek için aynı replika'ya yönlendirilir.
-
İstek önceliği ve aşırı yükleme koruması: Hizmet verme önceliğini atamak için kaynakları ve
InferenceObjectiveistek üst bilgisini kullanınx-gateway-inference-objective. Model sunucuları doyuma ulaştığında EPP, gecikmeye duyarlı trafiği korumak için önce düşük öncelikli istekleri eler. -
Dayanıklı uç nokta seçimi: Bir havuz için kullanılabilirliğin mi yoksa sıkı uç nokta seçiminin mi daha önemli olduğuna bağlı olarak, EPP hata davranışını
FailOpenveyaFailCloseile yapılandırın. - Ağ Geçidi API'si uyumluluğu: Giriş yapılandırması için Ağ Geçidi, HTTPRoute, ReferenceGrant ve standart Ağ Geçidi API'si durum koşullarını kullanmaya devam edin.
Güvenli çıkarım
Model sunucularını yönetilen ağ geçidinin arkasında özel tutun ve platformun güvenlik özelliklerini çıkarım trafiğine uygulayın.
- Web uygulaması güvenlik duvarı (WAF): Çıkarım ağ geçidi, kapsayıcılar için Application Gateway'deki mevcut WAF özelliğiyle yerel olarak eşleştirilir ve istekler model sunucularınıza ulaşmadan önce yapay zeka trafiğine OWASP ile hizalanmış korumalar uygulanır.
- Pahalı arka uçlar için koruma: İlke yönetilen uçta uygulandığından, hatalı biçimlendirilmiş veya kötü amaçlı istekler az GPU kapasitesi tüketilmeden önce incelenebilir ve engellenebilir.
Örnek senaryolar
Aşağıdaki senaryolarda çıkarım ağ geçidini kullanmanın yaygın yolları gösterilmektedir:
-
Model sürümlerini sunma ve dağıtma: OpenAI uyumlu istekleri
InferencePoolmodel adına göre yönlendirin, ardından dağıtımı tamamlamadan önce trafik yüzdesini kanarya testi için yeni bir model sürümüne kaydırmak için ağırlıklıHTTPRoutearka uçRefs'i kullanın. -
Gecikme süresi açısından kritik trafiğin önceliğini belirleme: Paylaşılan havuzdaki yüksek öncelikli ve düşük öncelikli iş yükleri için kaynakları tanımlayın
InferenceObjective. Etkileşimli sohbet istekleri yüksek öncelikli hedefi taşırken, toplu işler havuz doygun olduğunda önce ayrılan daha düşük bir öncelik kullanır.
InferencePool ile Service karşılaştırması
Kubernetes Service , standart uygulama trafiği için doğru arka uç soyutlaması olmaya devam eder. Arka uç, çıkarıma özel uç nokta seçimi gerektiren model sunucusu pod’larından oluşan bir grup olduğunda InferencePool kullanın.
| Sunucu türü | İçin kullanın | Yönlendirme davranışı |
|---|---|---|
Service |
Standart HTTP, gRPC ve uygulama arka uçları | Ağ geçidi, standart yük dengeleme davranışını kullanarak hizmet uç noktalarına yönlendirir. |
InferencePool |
Şirket içinde barındırılan model sunucu podları | Ağ geçidi, yapılandırılmış EPP'yi çağırır ve ardından seçili model sunucu uç noktasına yönlendirir. |
Bir InferencePool pod seçici, hedef bağlantı noktası bilgisi ve uç nokta seçici referansı içerir. EPP, bir istek için uç noktayı seçmekle sorumludur. Tek bir EPP, tek bir havuzla ilişkilendirilir.
Başarısızlık davranışı
Çıkarım yönlendirmesi istek zamanı davranışıdır, bu nedenle uç nokta seçicinin hata modu önemlidir.
InferencePool uç nokta seçici referansları aşağıdaki hata modlarını destekler:
- FailOpen: EPP kullanılamıyorsa veya yanıt vermiyorsa, ağ geçidi havuz için standart uç nokta seçimiyle devam edebilir. Bu seçenek kullanılabilirliği korur ancak yönlendirme kalitesini düşürebilir.
- FailClose: EPP kullanılamıyorsa veya yanıt vermiyorsa ağ geçidi isteği reddeder. Bu seçim, gerekli uç nokta seçimi kararı olmadan trafiğin gönderilmesini engeller.
İstek gövdesinin ayrıştırılmasına dayanan model farkındalıklı yönlendirme için Application Gateway for Containers doğruluğa öncelik verir. BBR gerektiren bir rota için model adı çıkarılamazsa, isteğin fark edilmeden yanlış model arka ucuna yönlendirilmesi yerine istek reddedilir.
İşlemle ilgili dikkat edilmesi gerekenler
Kapsayıcılar için Application Gateway'in arkasında çıkarım iş yüklerini çalıştırırken aşağıdaki noktaları planlayın:
-
EPP kapasitesi: EPP arka uçlar için
InferencePoolistek yolundadır. Kritik bir uygulama bileşeni gibi boyutlandırıp izleyin. - Model sunucusu telemetrisi: EPP'nin yüksek kaliteli yönlendirme kararları almak için yeni model sunucu ölçümlerine ihtiyacı vardır. Model sunucunuzun EPP yapılandırmanız tarafından beklenen ölçümleri desteklediğini onaylayın.
- GPU kapasitesi ve zamanlama: Model sunucusu podları genellikle GPU düğüm havuzları, cihaz eklentileri ve model indirme kimlik bilgilerini gerektirir.
- Otomatik ölçeklendirme: Model sunucu podlarını Yatay Pod Otomatik Ölçeklendiricisi veya KEDA kullanarak kuyruk derinliği ve KV önbellek kullanımı gibi çıkarım sinyalleri üzerinde ölçeklendirin. Otomatik ölçeklendirme, talep arttıkça kapasite ekler; EPP ise kapasitesi zaten dolmuş replikaların etrafından trafiği yönlendirir.
- Akış yanıtları: Birçok sohbet tamamlama iş yükü, sunucu tarafından gönderilen olayları kullanır. Uçtan uca gecikme süresi ve zaman aşımı ayarlarını test ederken akış davranışını doğrulayın.
- Gözlemlenebilirlik: Ağ geçidini ve HTTPRoute durumunu, InferencePool durumunu, EPP durumunu, model sunucusu hazırlığını ve etkin istekler ve kuyruk derinliği gibi model sunucusu ölçümlerini izleyin.
Sınırlamalar
Çıkarım ağ geçidi, Kubernetes üzerinde çalışan kendi kendine barındırılan çıkarım iş yüklerine odaklanır. Doğrudan genel veya yönetilen model sağlayıcısı uç noktalarına yönlendirme, bu tümleştirmenin kapsamı dışındadır.
Ağ Geçidi API Çıkarımı Uzantısı, Kapsayıcılar için Application Gateway'den bağımsız olarak gelişir. Kümenizde yüklü çıkarım uzantısı CRD'leriyle eşleşen API sürümlerini ve bildirimlerini kullanın.