Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Yerel yapay zeka çıkarımı , sizin veya kuruluşunuzun kontrol ettiği altyapıda eğitilmiş bir yapay zeka modeli çalıştırma sürecidir. Ana Windows Server senaryosu dağıtık çıkarımdır: OpenAI uyumlu bir model sunucu Windows Server'da çalışır ve uzak istemciler ağ üzerinden uç noktasına istekler gönderir. Örneğin, Windows 11 iş istasyonunda Visual Studio Code, sunucuya istem gönderebilir ve üretilen çıktıyı alabilir.
Organizasyonlar, birden fazla istemciyi ortak model hesaplamasına erişim sağlamak için dağıtık çıkarım kullanırken, istekler ve çıktıların nereye gittiğini kontrol eder. Bu kontrol, uç nokta konumuna, ağ yoluna, istemci yapılandırmasına, model edinimine, tanı teline ve çözümdeki diğer hizmetlere bağlıdır.
Bu makale, Windows Server yöneticileri ve geliştiricilerinin yerel çıkarımı ne zaman kullanacaklarına karar vermelerine ve bu seçimle ilgili altyapı hususlarını belirlemelerine yardımcı olur.
Windows Server'da yapay zeka çıkarımı nasıl çalışır?
Windows Server'ta yerel yapay zeka çıkarımı kullanılarak, uzaktan uygulamalar ve araçlar model sunucunun ağ adresine bağlanır, istekler gönderir ve yanıtlar alır. İstemciler modeli yerel olarak yüklemez veya çalıştırmaz.
Bu topoloji Windows Server'a belirgin bir rol kazandırır. Sunucu, birden fazla istemci için hesaplama ve GPU kapasitesini, model depolama ve barındırmayı, ağ erişimini, hizmet işlemlerini ve kapasite yönetimini merkezileştirir. Yöneticiler paylaşılan hizmeti ve altyapısını işletir, geliştiriciler ise istemcileri uç noktanın temel URL’si, model tanımlayıcısı, desteklenen API’si ve kimlik doğrulama yöntemi için yapılandırır.
Çözüm şu unsurları içerir:
- Uzak istemci: Ağ üzerinden istem veya diğer model girdisi gönderen bir uygulama, geliştirme aracı veya yönetici araç. İstemciler Windows 11, Windows Server veya desteklenen başka bir platformda çalışabilir.
- Arayüz: İstek ve yanıt formatlarını tanımlayan bir SDK veya HTTP API. Örneğin, birçok paylaşılan çalışma zamanı OpenAI uyumlu API'leri ortaya çıkarır.
- Model sunucusu ve model: Eğitilmiş bir modeli yükleyen, çıkarım isteklerini zamanlayan ve çıkışı uç nokta üzerinden döndüren sunucu odaklı çalışma zamanı.
- Windows Server altyapısı: Paylaşılan iş yükünü destekleyen ve açığa çıkaran fiziksel ana veya sanal makine, işlemci, bellek, depolama, GPU kaynakları, ağ ve yönetim araçları.
Bir uç nokta, istemcilerin kullandığı bir veya daha fazla API formatını uygular, ancak uyumluluk, her uç noktanın her yeteneği desteklediği anlamına gelmez. İstemciler belirli rotalar, model tanımlayıcıları, akış davranışı, araç veya fonksiyon çağrısı, kimlik doğrulama yöntemleri veya istek alanları gerektirebilir. Bağlamadan önce hem istemci gereksinimlerini hem de uç nokta yeteneklerini doğrulayın.
Gömülü çıkarımın farklı bir sınırı vardır. Uygulama, model sunucusunu çağırmak yerine genellikle uygulama sürecinde aynı cihazda modeli yükler ve çalıştırır. Windows ML, ONNX modelleri için bu uygulama çıkarım çerçevesini sağlar. Foundry Local ayrıca cihaz içi iş akışlarını da hedefliyor. Foundry Local SDK, çalışma zamanını bir uygulamaya gömer ve komut satırı arabirimi tek bir cihaz üzerindeki modelleri ve yerel bir hizmeti yönetir. Bu seçenekler Windows Server donanımında çalışabilir, ancak tek başına yöneticilerin birden fazla istemci için merkezi olarak işlediği dağıtık çıkarım hizmeti sunmazlar.
Çıkarım yaklaşımınızı seçin
Çıkarımın nerede çalıştığına, kaç istemcinin modele ihtiyaç duyduğuna ve çalışma zamanını kimin işlettiğine göre bir yaklaşım seçin. Windows Server'ı uzak istemciler için modelleri merkezileştirmek ve hesaplamayı merkezileştirmek amacıyla paylaşılan bir uç nokta olarak kullanın. Bu yaklaşım ağ, güvenlik, kapasite ve erişilebilirlik gereksinimlerini ekler. Alternatif olarak, bir uygulama veya cihazın çalışma zamanı ve model yaşam döngüsüne sahip olması gerektiğinde Windows Server'da gömülü veya cihaz içi çıkarım kullanın.
| Approach | En uygun | Operasyonel model | Önemli sınırlar |
|---|---|---|---|
| Windows Server uç noktası | Merkezi bir operasyon ekibinin yönettiği model hizmeti tüketen birden fazla uzaktan uygulama veya araç | Windows Server'daki bir model sunucu, model yükleme, istek zamanlama, eşzamanlılık ve API'ye sahiptir. Uzak müşteriler, kuruluşlarının onayladığı uç nokta tabanlı URL, model tanımlayıcısı ve kimlik doğrulama ayarlarını kullanır. | Seçtiğiniz ürün, çalışma zamanı kurulumunu, uç nokta dağıtımını, API desteğini ve ölçek özelliklerini belirler. Bu makale, uç noktanın var olduğunu ve istemcilerin ona ulaşabileceğini varsayıyor. |
| Windows ML | Aynı cihazda ONNX modellerini çalıştıran Windows uygulamaları | Uygulama, Windows'un desteklediği ONNX Çalışma Zamanı'nı ya paylaşılan sistem bileşeni olarak ya da uygulamayla birlikte kendi içinde kullanır. İsteğe bağlı yürütme sağlayıcıları mevcut CPU, GPU veya NPU kaynaklarını kullanır. | Windows ML, OpenAI uyumlu model hizmet veren bir uç nokta değil, bir uygulama çıkarım çerçevesidir. Yürütme sağlayıcısı, sürücü, donanım ve model gereksinimleri farklılık gösterir. |
| Dökümhane Yerel | Tek cihazda, cihaz içinde çıkarım ve özenli model kataloğu gerektiren uygulamalar ve geliştirme iş akışları | Uygulama genellikle SDK üzerinden süreç içinde çıkarım yapar. Foundry Local CLI, cihazda modelleri ve yerel hizmeti yönetebilir. | Foundry Local sunucu donanımında çalışabilir, ancak tasarımı çok kullanıcılı sunucu çıkarımı hedeflemiyor. Birçok eşzamanlı istemci için eşzamanlı istek kuyrutlama, sürekli toplu çalışma veya verimli GPU paylaşımı sağlamaz. |
Yaklaşımlar bir organizasyon genelinde birbirini dışlamaz. Bir uygulama Windows ML üzerinden ONNX modeli gömleyebilir, bir geliştirici Foundry Local'ı tek bir iş istasyonuna gömebilir ve uzaktan geliştirme araçları ile iş uygulamaları Windows Server'da paylaşılan bir uç nokta kullanabilir. Her yolu kendi modeli, donanımı, güvenliği ve destek gereksinimleri olan ayrı bir iş yükü olarak ele alın.
Yapay zekâ çıkarımı için Windows Server altyapısını planlayın
Model mimarisi, parametre sayısı, kuantizasyon, bağlam uzunluğu, istek eşzamanlılığı ve gecikme hedefleri gereken hesaplama ve belleği belirler. Bazı modeller CPU üzerinde çalışırken, diğer iş yükleri GPU hızlandırmasından faydalanır. GPU, her çıkarım çözümü için ön koşul değildir.
Fiziksel bir Windows Server sunucusunda bir iş yükü için, çalışma zamanı, Windows Server ve donanım satıcısının desteklediği donanım ve API'leri kullanabilir. Hyper-V sanal makinede bir iş yükü için, uygun bir GPU sanallaştırma seçeneği seçin. Windows Server'da GPU hızlandırma planı, doğrudan ana bilgisayar erişimi, Ayrık Cihaz Ataması (DDA), GPU bölümleme ve Windows konteyner senaryolarını karşılaştırıyor. GPU bölümleme, Windows Server 2025 veya daha sonrasında mevcuttur ve isteğe bağlı bir altyapı seçeneğidir.
Ayrıca şu kaynakları da planlayın:
- Bellek ve GPU belleği: Yüklenen model, bağlam ve önbellek gereksinimleri, eşzamanlı talepler ve ana bilgisayardaki diğer süreçleri hesaba katabilir.
- Depolama: Model dosyaları, çalışma zamanı paketleri, günlükler ve geçici veriler için kapasite ve erişim kontrolleri sağlanır. Model edinimi, çıkarım yerel olarak çalışsa bile harici bir ağ bağlantısı gerektirebilir.
- Ağ: Paylaşılan bir uç nokta için, istemciler ile uç nokta arasındaki bant genişliğini ve gecikmeyi tahmin edin. Hangi ağların ve sunucuların hizmete ulaşabileceğini tanımlayın.
- Kullanılabilirlik ve kapasite: Uç nokta mevcut olmadığında veya kapasitede çalıştığında müşterilerin nasıl davranacağına karar verin. Üretim kullanımından önce temsilci modeller ve taleplerle eşzamanlılığı ve veri verimini doğrulayın.
Windows Server'da yapay zeka çıkarımını güvence altına alın ve çalıştırın
Yerel yerleştirme tek başına bir güvenlik sınırı sağlamaz. İsteme veren sınırı tanımlayın, alınan veriler, model dosyaları, çıktılar, loglar ve tanı içinde kalmalıdır ve ardından her bileşeni bu sınıra göre doğrulayın.
Onaylı TLS ayarlarıyla ağ trafiğini koruyun, müşterileri doğrulayın ve yetkileyin, ağ kontrolleriyle uç nokta erişimini kısıtlayın ve kimlik bilgilerini onaylı gizli bir depoda saklayın. Kaynak dosyalarına veya diğer kullanıcıların okuyabileceği araç yapılandırmalarına kimlik bilgileri koymayın. Model dosyalarını dağıtmadan önce model lisanslarını ve satın alma kaynaklarını gözden geçirin.
Model çıktısını ona güvenmeden önce doğrulayın. Sonuç olarak gerçekleşen eylemler veya kararlar için uygun insan denetimini sürdürmek.
Windows Server altyapısını, gerekli işlemleri desteklediğinde Windows Admin Center dahil olmak üzere yerleşik yönetim araçlarınızla yönetin. Model yaşam döngüsü ve uç noktaya özgü işlemler için çalışma zamanı dokümantasyonunu takip edin. En azından, uç nokta sağlığını, talep gecikmesini, veri verimliliğini, arızaları, CPU ve bellek kullanımını, GPU kullanımını ve kullanılabilir olduğunda bellek kullanımını, ayrıca depolama kapasitesini gözlemlemeyi planlayın. Mevcut metrikler ve yönetim işlemleri çalışma zamanına göre değişir, bu nedenle bu makale tek bir gözlemlenebilirlik uygulaması önermemektedir.
Yaygın yerel yapay zeka çıkarımı senaryoları
Yerel çıkarım, geliştirici, yönetici ve uygulama iş yüklerini desteklerken, çıkarım yolunu bir kuruluşun seçtiği sınır içinde tutar.
- Kodlama yardımı: Windows 11'de Visual Studio Code gibi desteklenen bir geliştirme aracını, kod açıklaması, üretimi, incelemesi veya sorun gidermesi için Windows Server'daki mevcut bir uç noktaya bağlayın. Kaynak kodu ve istekler ağ üzerinden o uç noktaya ulaşır, bu yüzden ağ yolu, uç nokta ve operatörleri veri sınırına dahil edilir.
- İdari yardım: Bir idari aracı komutları açıklayabilen veya önerebilen bir modele bağlayın. Oluşturulan komutları gözden geçirin ve özellikle sistem durumu değiştiğinde onları çalıştırmadan önce etkilerini anlayın.
- Belge işleme: Yerel bir modelle belgeleri özetlemek, sınıflandırmak, çıkarmak veya indekslemek için bir uygulama kullanın. Uygulama, kaynak belgeler ve üretilen çıktı için yetkilendirme sorumluluğunu sürdürür.
- Sohbet uygulamaları: Mevcut bir uygulamaya sohbet veya soru yanıtlama deneyimleri ekleyin. Uygulama, model uç noktasını yetkili kurumsal verilerle birleştirebilir, ancak erişim kontrollerini modelden bağımsız olarak uygulamak zorundadır.
Windows Server'da yerel yapay zeka çıkarımı için sonraki adımlar
- Yerel çıkarım için GitHub Copilot CLI'yı configure et
- Visual Studio Code'u yerel model uç noktası kullanacak şekilde configure et
- Intelligent Terminal Önizleme'yi yerel model uç noktasına bağlayın
- Microsoft Agent Framework ile OpenAI uyumlu uç noktalara bağlanın
- Windows ML kullanarak ONNX modellerini çalıştırın
- Çıkarım SDK'larını Foundry Local ile tümleştirme