Tutarlı davranış için modelde ince ayar yapma

Tamamlandı

Tip

Daha fazla ayrıntı için Metin ve resimler sekmesine bakın!

İstem mühendisliği modelin davranışına yol göstermenize yardımcı olurken RAG, gerçek verilerdeki yanıtların temellerini oluşturmanıza yardımcı olur. Ancak bazen model yine de ihtiyacınız olan tutarlı stil, ton veya biçime sahip yanıtlar üretmez. Modelin talimatlarınızı göz ardı ettiğini veya bunları tutarsız bir şekilde izlediğini fark ettiğinizde—hatta ayrıntılı sistem mesajları ve birkaç örnek bile kullanıyor olsanız—modelde ince ayar yapmanın zamanı gelmiş olabilir.

İnce ayar , önceden eğitilmiş bir dil modeli alma ve daha küçük, göreve özgü bir veri kümesi üzerinde daha fazla eğitim alma işlemidir. Bu, modelin iç ağırlıklarını ayarlayarak eğitim verilerinizdeki desenlerle tutarlı yanıtlar üretmesini sağlar.

hassas ayarlamayı anlama

GPT-4o gibi temel modeller büyük miktarlarda genel veri üzerinde eğitilir. Modeli özel gereksinimlerinizi yansıtan ek örneklerle eğiterek bu temel üzerinde ince ayarlamalar yapar. Bunu bir genelciyi uzmanlaştırmak gibi düşünün: Model geniş dil yeteneklerini korur ancak eğitim verilerinizin gösterdiği şekilde yanıt vermeyi öğrenir.

İnce ayar, düşük dereceli gösterimle ağırlık değişikliklerini yaklaşık olarak tanımlayan loRA (Low-Rank Adaptasyon) tekniğini kullanır. LoRA, modelin tüm parametrelerini yeniden eğitme yerine önemli parametrelerin yalnızca daha küçük bir alt kümesini güncelleştirir. Bu, model kalitesini korurken eğitimi daha hızlı ve daha uygun maliyetli hale getirir.

Modeli sıfırdan eğitme üzerinde ince ayarlamanın temel avantajı verimliliktir. Modelin davranışını özelleştirmek için daha az zamana, daha az bilgi işlem kaynağına ve önemli ölçüde daha az veriye ihtiyacınız vardır.

Ne zaman ince ayar yapmak zorunda kalınacaklarını öğrenme

hassas ayarlama, tek başına istem mühendisliğinin ihtiyacınız olan tutarlılığı elde etmediği senaryolar için uygundur. Yaygın kullanım örnekleri şunlardır:

  • Tutarlı stil ve ton: Kuruluşunuzun belirli bir marka sesi vardır ve modelin tüm etkileşimlerde bunu güvenilir bir şekilde izlemesi gerekir. Örneğin, seyahat acentesi her yanıtın kısa paragraflarla sıcak ve teşvik edici bir ton kullanmasını ister.
  • Belirli çıkış biçimleri: Modelin tanımlı bir şemayı izleyen JSON yanıtları gibi güvenilir bir şekilde yapılandırılmış çıkış üretmesi gerekir ve yalnızca birkaç deneme örneği yeterli değildir.
  • İstem uzunluğunu azaltma: Birçok örnek içeren uzun sistem iletileri belirteçleri tüketir ve gecikme süresini artırır. Hassas ayarlama, bu desenleri modele gömerek her talep için gereken istem boyutunu azaltır.
  • Damıtma: Büyük, pahalı bir modelin özelliklerini daha küçük, daha verimli bir modele aktarmak istiyorsunuz. Örneğin, yüksek performanslı bir modelden çıkış toplayabilir ve bunları kullanarak daha düşük maliyet ve gecikme süresiyle benzer kalite elde eden daha küçük bir modele ince ayar yapabilirsiniz.
  • Araç kullanımını geliştirme: Uygulamanız araç çağrısı kullandığında, araç örnekleriyle ince ayar yapmak, araç seçiminin ve parametre oluşturmanın doğruluğunu artırabilir.

Önemli

İnce ayar gelişmiş bir özelliktir. her zaman, ince ayarlamayı dikkate almadan önce standart modelin temel performansını gereksinimlerinize göre değerlendirerek başlayın. Referans noktası olmadan, ince ayarlamanın modelin performansını iyileştirip iyileştirmediğini veya düşürüp düşürmediğini saptamak zordur.

İnce ayar türlerini keşfetme

Microsoft Foundry çeşitli ince ayarlama teknikleri sunar:

  • Denetimli ince ayar (SFT):Modeli etiketli bir istem ve yanıt çiftleri veri kümesinde eğitin. Model, eğitim verilerinizdeki desenlerle eşleşen çıkışlar üretmeyi öğrenir. Bu teknik, bir göreve yaklaşmanın net ve iyi tanımlanmış yolları olduğunda en iyi şekilde çalışır.
  • Pekiştirici ince ayar (RFT): Daha iyi yanıtları artımlı olarak ödüllendirmek için bir derecelendirici kullanarak, yinelemeli geri bildirimle modelin davranışını optimize edin. RFT, birçok olası çözümün bulunduğu ve modelin akıl yürütme kalitesini geliştirmek istediğiniz karmaşık veya dinamik görevler için iyi çalışır.
  • Doğrudan Tercih İyileştirme (DPO): Tercih edilen ve tercih edilen olmayan yanıt çiftleri sağlayarak modeli insan tercihlerine göre hizalayın. DPO, geleneksel pekiştirme öğrenmesi yaklaşımlarından hesaplama açısından daha hafiftir ve hizalamada da eşit derecede etkilidir.

Teknikleri de birleştirebilirsiniz. Örneğin, önce özelleştirilmiş bir model oluşturmak için denetimli ince ayarlamayı kullanın, ardından yanıtları belirli tercihlerinize daha fazla hizalamak için DPO kullanın.

Eğitim verilerini hazırlama

hassas ayarlama, JSONL (JSON Çizgileri) biçimindeki yüksek kaliteli örneklerin bir veri kümesini gerektirir. Sohbet tamamlama modelleri için her örnek sistem, kullanıcı ve yardımcı iletileriyle yapılan bir konuşmadan oluşur:

{"messages": [{"role": "system", "content": "You are a friendly travel advisor for Margie's Travel."}, {"role": "user", "content": "What's a good beach destination in Europe?"}, {"role": "assistant", "content": "For a beautiful European beach experience, consider the Algarve in southern Portugal! It offers stunning golden cliffs, warm waters, and charming coastal towns. The best time to visit is from May through September."}]}
{"messages": [{"role": "system", "content": "You are a friendly travel advisor for Margie's Travel."}, {"role": "user", "content": "I need a budget hotel in Tokyo."}, {"role": "assistant", "content": "Here are some great budget-friendly options in Tokyo:\n\n- **Sakura Hotel Jimbocho** - Central location, from $45/night\n- **Khaosan World Asakusa** - Near Senso-ji temple, from $35/night\n- **Imano Tokyo Ginza Hostel** - Modern design, from $40/night\n\nAll three options are close to public transit, making it easy to explore the city."}]}

Eğitim verilerinizi hazırlarken:

  • Örnekler arasında tutarlı bir sistem iletisi ekleyin.
  • Beklediğiniz senaryo aralığını kapsayan yüksek kaliteli, temsili örnekler kullanın.
  • En az yüzlerce örneği hedefleyin; daha fazlası genellikle daha iyidir.
  • Yardımcı yanıtlarının tam olarak istediğiniz stili, biçimi ve tonu yansıtdığından emin olun.

Uyarı

Eğitim verilerinize bir sistem iletisi dahil edilmesi önemlidir. Boş bırakmak daha düşük doğruluklu modeller üretme eğilimindedir. Çıkarım için ince ayarlı modelinizi dağıtırken aynı sistem iletisini kullanın.

Zorlukları göz önünde bulundurun

İnce ayar, uygulamadan önce değerlendirmeniz gereken maliyetler ve beraberinde getirdiği karmaşıklıklarla gelir.

  • Eğitim maliyetleri: İnce ayarlamanın eğitim için ön maliyetleri ve özel modeli barındırmak için sürekli saatlik maliyetleri vardır.
  • Veri kalitesi gereksinimleri: Düşük kaliteli veya geçerli olmayan eğitim verileri fazla uygunluk, yetersiz uygunluk veya yanlılığa yol açar.
  • Bakım: Veri değişiklikleri veya güncelleştirilmiş temel modeller yayınlandığında ince ayarlı modellerin yeniden eğitilmesi gerekebilir.
  • Deneme: Hiper parametrelerin doğru bileşimini bulmak (dönemler, toplu iş boyutu, öğrenme hızı) test ve yineleme gerektirir.
  • Model sapması: Çok dar bir şekilde özelleştirmek, modelin ince ayarlı etki alanı dışındaki genel dil görevlerinde daha az etkili olmasına neden olabilir.

Seyahat acentesi için ince ayar, her yanıtın kapsamlı sistem mesajları olmadan bile şirketin marka sesi ve biçimlendirme yönergeleriyle tutarlı bir şekilde eşleşmesi anlamına gelir. Ancak ekibin bu avantajı eğitim verilerini hazırlama ve zaman içinde ince ayarlı modeli koruma maliyetine karşı tartması gerekir.