Kaliteden ödün vermeden LLM maliyetleri nasıl düşürülür?
Tasarrufun çoğu daha az göndermekten ve doğru yere göndermekten gelir. Her değişiklik değerlendirme setiyle kontrol edilir, çünkü daha fazla inceleme isteyen daha ucuz bir sistem aslında ucuz değildir.
veridive5 dk okuma
Model faturası iki katına çıkmıştır ve biri yazılım ekibinden daha ucuz bir modele geçmesini ister. Bu genellikle ilk değil, en son başvurulacak yöntemdir. LLM maliyet optimizasyonunda tasarrufun çoğu daha az göndermekten ve doğru yere göndermekten gelir: daha kısa bağlam, önbellek, toplu işleme, yönlendirme ve çıktı sınırları.
Ama bir koşul var: kalite. Her değişiklik değerlendirme setiyle kontrol edilir ve inceleme süresi faturayla birlikte izlenir, çünkü daha fazla inceleme isteyen daha ucuz bir sistem ucuz değildir. Aşağıdaki kontrol listesi bu sırayla ilerler.
LLM harcaması aslında nereye gidiyor?
- Tamamlanan görev başına maliyeti adım adım ölçün. Her adım için çağrıları, girdi ve çıktı token’larını, tekrar denemeleri ve kullanılan modeli kaydedin: sınıflandırma, bilgi erişimi, taslak hazırlama, kontrol. Faturadaki bir artışın hangi özellikten geldiğini izleyebilmek için her çağrıyı iş akışı ve adımıyla etiketleyin. Harcama genellikle bir iki adımda yoğunlaşır; adım başına rakamlar olmadan yanlış adımı optimize edersiniz.
- Her promptun sabit kısmını değişken kısmından ayırın. Her çağrıda tekrarlanan talimatlar ve örnekler, vakaya özgü metinden farklı davranır ve her biri için başvurulacak yöntemler de farklıdır.
- İnceleme dakikalarını aynı tabloya koyun. Bir insanın çıktıyı kontrol etmek için harcadığı zaman çoğu zaman en büyük kalemdir; token’dan tasarruf edip inceleme süresini artıran bir değişiklik zarardır. Hesabın tamamı token maliyetini hata maliyetiyle karşılaştıran notta, canlıya geçmeden önceki tahmin ise LLM işletme maliyetlerini tahmin etme notunda.
Bu tablo elinizdeyken başvurabileceğiniz yöntemler şunlardır:
| Yöntem | Neyi azaltır | Dikkat edilecek bedel |
|---|---|---|
| Bağlamı kırpmak | Her çağrıdaki girdiyi | Asıl önemli pasajı kaybetmek |
| Prompt önbelleği (prompt caching) | Sabit başlangıçlarda tekrarlanan girdiyi | Prompt yapısı; kaynak değiştikten sonra eskimiş içerik |
| Toplu işleme (batch) | Acil olmayan işlerin fiyatını | Saatlerce gecikme; başarısız öğelerin ele alınması |
| Küçük modellere yönlendirme | Rutin vakalardaki model maliyetini | Uç vakalarda kalite; yanlış yönlendirilen vakalar |
| Çıktı sınırları | Çıktı token’larını ve okuma süresini | Yarıda kesilen yanıtlar; eksik kanıt |
| Tekrar deneme sınırları | Boşa giden çağrıları | İnsanların üstlenmesi gereken daha fazla vaka |
Promptlar ve getirilen bağlam nasıl kırpılır?
- Daha az ama daha iyi pasaj gönderin. Daha az parça getirin, onları yeniden sıralayın (reranking), tekrarları çıkarın; e-posta imzaları, yasal uyarı metinleri ve sayfa başlıkları gibi kalıp metinleri temizleyin. Yalnızca adımın kullandığı kayıt alanlarını iletin. Bağlam penceresine sığıyor diye belgelerin tamamını gönderme isteğine direnin: her çağrıda her token’ın bedelini ödersiniz. Daha az alakasız metin çoğu zaman yanıtları da iyileştirir; ama buna değerlendirme seti karar verir.
- Talimatları sıkılaştırın. Tekrarlanan kuralları, eskimiş örnekleri ve adımın hiç görmediği vakalara ait kuralları çıkarın; koda ait kontrolleri koda taşıyın. Çok turlu ve ajan adımlarında, dökümün tamamı yerine kısa ve yapılandırılmış bir durum özeti taşıyın.
Önbellek ve toplu işleme ne zaman işe yarar?
- Promptun sabit kısmını başa koyun. Bazı sağlayıcılar ve model sunucu altyapıları, değişmeyen bir prompt başlangıcının işlenmesini yeniden kullanabilir; bu hem maliyeti hem yanıt süresini düşürür. Sağlayıcınızın koşullarını kontrol edin. Talimatlar, örnekler ve referans belgeler başa, vakaya özgü metin sona gelir. Aynı istekler tekrarlanıyorsa saklanan bir yanıt da yeniden kullanılabilir; ama yalnızca aynı kaynaklar ve aynı yetkilerle; bir kaynak değiştiğinde de yanıtın süresi dolmalıdır. Önbellekteki yanıtlar da diğerleri gibi saklanan veridir; kişisel veri içeriyorlarsa saklama süresini ve erişimi veri koruma görevlinizle (DPO) kararlaştırın.
- Acil olmayanı toplu işleyin. Eski katalog ürünlerinin zenginleştirilmesi, gece yapılan yeniden sınıflandırma ve haftalık rapor taslakları nadiren saniyeler içinde yanıt gerektirir. Sağlayıcınız sunuyorsa asenkron toplu işleme, hızdan feragat ederek daha düşük fiyat getirir. Kısmi başarısızlığa göre tasarlayın: başarısız olan öğeler, tüm grubu yeniden çalıştırmadan tekrar denensin ya da bir insana gönderilsin.
Küçük modellere yönlendirme nerede işe yarar?
- Zorluğa göre yönlendirin; eşikleri değerlendirme setinde belirleyin. Rutin vakalar daha küçük bir modele, zor olanlar daha büyük bir modele, belirsiz ya da riskli olanlar bir insana gider. Yönlendirme tek bir görevin içinde de işe yarar: taslak hazırlamak büyük bir model gerektirse bile küçük bir model mesajı sınıflandırabilir ya da birkaç alanı çekebilir. Bazı kolay vakalar hiç model gerektirmez, çünkü onları bir kural ya da bir tablo sorgusu halleder. Her yönlendirme değişikliğini bir model değişikliği gibi ele alın: yan yana çalıştırmalar ve kademeli yayına almayla.
Çıktı uzunluğu, tekrar denemeler ve araç çağrıları nasıl yönetilir?
- Çıktıyı sınırlayın ve biçimlendirin. Çıktı bir sisteme aktarılıyorsa yapılandırılmış alanlar isteyin, uzunluk sınırları koyun ve kimsenin okumadığı açıklamaları çıkarın; ama inceleyenin ihtiyaç duyduğu kanıtı koruyun.
- Tekrar denemeleri sınırlayın ve nedenlerini düzeltin. Yüksek bir tekrar deneme oranı, maliyet olarak görünen bir kalite sorunudur. Başarısız olan adımı bulun, şemasını ya da promptunu düzeltin ve tekrar denemelere bir sınır koyun; sınırı aşan vakalar bir insana gitsin. Ajan adımlarını ve araç çağrılarını da aynı şekilde bütçeleyin; görev içinde zaten yapılmış bir sorguyu tekrarlamayın.
Daha fazla inceleme isteyen daha ucuz bir sistem ucuz değildir.
Kalitenin düşmediği nasıl kanıtlanır?
- Her değişiklikte değerlendirme setini vaka türüne göre yeniden çalıştırın. Kaliteyi, doğrulama hatalarını ve yanıt süresini başlangıç ölçümüyle karşılaştırın. Her seferinde tek bir yöntemi değiştirin; böylece her tasarrufun ve kaliteye her etkinin kaynağı belli olur. Önemli bir vaka türünde kaliteye mal olan bir tasarruf, tasarruf değildir.
- Yayına aldıktan sonra inceleme süresini ve insan müdahalelerini izleyin. Bazı kayıplar yalnızca canlı işte, düzeltilmesi biraz daha uzun süren taslaklar olarak görünür. Bir tasarruf kalıcı olduğunda maliyet tavanını ve uyarılarını da ona göre düşürün; böylece bir sonraki kayma erkenden yakalanır.
Temsili bir örnek; birimler varsayımsaldır, fiyat ya da kıyaslama değildir. Destek yanıtı taslağı hazırlayan bir iş akışı, tamamlanan vaka başına 10 birime mal oluyor: 4’ü model çağrılarından, 6’sı inceleme süresinden.
| Değişiklik | Model | İnceleme | Vaka başına toplam |
|---|---|---|---|
| Önce | 4 | 6 | 10 |
| Bağlamı kırpmak, sabit başlangıcı önbelleğe almak | 2,2 | 6 | 8,2 |
| Tekrar denemelerin çoğunun arkasındaki şemayı düzeltmek | 1,8 | 6 | 7,8 |
| Taslak hazırlamayı daha küçük bir modele taşımak | 1,2 | 7,5 | 8,7; bu yüzden geri alındı |
Son değişiklik faturada en iyi görünen değişiklikti; ama taslaklar daha fazla düzeltme gerektirdiği için toplamda bir önceki adımdan daha pahalıya geldi. İlk iki değişiklik değerlendirme setindeki her vaka türünde kaliteyi korudu ve kalıcı oldu.
Kesmeden önce ne ölçülmeli?
İşin tipik bir dönemi boyunca adım başına maliyet kaydı ekleyin ve inceleme dakikalarını yanına koyun; en büyük tasarruf fırsatı genellikle kendiliğinden ortaya çıkar. Hizmetlerimizde, değerlendirme setinin geçiş kapısı olduğu maliyet kontrolü yapay zeka güvenilirliği kapsamındadır; yönlendirme ve sizin örneklerinizle model seçimi ise veri ve yapay zeka altyapısı kapsamında.
Bu notu bir yapay zeka asistanına sorun