veridive’ın yanıt motorunu veya ücretsiz araçlarını mı arıyorsunuz?Yanıt motorunu mu arıyorsunuz? Neler değişti

veridive EN Proje başlatın Menü

Saha notlarıEkonomi

Kaliteden ödün vermeden LLM maliyetleri nasıl düşürülür?

Tasarrufun çoğu daha az göndermekten ve doğru yere göndermekten gelir. Her değişiklik değerlendirme setiyle kontrol edilir, çünkü daha fazla inceleme isteyen daha ucuz bir sistem aslında ucuz değildir.

veridive5 dk okuma

Model faturası iki katına çıkmıştır ve biri yazılım ekibinden daha ucuz bir modele geçmesini ister. Bu genellikle ilk değil, en son başvurulacak yöntemdir. LLM maliyet optimizasyonunda tasarrufun çoğu daha az göndermekten ve doğru yere göndermekten gelir: daha kısa bağlam, önbellek, toplu işleme, yönlendirme ve çıktı sınırları.

Ama bir koşul var: kalite. Her değişiklik değerlendirme setiyle kontrol edilir ve inceleme süresi faturayla birlikte izlenir, çünkü daha fazla inceleme isteyen daha ucuz bir sistem ucuz değildir. Aşağıdaki kontrol listesi bu sırayla ilerler.

LLM harcaması aslında nereye gidiyor?

  1. Tamamlanan görev başına maliyeti adım adım ölçün. Her adım için çağrıları, girdi ve çıktı token’larını, tekrar denemeleri ve kullanılan modeli kaydedin: sınıflandırma, bilgi erişimi, taslak hazırlama, kontrol. Faturadaki bir artışın hangi özellikten geldiğini izleyebilmek için her çağrıyı iş akışı ve adımıyla etiketleyin. Harcama genellikle bir iki adımda yoğunlaşır; adım başına rakamlar olmadan yanlış adımı optimize edersiniz.
  2. Her promptun sabit kısmını değişken kısmından ayırın. Her çağrıda tekrarlanan talimatlar ve örnekler, vakaya özgü metinden farklı davranır ve her biri için başvurulacak yöntemler de farklıdır.
  3. İnceleme dakikalarını aynı tabloya koyun. Bir insanın çıktıyı kontrol etmek için harcadığı zaman çoğu zaman en büyük kalemdir; token’dan tasarruf edip inceleme süresini artıran bir değişiklik zarardır. Hesabın tamamı token maliyetini hata maliyetiyle karşılaştıran notta, canlıya geçmeden önceki tahmin ise LLM işletme maliyetlerini tahmin etme notunda.

Bu tablo elinizdeyken başvurabileceğiniz yöntemler şunlardır:

YöntemNeyi azaltırDikkat edilecek bedel
Bağlamı kırpmakHer çağrıdaki girdiyiAsıl önemli pasajı kaybetmek
Prompt önbelleği (prompt caching)Sabit başlangıçlarda tekrarlanan girdiyiPrompt yapısı; kaynak değiştikten sonra eskimiş içerik
Toplu işleme (batch)Acil olmayan işlerin fiyatınıSaatlerce gecikme; başarısız öğelerin ele alınması
Küçük modellere yönlendirmeRutin vakalardaki model maliyetiniUç vakalarda kalite; yanlış yönlendirilen vakalar
Çıktı sınırlarıÇıktı token’larını ve okuma süresiniYarıda kesilen yanıtlar; eksik kanıt
Tekrar deneme sınırlarıBoşa giden çağrılarıİnsanların üstlenmesi gereken daha fazla vaka

Promptlar ve getirilen bağlam nasıl kırpılır?

  1. Daha az ama daha iyi pasaj gönderin. Daha az parça getirin, onları yeniden sıralayın (reranking), tekrarları çıkarın; e-posta imzaları, yasal uyarı metinleri ve sayfa başlıkları gibi kalıp metinleri temizleyin. Yalnızca adımın kullandığı kayıt alanlarını iletin. Bağlam penceresine sığıyor diye belgelerin tamamını gönderme isteğine direnin: her çağrıda her token’ın bedelini ödersiniz. Daha az alakasız metin çoğu zaman yanıtları da iyileştirir; ama buna değerlendirme seti karar verir.
  2. Talimatları sıkılaştırın. Tekrarlanan kuralları, eskimiş örnekleri ve adımın hiç görmediği vakalara ait kuralları çıkarın; koda ait kontrolleri koda taşıyın. Çok turlu ve ajan adımlarında, dökümün tamamı yerine kısa ve yapılandırılmış bir durum özeti taşıyın.

Önbellek ve toplu işleme ne zaman işe yarar?

  1. Promptun sabit kısmını başa koyun. Bazı sağlayıcılar ve model sunucu altyapıları, değişmeyen bir prompt başlangıcının işlenmesini yeniden kullanabilir; bu hem maliyeti hem yanıt süresini düşürür. Sağlayıcınızın koşullarını kontrol edin. Talimatlar, örnekler ve referans belgeler başa, vakaya özgü metin sona gelir. Aynı istekler tekrarlanıyorsa saklanan bir yanıt da yeniden kullanılabilir; ama yalnızca aynı kaynaklar ve aynı yetkilerle; bir kaynak değiştiğinde de yanıtın süresi dolmalıdır. Önbellekteki yanıtlar da diğerleri gibi saklanan veridir; kişisel veri içeriyorlarsa saklama süresini ve erişimi veri koruma görevlinizle (DPO) kararlaştırın.
  2. Acil olmayanı toplu işleyin. Eski katalog ürünlerinin zenginleştirilmesi, gece yapılan yeniden sınıflandırma ve haftalık rapor taslakları nadiren saniyeler içinde yanıt gerektirir. Sağlayıcınız sunuyorsa asenkron toplu işleme, hızdan feragat ederek daha düşük fiyat getirir. Kısmi başarısızlığa göre tasarlayın: başarısız olan öğeler, tüm grubu yeniden çalıştırmadan tekrar denensin ya da bir insana gönderilsin.

Küçük modellere yönlendirme nerede işe yarar?

  1. Zorluğa göre yönlendirin; eşikleri değerlendirme setinde belirleyin. Rutin vakalar daha küçük bir modele, zor olanlar daha büyük bir modele, belirsiz ya da riskli olanlar bir insana gider. Yönlendirme tek bir görevin içinde de işe yarar: taslak hazırlamak büyük bir model gerektirse bile küçük bir model mesajı sınıflandırabilir ya da birkaç alanı çekebilir. Bazı kolay vakalar hiç model gerektirmez, çünkü onları bir kural ya da bir tablo sorgusu halleder. Her yönlendirme değişikliğini bir model değişikliği gibi ele alın: yan yana çalıştırmalar ve kademeli yayına almayla.

Çıktı uzunluğu, tekrar denemeler ve araç çağrıları nasıl yönetilir?

  1. Çıktıyı sınırlayın ve biçimlendirin. Çıktı bir sisteme aktarılıyorsa yapılandırılmış alanlar isteyin, uzunluk sınırları koyun ve kimsenin okumadığı açıklamaları çıkarın; ama inceleyenin ihtiyaç duyduğu kanıtı koruyun.
  2. Tekrar denemeleri sınırlayın ve nedenlerini düzeltin. Yüksek bir tekrar deneme oranı, maliyet olarak görünen bir kalite sorunudur. Başarısız olan adımı bulun, şemasını ya da promptunu düzeltin ve tekrar denemelere bir sınır koyun; sınırı aşan vakalar bir insana gitsin. Ajan adımlarını ve araç çağrılarını da aynı şekilde bütçeleyin; görev içinde zaten yapılmış bir sorguyu tekrarlamayın.

Daha fazla inceleme isteyen daha ucuz bir sistem ucuz değildir.

Kalitenin düşmediği nasıl kanıtlanır?

  1. Her değişiklikte değerlendirme setini vaka türüne göre yeniden çalıştırın. Kaliteyi, doğrulama hatalarını ve yanıt süresini başlangıç ölçümüyle karşılaştırın. Her seferinde tek bir yöntemi değiştirin; böylece her tasarrufun ve kaliteye her etkinin kaynağı belli olur. Önemli bir vaka türünde kaliteye mal olan bir tasarruf, tasarruf değildir.
  2. Yayına aldıktan sonra inceleme süresini ve insan müdahalelerini izleyin. Bazı kayıplar yalnızca canlı işte, düzeltilmesi biraz daha uzun süren taslaklar olarak görünür. Bir tasarruf kalıcı olduğunda maliyet tavanını ve uyarılarını da ona göre düşürün; böylece bir sonraki kayma erkenden yakalanır.

Temsili bir örnek; birimler varsayımsaldır, fiyat ya da kıyaslama değildir. Destek yanıtı taslağı hazırlayan bir iş akışı, tamamlanan vaka başına 10 birime mal oluyor: 4’ü model çağrılarından, 6’sı inceleme süresinden.

DeğişiklikModelİncelemeVaka başına toplam
Önce4610
Bağlamı kırpmak, sabit başlangıcı önbelleğe almak2,268,2
Tekrar denemelerin çoğunun arkasındaki şemayı düzeltmek1,867,8
Taslak hazırlamayı daha küçük bir modele taşımak1,27,58,7; bu yüzden geri alındı

Son değişiklik faturada en iyi görünen değişiklikti; ama taslaklar daha fazla düzeltme gerektirdiği için toplamda bir önceki adımdan daha pahalıya geldi. İlk iki değişiklik değerlendirme setindeki her vaka türünde kaliteyi korudu ve kalıcı oldu.

Kesmeden önce ne ölçülmeli?

İşin tipik bir dönemi boyunca adım başına maliyet kaydı ekleyin ve inceleme dakikalarını yanına koyun; en büyük tasarruf fırsatı genellikle kendiliğinden ortaya çıkar. Hizmetlerimizde, değerlendirme setinin geçiş kapısı olduğu maliyet kontrolü yapay zeka güvenilirliği kapsamındadır; yönlendirme ve sizin örneklerinizle model seçimi ise veri ve yapay zeka altyapısı kapsamında.

Bu notu bir yapay zeka asistanına sorun

EkonomiMaliyet kontrolüYönlendirme

veridive

Saha notlarını veridive yazar ve gözden geçirir. Nasıl yazıyoruz

Sorular

Bu notla ilgili sorular

LLM API maliyetleri nasıl düşürülür?

İşe, inceleme süresi dahil tamamlanan görev başına maliyeti adım adım ölçerek başlayın. Sonra daha az gönderin ve doğru yere gönderin: getirilen bağlamı ve promptları kırpın, sağlayıcınız destekliyorsa sabit prompt başlangıçlarını önbellekten yeniden kullanın, acil olmayan işleri toplu işleyin, rutin vakaları küçük modellere yönlendirin, çıktı uzunluğunu ve tekrar denemeleri sınırlayın. Her değişiklikten sonra değerlendirme setini yeniden çalıştırın.

Daha ucuz bir modele geçmek maliyeti gerçekten düşürür mü?

Yalnızca kalite kendi vakalarınızda korunuyorsa. Biraz daha zayıf taslaklar üreten ucuz bir model; inceleme süresini, yeniden işlemeyi ve hata maliyetlerini, model faturasında kazandırdığından daha fazla artırabilir. Onu değerlendirme setinde vaka türüne göre test edin, yayına aldıktan sonra inceleme dakikalarını izleyin ve yalnızca rutin vakaları küçük modele yönlendirmeyi düşünün.