veridive’ın yanıt motorunu veya ücretsiz araçlarını mı arıyorsunuz?Yanıt motorunu mu arıyorsunuz? Neler değişti

veridive EN Proje başlatın Menü

Saha notlarıVeri ve modeller

Bir yapay zekanın başka bir yapay zekanın yanıtlarını puanlamasına ne zaman güvenilir?

Otomatik puanlama, değerlendirmeyi her değişiklikte çalıştırılabilecek kadar ucuzlatır; ama puanlayıcı model de doğrulanması gereken bir sistemdir. Dar evet/hayır kontrolleri kullanın, puanlayıcıyı insanlarla kalibre edin, bilinen yanlılıkları izleyin ve yüksek riskli vakaları insanlarda tutun.

veridive5 dk okuma

Değerlendirme setinde birkaç yüz örnek var ve sistemin yanıtlarını elle puanlamak iki değerlendiricinin neredeyse bütün gününü alıyor. Prompt değişiklikleri inceleme sırası bekliyor ve çok geçmeden ekip değişiklikleri sezgiyle canlıya almaya başlıyor. Genellikle tam da o noktada biri LLM ile otomatik değerlendirmeyi (LLM-as-a-judge) öneriyor: başka bir modelin yanıtlarını puanlayan bir model.

Yöntem işe yarar, ama sınırları içinde. Otomatik puanlama, değerlendirmeyi her değişiklikte çalıştırılabilecek kadar ucuzlatır. Ne var ki puanlayıcı model de kendi hataları ve yanlılıkları olan bir yapay zeka sistemidir; bu yüzden puanladığı sistemle aynı muameleyi görmelidir: dar bir görev, insanlara karşı testler ve önemli vakalarda insanlar.

LLM ile otomatik değerlendirme nedir?

Puanlayıcı olarak kullanılan bir dil modelidir. Soruyu, sistemin yanıtını, kaynak pasajları ve bazen bir referans yanıtı alır, bir puanlama ölçütü (rubric) uygular ve kısa bir gerekçeyle birlikte bir karar döndürür. Üç biçimi yaygındır:

  • Ölçüte göre puanlama: tek bir yanıtın yazılı kriterlere göre kontrolü.
  • Referansla karşılaştırma: yanıtın değerlendirme setindeki onaylı yanıtla karşılaştırılması.
  • İkili karşılaştırma: aynı soruya verilmiş iki yanıttan puanlayıcının daha iyisini seçmesi; genellikle iki promptu ya da iki modeli karşılaştırırken kullanılır.

Rutin insan puanlamasının yerini alır. İyi sonucun ne demek olduğuna dair kararın yerini ise alamaz; o karar işin sahibi olan insanlarda kalır.

Bir model hangi kontrolleri güvenilir biçimde puanlayabilir?

Dar olanları: kanıtın bağlamda durduğu ve yanıtın evet ya da hayır olduğu kontrolleri. “10 üzerinden 7” doğrulanamaz, çalıştırmalar arasında karşılaştırılamaz ve ona göre harekete geçilemez; belirli bir kontrolde ise bunların hepsi mümkündür.

KontrolPuanlayıcıya uygun mu?
Yanıt, belirttiği tutarı içeren pasajı kaynak gösteriyor mu?Evet: kanıt göz önünde
Yanıt gerekli her bilgiyi içeriyor mu?Evet, her bilgi için ayrı bir kontrolle
Yanıt resmi Türkçeyle, “siz” diye hitap ederek mi yazılmış?Evet, iki hitap biçiminden birer örnekle
Yanıt, pasajların desteklemediği bir iddiada bulunuyor mu?Çoğunlukla; dikkatle kalibre edin
Tutar tam olarak doğru mu?Hayır: kodla karşılaştırın
Doğru iş kararı bu mu?Hayır: bu bir insanın kararı
Genel kaliteyi birden ona puanlamakHayır: belirsiz ve yanlılığa açık

Tarihler, tutarlar, kategoriler ve kimlik numaraları gibi kesin değerler bir modelin değil, kodun işidir: kod daha hızlı, daha ucuzdur ve hiçbir zaman kötü gününde olmaz.

Puanlayıcının uygulayabileceği bir ölçüt nasıl yazılır?

İnsanlar için yazar gibi, ama daha disiplinli:

  • Her soruda tek kontrol, yanıtı evet ya da hayır olacak biçimde yazılmış.
  • Kanıt promptun içinde: pasajlar, referans sonuç ve ölçüt satırı; böylece puanlayıcı hatırlamaya değil, karşılaştırmaya dayanır.
  • Sınırda kalan her kontrol için bir geçer ve bir kalır örneği.
  • Karardan önce gerekçe: kanıttan alıntı yaparak; böylece anlaşmazlıklar denetlenebilir.
  • Yapılandırılmış çıktı: kontrol kimliği, karar ve alıntılanan kanıt.
  • Sürümler: puanlayıcının modeli, promptu ve ölçütü kod gibi sürümlenir; herhangi bir değişiklik yeniden kalibrasyon demektir.

Bu şekilde yazılmış ölçüt satırlarını değerlendirme seti şablonu gösteriyor.

Puanlayıcı insanlara karşı nasıl doğrulanır?

Bunu geçme notu olan bir deney gibi ele alın:

  1. Etiketler arasından satırlar seçin, zor olanlar dahil; iki değerlendirici bunları aynı ölçütle birbirinden bağımsız puanlasın.
  2. Önce değerlendiricileri kontrol edin. Sık sık anlaşamıyorlarsa sorun ölçüttedir; puanlayıcıyı işin içine katmadan önce ölçütü düzeltin.
  3. Puanlayıcıyı ve değerlendiricileri genel olarak değil, kontrol bazında karşılaştırın. Bir puanlayıcı kaynak kontrolünde güvenilir, üslupta zayıf olabilir.
  4. Hataların yönüne bakın. İnsanların kalır diyeceği yanıtları geçiren bir puanlayıcı, fazla katı olandan daha kötüdür.
  5. Her kontrol için bir eşik belirleyin. Eşiği karşılayan kontroller otomatikleşir; geri kalanlar insanlarda kalır.
  6. Puanlayıcıdaki her değişiklikten sonra tekrarlayın; belirli aralıklarla da canlı kullanımdan alınan yeni örneklemlerle.

Temsili bir örnek ele alalım: Bir ekip politika asistanını, her yanıtı birden ona puanlayan bir puanlayıcıyla değerlendiriyor. Bir prompt değişikliği yanıtları uzatıyor ve puanlar yükseliyor. Değerlendiriciler ikna olmuyor: yeni yanıtlar daha iyi değil, yalnızca daha uzun ve bazılarında fazladan desteklenmeyen bir cümle var. Bir örneklem bunu doğruluyor: puanlayıcının ve değerlendiricilerin ayrıştığı yerlerde puanlayıcı neredeyse her zaman uzun yanıtı tercih etmiş. Ekip puanın yerine beş evet/hayır kontrolü koyuyor: kural belirtilmiş, istisna belirtilmiş, her tutar onu içeren pasaja dayandırılmış, desteklenmeyen iddia yok ve yanıt istenen uzunluğa uyuyor. İki değerlendirici bir örneklemi bağımsız olarak puanlıyor, anlaşamadıkları iki kontrol yeniden yazılıyor ve puanlayıcı onların üzerinde uzlaştığı puanlara göre yeniden kalibre ediliyor. Uzunluk etkisi ortadan kalkıyor, çünkü uzunluk puan kazandırmayı bırakıyor; dolgu cümleleri de desteklenmeyen iddia kontrolüne takılıyor.

Hangi yanlılıklara dikkat etmeli?

Birkaçı iyi bilinir ve her birinin bir karşı önlemi vardır:

  • Uzunluk: daha uzun, daha ayrıntılı yanıtları tercih etme. Buna evet/hayır kontrolleri ve bir kısalık kontrolüyle karşı koyun.
  • Sıra: ikili karşılaştırmalarda ilk ya da ikinci gösterilen yanıtı tercih etme. İki sırayla da çalıştırın ve yalnızca tutarlı kararları sayın.
  • Kendini kayırma: kendi üslubunu ya da kendi model ailesini tercih etme. Farklı bir aileden puanlayıcı ve referansa dayalı kontroller kullanın.
  • Kendinden emin biçim: kaynak gösteren akıcı yanıtlar doğru görünür. Kaynak gösterilen pasajın iddiayı içerip içermediğini açıkça sorun.
  • Dil: bir puanlayıcı Türkçede İngilizceden daha az güvenilir olabilir; bu yüzden her dil için ayrı kalibre edin.

Puanlayıcı da bir yapay zeka sistemidir. Onu da öyle test edin.

İnsanlar nerede devrede kalmalı?

Bir puanlama hatasının pahalıya patlayacağı her yerde:

  • Yüksek riskli vakaları, örneğin iadeleri, İK ya da hukuk yanıtlarını ve müşterilere verilen taahhütleri insanlar puanlar.
  • Puanlayıcının puanladığı vakalardan düzenli bir örneklem her hafta insanlara gider; böylece puanlayıcıdaki kayma yakalanır.
  • Ölçüt ve referans yanıtlar insanlarındır; puanlayıcı yalnızca onları uygular.
  • Canlıya alma kararlarını, puanlayıcının sonuçlarını kanıt olarak kullanan bir insan onaylar.

Hangi kontrolü önce otomatikleştirmeli?

Değerlendiricilerinizin en çok zaman harcadığı kontrolü seçin, kanıt göz önündeyken yanıtlanacak bir evet/hayır sorusu olarak yazın ve ona güvenmeden önce puanlayıcıyı bir örneklem üzerinde iki kişiyle karşılaştırın. Değerlendirme setlerini ve eşikleri kurmak veri ve yapay zeka altyapısı işidir; kontrollerin canlıya geçtikten sonra da çalışmaya devam etmesi yapay zeka güvenilirliği çalışmasının konusudur. Daha geniş test stratejisi için bir LLM uygulamasının nasıl test edileceğini anlatan nota bakın.

Kaynaklar

  1. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al.) arXiv arxiv.org/abs/2306.05685

Bu notu bir yapay zeka asistanına sorun

Veri ve modellerDeğerlendirmeKalite

veridive

Saha notlarını veridive yazar ve gözden geçirir. Nasıl yazıyoruz

Sorular

Bu notla ilgili sorular

LLM-as-a-judge, yani LLM ile otomatik değerlendirme nedir?

LLM-as-a-judge, başka bir yapay zeka sisteminin çıktısını bir puanlama ölçütüne göre puanlamak için bir dil modeli kullanmaktır. Puanlayıcı model soruyu, yanıtı, kaynak pasajları ve bazen bir referans yanıtı alır; kısa bir gerekçeyle birlikte bir karar döndürür. Değerlendirmeyi her değişiklikte çalıştırılabilecek kadar ucuzlatır, ama puanlayıcının kendisi de insan değerlendiricilerle karşılaştırılarak doğrulanmalıdır.

Bir LLM’in başka bir LLM’i değerlendirmesine güvenilebilir mi?

Dar kontroller için, kalibre edildikten sonra evet. Kanıt göz önündeyken belirli evet/hayır sorularını yanıtlayan bir puanlayıcı, örneğin kaynak gösterilen pasajın belirtilen tutarı içerip içermediğini soran bir kontrolde, insan değerlendiricilerle büyük ölçüde aynı kararı verebilir; bunu varsaymak yerine ölçersiniz. Geniş kapsamlı kalite puanları daha az güvenilirdir ve yanlılığa açıktır. Yüksek riskli vakaları ve düzenli bir örneklemi insanlarda tutun.