Bir yapay zekanın başka bir yapay zekanın yanıtlarını puanlamasına ne zaman güvenilir?
Otomatik puanlama, değerlendirmeyi her değişiklikte çalıştırılabilecek kadar ucuzlatır; ama puanlayıcı model de doğrulanması gereken bir sistemdir. Dar evet/hayır kontrolleri kullanın, puanlayıcıyı insanlarla kalibre edin, bilinen yanlılıkları izleyin ve yüksek riskli vakaları insanlarda tutun.
veridive5 dk okuma
Değerlendirme setinde birkaç yüz örnek var ve sistemin yanıtlarını elle puanlamak iki değerlendiricinin neredeyse bütün gününü alıyor. Prompt değişiklikleri inceleme sırası bekliyor ve çok geçmeden ekip değişiklikleri sezgiyle canlıya almaya başlıyor. Genellikle tam da o noktada biri LLM ile otomatik değerlendirmeyi (LLM-as-a-judge) öneriyor: başka bir modelin yanıtlarını puanlayan bir model.
Yöntem işe yarar, ama sınırları içinde. Otomatik puanlama, değerlendirmeyi her değişiklikte çalıştırılabilecek kadar ucuzlatır. Ne var ki puanlayıcı model de kendi hataları ve yanlılıkları olan bir yapay zeka sistemidir; bu yüzden puanladığı sistemle aynı muameleyi görmelidir: dar bir görev, insanlara karşı testler ve önemli vakalarda insanlar.
LLM ile otomatik değerlendirme nedir?
Puanlayıcı olarak kullanılan bir dil modelidir. Soruyu, sistemin yanıtını, kaynak pasajları ve bazen bir referans yanıtı alır, bir puanlama ölçütü (rubric) uygular ve kısa bir gerekçeyle birlikte bir karar döndürür. Üç biçimi yaygındır:
- Ölçüte göre puanlama: tek bir yanıtın yazılı kriterlere göre kontrolü.
- Referansla karşılaştırma: yanıtın değerlendirme setindeki onaylı yanıtla karşılaştırılması.
- İkili karşılaştırma: aynı soruya verilmiş iki yanıttan puanlayıcının daha iyisini seçmesi; genellikle iki promptu ya da iki modeli karşılaştırırken kullanılır.
Rutin insan puanlamasının yerini alır. İyi sonucun ne demek olduğuna dair kararın yerini ise alamaz; o karar işin sahibi olan insanlarda kalır.
Bir model hangi kontrolleri güvenilir biçimde puanlayabilir?
Dar olanları: kanıtın bağlamda durduğu ve yanıtın evet ya da hayır olduğu kontrolleri. “10 üzerinden 7” doğrulanamaz, çalıştırmalar arasında karşılaştırılamaz ve ona göre harekete geçilemez; belirli bir kontrolde ise bunların hepsi mümkündür.
| Kontrol | Puanlayıcıya uygun mu? |
|---|---|
| Yanıt, belirttiği tutarı içeren pasajı kaynak gösteriyor mu? | Evet: kanıt göz önünde |
| Yanıt gerekli her bilgiyi içeriyor mu? | Evet, her bilgi için ayrı bir kontrolle |
| Yanıt resmi Türkçeyle, “siz” diye hitap ederek mi yazılmış? | Evet, iki hitap biçiminden birer örnekle |
| Yanıt, pasajların desteklemediği bir iddiada bulunuyor mu? | Çoğunlukla; dikkatle kalibre edin |
| Tutar tam olarak doğru mu? | Hayır: kodla karşılaştırın |
| Doğru iş kararı bu mu? | Hayır: bu bir insanın kararı |
| Genel kaliteyi birden ona puanlamak | Hayır: belirsiz ve yanlılığa açık |
Tarihler, tutarlar, kategoriler ve kimlik numaraları gibi kesin değerler bir modelin değil, kodun işidir: kod daha hızlı, daha ucuzdur ve hiçbir zaman kötü gününde olmaz.
Puanlayıcının uygulayabileceği bir ölçüt nasıl yazılır?
İnsanlar için yazar gibi, ama daha disiplinli:
- Her soruda tek kontrol, yanıtı evet ya da hayır olacak biçimde yazılmış.
- Kanıt promptun içinde: pasajlar, referans sonuç ve ölçüt satırı; böylece puanlayıcı hatırlamaya değil, karşılaştırmaya dayanır.
- Sınırda kalan her kontrol için bir geçer ve bir kalır örneği.
- Karardan önce gerekçe: kanıttan alıntı yaparak; böylece anlaşmazlıklar denetlenebilir.
- Yapılandırılmış çıktı: kontrol kimliği, karar ve alıntılanan kanıt.
- Sürümler: puanlayıcının modeli, promptu ve ölçütü kod gibi sürümlenir; herhangi bir değişiklik yeniden kalibrasyon demektir.
Bu şekilde yazılmış ölçüt satırlarını değerlendirme seti şablonu gösteriyor.
Puanlayıcı insanlara karşı nasıl doğrulanır?
Bunu geçme notu olan bir deney gibi ele alın:
- Etiketler arasından satırlar seçin, zor olanlar dahil; iki değerlendirici bunları aynı ölçütle birbirinden bağımsız puanlasın.
- Önce değerlendiricileri kontrol edin. Sık sık anlaşamıyorlarsa sorun ölçüttedir; puanlayıcıyı işin içine katmadan önce ölçütü düzeltin.
- Puanlayıcıyı ve değerlendiricileri genel olarak değil, kontrol bazında karşılaştırın. Bir puanlayıcı kaynak kontrolünde güvenilir, üslupta zayıf olabilir.
- Hataların yönüne bakın. İnsanların kalır diyeceği yanıtları geçiren bir puanlayıcı, fazla katı olandan daha kötüdür.
- Her kontrol için bir eşik belirleyin. Eşiği karşılayan kontroller otomatikleşir; geri kalanlar insanlarda kalır.
- Puanlayıcıdaki her değişiklikten sonra tekrarlayın; belirli aralıklarla da canlı kullanımdan alınan yeni örneklemlerle.
Temsili bir örnek ele alalım: Bir ekip politika asistanını, her yanıtı birden ona puanlayan bir puanlayıcıyla değerlendiriyor. Bir prompt değişikliği yanıtları uzatıyor ve puanlar yükseliyor. Değerlendiriciler ikna olmuyor: yeni yanıtlar daha iyi değil, yalnızca daha uzun ve bazılarında fazladan desteklenmeyen bir cümle var. Bir örneklem bunu doğruluyor: puanlayıcının ve değerlendiricilerin ayrıştığı yerlerde puanlayıcı neredeyse her zaman uzun yanıtı tercih etmiş. Ekip puanın yerine beş evet/hayır kontrolü koyuyor: kural belirtilmiş, istisna belirtilmiş, her tutar onu içeren pasaja dayandırılmış, desteklenmeyen iddia yok ve yanıt istenen uzunluğa uyuyor. İki değerlendirici bir örneklemi bağımsız olarak puanlıyor, anlaşamadıkları iki kontrol yeniden yazılıyor ve puanlayıcı onların üzerinde uzlaştığı puanlara göre yeniden kalibre ediliyor. Uzunluk etkisi ortadan kalkıyor, çünkü uzunluk puan kazandırmayı bırakıyor; dolgu cümleleri de desteklenmeyen iddia kontrolüne takılıyor.
Hangi yanlılıklara dikkat etmeli?
Birkaçı iyi bilinir ve her birinin bir karşı önlemi vardır:
- Uzunluk: daha uzun, daha ayrıntılı yanıtları tercih etme. Buna evet/hayır kontrolleri ve bir kısalık kontrolüyle karşı koyun.
- Sıra: ikili karşılaştırmalarda ilk ya da ikinci gösterilen yanıtı tercih etme. İki sırayla da çalıştırın ve yalnızca tutarlı kararları sayın.
- Kendini kayırma: kendi üslubunu ya da kendi model ailesini tercih etme. Farklı bir aileden puanlayıcı ve referansa dayalı kontroller kullanın.
- Kendinden emin biçim: kaynak gösteren akıcı yanıtlar doğru görünür. Kaynak gösterilen pasajın iddiayı içerip içermediğini açıkça sorun.
- Dil: bir puanlayıcı Türkçede İngilizceden daha az güvenilir olabilir; bu yüzden her dil için ayrı kalibre edin.
Puanlayıcı da bir yapay zeka sistemidir. Onu da öyle test edin.
İnsanlar nerede devrede kalmalı?
Bir puanlama hatasının pahalıya patlayacağı her yerde:
- Yüksek riskli vakaları, örneğin iadeleri, İK ya da hukuk yanıtlarını ve müşterilere verilen taahhütleri insanlar puanlar.
- Puanlayıcının puanladığı vakalardan düzenli bir örneklem her hafta insanlara gider; böylece puanlayıcıdaki kayma yakalanır.
- Ölçüt ve referans yanıtlar insanlarındır; puanlayıcı yalnızca onları uygular.
- Canlıya alma kararlarını, puanlayıcının sonuçlarını kanıt olarak kullanan bir insan onaylar.
Hangi kontrolü önce otomatikleştirmeli?
Değerlendiricilerinizin en çok zaman harcadığı kontrolü seçin, kanıt göz önündeyken yanıtlanacak bir evet/hayır sorusu olarak yazın ve ona güvenmeden önce puanlayıcıyı bir örneklem üzerinde iki kişiyle karşılaştırın. Değerlendirme setlerini ve eşikleri kurmak veri ve yapay zeka altyapısı işidir; kontrollerin canlıya geçtikten sonra da çalışmaya devam etmesi yapay zeka güvenilirliği çalışmasının konusudur. Daha geniş test stratejisi için bir LLM uygulamasının nasıl test edileceğini anlatan nota bakın.
Kaynaklar
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al.) arXiv arxiv.org/abs/2306.05685
Bu notu bir yapay zeka asistanına sorun