veridive’ın yanıt motorunu veya ücretsiz araçlarını mı arıyorsunuz?Yanıt motorunu mu arıyorsunuz? Neler değişti

veridive EN Proje başlatın Menü

Saha notlarıVeri ve modeller

Değerlendirme seti şablonu: sütunlar, etiketler ve puanlama ölçütü.

Bir değerlendirme setinin arkasındaki çalışma tablosu: başlangıç için sütunlar, etiket listeleri, puanlama ölçütü ifadeleri ve bölümler. Bir ekip bu tabloyu bir öğleden sonrada kurabilir. Notta bir iade iş akışından ve bir politika asistanından doldurulmuş satırlar da var.

veridive6 dk okuma

Bu not, Değerlendirme setleri yeni gereksinim dokümanıdır notunun arkasındaki çalışma tablosudur. O not, onaylı yanıtları olan gerçek örneklerin gereksinim dokümanının büyük kısmının yerini neden aldığını anlatıyor. Bu not ise “neden”i atlayıp doğrudan değerlendirme seti şablonunu veriyor: sütunlar, etiket listeleri, puanlama ölçütü ifadeleri ve bölümler; yanında da doldurulmuş birkaç satır.

Başlamak için bir hesap tablosu yeterlidir. Araçtan çok yapı önemlidir: değişmeyen satır kimlikleri, işin sahibi olan kişilerin yazdığı referans sonuçlar, gerçekten raporlayacağınız etiketler ve iki inceleyenin aynı biçimde uyguladığı puanlama kuralları.

Her örnekte hangi sütunlar olmalı?

Her örnek bir satırdır ve on iki sütunu vardır. Bunlara aşağıda anlatılan bölüm sütunu eklenir.

Sütunİçine ne yazılırDikkat edilecek nokta
kimlik (id)RET-0107 gibi değişmeyen bir tanımlayıcıAsla yeniden kullanmayın, yeniden numaralandırmayın
girdiTalep, tam geldiği haliyleYazım hatalarını ve dil karışımlarını koruyun
eklerTalebe eşlik eden fotoğraflar, PDF’ler ya da kayıtlarCanlı bağlantıları değil, o anki kopyaları saklayın
referans sonuçSüreç sahibinin kabul edeceği yanıt ya da kararGeliştiriciler değil, süreç sahibi yazar
kanıtSonucun dayandığı kaynak: belge, sürüm, pasajSaniyeler içinde yeniden bulmaya yetecek bilgi
vaka türüSabit bir listeden tek bir değerHer satırda bir tane
zorlukRutin, çetrefilli ya da uç vakaSüreç sahibi belirler
riskDüşük, orta ya da yüksek: yanlış yapmanın bedeliİş diliyle tanımlanır
dilTürkçe, İngilizce ya da karmaGerekiyorsa alfabeyi ya da lehçeyi ekleyin
puanlama kuralıTam eşleşme, bir ölçüt kimliği ya da “yanıt vermemeli”Her satırda tek kural
inceleyenReferans sonucu kimin onayladığıEkip adı değil, kişi adı
sürümSatırın en son değiştiği set sürümüReferans değiştiğinde sürümü artırın

İşi sütunlara göre paylaştırın. Geliştiriciler girdileri ve ekleri kaynak sistemlerden çeker, kimlikleri atar. Süreç sahibi referans sonucu, kanıtı ve riski yazar. Etiketler üzerinde birlikte anlaşılır. Bu iş bölümü, neyin doğru olduğuna geliştiricilerin karar vermesini önler.

Hangi etiketler sonuçları anlamlı kılar?

Etiketler tek bir soruyu yanıtlamak için vardır: sistem nerede başarısız oluyor? Her listeyi kısa tutun; değerler birbiriyle örtüşmesin ve süreç sahibiyle üzerinde anlaşılmış olsun. Başlangıç için bir öneri:

  • Vaka türü. İadelerde: hasarlı ürün, yanlış ürün, mükerrer sipariş, fikir değişikliği, geç teslimat, garanti talebi, dolandırıcılık şüphesi. Politika asistanında: izin, seyahat, masraflar, yan haklar, BT erişimi.
  • Zorluk: rutin, çetrefilli, uç vaka.
  • Risk: düşük, orta, yüksek; para, müşteriye etkisi ya da mevzuata uyum açısından tanımlanır.
  • Dil: Türkçe, İngilizce, karma.
  • Kanal: e-posta, canlı sohbet, mağaza, pazaryeri, çağrı dökümü.
  • Müşteri segmenti: örneğin bireysel ya da kurumsal, yeni ya da tekrar gelen müşteri. Kalitedeki dengesizlik burada ortaya çıkar.
  • Davranış işaretleri: yanıt vermemeli, yetkili kişiye aktarılmalı, saldırı.

Bir etiket, ancak o etikette görülen bir açık bir sonraki adımınızı değiştirecekse listede yer almayı hak eder.

İki inceleyenin aynı biçimde uyguladığı ölçüt nasıl yazılır?

Her ölçüt maddesini, çıktıda görülebilen bir şey üzerine evet/hayır biçiminde bir kontrol olarak yazın. Çoğu ihtiyacı dört tür madde karşılar:

  • İçermeli: “Görünür nakliye hasarında değişimden önce inceleme gerekmediğini belirtir.” Her maddede tek bir bilgi.
  • İçermemeli: “Ürün teslim alınmadan para iadesi sözü vermez.” “Gösterilen pasajda bulunmayan hiçbir tutarı belirtmez.”
  • Kaynak: “Kuralı içeren politika paragrafını kaynak gösterir ve bu paragraf her olgusal ifadeyi destekler.”
  • Üslup: “Türkçe yanıtlarda resmi hitap (siz) kullanır.” “Müşteriyi suçlamaz.”

Tam eşleşmeyle puanlanan alanlar için normalleştirme kurallarını da yazın: tek bir tarih biçimi, aynı şekilde yuvarlanan tutarlar ve “ödeme” ile “odeme”nin aynı yanıt sayılıp sayılmayacağı.

Ardından kalibre edin. İki inceleyen aynı otuz satırı birbirinden bağımsız puanlar. Anlaşamadıkları yerde madde belirsizdir: maddeyi yeniden yazın ya da yanına geçen bir örnek ve kalan bir örnek koyun. Anlaşmazlıklar seyrek ve açıklanabilir hale gelene kadar tekrarlayın. Otomatik puanlama, bu inceleyenlerle karşılaştırılıp doğrulandıktan sonra aynı maddeleri büyük ölçekte uygulayabilir. Bunun nasıl yapılacağını puanlayıcı modeller (LLM-as-a-judge) üzerine olan not anlatıyor.

Set nasıl bölünür ve sürümlenir?

İki değer alan bir bölüm sütunu ekleyin:

  • Geliştirme: promptları, bilgi erişimini ve modelleri iyileştirirken baktığınız satırlar.
  • Ayrılmış (held-out): yalnızca devam/dur kararlarında ve büyük değişikliklerde kullanılan satırlar. Setin yaklaşık dörtte biridir ve her vaka türü ile her dil iki bölümde de yer alacak biçimde seçilir.

Ayrılmış bölümü iki kural dürüst tutar: kimse ona göre ayar yapmaz ve birinin üzerinde çalıştığı ayrılmış bir satır geliştirme bölümüne taşınır, yerine yenisi konur. Her vaka türünde, tek bir hatanın sonucu savurmayacağı kadar satır bulundurun. Yalnızca birkaç satırı olan bir vaka türü, raporlanacak bir sonuç değil, doldurulması gereken bir açıktır.

Seti kod gibi sürümleyin. Satır eklemek küçük bir sürüm değişikliğidir. Bir referans sonucu ya da bir ölçüt maddesini değiştirmek ise büyük bir sürüm değişikliğidir, çünkü eski ve yeni puanlar karşılaştırılamaz hale gelir. Her satırın neden eklendiğini söyleyen bir değişiklik kaydı tutun: canlıda görülen bir hata, yeni bir politika, yeni bir kanal. Bir politika değiştiğinde ona bağlı referans sonuçları güncelleyin, eskilerini arşivleyin.

Doldurulmuş birkaç satır neye benzer?

Bu satırlar temsilidir; bu not için kurgulanmıştır. İkisi bir iade iş akışından, ikisi de bir İK politika asistanından.

SatırReferans sonuçEtiketlerPuanlama
RET-0107: “The sofa arrived with a torn seam. Photos attached. I want a replacement, not a refund.” İki fotoğraf, sipariş kaydı.Değişim onaylanır; görünür nakliye hasarı inceleme gerektirmez; ürünün adresten alınması teklif edilirHasarlı ürün, orta risk, İngilizce, bireyselSonuç eşleşmesi ve R-DMG ölçütü
RET-0213: “Siparişi yanlışlıkla iki kez vermişim, birini iade edebilir miyim?” Sipariş kaydı.Mükerrer siparişin iadesi ücretsiz iade etiketiyle onaylanır; yanıt resmi Türkçeyle (siz) yazılırMükerrer sipariş, düşük risk, Türkçe, bireyselSonuç eşleşmesi ve üslup maddesi
POL-0031: “Can I carry unused leave over if I change teams mid-year?”Evet, devir sınırına kadar ve yeni yöneticinin onayıyla; izin politikasının birim değişikliği bölümü kaynak gösterilirİzin, orta risk, İngilizceR-LEAVE ölçütü ve kaynak kontrolü
POL-0058: “What is the per-diem for a client visit abroad?” Harcırah eki kapsam dışında.Kaynak bulunamadığı söylenir ve seyahat birimine yönlendirilirSeyahat, yanıt vermemeli, İngilizceYanıt vermeme kontrolü

İngilizce girdiler, geldikleri haliyle saklandıkları için çevrilmedi. Kabaca şunu söylüyorlar: RET-0107’de müşteri, dikişi yırtık gelen kanepe için para iadesi değil değişim istiyor; POL-0031’de çalışan, yıl ortasında ekip değiştirirse kullanmadığı izni devredip devredemeyeceğini soruyor; POL-0058’de ise yurt dışındaki bir müşteri ziyaretinin harcırahını soruyor.

Şablonu uyarlayabileceğiniz bir CSV başlangıç dosyası olarak indirebilirsiniz. Dosyada on iki sütunun yanında bölüm ve notlar sütunları, ayrıca yukarıdaki dört satır dolu olarak yer alır.

Sonuçlar nasıl raporlanmalı?

Dengesiz kalitenin saklandığı yer ortalamadır.

Sonuçları etikete göre raporlayın, asla yalnızca tek bir sayı olarak değil:

  • Kırılım: vaka türüne, riske ve dile göre, uygun olduğunda müşteri segmentine göre de geçme oranı. İngilizce e-postaları iyi işleyip Türkçe pazaryeri mesajlarında zorlanan bir sistem varsa bu durum ortalamada kaybolmamalı, açıkça görünmelidir.
  • Oranların yanında sayılar: dört satırdaki bir geçme oranı, kırk satırdakinden çok daha az şey söyler; okuyanlar hangisinin hangisi olduğunu görebilmelidir.
  • Ayrı ölçüler: sonuç eşleşmesi, ölçütten geçme, kaynağın desteklemesi ve doğru yerde yanıt vermeme için ayrı ayrı rakam verin.
  • Yüksek riskli hatalar tek tek: başarısız olan her yüksek riskli satır, bir orana gömülmeden kimliğiyle listelenir.
  • Regresyonlar: genel puan yükselmiş olsa bile önceki çalıştırmada geçip bu çalıştırmada kalan satırlar.
  • Çalıştırma bilgileri: herhangi iki çalıştırma karşılaştırılabilsin diye setin sürümü ve sistemin sürümü (model, prompt, bilgi erişimi ayarları).

Bu rapor, canlıya geçmeden önceki kontrol listemizde yer alan iki koşulun kanıtıdır: kabul kriterleri üzerinde anlaşılmış ve yazıya dökülmüştür; değerlendirme seti gerçek örneklerden oluşturulmuştur.

Süreç sahibiyle nasıl başlamalı?

On iki sütunu bir hesap tablosuna kopyalayın, bölüm sütununu ekleyin ve süreç sahibiyle tek oturumda otuz gerçek satır doldurun. Değerlendirme setleri ve kabul eşikleri kurmak, veri ve yapay zeka altyapısı çalışmamızın parçasıdır. İnsanların sistemin önerilerini kontrol ettiği ekran ise inceleme ekranı tasarımı notunun konusu.

Bu notu bir yapay zeka asistanına sorun

Veri ve modellerDeğerlendirmeŞablonlar

veridive

Saha notlarını veridive yazar ve gözden geçirir. Nasıl yazıyoruz

Sorular

Bu notla ilgili sorular

Bir LLM değerlendirme veri setinde hangi sütunlar olmalı?

En az şunlar: değişmeyen bir kimlik, tam geldiği haliyle girdi, varsa ekler, bir uzmanın onayladığı referans sonuç, bu sonucun dayandığı kanıt, vaka türü, zorluk, risk ve dil etiketleri, puanlama kuralı, satırı onaylayan inceleyen ve setin sürümü. Ayrılmış satırlar iyileştirme sırasında hiç kullanılmasın diye bir de bölüm sütunu ekleyin.

Yapay zeka yanıtları için puanlama ölçütü nasıl yazılır?

İzlenimleri değil, çıktıyı tarif eden kısa evet/hayır kontrolleri yazın: yer alması gereken bilgiler, yer almaması gereken ifadeler, gösterilen pasajın her iddiayı destekleyip desteklemediği ve resmi hitap gibi üslup kuralları. Sınırda kalan maddelere geçen ve kalan birer örnek ekleyin. Ardından iki inceleyen aynı satırları birbirinden bağımsız puanlasın; anlaşamadıkları her maddeyi yeniden yazın.