Değerlendirme setleri yeni gereksinim dokümanıdır.
Çıktı dil olduğunda “bitti”yi tanımlamak zordur. Uzmanların onayladığı yanıtlarla birkaç yüz gerçek örnek kaliteyi ölçülebilir kılar ve model seçimini bir görüş olmaktan çıkarıp bir deneye dönüştürür.
veridive5 dk okuma
Klasik yazılım projeleri bir gereksinim dokümanıyla başlar. Doküman sistemin ne yapması gerektiğini listeler ve her madde kontrol edilebilir: fatura ekranı vade tarihini gösterir, dışa aktarılan dosyada vergi numarası yer alır, rapor bir dakikadan kısa sürede çalışır. Geliştirme bittiğinde biri maddelerin yanına tik atar.
Dil üreten yapay zeka sistemleri, yani büyük dil modeli (LLM) üzerine kurulan sistemler, bu kalıba uymaz. “Asistan politika sorularını doğru yanıtlar” makul bir gereksinimdir ama kimse onun yanına tik atamaz. Hangi sorular için doğru? Kime göre? Politika belirsizse ya da soru kapsam dışındaysa ne olmalı? Bu soruların yanıtı yoksa “bitti” bir görüş meselesine dönüşür. Proje de etkileyici bir demo ile kimsenin içine sinmeyen bir canlıya geçiş arasında gidip gelir.
Çözüm bir LLM değerlendirme setidir: onaylı yanıtları olan gerçek örnekler ve sistemi bu yanıtlara göre değerlendirmenin kuralları. Projelerimizde gereksinim dokümanının eskiden yaptığı işin büyük kısmını bu set üstlenir.
Değerlendirme seti nedir?
Değerlendirme seti, bir iş akışından alınmış gerçek girdilerden oluşur. Her girdi, iyi bir uzmanın kabul edeceği sonuçla eşleştirilir; sistemin çıktısını bu sonuca göre puanlamanın bir yolu da tanımlanır. Bir iade iş akışında örneklerden biri müşterinin mesajı, sipariş kaydı ve iki fotoğraf olabilir. Bunlar iade ekibinin vereceği kararla ve bu kararı gerekçelendiren politika paragrafıyla eşleştirilir. Bir politika asistanında ise örnek, bir çalışanın sorusu olabilir; soru doğru yanıtla ve yanıtın dayandığı belgeyle eşleştirilir.
Yazıya döküldüğünde tek bir örneğin beş parçası vardır:
- Girdi: sistemin aldığı şey; ekleri dahil, tam geldiği haliyle.
- Referans sonuç: süreç sahibinin kabul edeceği yanıt ya da karar.
- Kanıt: sonucu gerekçelendiren kaynak; örneğin bir politika paragrafı ya da bir sipariş alanı.
- Etiketler: vaka türü, zorluk ve risk.
- Puanlama kuralı: bir inceleyenin ya da otomatik bir kontrolün, sistemin çıktısının referansla örtüşüp örtüşmediğine nasıl karar vereceği.
Başlamak için genellikle birkaç yüz örnek yeterlidir. Kapsam boyuttan daha önemlidir: yaygın vaka türlerinin hepsi sette bulunmalı, gerçek risk taşıyan nadir vakalar da onlarla birlikte yer almalıdır.
Değerlendirme seti nasıl oluşturulur?
Hayal ürünü örneklerle değil, canlı işle başlayın. Son gelen vakaları işin yapıldığı sistemlerden çekin; farklı haftalara, kanallara ve ekiplere olağan biçimde yayılsınlar. Ardından zorlu vakaları bilerek ekleyin: eksik formlar, çelişkili bilgiler, sistemin reddetmesi ya da yetkili kişiye aktarması gereken sorular ve doğru yanıtın “bir insana sorulmalı” olduğu vakalar.
Referans yanıtları sistemi geliştirenler değil, işin sahibi olan kişiler yazmalıdır. Uzmanlar anlaşamıyorsa bu anlaşmazlık başlı başına bir bulgudur: genellikle politikanın net olmadığını gösterir ve hiçbir sistem uyduğu kurallardan daha tutarlı olamaz. Konuyu süreç sahibiyle çözün ve kararı yazıya dökün.
Her örneği vaka türü, zorluk ve risk düzeyiyle etiketleyin. Etiketler sistemin nerede güçlü olduğunu ve nerede başarısız olduğunu gösterir. Tek bir ortalama ise ikisini de gizler.
Son olarak seti bölün. Bir kısmını ayırın ve promptları ya da bilgi erişimi ayarlarını iyileştirirken bu kısmı hiç kullanmayın. Ayrılan bu bölüm (held-out) dürüst bir final sınavıdır. Sütunlar, etiketler ve bölümler değerlendirme seti şablonunda yer alıyor.
İyi yanıtın neye benzediğini söyleyemiyorsanız hiçbir model onu size veremez.
Dil modeli çıktısı nasıl puanlanır?
Bazı çıktılar kesin olarak puanlanabilir: bir tarih, bir tutar, bir kategori, evet ya da hayır biçiminde bir karar. Bunları otomatik puanlayın. Serbest metin için süreç sahibiyle kısa bir puanlama ölçütü (rubric) yazın: hangi bilgiler mutlaka yer almalı, hangi ifadeler asla yer almamalı, kaynak doğru gösterilmiş mi, üslup uygun mu? İyi bir puanlama ölçütü, iki inceleyenin aynı biçimde uyguladığı ölçüttür.
Otomatik puanlama, seti sık çalıştırmayı pratik hale getirir. Buna yanıtları puanlama ölçütüne göre bir modele puanlatmak da dahildir. Puanlayıcıya da doğrulanması gereken bir sistem gibi davranın: bir örneklemde verdiği puanları insan inceleyenlerin puanlarıyla karşılaştırın. Yüksek riskli vakaları ise insanlar incelemeye devam etsin.
Değerlendirme seti model seçimini nasıl değiştirir?
Değerlendirme seti olduğunda model seçimi bir deneye dönüşür. Her adayı aynı örneklerle çalıştırın; kaliteyi, vaka başına maliyeti ve hızı karşılaştırın. Adaylar örneğin büyük bir ticari model, daha küçük ve daha ucuz bir model ve kendi sunucularınızda çalışabilen açık ağırlıklı bir model olabilir. Böylece soru pratik bir hal alır: önemli vakalarda kabul eşiğini karşılayan en ucuz seçenek hangisi?
Seçimi ne zaman yeniden ele almanız gerektiğini de aynı set söyler. Fiyatlar düştüğünde ya da yeni bir model çıktığında seti yeniden çalıştırın. Karar bir tartışmaya dönüşmez, birkaç günde verilir.
Set nasıl güncel tutulur?
Değerlendirme seti hiçbir zaman bitmez. Canlı kullanımda ortaya çıkıp bir insana ulaşan her hata yeni bir örnek olur. Yeni ürünler, politikalar ve kanallar yeni vaka türleri getirir. Farklı aylardaki sonuçları karşılaştırabilmek için seti sürümleriz ve her çeyrekte süreç sahibiyle birlikte gözden geçiririz.
En önemlisi, set bir regresyon testine dönüşür; bir LLM uygulamasını test etmenin katmanlarından biridir. Bir modelde, bir promptta ya da bir veri kaynağında yapılan her değişiklik, kullanıcılara ulaşmadan önce bu setten geçer. Bir güncellemenin işleri sessizce kötüleştirdiğini müşterilerinizden önce böyle öğrenirsiniz.
En sık hangi hatalar yapılır?
- Yalnızca kolay vakalar. Tipik örneklerden kurulan bir set yüksek puan verir ama size pek bir şey söylemez.
- Yanıtları geliştiricilerin yazması. Sistemi geliştiren ekip, neyin doğru olduğuna karar vermemelidir.
- Sınava göre ayar yapmak. Promptlar setin tamamı geçene kadar ayarlanırsa puan, canlıdaki performansı öngörmez olur.
- Tek bir sayı. Ortalama, başarısız olan vaka türlerini gizler; sonuçları etikete göre raporlayın.
- Hiç değişmeyen bir set. Canlı kullanım her ay yeni vakalar getirir; set de onlara ayak uydurmalıdır.
Değerlendirme seti neyin yerini tutmaz?
Değerlendirme seti kaliteyi tanımlar, geri kalan her şeyi değil. Entegrasyonlar, yetkiler, yanıt süreleri, güvenlik ve insanların kullandığı ekranlar için yine klasik gereksinimlere ihtiyacınız vardır. Değişen, ağırlık merkezidir. Bir yapay zeka projesindeki en zor soru, yani çıktının yeterince iyi olup olmadığı, somut ve test edilebilir bir yanıta kavuşur. Bu yanıtın sahibi de iş birimidir.
Nereden başlamalı?
Bir iş akışı seçin. Son gelen birkaç düzine vakayı çekin, süreç sahibinden kabul edeceği yanıtları yazmasını isteyin ve nerede duraksadığını not edin. O öğleden sonra iş akışı hakkında bir aylık gereksinim toplantısından daha fazlasını öğrenirsiniz. Yapay zeka projenizin en faydalı dokümanına da bir başlangıç yapmış olursunuz.
Bu notu bir yapay zeka asistanına sorun