veridive’ın yanıt motorunu veya ücretsiz araçlarını mı arıyorsunuz?Yanıt motorunu mu arıyorsunuz? Neler değişti

veridive EN Proje başlatın Menü

Saha notlarıGüvenilirlik

İnceleyenler yapay zeka çıktısını kontrol etmeyi neden bırakır ve inceleme göstermelik olmaktan nasıl korunur?

Bir sistem çoğu zaman haklıysa insanlar bakmayı bırakır. Kanıtı öne çıkaran ekranlar, cevabı bilinen vakalar, dönüşümlü çalışma ve onayın refleks haline geldiğini fark eden ölçütler insan denetimini anlamlı tutar.

veridive5 dk okuma

Canlıya geçişten sonraki ilk haftalarda inceleyenler her taslağı dikkatle okur. Kaynağı açar, tutarı kontrol eder, üslubu düzeltirler. Birkaç ay sonra aynı kişiler bir vakayı birkaç saniyede onaylar; çünkü sistem neredeyse her zaman haklıdır ve kuyruk uzundur.

Bu kaymanın bir adı var: otomasyon yanlılığı (automation bias). Bir karakter kusuru değil, iyi bir sistemin öngörülebilir bir etkisidir. İnsan incelemesini gerçek tutmak tasarım ister: kanıtı öne çıkaran ekranlar, cevabı bilinen vakalar, dönüşümlü çalışma ve onayın bir reflekse dönüştüğünü fark eden ölçütler.

Otomasyon yanlılığı nedir?

Otomasyon yanlılığı, otomatik bir sistemin çıktısını gereği gibi kontrol etmeden kabul etme eğilimidir. İki biçimde ortaya çıkar: İnsanlar yanlış bir öneriyi sistem yaptığı için izler ve bir sorunu sistem işaretlemediği için gözden kaçırır. Bir yapay zeka inceleme kuyruğunda ikisi de dışarıdan aynı görünür: hızlı bir onay. Otomasyon yanlılığı sistemi geri bildirimden de yoksun bırakır; çünkü göz yumulan her hata, değerlendirme setine hiç ulaşmayan bir düzeltmedir. Bu tarafı geri bildirim döngülerini anlatan notumuz ele alıyor.

İyi bir sistem bunu neden kötüleştirir?

Çünkü dikkat, karşılığını aldığı yere gider. Bir inceleyici iki yüz taslağı kontrol edip tek bir sorun bulursa kontrol etmek boşa harcanan bir çaba gibi gelmeye başlar; insanlar hangi çabanın boşa gittiğini de çabuk öğrenir. Zaman baskısı bunu artırır, özellikle iş gerekçesi kazanılacak dakikalara dayanıyorsa. Yanıtı önce gösteren bir ekran da inceleyicinin zihnini, başka hiçbir şeye bakmadan o yanıta sabitler.

Rahatsız edici sonuç şu: İnceleme kalitesi, tam da sistem güvenilecek kadar iyi hale geldiğinde düşme eğilimindedir. Seyrek hataların en çok önem taşıdığı an da budur.

İncelemenin formaliteye dönüştüğü nasıl anlaşılır?

İnceleme verilerinde şu işaretleri arayın:

  • Saniyelere inen onay süresi: kararın gerektirdiği kanıtı okumaya yetmeyecek kadar kısa.
  • Haftalardır sıfıra yakın müdahale oranı: oysa değerlendirme seti, sistemin bazı vakalarda hâlâ yanıldığını söylüyor.
  • Birbirinin aynı düzeltmeler: her seferinde aynı küçük değişiklik (örneğin bir selamlama) ve hiçbir zaman esaslı bir düzeltme yok.
  • Toplu onaylar: bir dakika içinde çok sayıda onay.
  • Açıklanamayan onaylar: inceleyenler bir gün önce onayladıkları bir vakayı açıklayamıyor.

Bunların hiçbiri tek başına bir şey kanıtlamaz. Bir aradaysalar bakma zamanı gelmiş demektir.

Hangi tasarım tercihleri insanların dikkatini canlı tutar?

Göstermelik onayın çoğu tasarımdan gelir. Beş kalıp ve çözümleri:

  • Önce hüküm. Öneri ve bir “Onayla” düğmesi başta gelir; kanıt bir tık ötededir. Çözüm: İnceleme ekranı tasarımını anlatan notumuzda açıklandığı gibi, kaynak pasajı ve temel bilgileri önerinin yanında gösterin.
  • Açık çek. İnceleyiciye önemli noktayı doğrulaması yerine “Onaylıyor musunuz?” diye sorulur. Çözüm: “İade tutarı sipariş satırıyla örtüşüyor” gibi belirli bir kontrol isteyin.
  • Her şeyi incelemek. Kolay ve zor vakalar aynı ilgiyi görür, bu yüzden dikkat dağılır. Çözüm: İnsanlara muhakeme gerektiren vakaları gönderin, gerisinden örneklem alın; ajanların ne zaman kendi başına işlem yapabileceğini anlatan notumuzdaki mantık da budur.
  • Bitmeyen kuyruk. Tek bir kişi yüzlerce benzer vakayı art arda inceler. Çözüm: İnceleyenleri kuyruklar ve vaka türleri arasında dönüşümlü çalıştırın; onaylanan vakalardan rastgele bir örneklemi ikinci bir inceleyiciye verin.
  • Pahalı müdahale. Karşı çıkmak, onaylamaktan daha uzun sürer ya da soru çeker. Çözüm: Müdahaleyi, tek satırlık bir gerekçeyle onay kadar hızlı hale getirin ve haklı bir müdahaleyi asla cezalandırmayın.

Cevabı bilinen kontroller nasıl işler?

Ekip, doğru sonucu bilinen vakaları canlı kuyruğa düşük bir oranda yerleştirir; bazılarında taslak bilerek yanlıştır. Bu vakalar sıradan vakalar gibi görünür. Herkes bu kontrollerin var olduğunu bilir: Kontroller bireyleri değil, kuyruğun dikkatini ölçer ve kaçırılan bir kontrol, açıklamasıyla birlikte inceleyiciye hemen gösterilir. Gerçekçi olmaları için kontrolleri geçmişteki gerçek hatalardan oluşturun. Bir müşteriye asla ulaşamamaları ve hiçbir sisteme kayıt atamamaları için de onları arka planda işaretleyin.

Temsili bir vaka bu kalıbı gösteriyor. Bir iade kuyruğunda onay süresi birkaç hafta içinde vaka başına yaklaşık bir dakikadan birkaç saniyeye iner ve müdahaleler neredeyse kaybolur. Ekip, bazılarında bilerek yapılmış hatalar bulunan cevabı bilinen vakalar ekler; örneğin sipariş tutarından yüksek bir iade. Bunların birkaçı onaylanıp geçer. Kimse suçlanmaz. Ekip ekranda sipariş tutarını iade tutarının yanına koyar, tutar için zorunlu bir kontrol ekler ve inceleyenleri iadeler ile değişimler arasında dönüşümlü çalıştırır. Onay süreleri okumanın mümkün olduğu bir düzeye çıkar ve cevabı bilinen vakalardaki yakalama oranı her hafta izlenen bir sayıya dönüşür.

Yöneticiler neyi ölçmeli, neyi takdir etmeli?

Yalnızca incelemenin hızını değil, kalitesini ölçün: cevabı bilinen vakalardaki yakalama oranı, müdahale oranı ve nedenleri, vaka başına sürenin ortalaması değil dağılımı, ikinci incelemelerin bulduğu görüş ayrılıkları ve daha sonra şikayetler ya da düzeltmeler yoluyla ortaya çıkan hatalar. Haklı müdahaleleri ve bildirilen sorunları takdir edin; duvardaki tek sayının işlem hacmi olmasına asla izin vermeyin.

Onay, birinin gerçekten baktığı anlamına gelmeli. Yoksa döngüdeki insan bir süsten ibarettir.

Bu, kalite kadar hesap verebilirlikle de ilgilidir. Bir karar sorgulandığında “bir insan onayladı” demek, ancak o kişi kontrol edebilecek durumdaysa ve gerçekten kontrol ettiyse işe yarar. Kanıtı görerek karar veren bir insan da bu yüzden koruma önlemlerimizden biridir.

Mevcut inceleme kuyruğunuz nasıl ölçülür?

Tek bir kuyruk için canlıya geçişten bu yana onay sürelerini ve müdahale oranını çıkarın; ortalamaya değil, dağılıma bakın. Ardından başka hiçbir şeyi değiştirmeden önce az sayıda cevabı bilinen vaka ekleyin; böylece üzerine iyileştirme yapabileceğiniz bir başlangıç ölçümünüz olur. Canlıya geçişten sonra bu sayılar, yapay zeka güvenilirliği hizmetimizin süreç sahibiyle yaptığı üç aylık değerlendirmede yer alır.

Kaynaklar

  1. Tüzük (AB) 2024/1689 (AB Yapay Zeka Yasası), resmi metin EUR-Lex eur-lex.europa.eu/eli/reg/2024/1689/oj
  2. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1 ABD Ulusal Standartlar ve Teknoloji Enstitüsü (NIST) nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf

Bu notu bir yapay zeka asistanına sorun

GüvenilirlikDenetimİnceleme

veridive

Saha notlarını veridive yazar ve gözden geçirir. Nasıl yazıyoruz

Sorular

Bu notla ilgili sorular

Otomasyon yanlılığı nedir?

Otomasyon yanlılığı, otomatik bir sistemin çıktısını gereği gibi kontrol etmeden kabul etme ve sistemin işaretlemediği sorunları gözden kaçırma eğilimidir. Sistem iyileştikçe artar; çünkü hatalar seyrekleşir ve kontrol etmek boşa harcanan bir çaba gibi gelmeye başlar. Yapay zeka inceleme kuyruklarında çok kısa onay süreleri ve neredeyse hiç müdahale olmaması biçiminde kendini gösterir.

Yapay zeka çıktısının insan incelemesi nasıl anlamlı tutulur?

Kanıtı önerinin yanında gösterin, inceleyenlerden önemli olan belirli noktayı doğrulamalarını isteyin, insanlara yalnızca muhakeme gerektiren vakaları gönderin, inceleyenleri dönüşümlü çalıştırın ve bir örneklemi ikinci kez inceletin. Ekibin bilgisi dahilinde kuyruğa cevabı bilinen vakalar yerleştirin. Yakalama oranlarını ve müdahale nedenlerini ölçün, haklı bir müdahaleyi de asla cezalandırmayın.