Yapay zeka koruma önlemleri nedir? Her birinin nerede durduğunu gösteren bir harita.
“Koruma önlemleri” birbirinden çok farklı kontrolleri kapsar: istek modele ulaşmadan yapılan kontroller, sistemin yapabileceklerine konan sınırlar, ürettiği çıktının doğrulanması ve onay noktalarındaki insanlar. En güvenilir olanlar bir prompttaki talimatlar değil, sıradan yazılımdır.
veridive5 dk okuma
Bir tedarikçiye asistanında hangi koruma önlemleri olduğunu sorarsanız bir içerik filtresinden söz edebilir. Güvenlik ekibine sorarsanız yetkileri anlatır. Operasyon yöneticisi onaylardan bahseder; promptu yazan kişi ise “Hiçbir koşulda…” diye başlayan bir paragrafı gösterir.
Dördüne de koruma önlemi (guardrail) denir. Ama bunlar farklı yerlerde duran, farklı biçimlerde başarısız olan farklı kontrollerdir. Yapay zeka koruma önlemleri dört katmanda durur (girdi, yetenek, çıktı ve insanlar) ve güvenilir olanlar bir modele verilen talimatlar değil, sıradan yazılımdır.
Koruma önlemi derken ne kastediliyor?
Koruma önlemi, bir yapay zeka sisteminin neyi aldığını, neyi yaptığını ya da neyi ürettiğini sınırlayan ya da bir karar noktasına bir insan koyan her türlü kontroldür. Durdukları yere göre haritalandığında:
| Katman | Nerede durur | İki örnek |
|---|---|---|
| Girdi | İstek modele ulaşmadan önce | Kişisel verileri maskelemek; kapsam dışı istekleri reddetmek |
| Yetenek | Sistemin erişebildiği araç ve verilerin çevresinde | Salt okuma erişimi; izin verilen işlemlerin sabit bir listesi |
| Çıktı | Modelle, yanıtını kullanan kişi ya da sistem arasında | Şema ve iş kuralı kontrolleri; kaynak kontrolleri |
| İnsanlar | Karar noktalarında | Bir eşiğin üzerinde onay; emin olunmadığında yetkili kişiye aktarma |
Eksik olana dikkat edin: prompttaki talimatlar. “Asla para iadesi sözü vermeyin” gibi bir satır davranışı çoğu zaman şekillendirir ve yazmaya değer. Ama model onu yanlış anlayabilir, uzun bir konuşmada gözden kaçırabilir ya da bir belgeye gizlenmiş bir metin modeli bu talimattan vazgeçirebilir. Bu bir kontrol değil, bir tercihtir. Bir kuralın çiğnenmesi para ya da güven kaybına yol açacaksa, kuralın arkasında koddaki bir kontrol ya da bir insan olmalıdır.
Prompttaki talimat bir tercihtir. Yetki ise bir kontroldür.
İstek modele ulaşmadan önce ne olur?
Girdi filtreleme. İstek modele ulaşmadan önce yapılan kontroller: kapsam dışı konular, hakaret içeren dil, bilinen enjeksiyon ifadeleri, beklenmeyen dosya türleri. İlk eleme için faydalıdır; tek önlem olduğunda ise atlatılması kolaydır. Şunu sorun: filtrenin kaçırdığı isteğe ne olur?
Veri maskeleme. Metin sistemlerinizden çıkmadan önce adlar, kimlik numaraları ya da hesap numaraları gibi kişisel verileri yer tutucularla değiştirmek. Model sağlayıcının gördüğünü azaltır ama veriyi anonim hale getirmez. Şunu sorun: hangi alanlar maskeleniyor ve kişisel veri tespiti kendi veri biçimlerimizde test edildi mi?
Filtreler gizli talimatlara karşı özellikle zayıftır; nedenleri prompt enjeksiyonuna karşı işe yarayan savunmalar notunda anlatılıyor.
Sistemin yapabileceklerini ne sınırlar?
En az yetki. Sistem kendi hesabıyla ve yalnızca görevinin gerektirdiği erişimle çalışır: okumanın yettiği yerde okuma, belirli alanlara yazma, asla yönetici rolü. Şunu sorun: bu hesabın yapabileceği en zararlı şey nedir?
İzin verilen işlemler ve sınırlar. Sistemin yapabileceği işlemlerin sabit bir listesi; parametreler kodla kontrol edilir, tutarlara, hacimlere ve harcamaya tavan konur. Model ne isterse istesin, listede olmayan her şeyi sistem reddeder. Şunu sorun: listeyi kim değiştirebilir ve her değişiklik kaydediliyor mu?
Yanıt, kimse görmeden önce nasıl kontrol edilir?
Çıktı doğrulama. Çıktıyı kullanılmadan önce bir şemaya ve iş kurallarına göre kontrol etmek: zorunlu alanlar dolu mu, tutarlar aralık içinde mi, tanımlayıcılar ana veride var mı? Şunu sorun: kontrolden geçemeyen bir çıktı nereye gider, bir tekrar deneme döngüsüne mi, bir insana mı?
Kaynağa dayanma kontrolleri. Her iddianın, kullanıcının görmeye yetkili olduğu bir kaynakla desteklendiğini ve gösterilen kaynağın yanıtın iddia ettiğini gerçekten söylediğini doğrulamak. Şunu sorun: hiçbir kaynak bir yanıtı desteklemediğinde sistem ne söylüyor?
İnsanlar nerede devreye girer?
Onay noktaları. Para hareket ettiren, müşteriye ulaşan, şirketi taahhüt altına sokan ya da geri alınamayan her işlemi bir insan onaylar. Şunu sorun: inceleyen kişi kanıtı mı görüyor, yoksa yalnızca öneriyi mi?
Yetkili kişiye aktarma. Sistem emin olmadığında ya da bir kontrol başarısız olduğunda vaka, o ana kadar toplanan bilgilerle birlikte bir insana gider. Şunu sorun: o kişinin eline tam olarak ne geçiyor? Bir insan devreye girmeden önce bir ajanın ne kadarını yapabileceği, ajanların ne zaman kendi başına işlem yapması gerektiğini anlatan notun konusudur.
Temsili bir örnek ele alalım: bir çevrimiçi perakendecinin para iadesi asistanı ve her katmanda bir koruma önlemi:
- Girdi: müşteri mesajlarındaki kart numaraları, herhangi bir model çağrısından önce maskelenir.
- Yetenek: asistan siparişleri ve para iadesi politikasını okuyabilir, para iadesi taslağı oluşturabilir; ama para iadesi yapma yetkisi yoktur.
- Çıktı: tutarı sipariş toplamını aşan ya da hiçbir politika paragrafını kaynak göstermeyen taslak durdurulur.
- İnsanlar: belirlenen bir tutarın üzerindeki para iadeleri ve sistemin belirsiz olarak işaretlediği her vaka, bir ekip üyesini bekler.
Koruma önlemlerinin işe yaradığını nasıl anlarsınız?
Onları diğer tüm özellikler gibi test edin. Her koruma önlemi belirli bir hatayı önlemek için vardır; o hatayı bir test vakası olarak yazın: kart numarası içeren bir mesaj, para iadesinin başka bir hesaba yapılmasını isteyen bir belge, sipariş toplamını aşan bir taslak, yetkili kişiye aktarılması gereken bir vaka. Bu saldırı vakalarını değerlendirme setine koyun ve her değişiklikte çalıştırın. Yetkileri de doğrudan test edin: yasak işlemi sistemin kendi kimlik bilgileriyle yapmayı deneyin.
Ardından onları canlı kullanımda izleyin. Her koruma önleminin ne sıklıkla devreye girdiğini sayın; yakaladıklarından ve geçirdiklerinden bir örneklemi gözden geçirin. Hiç devreye girmeyen bir koruma önlemi ya çalışıyordur ya da bozuktur. Hangisi olduğunu yalnızca örneklem söyler.
Tek bir sistemin haritası nasıl çıkarılır?
İşlettiğiniz bir yapay zeka sistemini seçin ve onun için dört katmanlı tabloyu doldurun. Boş hücreler ve yalnızca prompt talimatı içeren hücreler, başlamanız gereken yerlerdir. Nasıl çalışıyoruz sayfamızdaki dört koruma önlemi sorusu aynı haritanın kısaltılmış halidir. Bu sorular, geliştirdiğimiz her özel yapay zeka yazılımı projesini ve yapay zeka güvenilirliği çalışmasıyla baktığımız her sistemi şekillendirir.
Kaynaklar
- OWASP Top 10 for Large Language Model Applications OWASP Gen AI Security Project genai.owasp.org/llm-top-10
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1 ABD Ulusal Standartlar ve Teknoloji Enstitüsü (NIST) nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf
Bu notu bir yapay zeka asistanına sorun