Saha notları · Konu
Mühendislik.
İşe yarayan bir yapay zeka sisteminin büyük kısmı, iyi yazılmış sıradan yazılımdır. Bu notlar model çağrısının etrafındaki tasarım kararlarını ele alır: araçlar, çıktı doğrulama, testler, inceleme ekranları ve modele bağlı olmayan koruma önlemleri.
10 not
Bu konudaki notlar
-
Değerlendirme setleri yeni gereksinim dokümanıdır.
Çıktı dil olduğunda “bitti”yi tanımlamak zordur. Uzmanların onayladığı yanıtlarla birkaç yüz gerçek örnek kaliteyi ölçülebilir kılar ve model seçimini bir görüş olmaktan çıkarıp bir deneye dönüştürür.
-
Yapay zeka ajanları ne zaman kendi başlarına işlem yapmalı, ne zaman yapmamalı?
Ajanlar; işlemler geri alınabilir, düşük maliyetli ve iyi kayıt altında olduğunda güçlüdür. Diğer her durumda ajan işi hazırlamalı, kararı bir insan vermelidir.
-
Bir yapay zeka ajanına mı, birkaç model çağrısı olan bir iş akışına mı ihtiyacınız var?
Çoğu iş süreci, belirli adımlarında model çağrısı olan sabit bir iş akışıyla daha iyi çalışır. Ajanlar yolun önceden bilinemediği yerde değer katar; ancak test edilmeleri, işletilmeleri ve açıklanmaları daha pahalıdır.
-
Prompt enjeksiyonu: hangi savunmalar gerçekten işe yarar?
Prompt enjeksiyonunu filtrelerle tamamen önleyemezsiniz. Enjekte edilen bir talimatın yapabileceklerini sınırlayın: talimatı veriden ayırın, yetkileri daraltın, çıktıyı doğrulayın, önemli işlemlere insan onayı koyun.
-
Yapay zeka koruma önlemleri nedir? Her birinin nerede durduğunu gösteren bir harita.
“Koruma önlemleri” birbirinden çok farklı kontrolleri kapsar: istek modele ulaşmadan yapılan kontroller, sistemin yapabileceklerine konan sınırlar, ürettiği çıktının doğrulanması ve onay noktalarındaki insanlar. En güvenilir olanlar bir prompttaki talimatlar değil, sıradan yazılımdır.
-
İnsanların tek bakışta karar verebileceği bir inceleme ekranı nasıl tasarlanır?
Yapay zekanın zaman kazandırıp kazandırmayacağını inceleme ekranı belirler. Öneriyi, dayandığı kanıtı, belirsiz olanı ve onay verildiğinde ne olacağını gösterin; kişi işi yeniden yapmadan karar verebilsin.
-
Bir dil modelinden güvenilir yapılandırılmış veri almak.
Model çıktısını güvenilmeyen her girdi gibi ele alın: katı bir şema tanımlayın, üretimi kısıtlayın, her alanı iş kurallarıyla doğrulayın ve doğrulamadan geçemeyeni sonsuza kadar yeniden denemek yerine bir insana yönlendirin.
-
Bir LLM uygulaması katman katman nasıl test edilir?
Deterministik parçaları sıradan yazılım gibi, dil parçalarını değerlendirme setleriyle, aradaki bağlantıları da ayrıca test edin. Tek bir uçtan uca doğruluk sayısı, sorunun gerçekte nerede olduğunu gizler.
-
Promptlar koddur: nasıl sürümlenir, incelenir ve test edilir?
Bir prompt değişikliği bir davranış değişikliğidir. Promptları sürüm kontrolünde tutun, kod gibi inceleyin, her sürümü değerlendirme sonuçlarına bağlayın ve asla canlı bir panelde düzenlemeyin.
-
Bir yapay zeka ajanının kullanabileceği araçlar nasıl tasarlanır?
Bir ajan, araçları kadar güvenli ve güvenilirdir. Her aracı dar kapsamlı ve açıkça tanımlanmış yapın, en az yetkiyle sınırlayın; iki kez çağrıldığında zarar vermesin, başarısız olduğunda da yol göstersin.