# LLMOps ve MLOps: model bir dil modeli olduğunda ne değişir?

> Bu saha notunda veridive, LLMOps ile MLOps’u karşılaştırıyor. Sürümleme, test, izleme ve geri alma aynen geçerlidir; ama dil modelleri nadiren kurum içinde eğitilir. Ekipler bunun yerine promptları, bilgi kaynaklarını, dış model sürümlerini ve insan incelemesini yönetir. Not, neyin sürümlendiğini, izlemenin nasıl farklılaştığını, işi kimin yaptığını ve bir veri ekibinin önce ne öğrenmesi gerektiğini ele alıyor.

MLOps’un büyük kısmı geçerliliğini korur, ama dil modellerinde nadiren eğitim yaparsınız: Promptları, bilgi kaynaklarını, dış model sürümlerini ve insan incelemesini yönetirsiniz. Ağırlık merkezi eğitim hatlarından değerlendirmeye ve değişiklik kontrolüne kayar.

## Öne çıkanlar

- Sürümleme, test, aşamalı dağıtım, izleme ve geri alma MLOps’tan aynen geçer; yeniden eğitim ise çoğunlukla geçmez.
- Bir LLM sisteminde promptları, kaynakları ve dizini, model kimliklerini, değerlendirme setlerini ve yapılandırmayı birlikte sürümlersiniz.
- Sağlayıcı modeli değiştirebilir ya da kullanımdan kaldırabilir; bu yüzden ağırlık merkezi eğitim hattından değerlendirmeye ve değişiklik kontrolüne kayar.
- İnsan incelemesi, kendi metrikleri olan operasyonel bir bileşendir: işlem hacmi, kuyrukta bekleme süresi, uyum ve müdahale oranları.

Bir veri ekibi, talep tahmini modelini oturmuş bir rutinle işletiyor: öznitelik hatları (feature pipeline), planlı yeniden eğitim, model kayıt sistemi (model registry), kayma (drift) izleme ve bir geri alma düğmesi. Sonra iş birimi ekipten, bir dil modeli üzerine kurulu bir asistanı işletmesini istiyor. Rutinin çoğu hâlâ geçerli. Ama kalite ilk kez düştüğünde ortada yeniden eğitilmiş hiçbir şey yok; üstelik model ekibin kendisine bile ait değil.

MLOps’un büyük kısmı geçerliliğini korur: sürümleme, test, izleme, geri alma. LLMOps ve MLOps farkı, işin nerede yoğunlaştığındadır. Dil modellerinde nadiren eğitim yaparsınız; promptları, bilgi kaynaklarını, dış model sürümlerini ve insan incelemesini yönetirsiniz. Ağırlık merkezi eğitim hatlarından değerlendirmeye ve değişiklik kontrolüne kayar.

## MLOps neleri kapsar, hangileri geçerliliğini korur?

MLOps, eğitilmiş bir modeli deneyden canlı kullanıma taşıma ve işe yarar tutma pratiğidir: veri ve öznitelik hatları, deney takibi, eğitim ve yeniden eğitim, model kayıt sistemi, dağıtım, kayma ve doğruluk izleme ve geri alma.

Alışkanlıklar neredeyse olduğu gibi geçer. Davranışı etkileyen her şeyi sürümleyin. Yayına almadan önce sistemin görmediği verilerle test edin. Aşama aşama dağıtın. Canlıda bir başlangıç ölçümüne göre izleyin. Hızla geri alın. Denetim kaydı tutun. Alttaki mühendislik de geçer: otomatik hatlar, kod olarak altyapı (infrastructure as code), erişim kontrolü.

## Dil modellerinde yeni olan nedir?

Günlük işi beş şey değiştirir:

- **Nadiren eğitim yaparsınız.** Davranışı promptlar, örnekler, getirilen kaynaklar ve yapılandırma biçimlendirir ve bu davranış dakikalar içinde değişebilir. İnce ayar (fine-tuning) vardır ama istisnadır.
- **Model dışarıdadır.** Onu bir sağlayıcı barındırır, güncelleyebilir ve eninde sonunda kullanımdan kaldırır. Ekibiniz onu eğitmedi ve eğitim verisini inceleyemez.
- **Çıktı dildir.** Nadiren tek bir doğruluk metriği vardır; kaliteyi değerlendirme setleri ve puanlama ölçütleriyle, kısmen de insanlar değerlendirir.
- **İnsanlar döngünün içindedir.** İnceleyenler canlıda çıktıyı onaylar ve düzeltir; bu yüzden emekleri çalışan sistemin bir parçasıdır.
- **Maliyet çağrı başınadır.** Modeli kendiniz barındırmıyorsanız harcama hacimle, prompt uzunluğuyla ve model seçimiyle birlikte hareket eder.

| Boyut | MLOps: sizin eğittiğiniz model | LLMOps: sizin kullandığınız dil modeli |
|---|---|---|
| Ana varlıklar | Eğitim verisi, öznitelikler, model ağırlıkları | Promptlar, kaynaklar ve dizin, model kimlikleri, değerlendirme setleri, yapılandırma |
| Test | Ayrılmış etiketli veride metrikler | Puanlama ölçütlü değerlendirme setleri, tekrarlanan çalıştırmalar, kötü niyetli vakalar |
| İzleme | Veri kayması, tahmin kayması, sonuçlar geldikçe doğruluk | Müdahale oranı, örneklem incelemesi, kaynak desteği, görev başına maliyet |
| Değişikliği tetikleyenler | Yeni veri, kayma, planlı yeniden eğitim | Prompt düzenlemeleri, kaynak güncellemeleri, sağlayıcı güncellemeleri ve kullanımdan kaldırmalar |
| Roller | Veri bilimciler, ML mühendisleri | Mühendisler, süreç sahipleri, içerik sahipleri, inceleyenler |

Gerçek sistemlerin çoğu ikisine birden ihtiyaç duyar. Eğitilmiş bir model puanlar, tahmin eder ya da sınıflandırır; bir dil modeli de onun çevresinde okur ve taslak hazırlar. Eğitim yaptığınız yerde MLOps olduğu gibi geçerlidir; bir dil modelini çağırdığınız yerde ise bu notun geri kalanı.

## Bir LLM sisteminde neler sürümlenir?

Bir yanıtı değiştirebilecek her şey:

- **Promptlar:** görev ve model başına, kod gibi incelenerek. Ayrıntılar [promptları kod gibi sürümlemeyi anlatan notumuzda](https://veridive.com/tr/saha-notlari/prompt-surumleme-ve-test/).
- **Kaynaklar ve bilgi erişimi dizini:** hangi belgeler, hangi sürümler, metni parçalara bölme ve embedding (metnin anlamını sayılarla temsil eden vektör) ayarları; böylece dizin birebir yeniden oluşturulabilir.
- **Model kimlikleri:** her görev için yalnızca model ailesinin adı değil, tam sürüm dizesi; her kayıt satırına yazılır.
- **Değerlendirme setleri:** farklı sürümlerin puanları karşılaştırılabilsin diye.
- **Yapılandırma:** örnekleme ayarları, uzunluk sınırları, yönlendirme eşikleri, araç listeleri ve yetkiler.

Yayına alınan her paket, bu beşinin birleşimidir. Canlıdaki her yanıt, her birinin tek bir sürümüne kadar izlenebilmelidir.

> Modeli ekibiniz eğitmedi; ama davranışındaki her değişikliğin sahibi yine ekibinizdir.

## İzleme nasıl farklılaşır?

Bir tahmin modeli er geç gerçekle yüzleşir: Gerçek talep gelir ve doğruluk hesaplanabilir. Bir dil modelinin yanıtları ise nadiren doğru cevabıyla birlikte gelir. Bunu inceleme adımı sağlar: müdahaleler, düzeltmeler ve örneklem inceleme puanları; yanlarında da kaynak desteği, doğrulama hataları, görev başına maliyet ve yanıt süresi. Kaymanın yeni kaynakları da vardır; girdileriniz hiç değişmemişken sağlayıcının yaptığı model güncellemesi bunlardan biridir. Sinyalleri [canlıdaki bir yapay zeka sisteminde neyin izleneceğini anlatan notumuz](https://veridive.com/tr/saha-notlari/llm-izleme-metrikleri/) ele alıyor.

İnsan incelemesinin de operasyonel bir bileşen olarak kendi izlemesi gerekir: işlem hacmi, kuyrukta bekleme süresi, inceleyenler arasındaki uyum ve inceleyen başına müdahale oranları. Burada aykırı değerler bir eğitim ihtiyacına ya da kontrol etmeyi bırakmış inceleyenlere işaret eder. İnsan incelemesi de sistemin diğer her parçası gibi yeterli kadro ve yedekleme ister.

## Her birinde işi kim yapar?

MLOps’ta veri bilimciler modelleri kurar ve yeniden eğitir, ML mühendisleri onları dağıtır ve izler, veri mühendisleri de hatları işletir. Bir LLM sisteminde ise uygulamanın, promptların ve entegrasyonların sahibi yazılım mühendisleridir. Kaynakların ve dizinin sahibi veri mühendisleri, değerlendirme setinin sahibi alan uzmanlarıdır. Belgeleri içerik sahipleri güncel tutar, kuyruğu inceleyenler yürütür; eşikleri belirleyen ve değişiklikleri onaylayan da süreç sahibidir.

En büyük değişim, sistemin davranışını veri ekibinin dışındaki insanların da değiştirebilmesidir; örneğin bir politika belgesini yenisiyle değiştirerek. Değişiklik kontrolünün onlara da ulaşması gerekir.

Temsili bir değişiklik talebi ele alalım: Şirket yeni bir ürün grubu çıkarıyor.

- **Talep tahmini için makine öğrenmesi hattında** ekip benzer ürünlerin geçmiş verisini toplar, öznitelikleri oluşturur, modeli yeniden eğitir, ayrılmış bir dönem üzerinde doğrular ve dağıtır. Gerçek satışlar gelene kadar yeni ürün grubunun tahminleri vekil göstergelere dayanır ve işaretlenir. İşin çoğu veri ve eğitimdir.
- **Satış desteği için LLM sisteminde** kimse bir şeyi yeniden eğitmez. İçerik sahibi kataloğu ve fiyat listesini kaynaklara ekler, dizin yeniden oluşturulur. Prompta ürün grubunun garanti koşullarıyla ilgili tek bir kural eklenir. Süreç sahibi, ürün grubuyla ilgili birkaç düzine gerçek soruyu değerlendirme setine ekler. Başka hiçbir şeyin değişmediğini doğrulamak için setin tamamı çalıştırılır ve yeni vaka türündeki müdahale oranı izlenirken yeni sürüm aşama aşama yayına alınır. İşin çoğu içerik, değerlendirme ve değişiklik kontrolüdür.

## Bir veri ekibi önce ne öğrenmeli?

Önce değerlendirme: süreç sahipleriyle değerlendirme setleri oluşturmak, puanlama ölçütleri yazmak, sonuçları vaka türüne göre okumak. Sonra veri ekiplerinin doğal alanı olan bilgi erişimi: ayrıştırma, metni parçalara bölme, arama ve yetkiler. Ardından promptlar ve belgeler gibi kod olmayan şeyler için değişiklik kontrolü. Sıfırdan model eğitmek bekleyebilir; çoğu LLM sistemi buna hiç ihtiyaç duymaz.

## Önemli olan her şey sürümleniyor mu?

Promptlardan dizindeki belgelere kadar sisteminizin yanıtlarını değiştirebilecek her varlığı listeleyin. Her birinin sürümlendiğini ve bir değerlendirme çalıştırmasına bağlandığını kontrol edin. Sürümlenmemiş bir varlık varsa kapatılacak ilk açık odur. Canlı sistemleri [yapay zeka güvenilirliği](https://veridive.com/tr/hizmetler/yapay-zeka-guvenilirligi/) hizmetimizde böyle işletiriz; bunu [veri ve yapay zeka altyapısı](https://veridive.com/tr/hizmetler/veri-ve-yapay-zeka-altyapisi/) çalışmalarımızda kurulan kaynaklar, dizinler ve değerlendirme setleri üzerinde yaparız.

## Sık sorulan sorular

### LLMOps nedir?

LLMOps, büyük dil modelleri üzerine kurulu uygulamaları canlıda işletmek için kullanılan yöntemler bütünüdür. Promptları, bilgi kaynaklarını, model kimliklerini, değerlendirme setlerini ve yapılandırmayı sürümlemeyi; değişiklikleri bir değerlendirme setiyle test etmeyi; kaliteyi, maliyeti ve insan müdahalelerini izlemeyi ve sağlayıcının model güncellemeleriyle kullanımdan kaldırmalarını yönetmeyi kapsar. Disiplininin çoğunu MLOps’tan alır ama nadiren eğitim içerir.

### LLMOps ile MLOps arasındaki fark nedir?

MLOps eğitim hatlarını merkeze alır: ekibinizin eğittiği modeller için veri, öznitelikler, yeniden eğitim, model kayıt sistemi ve kayma izleme. LLMOps ise genellikle başkasının eğittiği ve barındırdığı bir modeli işletir. Bu yüzden davranış promptlar, kaynaklar ve yapılandırmayla değişir, kalite değerlendirme setleri ve insan incelemesiyle ölçülür, sağlayıcının model güncellemeleri de yönetmeniz gereken bir değişikliğe dönüşür.
