# İlk fatura gelmeden LLM işletme maliyetleri nasıl tahmin edilir?

> Bu saha notunda veridive, LLM işletme maliyetlerinin fiyat listesinden değil görevden yola çıkarak nasıl tahmin edileceğini anlatıyor: görev başına çağrılar, girdi ve çıktı token’ları, tekrar denemeler, hacim, yoğunluk katsayıları ve inceleme dakikaları bir pilotta ölçülür. Not, model faturası dışındaki maliyetleri, tavanları ve uyarıları ve temsili bir örnekle bir tahmin tablosunu ele alıyor.

Fiyat listesinden değil görevden yola çıkın: görev başına çağrılar, çağrı başına token’lar, tekrar denemeler, yoğun dönemler ve inceleme dakikaları; hepsi pilotta ölçülür. Ardından canlıya geçmeden önce uyarıları olan bir maliyet tavanı belirleyin.

## Öne çıkanlar

- Görevden yola çıkarak tahmin edin: her çağrı, girdi ve çıktı token’ları, tekrar denemeler ve inceleme dakikaları pilotta ölçülür.
- Kelime başına token sayısı dile ve modele göre değiştiği için token’ları gerçek Türkçe ve İngilizce vakalar üzerinde ölçün.
- Bütçeyi ortalama aya değil en yoğun aya göre yapın; kapasiteyi de en yoğun güne göre planlayın.
- Canlıya geçmeden önce bütçe, günlük harcama ve görev başına uyarıları olan bir tavan koyun; tavana yaklaşınca ne olacağına karar verin.

Bir pilotun model faturası genellikle görmezden gelinecek kadar küçüktür; canlı kullanım faturalarının insanları şaşırtmasının nedeni de tam olarak budur. Pilot birkaç yüz kolay vakayla çalıştı. Canlı kullanım ise uzun vakalar, tekrar denemeler ve ay sonu yoğunluğu dahil her vakayla çalışır.

İyi bir LLM maliyet tahmini fiyat listesinden değil, görevden başlar. Görev başına çağrıları, çağrı başına token’ları, tekrar denemeleri ve inceleme dakikalarını pilotta ölçün; bunları tam hacme ve yoğun dönemlere taşıyın ve canlıya geçmeden önce uyarıları olan bir tavan belirleyin. Aşağıda altı adımı, her birinin ne zaman bitmiş sayılacağını ve genellikle nerede hata yapıldığını bulacaksınız.

## Tek bir görevin maliyetine neler girer?

> Fiyat listesinden değil, görevden yola çıkarak tahmin edin.

Görev, tamamlanmış tek bir iş birimidir: taslağı hazırlanan bir fatura, yanıtlanan bir destek talebi. Nadiren tek bir model çağrısı anlamına gelir. Tipik bir akış girdiyi sınıflandırır, bağlamı getirir, taslak hazırlar, taslağı kontrol eder ve bazen yeniden dener. [Token’ın ne olduğunu anlatan notumuzda](https://veridive.com/tr/saha-notlari/token-nedir-yapay-zeka/) açıkladığımız gibi, her adımın kendi girdi ve çıktı token’ları vardır.

Bu yüzden akışı içindeki her çağrıyla birlikte yazın: bilgi erişiminin arkasındaki embedding (metnin anlamını sayılarla temsil eden vektör) çağrısı, çıktıyı kontrol eden doğrulayıcı, daha büyük bir modele geçen yedek yol ve her çağrıda yeniden gönderilen talimatlar.

- **İş bittiğinde:** her adım ve her çağrı, kullandığı modelle birlikte listelenmiştir.
- **Sık yapılan hata:** yalnızca ana çağrıyı sayıp bilgi erişimini, doğrulamayı ve tekrar denemeleri unutmak.

## Pilot sırasında token’lar ve çağrılar nasıl ölçülür?

Kullanımı kelime sayılarından değil, API yanıtlarından kaydedin. Sağlayıcılar her istek için girdi ve çıktı token’larını bildirir; her kaydı vaka numarası, adım ve dille etiketleyin, tekrar denemeleri de nedenleriyle birlikte saklayın.

Özenle seçilmiş bir set üzerinde değil, vakaların gerçek dağılımı üzerinde ölçün. Kelime başına token sayısı dile ve modele göre değişir; bu yüzden bir oran varsaymak yerine gerçek Türkçe ve İngilizce metinleri ölçün. Aynı vaka bir dilde diğerine göre belirgin biçimde daha fazla token tutabilir. İnceleme dakikalarını da kaydedin: vakanın inceleme ekranında açılmasından onaylanmasına kadar.

- **İş bittiğinde:** elinizde tek bir ortalama değil, adım ve dil başına tipik ve uzun vaka rakamları vardır.
- **Sık yapılan hata:** kısa demo vakalarını ya da canlıda kullanacağınızdan farklı bir modeli ölçmek. Seçim henüz açıksa adayları, [model seçimi çalışmalarımızda](https://veridive.com/tr/hizmetler/veri-ve-yapay-zeka-altyapisi/) olduğu gibi aynı değerlendirme setiyle karşılaştırın.

## Tam hacim ve yoğun dönemler nasıl öngörülür?

Aylık hacmi pilottan değil, işin kaydedildiği asıl sistemden alın ve insanlar sisteme güvendikçe gelecek büyümeyi ekleyin. Sonra yoğun dönemleri bulun: ay sonu kapanışı, kampanya haftaları, bayram ve yılbaşı sonrasındaki iade dönemi. Her birini bir yoğunluk katsayısıyla ifade edin: en yoğun dönemin ortalama bir döneme oranı.

Bütçeyi en yoğun aya göre yapın; kapasiteyi ve sağlayıcının istek sınırlarını (rate limit) en yoğun güne göre planlayın. Yoğun dönemdeki vaka dağılımını da kontrol edin: ay sonu faturaları ve bayram sonrası iadeler çoğu zaman ortalama vakadan daha uzun ve daha dağınıktır.

- **İş bittiğinde:** tahminde ortalama bir ay, en yoğun ay ve en yoğun gün yer alır.
- **Sık yapılan hata:** pilot ayını tipik saymak ya da yoğun dönemlerin yalnızca hacmi değil vaka dağılımını da değiştirdiğini unutmak.

## Model faturasının dışında hangi maliyetler var?

Model faturası yalnızca bir kalemdir. Diğerleri:

- **İnceleme süresi**, çoğu zaman en büyüğü: vaka başına dakika çarpı hacim çarpı o ekibin bir saatinin maliyeti.
- **Altyapı:** barındırma, arama dizini, depolama, kayıt ve izleme (tracing) araçları.
- **Yeniden dizinleme:** belgeler değiştiğinde yeniden embedding’e çevrilen her sayfa tekrar faturalanır.
- **Değerlendirme çalıştırmaları:** her değişiklikte değerlendirme setini çalıştırmak da token harcar.
- **İzleme, destek ve iyileştirme:** sistemi işe yarar tutan insanlar.

[Token maliyetini hata maliyetiyle karşılaştıran notumuz](https://veridive.com/tr/saha-notlari/yapay-zeka-hata-maliyeti/), tahminlerin çoğu zaman dışarıda bıraktığı kalemi ekliyor: hataların beklenen maliyeti.

- **İş bittiğinde:** her kalemin bir sahibi ve aylık bir tahmini vardır.
- **Sık yapılan hata:** “insanlar bu işi zaten yapıyordu” diyerek inceleme süresini dışarıda bırakmak.

## Maliyet tavanı ve uyarılar nasıl belirlenir?

Süreç sahibiyle, en yoğun ay tahminine bir pay ekleyerek aylık bir tavan üzerinde anlaşın. Ardından üç tür uyarı ekleyin:

- **Bütçe uyarıları:** tavandan çok önce, örneğin tavanın yarısında ve dörtte üçünde.
- **Günlük harcama uyarısı:** kontrolden çıkan bir döngüyü ay sonunda değil, bir gün içinde yakalar.
- **Görev başına maliyet uyarısı:** toplamlar normal görünse bile şişen promptları ya da bir tekrar deneme fırtınasını yakalar.

Artışın hangi bölümden geldiğini görebilmek için bütçeleri özelliklere göre ayırın. Tavana yaklaşıldığında ne olacağına önceden karar verin: rutin vakalar daha küçük bir modele geçer, acil olmayan işler kuyrukta bekler ya da vakalar insanlara döner. Sistem asla sessizce durmamalıdır.

- **İş bittiğinde:** her uyarı bilerek bir kez tetiklenmiş ve adı belli bir kişiye ulaşmıştır.
- **Sık yapılan hata:** uyarıların kimsenin okumadığı ortak bir posta kutusuna düşmesi.

## Bir tahmin tablosu neye benzer?

Her adım için bir satır ve şu sütunlar:

- **Adım** ve kullandığı model.
- **Görev başına çağrı**, yedek yollar dahil.
- **Çağrı başına girdi ve çıktı token’ı**, tipik ve uzun vaka için.
- Adımın **tekrar deneme oranı**.
- Tüm satırlarda ortak olan **aylık hacim** ve **yoğunluk katsayısı**.
- Görev başına **inceleme dakikaları**, ayrı bir satırda.

Fatura taslağı hazırlama için temsili bir tahmin ele alalım. Sayılar hesabı göstermek için seçilmiş varsayımsal değerlerdir ve birimler temsilidir; fiyat ya da kıyaslama değildir. 1.000 girdi token’ı için 1 birim, 1.000 çıktı token’ı için 5 birim varsayalım.

| Adım | Görev başına çağrı | Çağrı başına token (girdi / çıktı) | Görev başına birim |
|---|---|---|---|
| Sınıflandırma | 1 | 2.000 / 100 | 2,5 |
| Alanları çıkarma | 1 | 5.000 / 400 | 7 |
| Eşleştirme ve kontrol | 1 | 3.000 / 200 | 4 |
| Kayıt taslağı | 1 | 2.000 / 300 | 3,5 |

Bu, fatura başına 17 birim eder. Her on çıkarma işleminden biri iki kez çalışır; bu 0,7 ekler ve toplam 17,7 olur. Ortalama bir ayda 10.000 faturada model maliyeti 177.000 birimdir; 1,5 yoğunluk katsayısıyla en yoğun ay 265.500 birim tutar. İnceleme, dakikası varsayımsal olarak 10 birimden fatura başına 1,5 dakika ekler: fatura başına 15 birim, yani neredeyse model kadar. Tavan en yoğun aya göre belirlenir; görev başına uyarı ise örneğin 25 birimin üzerinde devreye girer.

## Pilotta ilk olarak ne kurulmalı?

Pilot bitmeden önce vaka, adım ve dil başına kullanım kaydını ekleyin; tahmindeki diğer her sayı buna dayanır. Sistem canlıya geçtikten sonra [yapay zeka güvenilirliği](https://veridive.com/tr/hizmetler/yapay-zeka-guvenilirligi/) hizmetimiz onu uyarılar ve yönlendirmeyle bu tavanın altında tutar.

## Sık sorulan sorular

### LLM API maliyeti canlıya geçmeden önce nasıl tahmin edilir?

Gerçek vakalarla bir pilotu ölçün: görev başına çağrıları, çağrı başına girdi ve çıktı token’larını, tekrar denemeleri ve inceleme dakikalarını adım adım ve dil dil kaydedin. Aylık hacimle çarpın, en yoğun dönemler için bir yoğunluk katsayısı uygulayın, altyapı ve inceleme süresi gibi model faturası dışındaki maliyetleri ekleyin; ardından canlıya geçmeden önce uyarıları olan bir tavan belirleyin.

### Yapay zeka bütçesi için ortalama ay neden yanlış bir temeldir?

Çünkü hacim de vaka dağılımı da belirli dönemlerde zirve yapar. Ay sonu kapanışları, kampanyalar ve sezonluk iadeler kısa sürede daha fazla ve çoğu zaman daha uzun vaka getirir; ortalama aya göre yapılan bir bütçe ilk yoğun dönemde aşılır. Ortalama bir ay, en yoğun ay ve en yoğun gün için ayrı tahmin yapın; bütçeyi en yoğun aya göre kurun ve kapasitenin ve istek sınırlarının en yoğun günü karşıladığını kontrol edin.
