
LLM Fine-Tuning Maliyeti 2026: GPU-Saat Hesabı
Kısa cevap: 7B QLoRA birkaç RTX 4090 saati; 70B full fine-tuning ise çoklu H100 günleri demektir. Yöntem, GPU ve gizli maliyetleri Türkiye bütçesine göre hesaplayın.
Maliyet kalemleri ve yöntemler
GPU saati görünür; experiment tax, veri hazırlığı ve mühendis zamanı asıl şişirendir. QLoRA en ekonomik, full en pahalı. Colab vs GPU, LLM GPU seçimi.
7B QLoRA saatlik 4090/A100 ile PoC; 70B+ için H100+NVLink ve spot. KVKK kişisel veride şart. Lokasyon: İstanbul H100, Ankara A100; gecikme için İstanbul.
Tasarruf checklist
Smoke train, dar grid, early stopping, NVMe dataset, idle kapat, Docker ile pin'li imaj, önceden yazılı başarı metriği. Fiyatlandırma, akademik indirim, startup ipuçları.
Örnek komutlar / snippet
nvidia-smi --query-gpu=name,memory.used --format=csvTürkiye bağlamı ve operasyon
Türkiye'de GPU kiralama kararını yalnızca TFLOPS belirlemez. Veri lokasyonu, şehir gecikmesi, TL fatura, destek dili ve rezervasyon süresi toplam sahip olma deneyimini şekillendirir. Özellikle kişisel veri içeren eğitim ve çıkarım işlerinde KVKK kapsamında verinin yurt içinde işlenmesi beklenir; anonimleştirme tek başına her senaryoda yeterli sayılmaz.
Operasyonel olarak en sık görülen kayıp, GPU'nun kendisinden değil idle sürelerden ve tekrarlanmayan ortamlardan gelir. Driver/CUDA uyumsuzluğu, her instance'ta sıfırdan kurulum ve dataset'i eğitim sırasında ağ üzerinden okumak hem süreyi hem maliyeti şişirir. Container tabanlı imaj, NVMe'ye lokal dataset ve checkpoint disiplini bu kaybı azaltır.
İlgili sayfalar: H100 vs A100; AI eğitimi; İletişim; GPU rehberi.
Pratik kontrol listesi
- İş yükünü tek cümleyle yazın (eğitim / fine-tuning / inference / render / transcode).
- VRAM ve throughput için 30–60 dakikalık micro-benchmark planlayın.
- Saatlik planla başlayıp reserved/aylık modele ancak stabil kullanımda geçin.
- Spot kullanacaksanız checkpoint ve resume'u önceden test edin.
- Başarı metriğini (eval, latency p95, images/s, $/1k token) önceden sabitleyin.
- Idle Jupyter ve unutulan instance'ları otomatik kapatacak alarm kurun.
Sık yapılan hatalar
Benchmark yapmadan en pahalı GPU'ya çıkmak; tek metrikle (yalnızca VRAM veya yalnızca fiyat) karar vermek; production inference'ı eğitim kartıyla uzun süre koşturmak; multi-GPU'ya geçmeden single-GPU optimizasyonunu bitirmemek; veri sınıflandırması yapmadan yurtdışı bölgesine dataset taşımak.
Bir diğer yaygın hata, PoC başarı kriterini tanımsız bırakmaktır. 'Model biraz daha iyi olsun' diye açılan açık uçlu eğitimler, bütçeyi sessizce tüketir. Erken durdurma, eval bütçesi ve maksimum deneme sayısı olmadan fine-tuning işi bitmez; yalnızca fatura büyür.
Sonuç
LLM fine-tuning maliyeti model boyutu, LoRA/QLoRA/full yöntem, epoch ve deneme sayısına bağlıdır. Doğru GPU seçimi, ölçüm ve disiplinli operasyon bir araya geldiğinde hem maliyeti hem teslim süresini kontrol altına alırsınız.
Sonraki adım için ilgili GPU modeli, hizmet ve şehir sayfalarından senaryonuza uygun planı seçin; emin değilseniz saatlik küçük bir deneme ile başlamak genelde en düşük riskli yoldur.
Derinlemesine notlar
Fine-tuning faturasında görünür kalem GPU-saattir; asıl şişkinlik experiment tax (gereksiz grid, kötü eval, idle Jupyter) ve veri hazırlığıdır. Önce QLoRA ile smoke train + dar hiperparametre; kazanan config'i LoRA/full'e taşıyın. 70B full FT'ye gitmeden tek GPU optimizasyonu ve checkpoint disiplini bitmiş olmalı.
Türkiye'de kişisel veri içeren corpus için lokasyon ve DPA'yı bütçeye satır olarak yazın (KVKK). Eğitim düğümlerini kullanıcıya yakın seçin: İstanbul H100, Ankara A100; ofis gecikmesi için İstanbul / Ankara. Spot + sağlam resume (spot stratejisi) gece batch'te birim maliyeti düşürür.
SSS
Sıkça Sorulan Sorular
Bu yazıdaki karar noktalarına kısa yanıtlar.


