Tüm yazılar
LLM Fine-Tuning Maliyeti 2026: GPU-Saat Hesabı
LLM Fine-Tuning Maliyeti 2026: GPU-Saat Hesabı
Fiyatlandırma10 dk okuma1.948 kelime

LLM Fine-Tuning Maliyeti 2026: GPU-Saat Hesabı

Kısa cevap: 7B QLoRA birkaç RTX 4090 saati; 70B full fine-tuning ise çoklu H100 günleri demektir. Yöntem, GPU ve gizli maliyetleri Türkiye bütçesine göre hesaplayın.

Emre KayaBulut Altyapı Uzmanı
Güncellendi:

Maliyet kalemleri ve yöntemler

GPU saati görünür; experiment tax, veri hazırlığı ve mühendis zamanı asıl şişirendir. QLoRA en ekonomik, full en pahalı. Colab vs GPU, LLM GPU seçimi.

7B QLoRA saatlik 4090/A100 ile PoC; 70B+ için H100+NVLink ve spot. KVKK kişisel veride şart.

Tasarruf checklist

Smoke train, dar grid, early stopping, NVMe dataset, idle kapat, Docker ile pin'li imaj, önceden yazılı başarı metriği. Fiyatlandırma, akademik indirim, startup ipuçları.

Örnek komutlar / snippet

nvidia-smi --query-gpu=name,memory.used --format=csv

Türkiye bağlamı ve operasyon

Türkiye'de GPU kiralama kararını yalnızca TFLOPS belirlemez. Veri lokasyonu, şehir gecikmesi, TL fatura, destek dili ve rezervasyon süresi toplam sahip olma deneyimini şekillendirir. Özellikle kişisel veri içeren eğitim ve çıkarım işlerinde KVKK kapsamında verinin yurt içinde işlenmesi beklenir; anonimleştirme tek başına her senaryoda yeterli sayılmaz.

Operasyonel olarak en sık görülen kayıp, GPU'nun kendisinden değil idle sürelerden ve tekrarlanmayan ortamlardan gelir. Driver/CUDA uyumsuzluğu, her instance'ta sıfırdan kurulum ve dataset'i eğitim sırasında ağ üzerinden okumak hem süreyi hem maliyeti şişirir. Container tabanlı imaj, NVMe'ye lokal dataset ve checkpoint disiplini bu kaybı azaltır.

İlgili sayfalar: H100 vs A100; AI eğitimi; İletişim; GPU rehberi.

Pratik kontrol listesi

  1. İş yükünü tek cümleyle yazın (eğitim / fine-tuning / inference / render / transcode).
  2. VRAM ve throughput için 30–60 dakikalık micro-benchmark planlayın.
  3. Saatlik planla başlayıp reserved/aylık modele ancak stabil kullanımda geçin.
  4. Spot kullanacaksanız checkpoint ve resume'u önceden test edin.
  5. Başarı metriğini (eval, latency p95, images/s, $/1k token) önceden sabitleyin.
  6. Idle Jupyter ve unutulan instance'ları otomatik kapatacak alarm kurun.

Sık yapılan hatalar

Benchmark yapmadan en pahalı GPU'ya çıkmak; tek metrikle (yalnızca VRAM veya yalnızca fiyat) karar vermek; production inference'ı eğitim kartıyla uzun süre koşturmak; multi-GPU'ya geçmeden single-GPU optimizasyonunu bitirmemek; veri sınıflandırması yapmadan yurtdışı bölgesine dataset taşımak.

Bir diğer yaygın hata, PoC başarı kriterini tanımsız bırakmaktır. 'Model biraz daha iyi olsun' diye açılan açık uçlu eğitimler, bütçeyi sessizce tüketir. Erken durdurma, eval bütçesi ve maksimum deneme sayısı olmadan fine-tuning işi bitmez; yalnızca fatura büyür.

Sonuç

LLM fine-tuning maliyeti model boyutu, LoRA/QLoRA/full yöntem, epoch ve deneme sayısına bağlıdır. Doğru GPU seçimi, ölçüm ve disiplinli operasyon bir araya geldiğinde hem maliyeti hem teslim süresini kontrol altına alırsınız.

Sonraki adım için ilgili GPU modeli, hizmet ve şehir sayfalarından senaryonuza uygun planı seçin; emin değilseniz saatlik küçük bir deneme ile başlamak genelde en düşük riskli yoldur.

Derinlemesine notlar (1)

Bu bölüm (1), llm fine tuning maliyeti başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: H100 vs A100; AI eğitimi; İletişim; GPU rehberi.

Derinlemesine notlar (2)

Bu bölüm (2), llm fine tuning maliyeti başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: H100 vs A100; AI eğitimi; İletişim; GPU rehberi.

Derinlemesine notlar (3)

Bu bölüm (3), llm fine tuning maliyeti başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: H100 vs A100; AI eğitimi; İletişim; GPU rehberi.

#llm#fine-tuning#maliyet#qlora

Sıkça Sorulan Sorular

QLoRA ile 1× RTX 4090 üzerinde genelde 2–4 GPU-saat yeterlidir. Asıl maliyeti artıran unsur tekrarlanan hyperparameter denemeleridir; buffer ekleyin.
Çoğu ürün ve domain adaptasyonu için LoRA/QLoRA yeterlidir. Full FT, büyük dağılım kayması veya maksimum kalite gerektiğinde düşünülür.
Edu doğrulama ve kurumsal anlaşmalarla %15–25 bandında indirimler yaygındır. BAP bütçesine GPU-saat kalemi eklerken akademik GPU indirimi rehberine bakın.
Evet, checkpoint disiplini varsa. Kesinti riskine karşı object storage'a düzenli kayıt ve otomatik resume şarttır.
PoC ve benchmark için saatlik; düzenli eğitim veya 7/24 servis için aylık/reserved daha öngörülebilirdir. Idle riskini saatlikte daha sık kontrol edin.
Micro-benchmark ile doğru GPU'yu seçin, idle alarm kurun, checkpoint alın ve spot'u yalnızca toleranslı işlerde kullanın. Haftalık $/metrik raporu tutun.