
LLM Eğitimi İçin GPU Seçimi: VRAM, Bandwidth ve Multi-GPU Rehberi (2026)
LoRA, QLoRA ve full fine-tuning için doğru GPU nasıl seçilir? A100, H100 ve L40S karşılaştırması; VRAM, bellek bant genişliği ve multi-GPU stratejisi.
LLM Eğitiminde GPU Seçimi Neden Kritik?
Büyük dil modeli (LLM) eğitimi ve fine-tuning, klasik derin öğrenme iş yüklerinden farklı bir kaynak profili ister. Darboğaz çoğu zaman ham TFLOPS değil; VRAM kapasitesi, bellek bant genişliği ve gerekirse GPU arası iletişim olur. Yanlış kart seçimi ya eğitimi başlatamazsınız (OOM) ya da saatlik fatura boşa gider.
Türkiye'deki ekipler için ek bir katman daha vardır: KVKK kapsamındaki eğitim verileriyle çalışıyorsanız lokasyon, fatura ve gecikme birlikte planlanmalıdır. Bu rehber, 7B'den 70B+'ya kadar senaryolarda hangi GPU'yu ne zaman kiramanız gerektiğini netleştirir. Genel başlangıç için GPU kiralama rehberi 2026 yazısına, hizmet tarafı için LLM fine-tuning ve AI eğitimi sayfalarına bakabilirsiniz.
Önce Yöntemi Seçin: QLoRA, LoRA veya Full Fine-Tuning
GPU seçimi, eğitim yönteminden bağımsız düşünülemez. Aynı 13B model QLoRA ile tek RTX sınıfı kartta sığarken full fine-tuning'de çoklu A100/H100 ister.
QLoRA (4-bit / düşük VRAM)
QLoRA, taban ağırlıkları 4-bit quantize ederek VRAM'i dramatik düşürür; eğitilebilir LoRA adaptörleri daha yüksek precision'da kalır. Prototip, domain adaptasyonu ve Türkçe chatbot denemelerinde varsayılan başlangıç noktasıdır.
- 7B QLoRA: 16–24 GB VRAM yeterli (RTX 4090 veya benzeri)
- 13B QLoRA: 24 GB ile mümkün, 40 GB konforlu
- 70B QLoRA: genelde 48–80 GB veya 2× GPU
Kalite/maliyet dengesi çoğu ürün ekibi için yeterlidir. Hyperparameter aramasını QLoRA ile bitirip yalnızca kazanan yapılandırmayı LoRA veya full FT'ye taşımak bütçeyi korur. Maliyet kalemleri için LLM fine-tuning maliyeti rehberini inceleyin.
LoRA (daha yüksek kalite, orta VRAM)
LoRA, düşük rank adaptörlerle ağırlık güncellemesi yapar; QLoRA'ya göre daha fazla VRAM ister ama genelde full FT'den çok daha ucuzdur. 7B–30B aralığında üretim kalitesine yaklaşmak isteyen ekiplerin standart tercihidir.
- 7B LoRA: 24–40 GB
- 13B LoRA: 40–48 GB (A100 40GB veya L40S 48GB)
- 70B LoRA: 2–4× 80 GB sınıfı GPU veya agresif offload
Full Fine-Tuning
Tüm parametreleri güncellersiniz. En yüksek veri uyumu potansiyeli; en yüksek VRAM, iletişim ve bütçe ihtiyacı. Kurumsal domain modelleri, regüle sektörler veya LoRA'nın yetmediği senaryolarda gündeme gelir.
- 7B full FT: 1× A100 80GB veya 2× 40GB
- 13B–30B full FT: 2–4× A100/H100
- 70B full FT: 4–8× H100 (FSDP/DeepSpeed ile)
VRAM Hesabı: Kabaca Ama İşe Yarar Formül
Pratik bir üst sınır tahmini (BF16, optimizer AdamW, aktivasyonlar dahil kabaca):
VRAM ≈ model_parametreleri × bayt_precision × (1 + optimizer_çarpanı) + aktivasyon + KV/scratch- BF16 ağırlık: parametre başına ~2 byte
- AdamW durumları: pratikte ağırlık boyutunun ~2–4×'i kadar ek
- Aktivasyon: sequence length, batch size ve gradient checkpointing'e bağlı
Örnekler (yaklaşık, framework ve ayara göre değişir):
| Model | Yöntem | Tipik VRAM | Önerilen GPU |
|---|---|---|---|
| 7B | QLoRA | 12–20 GB | RTX 4090 |
| 7B | LoRA | 20–35 GB | A100 40GB / L40S |
| 13B | LoRA | 35–48 GB | A100 40–80GB / L40S |
| 70B | QLoRA | 48–80 GB | A100 80GB / 2× L40S |
| 70B | Full FT | 320+ GB toplam | 4–8× H100 |
Sequence length 4K'dan 32K'ya çıktığında aktivasyon maliyeti hızla büyür. Uzun bağlam eğitiminde VRAM'i "model sığdı" diye değil, hedef context × batch ile yeniden hesaplayın.
Bellek Bant Genişliği: Gizli Performans Faktörü
LLM eğitiminde matris çarpımları bellek bound olabilir. Yüksek VRAM'li ama düşük bandwidth'li bir kart, eğitim adımı süresinde hayal kırıklığı yaratır.
Kabaca referanslar (üretici spesifikasyonlarından yuvarlak değerler):
| GPU | VRAM | Bellek bandwidth (yaklaşık) | Eğitim notu |
|---|---|---|---|
| RTX 4090 | 24 GB | ~1 TB/s | Küçük LoRA/QLoRA için fiyat/performans |
| L40S | 48 GB | ~864 GB/s | Inference + orta LoRA dengesi |
| A100 80GB | 80 GB | ~2 TB/s (HBM2e) | Eğitim iş yüklerinde olgun standart |
| H100 80GB | 80 GB | ~3.35 TB/s (HBM3) | Transformer Engine, FP8, büyük FT |
VRAM "sığmak", bandwidth "hız"tır. 70B LoRA'da A100 ile H100 arasındaki fark çoğu zaman 1.5–3× adım süresi olarak görünür; detaylı karşılaştırma için H100 vs A100 yazısına bakın. Model sayfaları: NVIDIA A100, NVIDIA H100, NVIDIA L40S.
Önerilen GPU'lar: A100, H100, L40S
NVIDIA A100 — Çoğu ekip için varsayılan eğitim kartı
A100, PyTorch/DeepSpeed/FSDP ekosisteminde en az sürpriz üreten seçenektir. 40GB ve 80GB varyantları vardır; LLM fine-tuning'de 80GB tercihi daha az sharding karmaşıklığı demektir.
Ne zaman A100?
- 7B–30B LoRA / QLoRA üretim işleri
- Akademik ve BAP bütçelerinde fiyat/performans
- Multi-GPU cluster'a geçmeden önce tek/çift GPU doğrulama
- Yazılım uyumluluğu kritik olduğunda (eski CUDA stack'ler dahil)
Ne zaman A100 yetmez?
- 70B+ full FT ve sıkı zaman penceresi
- FP8 / Transformer Engine ile yeni nesil eğitim pipeline'ı
- Eğitim süresinin takvim maliyetinin GPU saatinden pahalı olduğu ürün lansmanları
NVIDIA H100 — Büyük model ve zaman kritik eğitim
H100, Hopper mimarisi ve Transformer Engine ile LLM eğitiminde A100'e göre genelde 2–4× hız avantajı sunar (model, precision ve framework'e bağlı). FP8 destekli pipeline'larda avantaj büyür.
Ne zaman H100?
- 70B full fine-tuning veya yoğun multi-node eğitim
- Aynı bütçede daha az takvim günü (toplam GPU-saat bazen A100'den düşük çıkar)
- FP8 / modern stacking (ör. bazı Hugging Face + Transformer Engine akışları)
H100 saatlik birim fiyatı yüksektir; karar verirken toplam GPU-saat × birim fiyat ve fırsat maliyetini birlikte hesaplayın. Güncel paketler için fiyatlandırma sayfasına bakın.
NVIDIA L40S — 48 GB ile esnek orta yol
L40S, 48 GB GDDR6 ile inference ve orta ölçek LoRA için cazip bir dengedir. Eğitim bandwidth'i A100/H100 HBM kadar yüksek değildir; buna rağmen 13B LoRA, embedding fine-tuning ve "eğitim + ardından yoğun inference" hibrit işlerde tek kartta kalmak isteyen ekipler için pratiktir.
Ne zaman L40S?
- 7B–13B LoRA, sık deneme / düşük batch
- Fine-tuning sonrası aynı ortamda yüksek throughput inference
- A100 80GB'ye erişim kısıtlıyken 48 GB ihtiyacı
Ne zaman L40S seçmeyin?
- Uzun context × büyük batch full FT
- NVLink bekleyen yoğun model-parallel eğitim
- Bandwidth bound 70B+ eğitim döngüleri
Multi-GPU: Ne Zaman 2, 4 veya 8 Kart?
Tek GPU VRAM yetmiyorsa veya epoch süresi kabul edilemezse multi-GPU'ya geçin. Erken geçiş, NCCL ve veri pipeline karmaşıklığını gereksiz artırır.
Data Parallel (DDP)
Her GPU tam model kopyası tutar; batch bölünür. Model tek karta sığıyorsa ölçeklemenin en basit yoludur. 4× GPU ile ~3–3.7× hız bekleyin; %100 lineer ölçek nadirdir.
Model / Tensor Parallel ve FSDP
Model tek GPU'ya sığmıyorsa parametreleri bölersiniz (FSDP, DeepSpeed ZeRO, tensor parallel). 70B full FT'de standarttır. Kartlar arası bağlantı (NVLink / NVSwitch / InfiniBand) burada kritikleşir. Pratik kurulum için multi-GPU eğitim rehberi yazısını okuyun.
Karar tablosu
| Senaryo | GPU adedi | Tipik seçim |
|---|---|---|
| 7B QLoRA / LoRA | 1 | RTX 4090 veya L40S |
| 13B LoRA | 1–2 | A100 40/80 veya L40S |
| 30B LoRA | 2–4 | A100 80GB |
| 70B QLoRA | 1–2 | A100 80GB / H100 |
| 70B full FT | 4–8 | H100 cluster |
Türkiye lokasyonunda multi-node planlıyorsanız node-içi NVLink'li paketleri tercih edin; node-lar arası zayıf ağ, FSDP'yi boğabilir. İstanbul erişimi için İstanbul GPU kiralama ve şehir bazlı sayfalar gecikme planlamasına yardımcı olur.
Precision, Checkpoint ve Yazılım Yığını
Donanım kadar yazılım ayarı da GPU ihtiyacını değiştirir:
- BF16 / FP16 mixed precision: VRAM ve hız kazanımı; H100'de FP8 ek seçenek
- Gradient checkpointing: Aktivasyon VRAM'ini düşürür, adım süresini biraz uzatır
- Gradient accumulation: Efektif batch'i VRAM patlatmadan büyütür
- Flash Attention / SDPA: Uzun sequence'te bellek ve hız avantajı
- Checkpoint sıklığı: Spot veya preemptible senaryoda zorunlu; yerel NVMe'ye yazın
Ortam kurulumu için hazır PyTorch + CUDA imajları zaman kazandırır. Framework tarafında Hugging Face Transformers + PEFT (LoRA/QLoRA), DeepSpeed ZeRO-2/3 ve PyTorch FSDP 2026'da en sık görülen kombinasyonlardır.
Senaryo Bazlı Öneri Matrisi (Türkiye Odaklı)
Startup / MVP chatbot (Türkçe domain)
- Veri: 50K–500K örnek, 7B taban (Llama/Mistral ailesi)
- Yöntem: QLoRA → doğrulama sonrası LoRA
- GPU: 1× RTX 4090 veya 1× L40S
- Süre: birkaç saat–2 gün (deneme sayısıyla)
SaaS ürün fine-tuning (13B, düzenli retrain)
- Yöntem: LoRA, BF16, Flash Attention
- GPU: 1× A100 80GB (veya 2× L40S)
- Operasyon: haftalık/aylık retrain; saatlik kiralama ile idle maliyeti sıfırlayın
Kurumsal 70B domain modeli
- Yöntem: önce QLoRA smoke test, sonra LoRA veya partial/full FT
- GPU: 4× H100 (NVLink) veya en az 4× A100 80GB FSDP
- Veri: KVKK — Türkiye lokasyonlu depolama ve eğitim
Araştırma / ablation yoğun akademik iş
- Küçük subset + QLoRA ile arama alanı tarayın
- Kazanan config'i A100/H100'e taşıyın
- BAP kaleminde GPU-saat × deneme sayısını peşinen yazın; akademik indirim ve proje bazlı fatura seçeneklerini teklif aşamasında sorun
Maliyet Tuzağı: Saatlik Fiyat Değil, Toplam GPU-Saat
Daha ucuz görünen kart, eğitim 3× uzarsa daha pahalı çıkar. Karşılaştırma şablonu:
Toplam maliyet ≈ (adım_sayısı × sn_per_step / 3600) × GPU_adet × saatlik_birim_fiyatBuna ekleyin:
- Başarısız deneme sayısı (genelde başarılı run'un %20–40'ı)
- Veri hazırlama CPU/NVMe süresi
- Değerlendirme (eval) GPU saatleri
- Checkpoint depolama
Spot/preemptible kullanacaksanız checkpoint stratejisi olmadan tasarruf illüzyondur; kesinti toleranslı işlerde sık checkpoint ve otomatik resume zorunludur.
Sık Yapılan Hatalar
- 70B'ye full FT ile başlamak: Önce QLoRA ile veri ve prompt kalitesini doğrulayın
- VRAM'e göre alıp bandwidth'i yok saymak: Eğitim adımı beklenenden yavaş kalır
- Batch'i maksimize etmek: OOM veya thrashing; accumulation daha öngörülebilir
- Tek node yetmezken zayıf ağlı multi-node: NCCL timeout ve düşük scaling
- Yurtdışı GPU + KVKK verisi: Hukuki risk; Türkiye lokasyonu seçin
- Aynı kartta 7/24 idle tutmak: Saatlik modele geçin veya instance'ı kapatın
Pratik Seçim Akışı (5 Adım)
- Model boyutu ve yöntem (QLoRA / LoRA / full FT) netleştirin
- Hedef sequence length ve efektif batch'i yazın
- VRAM tablosundan aday GPU'yu seçin; bandwidth ihtiyacını kontrol edin
- Tek GPU'da 1–2 epoch smoke test; OOM veya süre kötüyse multi-GPU / üst segment
- Toplam GPU-saat maliyetini A100 vs H100 vs L40S için yan yana koyun
Bu akış, "en pahalı kartı alalım" refleksini engeller ve çoğu Türk AI ekibinde 1–2 iterasyonda doğru boyuta oturur.
Örnek Kapasite Planı: 13B Türkçe Domain LoRA
Somut bir plan, soyut VRAM tablolarından daha hızlı karar verdirir. Varsayalım ki e-ticaret veya bankacılık FAQ verisiyle 13B bir açık ağırlıklı modeli LoRA ile uyarlıyorsunuz:
- Veri: 120K temizlenmiş diyalog çifti, ortalama 512–1024 token
- Hedef context: 4K (eğitim), inference'da 8K'ya kadar
- Yöntem: rank 16–64 LoRA, BF16, gradient checkpointing açık
- Smoke test: 1× L40S veya 1× A100 40GB, 2 epoch, tek gece
- Üretim retrain: 1× A100 80GB, efektif batch 8–16 (accumulation ile), 3–5 epoch
Bu planda çoğu ekip ilk hafta L40S ile hiperparametre ve veri kalitesini oturtur; haftalık retrain döngüsüne geçince A100 80GB'ye kilitlenir. H100'e çıkmak yalnızca retrain penceresi (ör. gece 4 saatten kısa) veya daha büyük modele geçiş zorunluysa mantıklıdır. Idle süreleri kapatmak için saatlik faturalandırma kullanın; aksi halde "ucuz görünen" aylık rezerve kart boşta kalır.
Eval tarafını unutmayın: hold-out set, Türkçe toksisite/hallüsinasyon kontrolleri ve latency ölçümü de GPU-saat yer. Smoke test bütçesinin %15–25'ini eval'e ayırmak, yanlış kart yükseltmesini engeller.
Veri Pipeline ve I/O: GPU'yu Aç Bırakmayan Detaylar
Doğru GPU seçilse bile veri yükleme yavaşsa utilization %30–40'ta takılır. LLM fine-tuning'de sık görülen I/O sorunları:
- Dataset NFS üzerinde; her step'te tokenize yeniden yapılıyor
num_workers=0ile tek süreçli DataLoader- Checkpoint'lerin yavaş disk'e senkron yazılması eğitim adımını blokluyor
- Çok küçük micro-batch + aşırı accumulation (kernel launch overhead)
Kiralanan sunucuda dataset'i mümkünse yerel NVMe'ye kopyalayın, tokenize edilmiş Arrow/Parquet önbelleği kullanın ve checkpoint'i asenkron veya seyrek yazın. Multi-GPU'da bu disiplin daha kritiktir; aksi halde NCCL beklerken GPU'lar boş döner. Ortam tarafında hazır PyTorch imajı zaman kazandırır; sıfırdan driver/CUDA kurmak nadiren gerekir.
Sonuç
LLM eğitimi için ideal GPU, model boyutundan çok yöntem × VRAM × bandwidth × takvim çarpımına bağlıdır. 7B–13B LoRA/QLoRA'da L40S veya A100 çoğu zaman yeter; 70B full FT ve zaman kritik işlerde H100 cluster öne çıkar. A100 ise hâlâ en güvenli genel amaçlı eğitim seçeneğidir.
Doğru boyutu bulduktan sonra fiyatlandırma üzerinden saatlik planla smoke test'e başlayın; gerekirse H100 veya A100 paketlerine geçiş yapın. Yöntem ve maliyet derinliği için LLM fine-tuning maliyeti ve H100 vs A100 karşılaştırması yazılarıyla bu rehberi birlikte kullanın.
SSS
Sıkça Sorulan Sorular
Bu yazıdaki karar noktalarına kısa yanıtlar.



