Tüm yazılar
LLM Eğitimi İçin GPU Seçimi: VRAM, Bandwidth ve Multi-GPU Rehberi (2026)
LLM Eğitimi İçin GPU Seçimi: VRAM, Bandwidth ve Multi-GPU Rehberi (2026)
Rehber10 dk okuma1.974 kelime

LLM Eğitimi İçin GPU Seçimi: VRAM, Bandwidth ve Multi-GPU Rehberi (2026)

LoRA, QLoRA ve full fine-tuning için doğru GPU nasıl seçilir? A100, H100 ve L40S karşılaştırması; VRAM, bellek bant genişliği ve multi-GPU stratejisi.

LLM Eğitiminde GPU Seçimi Neden Kritik?

Büyük dil modeli (LLM) eğitimi ve fine-tuning, klasik derin öğrenme iş yüklerinden farklı bir kaynak profili ister. Darboğaz çoğu zaman ham TFLOPS değil; VRAM kapasitesi, bellek bant genişliği ve gerekirse GPU arası iletişim olur. Yanlış kart seçimi ya eğitimi başlatamazsınız (OOM) ya da saatlik fatura boşa gider.

Türkiye'deki ekipler için ek bir katman daha vardır: KVKK kapsamındaki eğitim verileriyle çalışıyorsanız lokasyon, fatura ve gecikme birlikte planlanmalıdır. Bu rehber, 7B'den 70B+'ya kadar senaryolarda hangi GPU'yu ne zaman kiramanız gerektiğini netleştirir. Genel başlangıç için GPU kiralama rehberi 2026 yazısına, hizmet tarafı için LLM fine-tuning ve AI eğitimi sayfalarına bakabilirsiniz.

Önce Yöntemi Seçin: QLoRA, LoRA veya Full Fine-Tuning

GPU seçimi, eğitim yönteminden bağımsız düşünülemez. Aynı 13B model QLoRA ile tek RTX sınıfı kartta sığarken full fine-tuning'de çoklu A100/H100 ister.

QLoRA (4-bit / düşük VRAM)

QLoRA, taban ağırlıkları 4-bit quantize ederek VRAM'i dramatik düşürür; eğitilebilir LoRA adaptörleri daha yüksek precision'da kalır. Prototip, domain adaptasyonu ve Türkçe chatbot denemelerinde varsayılan başlangıç noktasıdır.

  • 7B QLoRA: 16–24 GB VRAM yeterli (RTX 4090 veya benzeri)
  • 13B QLoRA: 24 GB ile mümkün, 40 GB konforlu
  • 70B QLoRA: genelde 48–80 GB veya 2× GPU

Kalite/maliyet dengesi çoğu ürün ekibi için yeterlidir. Hyperparameter aramasını QLoRA ile bitirip yalnızca kazanan yapılandırmayı LoRA veya full FT'ye taşımak bütçeyi korur. Maliyet kalemleri için LLM fine-tuning maliyeti rehberini inceleyin.

LoRA (daha yüksek kalite, orta VRAM)

LoRA, düşük rank adaptörlerle ağırlık güncellemesi yapar; QLoRA'ya göre daha fazla VRAM ister ama genelde full FT'den çok daha ucuzdur. 7B–30B aralığında üretim kalitesine yaklaşmak isteyen ekiplerin standart tercihidir.

  • 7B LoRA: 24–40 GB
  • 13B LoRA: 40–48 GB (A100 40GB veya L40S 48GB)
  • 70B LoRA: 2–4× 80 GB sınıfı GPU veya agresif offload

Full Fine-Tuning

Tüm parametreleri güncellersiniz. En yüksek veri uyumu potansiyeli; en yüksek VRAM, iletişim ve bütçe ihtiyacı. Kurumsal domain modelleri, regüle sektörler veya LoRA'nın yetmediği senaryolarda gündeme gelir.

  • 7B full FT: 1× A100 80GB veya 2× 40GB
  • 13B–30B full FT: 2–4× A100/H100
  • 70B full FT: 4–8× H100 (FSDP/DeepSpeed ile)

VRAM Hesabı: Kabaca Ama İşe Yarar Formül

Pratik bir üst sınır tahmini (BF16, optimizer AdamW, aktivasyonlar dahil kabaca):

VRAM ≈ model_parametreleri × bayt_precision × (1 + optimizer_çarpanı) + aktivasyon + KV/scratch
  • BF16 ağırlık: parametre başına ~2 byte
  • AdamW durumları: pratikte ağırlık boyutunun ~2–4×'i kadar ek
  • Aktivasyon: sequence length, batch size ve gradient checkpointing'e bağlı

Örnekler (yaklaşık, framework ve ayara göre değişir):

ModelYöntemTipik VRAMÖnerilen GPU
7BQLoRA12–20 GBRTX 4090
7BLoRA20–35 GBA100 40GB / L40S
13BLoRA35–48 GBA100 40–80GB / L40S
70BQLoRA48–80 GBA100 80GB / 2× L40S
70BFull FT320+ GB toplam4–8× H100

Sequence length 4K'dan 32K'ya çıktığında aktivasyon maliyeti hızla büyür. Uzun bağlam eğitiminde VRAM'i "model sığdı" diye değil, hedef context × batch ile yeniden hesaplayın.

Bellek Bant Genişliği: Gizli Performans Faktörü

LLM eğitiminde matris çarpımları bellek bound olabilir. Yüksek VRAM'li ama düşük bandwidth'li bir kart, eğitim adımı süresinde hayal kırıklığı yaratır.

Kabaca referanslar (üretici spesifikasyonlarından yuvarlak değerler):

GPUVRAMBellek bandwidth (yaklaşık)Eğitim notu
RTX 409024 GB~1 TB/sKüçük LoRA/QLoRA için fiyat/performans
L40S48 GB~864 GB/sInference + orta LoRA dengesi
A100 80GB80 GB~2 TB/s (HBM2e)Eğitim iş yüklerinde olgun standart
H100 80GB80 GB~3.35 TB/s (HBM3)Transformer Engine, FP8, büyük FT

VRAM "sığmak", bandwidth "hız"tır. 70B LoRA'da A100 ile H100 arasındaki fark çoğu zaman 1.5–3× adım süresi olarak görünür; detaylı karşılaştırma için H100 vs A100 yazısına bakın. Model sayfaları: NVIDIA A100, NVIDIA H100, NVIDIA L40S.

Önerilen GPU'lar: A100, H100, L40S

NVIDIA A100 — Çoğu ekip için varsayılan eğitim kartı

A100, PyTorch/DeepSpeed/FSDP ekosisteminde en az sürpriz üreten seçenektir. 40GB ve 80GB varyantları vardır; LLM fine-tuning'de 80GB tercihi daha az sharding karmaşıklığı demektir.

Ne zaman A100?

  • 7B–30B LoRA / QLoRA üretim işleri
  • Akademik ve BAP bütçelerinde fiyat/performans
  • Multi-GPU cluster'a geçmeden önce tek/çift GPU doğrulama
  • Yazılım uyumluluğu kritik olduğunda (eski CUDA stack'ler dahil)

Ne zaman A100 yetmez?

  • 70B+ full FT ve sıkı zaman penceresi
  • FP8 / Transformer Engine ile yeni nesil eğitim pipeline'ı
  • Eğitim süresinin takvim maliyetinin GPU saatinden pahalı olduğu ürün lansmanları

NVIDIA H100 — Büyük model ve zaman kritik eğitim

H100, Hopper mimarisi ve Transformer Engine ile LLM eğitiminde A100'e göre genelde 2–4× hız avantajı sunar (model, precision ve framework'e bağlı). FP8 destekli pipeline'larda avantaj büyür.

Ne zaman H100?

  • 70B full fine-tuning veya yoğun multi-node eğitim
  • Aynı bütçede daha az takvim günü (toplam GPU-saat bazen A100'den düşük çıkar)
  • FP8 / modern stacking (ör. bazı Hugging Face + Transformer Engine akışları)

H100 saatlik birim fiyatı yüksektir; karar verirken toplam GPU-saat × birim fiyat ve fırsat maliyetini birlikte hesaplayın. Güncel paketler için fiyatlandırma sayfasına bakın.

NVIDIA L40S — 48 GB ile esnek orta yol

L40S, 48 GB GDDR6 ile inference ve orta ölçek LoRA için cazip bir dengedir. Eğitim bandwidth'i A100/H100 HBM kadar yüksek değildir; buna rağmen 13B LoRA, embedding fine-tuning ve "eğitim + ardından yoğun inference" hibrit işlerde tek kartta kalmak isteyen ekipler için pratiktir.

Ne zaman L40S?

  • 7B–13B LoRA, sık deneme / düşük batch
  • Fine-tuning sonrası aynı ortamda yüksek throughput inference
  • A100 80GB'ye erişim kısıtlıyken 48 GB ihtiyacı

Ne zaman L40S seçmeyin?

  • Uzun context × büyük batch full FT
  • NVLink bekleyen yoğun model-parallel eğitim
  • Bandwidth bound 70B+ eğitim döngüleri

Multi-GPU: Ne Zaman 2, 4 veya 8 Kart?

Tek GPU VRAM yetmiyorsa veya epoch süresi kabul edilemezse multi-GPU'ya geçin. Erken geçiş, NCCL ve veri pipeline karmaşıklığını gereksiz artırır.

Data Parallel (DDP)

Her GPU tam model kopyası tutar; batch bölünür. Model tek karta sığıyorsa ölçeklemenin en basit yoludur. 4× GPU ile ~3–3.7× hız bekleyin; %100 lineer ölçek nadirdir.

Model / Tensor Parallel ve FSDP

Model tek GPU'ya sığmıyorsa parametreleri bölersiniz (FSDP, DeepSpeed ZeRO, tensor parallel). 70B full FT'de standarttır. Kartlar arası bağlantı (NVLink / NVSwitch / InfiniBand) burada kritikleşir. Pratik kurulum için multi-GPU eğitim rehberi yazısını okuyun.

Karar tablosu

SenaryoGPU adediTipik seçim
7B QLoRA / LoRA1RTX 4090 veya L40S
13B LoRA1–2A100 40/80 veya L40S
30B LoRA2–4A100 80GB
70B QLoRA1–2A100 80GB / H100
70B full FT4–8H100 cluster

Türkiye lokasyonunda multi-node planlıyorsanız node-içi NVLink'li paketleri tercih edin; node-lar arası zayıf ağ, FSDP'yi boğabilir. İstanbul erişimi için İstanbul GPU kiralama ve şehir bazlı sayfalar gecikme planlamasına yardımcı olur.

Precision, Checkpoint ve Yazılım Yığını

Donanım kadar yazılım ayarı da GPU ihtiyacını değiştirir:

  1. BF16 / FP16 mixed precision: VRAM ve hız kazanımı; H100'de FP8 ek seçenek
  2. Gradient checkpointing: Aktivasyon VRAM'ini düşürür, adım süresini biraz uzatır
  3. Gradient accumulation: Efektif batch'i VRAM patlatmadan büyütür
  4. Flash Attention / SDPA: Uzun sequence'te bellek ve hız avantajı
  5. Checkpoint sıklığı: Spot veya preemptible senaryoda zorunlu; yerel NVMe'ye yazın

Ortam kurulumu için hazır PyTorch + CUDA imajları zaman kazandırır. Framework tarafında Hugging Face Transformers + PEFT (LoRA/QLoRA), DeepSpeed ZeRO-2/3 ve PyTorch FSDP 2026'da en sık görülen kombinasyonlardır.

Senaryo Bazlı Öneri Matrisi (Türkiye Odaklı)

Startup / MVP chatbot (Türkçe domain)

  • Veri: 50K–500K örnek, 7B taban (Llama/Mistral ailesi)
  • Yöntem: QLoRA → doğrulama sonrası LoRA
  • GPU: 1× RTX 4090 veya 1× L40S
  • Süre: birkaç saat–2 gün (deneme sayısıyla)

SaaS ürün fine-tuning (13B, düzenli retrain)

  • Yöntem: LoRA, BF16, Flash Attention
  • GPU: 1× A100 80GB (veya 2× L40S)
  • Operasyon: haftalık/aylık retrain; saatlik kiralama ile idle maliyeti sıfırlayın

Kurumsal 70B domain modeli

  • Yöntem: önce QLoRA smoke test, sonra LoRA veya partial/full FT
  • GPU: 4× H100 (NVLink) veya en az 4× A100 80GB FSDP
  • Veri: KVKK — Türkiye lokasyonlu depolama ve eğitim

Araştırma / ablation yoğun akademik iş

  • Küçük subset + QLoRA ile arama alanı tarayın
  • Kazanan config'i A100/H100'e taşıyın
  • BAP kaleminde GPU-saat × deneme sayısını peşinen yazın; akademik indirim ve proje bazlı fatura seçeneklerini teklif aşamasında sorun

Maliyet Tuzağı: Saatlik Fiyat Değil, Toplam GPU-Saat

Daha ucuz görünen kart, eğitim 3× uzarsa daha pahalı çıkar. Karşılaştırma şablonu:

Toplam maliyet ≈ (adım_sayısı × sn_per_step / 3600) × GPU_adet × saatlik_birim_fiyat

Buna ekleyin:

  • Başarısız deneme sayısı (genelde başarılı run'un %20–40'ı)
  • Veri hazırlama CPU/NVMe süresi
  • Değerlendirme (eval) GPU saatleri
  • Checkpoint depolama

Spot/preemptible kullanacaksanız checkpoint stratejisi olmadan tasarruf illüzyondur; kesinti toleranslı işlerde sık checkpoint ve otomatik resume zorunludur.

Sık Yapılan Hatalar

  1. 70B'ye full FT ile başlamak: Önce QLoRA ile veri ve prompt kalitesini doğrulayın
  2. VRAM'e göre alıp bandwidth'i yok saymak: Eğitim adımı beklenenden yavaş kalır
  3. Batch'i maksimize etmek: OOM veya thrashing; accumulation daha öngörülebilir
  4. Tek node yetmezken zayıf ağlı multi-node: NCCL timeout ve düşük scaling
  5. Yurtdışı GPU + KVKK verisi: Hukuki risk; Türkiye lokasyonu seçin
  6. Aynı kartta 7/24 idle tutmak: Saatlik modele geçin veya instance'ı kapatın

Pratik Seçim Akışı (5 Adım)

  1. Model boyutu ve yöntem (QLoRA / LoRA / full FT) netleştirin
  2. Hedef sequence length ve efektif batch'i yazın
  3. VRAM tablosundan aday GPU'yu seçin; bandwidth ihtiyacını kontrol edin
  4. Tek GPU'da 1–2 epoch smoke test; OOM veya süre kötüyse multi-GPU / üst segment
  5. Toplam GPU-saat maliyetini A100 vs H100 vs L40S için yan yana koyun

Bu akış, "en pahalı kartı alalım" refleksini engeller ve çoğu Türk AI ekibinde 1–2 iterasyonda doğru boyuta oturur.

Örnek Kapasite Planı: 13B Türkçe Domain LoRA

Somut bir plan, soyut VRAM tablolarından daha hızlı karar verdirir. Varsayalım ki e-ticaret veya bankacılık FAQ verisiyle 13B bir açık ağırlıklı modeli LoRA ile uyarlıyorsunuz:

  • Veri: 120K temizlenmiş diyalog çifti, ortalama 512–1024 token
  • Hedef context: 4K (eğitim), inference'da 8K'ya kadar
  • Yöntem: rank 16–64 LoRA, BF16, gradient checkpointing açık
  • Smoke test: 1× L40S veya 1× A100 40GB, 2 epoch, tek gece
  • Üretim retrain: 1× A100 80GB, efektif batch 8–16 (accumulation ile), 3–5 epoch

Bu planda çoğu ekip ilk hafta L40S ile hiperparametre ve veri kalitesini oturtur; haftalık retrain döngüsüne geçince A100 80GB'ye kilitlenir. H100'e çıkmak yalnızca retrain penceresi (ör. gece 4 saatten kısa) veya daha büyük modele geçiş zorunluysa mantıklıdır. Idle süreleri kapatmak için saatlik faturalandırma kullanın; aksi halde "ucuz görünen" aylık rezerve kart boşta kalır.

Eval tarafını unutmayın: hold-out set, Türkçe toksisite/hallüsinasyon kontrolleri ve latency ölçümü de GPU-saat yer. Smoke test bütçesinin %15–25'ini eval'e ayırmak, yanlış kart yükseltmesini engeller.

Veri Pipeline ve I/O: GPU'yu Aç Bırakmayan Detaylar

Doğru GPU seçilse bile veri yükleme yavaşsa utilization %30–40'ta takılır. LLM fine-tuning'de sık görülen I/O sorunları:

  • Dataset NFS üzerinde; her step'te tokenize yeniden yapılıyor
  • num_workers=0 ile tek süreçli DataLoader
  • Checkpoint'lerin yavaş disk'e senkron yazılması eğitim adımını blokluyor
  • Çok küçük micro-batch + aşırı accumulation (kernel launch overhead)

Kiralanan sunucuda dataset'i mümkünse yerel NVMe'ye kopyalayın, tokenize edilmiş Arrow/Parquet önbelleği kullanın ve checkpoint'i asenkron veya seyrek yazın. Multi-GPU'da bu disiplin daha kritiktir; aksi halde NCCL beklerken GPU'lar boş döner. Ortam tarafında hazır PyTorch imajı zaman kazandırır; sıfırdan driver/CUDA kurmak nadiren gerekir.

Sonuç

LLM eğitimi için ideal GPU, model boyutundan çok yöntem × VRAM × bandwidth × takvim çarpımına bağlıdır. 7B–13B LoRA/QLoRA'da L40S veya A100 çoğu zaman yeter; 70B full FT ve zaman kritik işlerde H100 cluster öne çıkar. A100 ise hâlâ en güvenli genel amaçlı eğitim seçeneğidir.

Doğru boyutu bulduktan sonra fiyatlandırma üzerinden saatlik planla smoke test'e başlayın; gerekirse H100 veya A100 paketlerine geçiş yapın. Yöntem ve maliyet derinliği için LLM fine-tuning maliyeti ve H100 vs A100 karşılaştırması yazılarıyla bu rehberi birlikte kullanın.

#llm#fine-tuning#gpu seçimi#a100#h100#lora

SSS

Sıkça Sorulan Sorular

Bu yazıdaki karar noktalarına kısa yanıtlar.