Tüm yazılar
Multi-GPU ve NVLink ile Kiralama Rehberi: 2/4/8 GPU, NCCL ve Paralellik
Multi-GPU ve NVLink ile Kiralama Rehberi: 2/4/8 GPU, NCCL ve Paralellik
Rehber11 dk okuma2.050 kelime

Multi-GPU ve NVLink ile Kiralama Rehberi: 2/4/8 GPU, NCCL ve Paralellik

Ne zaman 2, 4 veya 8 GPU kiralamalısınız? NVLink, NCCL, data parallel vs model parallel ve fiyatlandırmaya etkisini adım adım anlatıyoruz.

Tek GPU ile ilerleyen bir eğitim veya inference işi bir noktada duvara çarpar: VRAM yetmez, epoch süresi kabul edilemez olur veya batch boyutu küçülüp yakınsama bozulur. Bu noktada çözüm çoğu zaman "daha büyük tek kart" değil; aynı sunucuda birden fazla GPU ve doğru iletişim topolojisidir. Türkiye'de saatlik GPU kiralama planlarında 2, 4 ve 8 GPU düğümleri yaygınlaşırken, asıl karar NVLink var mı, NCCL nasıl davranıyor ve paralellik stratejiniz (data parallel mi, model parallel mi) nedir sorularında düğümlenir.

Bu rehber, multi-GPU kiralama kararını ticari ve teknik açıdan netleştirmek için yazıldı: ne zaman 2 GPU yeter, ne zaman 4 veya 8 GPU gerekir, NVLink'in fiyat farkını ne zaman hak ettiği, NCCL darboğazlarını nasıl okuyacağınız ve AI eğitimi ile LLM fine-tuning senaryolarında hangi konfigürasyonun toplam maliyeti düşürdüğü.

Multi-GPU kiralamanın üç katmanı

Çoğu ekip "kaç GPU?" sorusuyla başlar. Doğru sıra aslında şudur:

  1. Bellek (VRAM) sınırı: Model + optimizer + aktivasyonlar tek karta sığıyor mu?
  2. Zaman sınırı: Tek GPU ile eğitim süresi iş hedefini kaçırıyor mu?
  3. İletişim sınırı: GPU'lar arası bant genişliği, ölçeklenmeyi öldürüyor mu?

İlk iki soru tek GPU yükseltmesiyle (ör. A100H100 veya H200) çözülebilir. Üçüncü soru multi-GPU ve NVLink dünyasına aittir. Yanlış sırayla karar verirseniz 8 GPU kiralar, NCCL all-reduce'da bekler ve tek GPU'dan sadece 2–3x hız alırsınız — saatlik fatura ise 8 katına çıkar.

NVLink, NVIDIA GPU'lar arasında doğrudan yüksek bant genişlikli bir ara bağlantıdır. Klasik PCIe üzerinden GPU–GPU trafiği CPU/chipset üzerinden dolaylı ilerler; NVLink ise GPU'ları birbirine yakın bir "bellek ailesi" gibi bağlar. Pratik sonuç:

BağlantıTipik senaryoNe zaman yeterli?
PCIe Gen4/5Consumer / bazı sunucu kartlarıData parallel, küçük gradyan senkronu
NVLink (aynı node)A100/H100 SXMModel parallel, tensor parallel, büyük all-reduce
InfiniBand / RoCE (multi-node)8+ GPU clusterÇok düğümlü dağıtık eğitim

NVLink'in kiralama tarafındaki anlamı şudur: aynı node içinde 2–8 GPU'yu düşük gecikmeli ve yüksek bant genişlikli bir topolojiyle kullanırsınız. Bu, özellikle tensor parallel ve pipeline parallel iş yüklerinde PCIe'ye göre belirgin hız farkı üretir. Saf data parallel (her GPU tam model kopyası) senaryosunda fark daha küçüktür; yine de büyük modellerde gradyan senkronu NVLink üzerinde daha az "bekleme" yaratır.

Türkiye lokasyonlu kiralama seçerken yalnızca "4x H100" yazısına bakmayın; teklifte SXM + NVLink mi, yoksa PCIe kartlar mı olduğu açıkça yazılmalıdır. Aynı GPU modeli, bağlantı topolojisine göre farklı performans verir.

Ne zaman 2 GPU, ne zaman 4, ne zaman 8?

Aşağıdaki matris pratik bir başlangıç noktasıdır. Değerler model mimarisine, precision'a (FP16/BF16/FP8) ve framework'e göre değişir; yine de kiralama planı seçerken işe yarar.

2 GPU — ilk ölçek adımı

Ne zaman: Tek GPU VRAM'i sıkışıyor ama model hâlâ makul boyutta; veya epoch süresini yaklaşık 1.7–1.9x hızlandırmak istiyorsunuz.

Tipik kullanım:

  • 7B–13B LoRA / QLoRA fine-tuning'i hızlandırmak
  • Orta boy vision model eğitimi
  • Tek node'da A/B deney: aynı dataset, iki farklı hiperparametre (cihaz atayarak)

2x RTX 4090 veya 2x A100 çoğu startup için ilk multi-GPU deneyimidir. Consumer kartlarda NVLink olmayabilir; DDP yine çalışır, ancak tensor parallel beklentinizi düşük tutun. Daha derin bir DDP/FSDP çerçevesi için multi-GPU eğitim rehberine bakın.

4 GPU — üretim eğitimlerinin tatlı noktası

Ne zaman: 30B civarı modeller, daha büyük batch, veya 70B'ye FSDP/ZeRO ile yaklaşmak.

4 GPU aynı node'da NVLink ile:

  • Data parallel ölçeklenmesi genelde 3.2–3.7x aralığına oturur (veri pipeline sağlıklıysa)
  • Tensor parallel (ör. TP=2 veya TP=4) ile büyük LLM katmanları sığdırılabilir
  • Checkpoint ve hata ayıklama maliyeti hâlâ yönetilebilir

Kurumsal LLM fine-tuning işlerinde 4x A100 80GB veya 4x H100, maliyet/performans dengesi açısından sık tercih edilen konfigürasyondur. H100 vs A100 karşılaştırması model boyutu ve FP8 ihtiyacına göre kart seçimini netleştirir.

8 GPU — büyük model ve sıkı deadline

Ne zaman: 70B+ full fine-tuning veya uzun pretrain devamı; zaman kritik; tek node VRAM toplamı şart.

8 GPU'da dikkat edilmesi gerekenler:

  • Veri yükleme ve disk I/O darboğazı büyür; NVMe ve yeterli num_workers şarttır
  • NCCL collective'ler daha uzun sürer; NVLink topolojisi kritikleşir
  • Saatlik fiyat 8 katına yaklaşırken hızlanma nadiren 8 kat olur — toplam GPU-saat hesabı yapın

8x H100/H200 düğümleri Türkiye'de kapasite kısıtlı olabilir; İstanbul merkezli rezervasyon ve önceden kapasite teyidi önerilir.

Data parallel vs model parallel: hangisini kiralamalısınız?

Paralellik stratejisi, kiralayacağınız GPU sayısını ve NVLink ihtiyacını doğrudan belirler.

Data parallel (DDP / FSDP data-sharding)

Her GPU (veya shard grubu) aynı model mimarisini görür; farklı mini-batch dilimleri üzerinde çalışır. Gradyanlar NCCL all-reduce ile birleştirilir.

Avantajlar:

  • Kurulumu görece kolay (torchrun, Hugging Face Accelerate)
  • Küçük–orta modellerde yüksek ölçek verimi
  • PCIe node'larda bile kabul edilebilir performans

Dezavantajlar:

  • Her GPU'da (saf DDP'de) tam model kopyası gerekir → VRAM tavanı model boyutuna bağlı kalır
  • FSDP/ZeRO ile parametreler shard edilir; iletişim maliyeti artar

Kiralama önerisi: Model tek karta sığıyorsa önce 2–4 GPU data parallel deneyin. NVLink "şart" değildir ama büyük all-reduce'larda faydalıdır.

Model parallel (tensor / pipeline / expert)

Model katmanları veya tensör dilimleri GPU'lara bölünür. Tek örnek bile birden fazla GPU belleğini kullanır.

Avantajlar:

  • Tek GPU'ya sığmayan modelleri eğitmek / serve etmek mümkün olur
  • 70B+ modellerde neredeyse zorunlu yol

Dezavantajlar:

  • GPU–GPU aktivasyon trafiği yoğundur → NVLink tercihi güçlüdür
  • Yanlış TP/PP oranı ölçeklenmeyi öldürebilir
  • Debugging ve checkpoint daha karmaşıktır

Kiralama önerisi: Tensor parallel kullanacaksanız aynı node, NVLink'li SXM konfigürasyon isteyin. Multi-node'a erken geçmeyin; önce tek node 4–8 GPU ile doyurun.

Hibrit (gerçek dünya)

Üretimde çoğu ekip hibrit kullanır: örneğin TP=2 + DP=2 (4 GPU) veya TP=4 + DP=2 (8 GPU). Karar ağacı:

  1. Model tek GPU VRAM'ine sığmıyor mu? → Model parallel ekle
  2. Sığıyor ama süre uzun mu? → Data parallel ile GPU sayısını artır
  3. İkisi birden mi? → Hibrit; NVLink'li node şartına yaklaşır

NCCL: multi-GPU kiralamanın sessiz kahramanı (ve suçlusu)

NCCL (NVIDIA Collective Communications Library), all-reduce, all-gather, broadcast gibi kolektifleri yönetir. PyTorch DDP/FSDP altında çoğu zaman NCCL çalışır. Kiralık sunucuda performans şikayetlerinin önemli kısmı "GPU yavaş" değil, NCCL iletişiminin yavaş olmasıdır.

Kontrol listesi (kiralamadan sonra ilk 30 dakika)

  1. nvidia-smi topo -m ile GPU topolojisini okuyun — NVLink bağları görünüyor mu?
  2. NCCL_DEBUG=INFO ile kısa bir all-reduce smoke test çalıştırın
  3. nvidia-smi dmon veya Nsight ile SM aktivitesi vs. iletişim beklemesini ayırın
  4. Aynı node'da gereksiz CPU pinning / IRQ sorunlarını eleyin

Sık görülen NCCL tuzakları

  • Yanlış network interface: Multi-node'da NCCL eth0 yerine IB/RoCE arayüzünü seçmelidir
  • Docker + host network: Container'da GPU var ama NCCL P2P kapalı kalmış olabilir — Docker GPU ortamında NCCL_P2P_DISABLE gibi bayrakları bilinçli kullanın
  • Karışık GPU modelleri: Farklı nesil kartları aynı job'da birleştirmek NCCL ve CUDA için risklidir; kiralarken homojen node isteyin
  • Güç/termal throttle: 8 GPU full load'da PSU veya soğutma yetersizse SM clock düşer; iletişim değil compute tarafı yavaşlar

NCCL sağlıklıysa ve NVLink aktifse, 4 GPU DDP'de lineer ölçeğe yaklaşabilirsiniz. NCCL sağlıksızsa 8 GPU kirasanız da 2 GPU gibi hissedersiniz.

Fiyatlandırma etkisi: saatlik fiyat tuzağı vs toplam GPU-saat

Multi-GPU'da en pahalı hata, yalnızca saatlik birim fiyatı karşılaştırmaktır. Doğru metrik:

> Toplam maliyet ≈ (GPU sayısı × saatlik birim fiyat × duvar saati) + depolama/egress

Örnek senaryo (illustrative, relative):

KonfigürasyonBağıl hızDuvar saatiBağıl toplam maliyet
1× H1001.0x40 saat40 birim
2× H100 (DDP, NVLink)~1.85x~22 saat~44 birim
4× H100 (DDP, NVLink)~3.5x~11.5 saat~46 birim
4× H100 (kötü veri pipeline)~2.0x20 saat80 birim

Görüldüğü gibi iyi ölçeklenen 4 GPU, tek GPU'ya göre biraz daha pahalı olabilir ama teslim süresini dramatik kısaltır. Kötü ölçeklenen 4 GPU ise hem pahalı hem yavaştır. Bu yüzden kiralama kararından önce 30–60 dakikalık bir ölçek testi (1→2→4 GPU) yapmak, fiyatlandırma sayfasındaki paket seçiminden daha kritiktir.

NVLink'li node genelde PCIe node'dan daha pahalıdır. Premium'u haklı kılan durumlar:

  • Tensor / pipeline parallel
  • Büyük FSDP/ZeRO-3 all-gather trafiği
  • Düşük latency isteyen çok GPU inference (büyük LLM serve)
  • 4–8 GPU aynı job, sık collective

Premium'u erteleyebileceğiniz durumlar:

  • Küçük LoRA (7B) ve saf DDP
  • Embarrassingly parallel batch inference (her GPU bağımsız iş)
  • Render / bazı video işleri (kartlar arası senkron az)

LLM fine-tuning maliyeti yazısı model boyutu × yöntem matrisini; bu yazı ise GPU sayısı × topoloji matrisini tamamlar.

Senaryo bazlı kiralama önerileri

Senaryo A — 7B LoRA, hızlı iterasyon

  • Öneri: 1× RTX 4090 veya 1× L40S; gerekirse 2× DDP
  • NVLink: Gerekmez
  • Not: Çok GPU'ya erken geçmek deney hızını düşürebilir (ortam karmaşıklığı)

Senaryo B — 13B–30B LoRA / QLoRA

  • Öneri: 2× A100 80GB veya 2–4× L40S
  • NVLink: Tercihen var; zorunlu değil
  • Hizmet: AI eğitimi paketleri + saatlik fatura

Senaryo C — 70B LoRA / kısmi full FT

  • Öneri: 4× A100 80GB (FSDP) veya 4× H100
  • NVLink: Güçlü öneri
  • Alternatif: 8× A100 ile daha agresif batch

Senaryo D — 70B+ full fine-tuning / uzun eğitim

  • Öneri: 8× H100/H200 NVLink node; gerekirse multi-node InfiniBand
  • Kontrol: Checkpoint sıklığı, spot stratejisi (spot instance rehberi)
  • Karşılaştırma: H100 vs A100

Senaryo E — Büyük model inference / vLLM tensor parallel

  • Öneri: 2–4× H100/H200 aynı node, NVLink
  • Neden: Tensor parallel KV/aktivasyon trafiği PCIe'de boğulabilir
  • Hizmet: Inference odaklı düğümler

Türkiye'de multi-GPU kiralarken operasyonel kontrol listesi

  1. Homojen GPU: Aynı model, aynı VRAM, aynı driver/CUDA
  2. Topo belgesi: NVLink matrisi veya en azından nvidia-smi topo çıktısı istenmeli
  3. Depolama: Dataset NVMe'de mi, yoksa yavaş network disk mi?
  4. Ağ: Multi-node ise RDMA/IB var mı, yoksa sadece Ethernet mi?
  5. KVKK: Eğitim verisi kişisel veri içeriyorsa Türkiye lokasyonu — KVKK rehberi
  6. İzleme: nvidia-smi, NCCL log, wandb/mlflow — kör koşu yapmayın
  7. CUDA/PyTorch uyumu: PyTorch kurulum ve CUDA optimizasyonu ile stack'i kilitleyin

İstanbul ve Ankara endpoint'leri düşük gecikmeli ekip erişimi için uygundur; dağıtık eğitimde asıl kritik olan GPU–GPU bağıdır, laptop–sunucu ping'i değil.

Ölçek testi: kiralamadan önce 45 dakikalık protokol

Bütçeyi yakmadan doğru GPU sayısını bulmak için kısa bir protokol:

  1. Tek GPU baseline: 500–1000 adım, tokens/s veya images/s ölç
  2. 2 GPU DDP: Aynı adım sayısı; ideal ~1.8x+ hız. Altındaysa veri pipeline'ı düzelt
  3. 4 GPU DDP: ~3.3x+ hedefle. Düşükse NCCL/topo kontrol et
  4. Model parallel ihtiyacı: CUDA out of memory tek GPU'da geliyorsa TP/FSDP dene; NVLink'li node'a geç
  5. Maliyet projeksiyonu: (gpu_sayisi × birim_fiyat × tahmini_saat) — en düşük toplamı seç, en düşük birim fiyatı değil

Bu protokol, "8 GPU alırız hızlanır" varsayımını veriyle değiştirir.

Yazılım yığını: kiralık multi-GPU'da minimum set

  • Orkestrasyon: torchrun / Accelerate / DeepSpeed
  • Kolektifler: NCCL (varsayılan), gerekirse Gloo ile debug
  • Precision: BF16 (A100/H100), FP8 (H100 Transformer Engine)
  • Checkpoint: Her N adımda + signal handler (preempt / spot için)
  • Konteyner: Homojen image; host CUDA ile uyumlu runtime — Docker toolkit yazılarıyla hizalayın

Framework seçimi kiralama SKU'sunu değiştirmez; fakat yanlış precision VRAM'i şişirip sizi gereksiz yere 8 GPU'ya iter. Önce mixed precision ve aktivasyon checkpointing, sonra GPU sayısı.

Sık yapılan maliyet hataları

  1. NVLink'siz node'da tensor parallel: Performans çöker, süre uzar, fatura şişer
  2. 8 GPU + yavaş disk: GPU'lar idle bekler
  3. Gereksiz full fine-tuning: LoRA yeterliyken 8× H100
  4. Spot'suz uzun job: Kesinti riski düşük sanılıp checkpoint ihmal edilir
  5. Sadece VRAM'e bakmak: Bandwidth ve NCCL ihmal edilir
  6. Farklı şehirlerde multi-node: WAN üzerinden NCCL — kaçının

Özet karar tablosu

İhtiyaçGPU sayısıNVLinkParalellik
Hızlı LoRA iterasyonu1–2HayırDDP / tek GPU
30B eğitim2–4TercihenDDP + FSDP
70B LoRA4Evet (önerilir)FSDP / ZeRO
70B+ full FT8EvetTP + DP hibrit
Büyük LLM serve2–4EvetTensor parallel

Multi-GPU kiralama bir prestij konfigürasyonu değil, ölçülmüş bir kapasite kararıdır. 2 GPU ile sağlıklı ölçek alamıyorsanız 8 GPU sorunu çözmez; önce NCCL, veri yolu ve paralellik stratejisini düzeltin. Doğru topoloji ve doğru GPU sayısı ile hem fiyatlandırma hem teslim süresi kontrol altına alınır.

Türkiye'de NVLink'li A100/H100/H200 düğümlerini saatlik veya proje bazlı kiralamak, özellikle KVKK kapsamındaki LLM işlerinde hem regülasyon hem performans açısından yurtdışı parçalı cluster'lara göre daha öngörülebilir bir yol sunar. Ölçek testinizi yapın, topo'yu doğrulayın, sonra GPU sayısını kilitleyin.

#multi-gpu#nvlink#nccl#data parallel#model parallel#gpu kiralama

SSS

Sıkça Sorulan Sorular

Bu yazıdaki karar noktalarına kısa yanıtlar.