
Multi-GPU ve NVLink ile Kiralama Rehberi: 2/4/8 GPU, NCCL ve Paralellik
Ne zaman 2, 4 veya 8 GPU kiralamalısınız? NVLink, NCCL, data parallel vs model parallel ve fiyatlandırmaya etkisini adım adım anlatıyoruz.
Multi-GPU ve NVLink ile kiralama: neyi optimize ediyorsunuz?
Tek GPU ile ilerleyen bir eğitim veya inference işi bir noktada duvara çarpar: VRAM yetmez, epoch süresi kabul edilemez olur veya batch boyutu küçülüp yakınsama bozulur. Bu noktada çözüm çoğu zaman "daha büyük tek kart" değil; aynı sunucuda birden fazla GPU ve doğru iletişim topolojisidir. Türkiye'de saatlik GPU kiralama planlarında 2, 4 ve 8 GPU düğümleri yaygınlaşırken, asıl karar NVLink var mı, NCCL nasıl davranıyor ve paralellik stratejiniz (data parallel mi, model parallel mi) nedir sorularında düğümlenir.
Bu rehber, multi-GPU kiralama kararını ticari ve teknik açıdan netleştirmek için yazıldı: ne zaman 2 GPU yeter, ne zaman 4 veya 8 GPU gerekir, NVLink'in fiyat farkını ne zaman hak ettiği, NCCL darboğazlarını nasıl okuyacağınız ve AI eğitimi ile LLM fine-tuning senaryolarında hangi konfigürasyonun toplam maliyeti düşürdüğü.
Multi-GPU kiralamanın üç katmanı
Çoğu ekip "kaç GPU?" sorusuyla başlar. Doğru sıra aslında şudur:
- Bellek (VRAM) sınırı: Model + optimizer + aktivasyonlar tek karta sığıyor mu?
- Zaman sınırı: Tek GPU ile eğitim süresi iş hedefini kaçırıyor mu?
- İletişim sınırı: GPU'lar arası bant genişliği, ölçeklenmeyi öldürüyor mu?
İlk iki soru tek GPU yükseltmesiyle (ör. A100 → H100 veya H200) çözülebilir. Üçüncü soru multi-GPU ve NVLink dünyasına aittir. Yanlış sırayla karar verirseniz 8 GPU kiralar, NCCL all-reduce'da bekler ve tek GPU'dan sadece 2–3x hız alırsınız — saatlik fatura ise 8 katına çıkar.
NVLink nedir, PCIe'den farkı ne?
NVLink, NVIDIA GPU'lar arasında doğrudan yüksek bant genişlikli bir ara bağlantıdır. Klasik PCIe üzerinden GPU–GPU trafiği CPU/chipset üzerinden dolaylı ilerler; NVLink ise GPU'ları birbirine yakın bir "bellek ailesi" gibi bağlar. Pratik sonuç:
| Bağlantı | Tipik senaryo | Ne zaman yeterli? |
|---|---|---|
| PCIe Gen4/5 | Consumer / bazı sunucu kartları | Data parallel, küçük gradyan senkronu |
| NVLink (aynı node) | A100/H100 SXM | Model parallel, tensor parallel, büyük all-reduce |
| InfiniBand / RoCE (multi-node) | 8+ GPU cluster | Çok düğümlü dağıtık eğitim |
NVLink'in kiralama tarafındaki anlamı şudur: aynı node içinde 2–8 GPU'yu düşük gecikmeli ve yüksek bant genişlikli bir topolojiyle kullanırsınız. Bu, özellikle tensor parallel ve pipeline parallel iş yüklerinde PCIe'ye göre belirgin hız farkı üretir. Saf data parallel (her GPU tam model kopyası) senaryosunda fark daha küçüktür; yine de büyük modellerde gradyan senkronu NVLink üzerinde daha az "bekleme" yaratır.
Türkiye lokasyonlu kiralama seçerken yalnızca "4x H100" yazısına bakmayın; teklifte SXM + NVLink mi, yoksa PCIe kartlar mı olduğu açıkça yazılmalıdır. Aynı GPU modeli, bağlantı topolojisine göre farklı performans verir.
Ne zaman 2 GPU, ne zaman 4, ne zaman 8?
Aşağıdaki matris pratik bir başlangıç noktasıdır. Değerler model mimarisine, precision'a (FP16/BF16/FP8) ve framework'e göre değişir; yine de kiralama planı seçerken işe yarar.
2 GPU — ilk ölçek adımı
Ne zaman: Tek GPU VRAM'i sıkışıyor ama model hâlâ makul boyutta; veya epoch süresini yaklaşık 1.7–1.9x hızlandırmak istiyorsunuz.
Tipik kullanım:
- 7B–13B LoRA / QLoRA fine-tuning'i hızlandırmak
- Orta boy vision model eğitimi
- Tek node'da A/B deney: aynı dataset, iki farklı hiperparametre (cihaz atayarak)
2x RTX 4090 veya 2x A100 çoğu startup için ilk multi-GPU deneyimidir. Consumer kartlarda NVLink olmayabilir; DDP yine çalışır, ancak tensor parallel beklentinizi düşük tutun. Daha derin bir DDP/FSDP çerçevesi için multi-GPU eğitim rehberine bakın.
4 GPU — üretim eğitimlerinin tatlı noktası
Ne zaman: 30B civarı modeller, daha büyük batch, veya 70B'ye FSDP/ZeRO ile yaklaşmak.
4 GPU aynı node'da NVLink ile:
- Data parallel ölçeklenmesi genelde 3.2–3.7x aralığına oturur (veri pipeline sağlıklıysa)
- Tensor parallel (ör. TP=2 veya TP=4) ile büyük LLM katmanları sığdırılabilir
- Checkpoint ve hata ayıklama maliyeti hâlâ yönetilebilir
Kurumsal LLM fine-tuning işlerinde 4x A100 80GB veya 4x H100, maliyet/performans dengesi açısından sık tercih edilen konfigürasyondur. H100 vs A100 karşılaştırması model boyutu ve FP8 ihtiyacına göre kart seçimini netleştirir.
8 GPU — büyük model ve sıkı deadline
Ne zaman: 70B+ full fine-tuning veya uzun pretrain devamı; zaman kritik; tek node VRAM toplamı şart.
8 GPU'da dikkat edilmesi gerekenler:
- Veri yükleme ve disk I/O darboğazı büyür; NVMe ve yeterli num_workers şarttır
- NCCL collective'ler daha uzun sürer; NVLink topolojisi kritikleşir
- Saatlik fiyat 8 katına yaklaşırken hızlanma nadiren 8 kat olur — toplam GPU-saat hesabı yapın
8x H100/H200 düğümleri Türkiye'de kapasite kısıtlı olabilir; İstanbul merkezli rezervasyon ve önceden kapasite teyidi önerilir.
Data parallel vs model parallel: hangisini kiralamalısınız?
Paralellik stratejisi, kiralayacağınız GPU sayısını ve NVLink ihtiyacını doğrudan belirler.
Data parallel (DDP / FSDP data-sharding)
Her GPU (veya shard grubu) aynı model mimarisini görür; farklı mini-batch dilimleri üzerinde çalışır. Gradyanlar NCCL all-reduce ile birleştirilir.
Avantajlar:
- Kurulumu görece kolay (torchrun, Hugging Face Accelerate)
- Küçük–orta modellerde yüksek ölçek verimi
- PCIe node'larda bile kabul edilebilir performans
Dezavantajlar:
- Her GPU'da (saf DDP'de) tam model kopyası gerekir → VRAM tavanı model boyutuna bağlı kalır
- FSDP/ZeRO ile parametreler shard edilir; iletişim maliyeti artar
Kiralama önerisi: Model tek karta sığıyorsa önce 2–4 GPU data parallel deneyin. NVLink "şart" değildir ama büyük all-reduce'larda faydalıdır.
Model parallel (tensor / pipeline / expert)
Model katmanları veya tensör dilimleri GPU'lara bölünür. Tek örnek bile birden fazla GPU belleğini kullanır.
Avantajlar:
- Tek GPU'ya sığmayan modelleri eğitmek / serve etmek mümkün olur
- 70B+ modellerde neredeyse zorunlu yol
Dezavantajlar:
- GPU–GPU aktivasyon trafiği yoğundur → NVLink tercihi güçlüdür
- Yanlış TP/PP oranı ölçeklenmeyi öldürebilir
- Debugging ve checkpoint daha karmaşıktır
Kiralama önerisi: Tensor parallel kullanacaksanız aynı node, NVLink'li SXM konfigürasyon isteyin. Multi-node'a erken geçmeyin; önce tek node 4–8 GPU ile doyurun.
Hibrit (gerçek dünya)
Üretimde çoğu ekip hibrit kullanır: örneğin TP=2 + DP=2 (4 GPU) veya TP=4 + DP=2 (8 GPU). Karar ağacı:
- Model tek GPU VRAM'ine sığmıyor mu? → Model parallel ekle
- Sığıyor ama süre uzun mu? → Data parallel ile GPU sayısını artır
- İkisi birden mi? → Hibrit; NVLink'li node şartına yaklaşır
NCCL: multi-GPU kiralamanın sessiz kahramanı (ve suçlusu)
NCCL (NVIDIA Collective Communications Library), all-reduce, all-gather, broadcast gibi kolektifleri yönetir. PyTorch DDP/FSDP altında çoğu zaman NCCL çalışır. Kiralık sunucuda performans şikayetlerinin önemli kısmı "GPU yavaş" değil, NCCL iletişiminin yavaş olmasıdır.
Kontrol listesi (kiralamadan sonra ilk 30 dakika)
- nvidia-smi topo -m ile GPU topolojisini okuyun — NVLink bağları görünüyor mu?
- NCCL_DEBUG=INFO ile kısa bir all-reduce smoke test çalıştırın
- nvidia-smi dmon veya Nsight ile SM aktivitesi vs. iletişim beklemesini ayırın
- Aynı node'da gereksiz CPU pinning / IRQ sorunlarını eleyin
Sık görülen NCCL tuzakları
- Yanlış network interface: Multi-node'da NCCL eth0 yerine IB/RoCE arayüzünü seçmelidir
- Docker + host network: Container'da GPU var ama NCCL P2P kapalı kalmış olabilir — Docker GPU ortamında NCCL_P2P_DISABLE gibi bayrakları bilinçli kullanın
- Karışık GPU modelleri: Farklı nesil kartları aynı job'da birleştirmek NCCL ve CUDA için risklidir; kiralarken homojen node isteyin
- Güç/termal throttle: 8 GPU full load'da PSU veya soğutma yetersizse SM clock düşer; iletişim değil compute tarafı yavaşlar
NCCL sağlıklıysa ve NVLink aktifse, 4 GPU DDP'de lineer ölçeğe yaklaşabilirsiniz. NCCL sağlıksızsa 8 GPU kirasanız da 2 GPU gibi hissedersiniz.
Fiyatlandırma etkisi: saatlik fiyat tuzağı vs toplam GPU-saat
Multi-GPU'da en pahalı hata, yalnızca saatlik birim fiyatı karşılaştırmaktır. Doğru metrik:
> Toplam maliyet ≈ (GPU sayısı × saatlik birim fiyat × duvar saati) + depolama/egress
Örnek senaryo (illustrative, relative):
| Konfigürasyon | Bağıl hız | Duvar saati | Bağıl toplam maliyet |
|---|---|---|---|
| 1× H100 | 1.0x | 40 saat | 40 birim |
| 2× H100 (DDP, NVLink) | ~1.85x | ~22 saat | ~44 birim |
| 4× H100 (DDP, NVLink) | ~3.5x | ~11.5 saat | ~46 birim |
| 4× H100 (kötü veri pipeline) | ~2.0x | 20 saat | 80 birim |
Görüldüğü gibi iyi ölçeklenen 4 GPU, tek GPU'ya göre biraz daha pahalı olabilir ama teslim süresini dramatik kısaltır. Kötü ölçeklenen 4 GPU ise hem pahalı hem yavaştır. Bu yüzden kiralama kararından önce 30–60 dakikalık bir ölçek testi (1→2→4 GPU) yapmak, fiyatlandırma sayfasındaki paket seçiminden daha kritiktir.
NVLink premium'unu ne zaman ödeyin?
NVLink'li node genelde PCIe node'dan daha pahalıdır. Premium'u haklı kılan durumlar:
- Tensor / pipeline parallel
- Büyük FSDP/ZeRO-3 all-gather trafiği
- Düşük latency isteyen çok GPU inference (büyük LLM serve)
- 4–8 GPU aynı job, sık collective
Premium'u erteleyebileceğiniz durumlar:
- Küçük LoRA (7B) ve saf DDP
- Embarrassingly parallel batch inference (her GPU bağımsız iş)
- Render / bazı video işleri (kartlar arası senkron az)
LLM fine-tuning maliyeti yazısı model boyutu × yöntem matrisini; bu yazı ise GPU sayısı × topoloji matrisini tamamlar.
Senaryo bazlı kiralama önerileri
Senaryo A — 7B LoRA, hızlı iterasyon
- Öneri: 1× RTX 4090 veya 1× L40S; gerekirse 2× DDP
- NVLink: Gerekmez
- Not: Çok GPU'ya erken geçmek deney hızını düşürebilir (ortam karmaşıklığı)
Senaryo B — 13B–30B LoRA / QLoRA
- Öneri: 2× A100 80GB veya 2–4× L40S
- NVLink: Tercihen var; zorunlu değil
- Hizmet: AI eğitimi paketleri + saatlik fatura
Senaryo C — 70B LoRA / kısmi full FT
- Öneri: 4× A100 80GB (FSDP) veya 4× H100
- NVLink: Güçlü öneri
- Alternatif: 8× A100 ile daha agresif batch
Senaryo D — 70B+ full fine-tuning / uzun eğitim
- Öneri: 8× H100/H200 NVLink node; gerekirse multi-node InfiniBand
- Kontrol: Checkpoint sıklığı, spot stratejisi (spot instance rehberi)
- Karşılaştırma: H100 vs A100
Senaryo E — Büyük model inference / vLLM tensor parallel
- Öneri: 2–4× H100/H200 aynı node, NVLink
- Neden: Tensor parallel KV/aktivasyon trafiği PCIe'de boğulabilir
- Hizmet: Inference odaklı düğümler
Türkiye'de multi-GPU kiralarken operasyonel kontrol listesi
- Homojen GPU: Aynı model, aynı VRAM, aynı driver/CUDA
- Topo belgesi: NVLink matrisi veya en azından nvidia-smi topo çıktısı istenmeli
- Depolama: Dataset NVMe'de mi, yoksa yavaş network disk mi?
- Ağ: Multi-node ise RDMA/IB var mı, yoksa sadece Ethernet mi?
- KVKK: Eğitim verisi kişisel veri içeriyorsa Türkiye lokasyonu — KVKK rehberi
- İzleme: nvidia-smi, NCCL log, wandb/mlflow — kör koşu yapmayın
- CUDA/PyTorch uyumu: PyTorch kurulum ve CUDA optimizasyonu ile stack'i kilitleyin
İstanbul ve Ankara endpoint'leri düşük gecikmeli ekip erişimi için uygundur; dağıtık eğitimde asıl kritik olan GPU–GPU bağıdır, laptop–sunucu ping'i değil.
Ölçek testi: kiralamadan önce 45 dakikalık protokol
Bütçeyi yakmadan doğru GPU sayısını bulmak için kısa bir protokol:
- Tek GPU baseline: 500–1000 adım, tokens/s veya images/s ölç
- 2 GPU DDP: Aynı adım sayısı; ideal ~1.8x+ hız. Altındaysa veri pipeline'ı düzelt
- 4 GPU DDP: ~3.3x+ hedefle. Düşükse NCCL/topo kontrol et
- Model parallel ihtiyacı: CUDA out of memory tek GPU'da geliyorsa TP/FSDP dene; NVLink'li node'a geç
- Maliyet projeksiyonu: (gpu_sayisi × birim_fiyat × tahmini_saat) — en düşük toplamı seç, en düşük birim fiyatı değil
Bu protokol, "8 GPU alırız hızlanır" varsayımını veriyle değiştirir.
Yazılım yığını: kiralık multi-GPU'da minimum set
- Orkestrasyon: torchrun / Accelerate / DeepSpeed
- Kolektifler: NCCL (varsayılan), gerekirse Gloo ile debug
- Precision: BF16 (A100/H100), FP8 (H100 Transformer Engine)
- Checkpoint: Her N adımda + signal handler (preempt / spot için)
- Konteyner: Homojen image; host CUDA ile uyumlu runtime — Docker toolkit yazılarıyla hizalayın
Framework seçimi kiralama SKU'sunu değiştirmez; fakat yanlış precision VRAM'i şişirip sizi gereksiz yere 8 GPU'ya iter. Önce mixed precision ve aktivasyon checkpointing, sonra GPU sayısı.
Sık yapılan maliyet hataları
- NVLink'siz node'da tensor parallel: Performans çöker, süre uzar, fatura şişer
- 8 GPU + yavaş disk: GPU'lar idle bekler
- Gereksiz full fine-tuning: LoRA yeterliyken 8× H100
- Spot'suz uzun job: Kesinti riski düşük sanılıp checkpoint ihmal edilir
- Sadece VRAM'e bakmak: Bandwidth ve NCCL ihmal edilir
- Farklı şehirlerde multi-node: WAN üzerinden NCCL — kaçının
Özet karar tablosu
| İhtiyaç | GPU sayısı | NVLink | Paralellik |
|---|---|---|---|
| Hızlı LoRA iterasyonu | 1–2 | Hayır | DDP / tek GPU |
| 30B eğitim | 2–4 | Tercihen | DDP + FSDP |
| 70B LoRA | 4 | Evet (önerilir) | FSDP / ZeRO |
| 70B+ full FT | 8 | Evet | TP + DP hibrit |
| Büyük LLM serve | 2–4 | Evet | Tensor parallel |
Multi-GPU kiralama bir prestij konfigürasyonu değil, ölçülmüş bir kapasite kararıdır. 2 GPU ile sağlıklı ölçek alamıyorsanız 8 GPU sorunu çözmez; önce NCCL, veri yolu ve paralellik stratejisini düzeltin. Doğru topoloji ve doğru GPU sayısı ile hem fiyatlandırma hem teslim süresi kontrol altına alınır.
Türkiye'de NVLink'li A100/H100/H200 düğümlerini saatlik veya proje bazlı kiralamak, özellikle KVKK kapsamındaki LLM işlerinde hem regülasyon hem performans açısından yurtdışı parçalı cluster'lara göre daha öngörülebilir bir yol sunar. Ölçek testinizi yapın, topo'yu doğrulayın, sonra GPU sayısını kilitleyin.
SSS
Sıkça Sorulan Sorular
Bu yazıdaki karar noktalarına kısa yanıtlar.



