Tüm yazılar
PyTorch GPU Kurulumu: Bulut Sunucuda Hızlı Başlangıç
PyTorch GPU Kurulumu: Bulut Sunucuda Hızlı Başlangıç
Teknik10 dk okuma1.914 kelime

PyTorch GPU Kurulumu: Bulut Sunucuda Hızlı Başlangıç

Kısa cevap: Çoğu kiralık GPU'da hazır PyTorch image kullanın; CUDA 12.x + Docker ile dakikalar içinde eğitime başlanır. Sıfırdan kurulum nadiren gerekir.

Can DemirDevOps Mühendisi
Güncellendi:

Host vs container

Host'ta driver; CUDA/PyTorch container'da. nvidia-smi CUDA Version satırı üst sınırdır. Docker GPU kullanımı. Pip kullanacaksanız resmi CUDA etiketli wheel seçin.

Doğrulama ve performans

torch.cuda.is_available, matmul smoke, bellek bilgisi. Mixed precision ve DataLoader ilk kazanımlardır. CUDA optimizasyonu, Jupyter.

Örnek komutlar / snippet

docker run --rm --gpus all pytorch/pytorch:2.4.0-cuda12.1-cudnn9-runtime python -c "import torch; print(torch.cuda.get_device_name(0))"

Türkiye bağlamı ve operasyon

Türkiye'de GPU kiralama kararını yalnızca TFLOPS belirlemez. Veri lokasyonu, şehir gecikmesi, TL fatura, destek dili ve rezervasyon süresi toplam sahip olma deneyimini şekillendirir. Özellikle kişisel veri içeren eğitim ve çıkarım işlerinde KVKK kapsamında verinin yurt içinde işlenmesi beklenir; anonimleştirme tek başına her senaryoda yeterli sayılmaz.

Operasyonel olarak en sık görülen kayıp, GPU'nun kendisinden değil idle sürelerden ve tekrarlanmayan ortamlardan gelir. Driver/CUDA uyumsuzluğu, her instance'ta sıfırdan kurulum ve dataset'i eğitim sırasında ağ üzerinden okumak hem süreyi hem maliyeti şişirir. Container tabanlı imaj, NVMe'ye lokal dataset ve checkpoint disiplini bu kaybı azaltır.

İlgili sayfalar: A100; RTX 4090; İstanbul; Ankara.

Pratik kontrol listesi

  1. İş yükünü tek cümleyle yazın (eğitim / fine-tuning / inference / render / transcode).
  2. VRAM ve throughput için 30–60 dakikalık micro-benchmark planlayın.
  3. Saatlik planla başlayıp reserved/aylık modele ancak stabil kullanımda geçin.
  4. Spot kullanacaksanız checkpoint ve resume'u önceden test edin.
  5. Başarı metriğini (eval, latency p95, images/s, $/1k token) önceden sabitleyin.
  6. Idle Jupyter ve unutulan instance'ları otomatik kapatacak alarm kurun.

Sık yapılan hatalar

Benchmark yapmadan en pahalı GPU'ya çıkmak; tek metrikle (yalnızca VRAM veya yalnızca fiyat) karar vermek; production inference'ı eğitim kartıyla uzun süre koşturmak; multi-GPU'ya geçmeden single-GPU optimizasyonunu bitirmemek; veri sınıflandırması yapmadan yurtdışı bölgesine dataset taşımak.

Bir diğer yaygın hata, PoC başarı kriterini tanımsız bırakmaktır. 'Model biraz daha iyi olsun' diye açılan açık uçlu eğitimler, bütçeyi sessizce tüketir. Erken durdurma, eval bütçesi ve maksimum deneme sayısı olmadan fine-tuning işi bitmez; yalnızca fatura büyür.

Sonuç

Kiralanan GPU'da PyTorch: önce driver, sonra CUDA uyumlu wheel veya container. Doğru GPU seçimi, ölçüm ve disiplinli operasyon bir araya geldiğinde hem maliyeti hem teslim süresini kontrol altına alırsınız.

Sonraki adım için ilgili GPU modeli, hizmet ve şehir sayfalarından senaryonuza uygun planı seçin; emin değilseniz saatlik küçük bir deneme ile başlamak genelde en düşük riskli yoldur.

Derinlemesine notlar (1)

Bu bölüm (1), pytorch gpu kurulum rehberi başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: A100; RTX 4090; İstanbul; Ankara.

Derinlemesine notlar (2)

Bu bölüm (2), pytorch gpu kurulum rehberi başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: A100; RTX 4090; İstanbul; Ankara.

Derinlemesine notlar (3)

Bu bölüm (3), pytorch gpu kurulum rehberi başlığında ekiplerin sahada tekrar ettiği sorulara daha uzun yanıt verir. Amacımız teorik katalog bilgisi değil; kiralanan instance üzerinde yarın sabah uygulanabilir bir çerçeve sunmaktır. Önce ölçün, sonra ölçekleyin, ardından maliyeti kilitleyin. Her ekip kendi iş yükünü yazmalı: model boyutu, beklenen QPS veya frame sayısı, veri hassasiyeti ve deadline.

Karar çerçevesini üç katmanda tutun: (1) teknik uygunluk — VRAM, throughput, framework desteği, sürücü/CUDA uyumu; (2) uyumluluk — veri lokasyonu, erişim kontrolü, log politikası, sözleşme ve SLA; (3) ekonomi — time-to-result ile cost-to-result çarpımı, idle riski ve deneme sayısı. Bu üçünden biri zayıfsa seçim uzun vadede pahalıya patlar.

Ölçüm olmadan yapılan 'en iyi GPU' tartışmaları genellikle ekip içi sezgiye dayanır. 2–4 saatlik kontrollü benchmark, sezgiyi veriye çevirir. Aynı script'i farklı kartlarda çalıştırın; tokens/s, images/s, iter/s, GPU util, bellek kırpılması (OOM) ve $/metrik notlarını aynı tabloya yazın. Sonra kararı tabloya göre verin; satıcı sunumuna göre değil.

Ölçekleme kararı verirken yalnızca daha büyük karta sıçramayın; önce precision (FP16/BF16/FP8), gradient checkpointing, FlashAttention, daha iyi data loader, daha temiz dataset ve daha iyi batch stratejisi ile single-GPU verimini artırın. Bu adımlar çoğu zaman bir üst GPU sınıfına çıkmadan throughput kazandırır ve multi-GPU karmaşıklığını erteler.

Production'a yaklaşırken gözlemlenebilirlik ekleyin: GPU util, bellek, latency p95/p99, kuyruk derinliği, hata oranı ve $/istek. Metrik yoksa optimizasyon da yoktur. Inference işlerinde TensorRT/ONNX gibi derleme adımları, eğitim işlerinde ise doğru parallel stratejisi ve checkpoint disiplini öne çıkar.

Rezervasyon politikasını netleştirin. Kısa PoC saatlik; düzenli eğitim aylık; 7/24 API reserved model ister. Spot yalnızca kesintiye toleranslı ve checkpoint'li işlerde anlamlıdır. Gece saatlerinde batch kuyruğu çalıştırmak birim maliyeti düşürür. Bu disiplin, aynı işi daha az TL ile bitirmenizi sağlar.

Dokümantasyon alışkanlığı da maliyeti düşürür: hangi imaj, hangi CUDA, hangi commit, hangi eval set, hangi seed. İki hafta sonra o başarılı run'u yeniden üretememek gizil bir vergi gibidir. Container tag'lerini ve dataset sürümlerini sabitleyin; latest kullanmayın.

Uygulama senaryoları: (1) Hızlı PoC — saatlik RTX 4090/A100; (2) Düzenli eğitim — aylık A100/H100 + gece spot; (3) Production inference — L40S, önce batching/quantization sonra yatay ölçek; (4) Yaratıcı üretim — ComfyUI/Blender/Unreal + spot kuyruk; (5) Akademik — A100 ağırlıklı, tekrarlanabilir container ve paylaşımlı cache.

Ekip içi sorumlulukları ayırın: kim instance açar, kim kapatır, kim dataset sürümler, kim eval onaylar, kim harcama limitini izler. Belirsiz sahiplik, açık kalan GPU demektir. Güvenlikte en az yetki ilkesini uygulayın; SSH anahtarlarını döndürün; secret'ları diske düz metin yazmayın; iş bitince volume temizliği yapın; son kontrol olarak instance'ın gerçekten kapalı olduğunu doğrulayın.

Kapasite planlamasında yalnızca bugünkü işi değil, iki sprint sonrasındaki spike'ı da düşünün. Reserved kapasiteyi erken kilitlemek bazen saatlik fiyat farkından daha değerlidir; tersine belirsiz projelerde reserved taahhüdü nakit yakar. Şehir seçiminde kullanıcı ve ofis yakınlığını ölçün; interaktif notebook ve remote desktop ping'e duyarlıdır. Batch eğitimde veri merkezi içi disk/ağ topolojisi ping'den daha kritik olabilir.

Model ve veri lisanslarını izleyin: ticari kullanım, çıktı hakları ve üçüncü parti LoRA/checkpoint lisansları prod'a çıkmadan netleşmeli. Eval set'i prod trafiğinden ayrı tutun; sızıntı hem etik hem metrik yanılsaması üretir. Haftalık $/metrik raporu ekibi doğru boyuta iter. İlgili sayfalar: A100; RTX 4090; İstanbul; Ankara.

#pytorch#cuda#kurulum#docker

Sıkça Sorulan Sorular

nvidia-smi çalışıyor mu kontrol edin; ardından torch.cuda.is_available() test edin. Driver ile image CUDA sürümü uyumsuzsa sağlayıcı image'ına geçin.
Tek kullanıcı hızlı deneme için conda yeterli olabilir. Ekip ve üretimde Docker tekrarlanabilirlik için daha güvenlidir.
Token zorunlu tutun ve SSH tunnel kullanın. Jupyter portunu doğrudan 0.0.0.0 ile internete açmayın.
Küçük modeller için RTX 4090; orta/büyük eğitim için A100. Kurulum doğrulaması herhangi bir CUDA GPU'da yapılabilir.
PoC ve benchmark için saatlik; düzenli eğitim veya 7/24 servis için aylık/reserved daha öngörülebilirdir. Idle riskini saatlikte daha sık kontrol edin.
Micro-benchmark ile doğru GPU'yu seçin, idle alarm kurun, checkpoint alın ve spot'u yalnızca toleranslı işlerde kullanın. Haftalık $/metrik raporu tutun.