- Birden fazla girişim ve araştırma laboratuvarının ortaklaşa GPU kümesi satın alarak büyük model eğitimi için gereken hesaplama kaynaklarını birlikte güvenceye alması
- Her birinin ayrı ayrı N adet GPU satın alması yerine, K girişimin bir araya gelip N×K ölçeğinde bir kümeyi birlikte satın alması
- İş zamanlayıcısının, sahiplik payı oranında hesaplamayı adil biçimde dağıtması; boşta kapasite oluşursa bunun ek olarak tahsis edilmesi
- 128 A100’ü bir ay boyunca tam dolu tutmak yerine, bir hafta boyunca 512 A100’e burst yapabilmek ve modeli daha hızlı eğitmek
- OpenAI ve Deepmind gibi büyük araştırma laboratuvarlarının yararlandığı burst tahsis modelini girişimlere de sunan bir yapı
Temel fikir
- K girişimin her birinin ayrı ayrı N GPU’luk küme satın alması yerine, birlikte N×K GPU’luk bir küme satın alması
- Her girişimin sahip olduğu pay oranında hesaplamayı adil biçimde dağıtmak için bir iş zamanlayıcısı kullanılması
- Boşta hesaplama kapasitesi oluşursa zamanlayıcının bunu doğrudan tahsis etmesi; böylece şanslı olanların kendi payından daha fazla hesaplama kullanabilmesi
- 128 A100’ü bir ay boyunca sürekli dolu tutmak yerine, bir hafta boyunca 512 A100’e kadar burst ederek modeli daha hızlı elde etmek
- OpenAI ve Deepmind gibi büyük araştırma laboratuvarlarının, araştırmacılar için burst tahsisini destekleyen büyük kümelere sahip olması
- Buna karşılık girişimlerin bugüne kadar çok uzun vadeli sözleşmelerle yalnızca çok küçük kümeler edinebilmesi, aylarca beklemesi ve bu kümeleri sürekli meşgul tutmak zorunda kalması
- Burst tahsisi ve kısa vadeli sözleşmeleri uygularken H100 başına yaklaşık $2.00 seviyesinin hedeflenmesi
- Katılmak isteyen girişimlerin başvuru formunu doldurması; sorular için evan@roomservice.dev adresine e-posta gönderilmesi
Katılım, ayrılma ve büyüme
- Bir hacker house gibi, kümeden ayrılmak isteyenlerin (örneğin kendi kümelerini kurmak için) yerlerini dolduracak birini bulabilmek adına bir-iki ay önceden haber vermesi gerekecek
- Yeni girişimlerin gruba batch bazında eklenecek olması ve kümeye birkaç ayda bir yeni H100’lerin eklenmesi
- Hâlihazırda grupta olanların hesaplama kapasitesini büyütmek istemesi durumunda da aynı yaklaşımın geçerli olması
- Bir miktar overprovisioning düşünülmesi — örneğin bir arkadaş küçük bir deney için birkaç node isterse bunların hemen iyi bir fiyatla verilebilmesi
- %10 overprovisioning durumunda H100’ün saatlik fiyatının %10 artması
Finans
- 512 H100’ü 4-6 hafta içinde devreye alabilecek güçlü bir yolun güvence altına alınmış olması
- Bunun üzerindeki talep gelirse yaklaşık 8 hafta içinde ek H100’lerin sağlanabilmesi
- Bankalar aracılığıyla küme satın alma maliyetinin iyi koşullarla yayılabilmesi sayesinde, kısa vadeli sözleşmeler ve burst tahsisi korunurken H100 başına $2.00 seviyesinin mümkün olması
Altyapı
- Altyapı hata ayıklama mailing listesi/Slack paylaşılması; InfiniBand gibi sorunlar çıktığında gruba soru sorulabilmesi
- Aynı sorun üzerinde daha önce çalışmış olanların birbirine yardımcı olabilmesi
1 yorum
Hacker News yorumları
Başarılı olmasını dilerim. TPU Research Cloud(TRC) 2019'da buna benzer bir şeyi denemişti ve benim başlayabilmemi sağlayan şey de oydu.
2023'te tek bir TPU'yu bir saatten fazla almak bile zor, ama o zamanlar kelimenin tam anlamıyla yüzlercesini alabiliyordunuz. TRC'ye inanıyordum; ölçeği büyütüp bir TPU kıtası kurarsak sorunun çözüleceğini düşünüyordum, ama sonunda TPU süreleri kurum içi araştırmacılara öncelikli ayrılmaya başladı ve azaldı. Bugün H100 ile GPT'ye satranç öğretmeyi önerseniz alay konusu olacak kadar dünya değişti.
Bu projede kaybolmamasını umduğum genç bir iyimserlik var; uzun vadede kazanmanın yolu da bu olabilir. Biri saçma bir fikirle H100'ün çok küçük bir parçasını istemeye gelirse kabul etmelerini isterim. Benim bir şey olabilmemin tek nedeni buydu.
H100'ün küçük bir parçasını isteyen saçma talepleri de elbette kabul etmeyi düşünüyorum.
TRC destekli makalelerin güncel listesine https://sites.research.google/trc/publications/ adresinden bakabilirsiniz.
Cloud TPU talebi çok güçlü olduğu için preemptible kapasite kullanırsanız kesintileri daha sık görebilirsiniz, ancak rezerve kapasite de mümkün. TRC destek ekibiyle iletişime geçmeniz iyi olur.
Karşılaştırma tamamen birebir değil, ama TRC'yi kullanmak çok zordu; TPUv3 erişimim yalnızca bir kez oldu ve temelleri öğrenmeye bile zaman yetmedi. Hangi e-posta adresini kullandığınıza ve Twitter hesabınızın ne kadar tanınır olduğuna göre durumun büyük ölçüde değiştiğini anladım.
Akademide olup olmadığını merak ediyorum. Değilsen, bana neden daha cömert davrandıklarını bilmiyorum; benim projelerim de en fazla biraz ilginç sayılırdı. Yine de eskisine göre büyük Pod'lar konusunda çok daha cimri oldukları doğru.
“Her biri K adet startup'ın ayrı ayrı N GPU'luk küme satın alması yerine, birlikte NK GPU'luk bir küme alıp hesaplamayı bir iş zamanlayıcıyla dağıtması” teoride AWS, Azure gibi bulut sağlayıcılarının modeline çok benziyor.
Yapı şu: “Herkesin sabit donanımı ayrı ayrı satın alması yerine, biz devasa bir donanım havuzu alalım ve zaman paylaşımı yaptırıyoruz.” Bulut sağlayıcılarının net marj için fiyatları yükseltmek zorunda olması dışında, böyle bir projeyi gerekli kılacak kaçırdığım başka bir şey var mı merak ediyorum.
Birincisi, genel bulut yatırımcıları belirli bir marj yapısı bekliyor; bu yüzden Lambda veya Fluidstack'in marjlarıyla rekabet etmeleri zor. İkincisi, büyük bulutlar büyük dil modeli eğitimi için gereken ağ tarafında da bir ölçüde dezavantajlı. Bildiğim kadarıyla yalnızca Azure'da InfiniBand var; Oracle 3200Gbps ama InfiniBand değil, AWS'nin de benzer olduğunu düşünüyorum. GCP'den emin değilim ama A100 ağ hızının 1600Gbps değil 100Gbps olduğunu hatırlıyorum. Buna karşılık Lambda, Fluidstack ve CoreWeave'in hepsinde InfiniBand var. Üçüncüsü, Nvidia büyük bulutlara istedikleri kadar ürün tahsis etmiyor.
İkinci olarak, burada kaynak paylaşımıyla ilgili temel bir sorun var. Evan ve AI Grant'in bu projesinde de bir ekip tüm kümeyi sürekli kaplayacak paraya sahipse neden buna izin verilmesin sorusu ortaya çıkıyor. Sorun, adil kullanımın tam ölçütünün ne olduğu. Ağlarda TCP fairness gibi bant genişliği paylaşım algoritmaları var, ama bu tür büyük parça işler için pek uygun değiller.
Önümüzdeki birkaç ay içinde AWS ve benzerleri, hesaplama parçalarını geçici olarak tahsis eden bir kuyruk servisi çıkarmaya çalışacak; muhtemelen ön ödeme ve yüksek maliyet gerektirecek. On-demand fiyatlardan bile pahalı olabilir.
Bu havuzlamayı kendileri yaparlar; müşteri ilişkisini ve kârı aracıya ya da müşteriye bırakmak istemezler.
CA'daki birkaç colocation tesisinde altyapı işletmiş biri olarak, mümkünse başka bir yere koymak daha iyi. Kaliforniya elektrik maliyeti ve diğer altyapı giderleri AZ veya NV'den çok daha yüksek.
“Dünyadaki hiçbir bulut sağlayıcısı yalnızca birkaç hafta için 100 bin dolarlık hesaplama vermez” cümlesini gördüm; çok büyük ölçekli hesaplama satın almış değilim ama bunun bulutun özü olduğunu düşünürdüm.
https://lambdalabs.com/ ile farkının ne olduğunu merak ediyorum
Şu anda birkaç A100/H100 bulmak oldukça kolay ve Lambda da bu kullanım için harika. Ama 24 veya daha fazlasını makul bir fiyata, kabaca saatlik 2 dolara bulmak çok zor. H100 üzerinde sadece 8 saatlik eğitim çalıştırmak isteseniz bile çoğu zaman 6 aydan uzun taahhüt isteniyor
GPU aracılarının uzun vadeli rezervasyonları tercih etmesi iş açısından mantıklı bir karar; biz de onların yerinde olsak öyle yapabilirdik. Ama bizim hedefimiz farklı. İsyancıları silahlandırmak istiyoruz. BigCorp olmayan birilerinin de model eğitebilmesini istiyoruz
Orijinal yazıdaki yöntem, 512 GPU'luk kümenin iş kuyruğuna iş koyma hakkını satın almaya daha yakın; dolayısıyla 256 GPU gerektiren işler de sorun olmaz. Ancak 512 GPU'luk bir iş çalıştıran birinin arkasında beklemek gerekebilir
Lambdalabs'ın gerçek kapasitesinin ne olduğunu bilmiyorum. Orada 2-3'ten fazla instance ayağa kaldırmanın ne kadar kolay olduğunu bilen var mı merak ediyorum
Kişisel olarak yapay zekaya çok ilgi duyuyorum ve birkaç yıldır bu alanın içindeyim, ama şu anki gibi bir GPU kıtlığı görmedim. Hobi olarak makine öğrenmesi denemek isteyenlere vast.ai'ı şiddetle tavsiye ederim
A100/H100 dışındaki GPU'lar için vast, TensorDock ve RunPod da var
Şu anda AWS ve GCP'yi yeniden satıyorlar ve A100 de var, ama şimdilik T4 yeterli
AWS/GCP/Azure'da ek yük olduğunu ve birçok şirketin operasyonda bare metal seçmesinin nedenini anlıyorum. Kişisel olarak zaman ve emek harcamaya değen durumların nadir olduğunu düşünüyorum, ama ölçek büyükse tasarrufun ciddi olabileceğini kabul ediyorum
Ancak yapay zeka eğitimi tarafında da genel bulutlar ani talep artışlarında rekabetçi değilse, marjları beklenenden çok daha yüksek demektir. Orijinal yazıdaki 10-20 kat maliyet düşüşünün neyle karşılaştırıldığını merak ediyorum. AWS baz alınmış olabilir mi
SF'yi seven biri olarak isimle ilgili ilginç bir nokta olup olmadığını merak ediyorum. Donanımın gerçekten SF'de bulunup bulunmayacağını, meetup düzenleme ya da müşterileri bir araya getirip etkileşim kurdurma planınız olup olmadığını da merak ediyorum
Henüz Xerces blue gibi yok olmuş değiliz; hâlâ varız
https://en.wikipedia.org/wiki/Xerces_blue
Ama müşterilerimizin önemli bir kısmının burada olacağını düşünüyoruz. SF hâlâ startup kurmak için muhtemelen en iyi yer. Zor teknik problemleri çözen gerçekten çok insan var. SF'de yaşadığım her yerde üst ya da alt katta başka bir startup vardı
Yüz yüze etkinlik düzenlemek de iyi bir fikir
Topluluk varlığı fikri hoşuma gitti. Bu, bir GPU kooperatifinin başlangıcı olabilir mi
https://cloud.vast.ai/host/setup
Rack alanı, VM, container, bağlantı — her şey olabilir. Temelde Twitter'ın 90'ların sonlarındaki colocation sağlayıcılarına gerilemesi gibi
Fark etmeyenler için ekleyeyim: şakaydı
512 adet H100 alacak parayı nasıl bulduklarını merak ediyorum