2 puan yazan GN⁺ 2023-07-31 | 1 yorum | WhatsApp'ta paylaş
  • Birden fazla girişim ve araştırma laboratuvarının ortaklaşa GPU kümesi satın alarak büyük model eğitimi için gereken hesaplama kaynaklarını birlikte güvenceye alması
  • Her birinin ayrı ayrı N adet GPU satın alması yerine, K girişimin bir araya gelip N×K ölçeğinde bir kümeyi birlikte satın alması
  • İş zamanlayıcısının, sahiplik payı oranında hesaplamayı adil biçimde dağıtması; boşta kapasite oluşursa bunun ek olarak tahsis edilmesi
  • 128 A100’ü bir ay boyunca tam dolu tutmak yerine, bir hafta boyunca 512 A100’e burst yapabilmek ve modeli daha hızlı eğitmek
  • OpenAI ve Deepmind gibi büyük araştırma laboratuvarlarının yararlandığı burst tahsis modelini girişimlere de sunan bir yapı

Temel fikir

  • K girişimin her birinin ayrı ayrı N GPU’luk küme satın alması yerine, birlikte N×K GPU’luk bir küme satın alması
  • Her girişimin sahip olduğu pay oranında hesaplamayı adil biçimde dağıtmak için bir iş zamanlayıcısı kullanılması
  • Boşta hesaplama kapasitesi oluşursa zamanlayıcının bunu doğrudan tahsis etmesi; böylece şanslı olanların kendi payından daha fazla hesaplama kullanabilmesi
  • 128 A100’ü bir ay boyunca sürekli dolu tutmak yerine, bir hafta boyunca 512 A100’e kadar burst ederek modeli daha hızlı elde etmek
  • OpenAI ve Deepmind gibi büyük araştırma laboratuvarlarının, araştırmacılar için burst tahsisini destekleyen büyük kümelere sahip olması
    • Buna karşılık girişimlerin bugüne kadar çok uzun vadeli sözleşmelerle yalnızca çok küçük kümeler edinebilmesi, aylarca beklemesi ve bu kümeleri sürekli meşgul tutmak zorunda kalması
  • Burst tahsisi ve kısa vadeli sözleşmeleri uygularken H100 başına yaklaşık $2.00 seviyesinin hedeflenmesi
  • Katılmak isteyen girişimlerin başvuru formunu doldurması; sorular için evan@roomservice.dev adresine e-posta gönderilmesi

Katılım, ayrılma ve büyüme

  • Bir hacker house gibi, kümeden ayrılmak isteyenlerin (örneğin kendi kümelerini kurmak için) yerlerini dolduracak birini bulabilmek adına bir-iki ay önceden haber vermesi gerekecek
  • Yeni girişimlerin gruba batch bazında eklenecek olması ve kümeye birkaç ayda bir yeni H100’lerin eklenmesi
  • Hâlihazırda grupta olanların hesaplama kapasitesini büyütmek istemesi durumunda da aynı yaklaşımın geçerli olması
  • Bir miktar overprovisioning düşünülmesi — örneğin bir arkadaş küçük bir deney için birkaç node isterse bunların hemen iyi bir fiyatla verilebilmesi
    • %10 overprovisioning durumunda H100’ün saatlik fiyatının %10 artması

Finans

  • 512 H100’ü 4-6 hafta içinde devreye alabilecek güçlü bir yolun güvence altına alınmış olması
  • Bunun üzerindeki talep gelirse yaklaşık 8 hafta içinde ek H100’lerin sağlanabilmesi
  • Bankalar aracılığıyla küme satın alma maliyetinin iyi koşullarla yayılabilmesi sayesinde, kısa vadeli sözleşmeler ve burst tahsisi korunurken H100 başına $2.00 seviyesinin mümkün olması

Altyapı

  • Altyapı hata ayıklama mailing listesi/Slack paylaşılması; InfiniBand gibi sorunlar çıktığında gruba soru sorulabilmesi
  • Aynı sorun üzerinde daha önce çalışmış olanların birbirine yardımcı olabilmesi

1 yorum

 
GN⁺ 2023-07-31
Hacker News yorumları
  • Başarılı olmasını dilerim. TPU Research Cloud(TRC) 2019'da buna benzer bir şeyi denemişti ve benim başlayabilmemi sağlayan şey de oydu.
    2023'te tek bir TPU'yu bir saatten fazla almak bile zor, ama o zamanlar kelimenin tam anlamıyla yüzlercesini alabiliyordunuz. TRC'ye inanıyordum; ölçeği büyütüp bir TPU kıtası kurarsak sorunun çözüleceğini düşünüyordum, ama sonunda TPU süreleri kurum içi araştırmacılara öncelikli ayrılmaya başladı ve azaldı. Bugün H100 ile GPT'ye satranç öğretmeyi önerseniz alay konusu olacak kadar dünya değişti.
    Bu projede kaybolmamasını umduğum genç bir iyimserlik var; uzun vadede kazanmanın yolu da bu olabilir. Biri saçma bir fikirle H100'ün çok küçük bir parçasını istemeye gelirse kabul etmelerini isterim. Benim bir şey olabilmemin tek nedeni buydu.

    • “Projede genç bir iyimserlik var” sözü şimdiye kadar duyduğum en güzel sözlerden biri. Çerçeveletip duvara asmak isteyeceğim kadar.
      H100'ün küçük bir parçasını isteyen saçma talepleri de elbette kabul etmeyi düşünüyorum.
    • Aslında TPU Research Cloud programı hâlâ gayet iyi işliyor. Hesaplama havuzunu ciddi biçimde genişlettiler; Cloud TPU v4 Pod slice'ları da dahil ettiler ve büyük projeler hâlâ tek seferde yüzlerce çip kullanıyor. TRC kapasitesi kurum içi kullanım için geri çekilmiş değil.
      TRC destekli makalelerin güncel listesine https://sites.research.google/trc/publications/ adresinden bakabilirsiniz.
      Cloud TPU talebi çok güçlü olduğu için preemptible kapasite kullanırsanız kesintileri daha sık görebilirsiniz, ancak rezerve kapasite de mümkün. TRC destek ekibiyle iletişime geçmeniz iyi olur.
    • Şaşırtıcı biçimde, sanırım o ışığı ancak şimdi görmüş oldum. Önceki yazılarda TRC için sadece övgüler görmüştüm; ama daha geç başlayan biri olarak kendi sahip olduğum oyun GPU'su ile çok daha fazla sonuç aldım.
      Karşılaştırma tamamen birebir değil, ama TRC'yi kullanmak çok zordu; TPUv3 erişimim yalnızca bir kez oldu ve temelleri öğrenmeye bile zaman yetmedi. Hangi e-posta adresini kullandığınıza ve Twitter hesabınızın ne kadar tanınır olduğuna göre durumun büyük ölçüde değiştiğini anladım.
    • Benim deneyimim farklıydı. Başvurunun nispeten kolay olduğu düşünülürse hâlâ oldukça cömert olduğunu düşünüyorum. Son 6 ayda çeşitli projeler için v3-8, v3-32 30 gün ve preemptible v3-64 28 gün teklif edildi.
      Akademide olup olmadığını merak ediyorum. Değilsen, bana neden daha cömert davrandıklarını bilmiyorum; benim projelerim de en fazla biraz ilginç sayılırdı. Yine de eskisine göre büyük Pod'lar konusunda çok daha cimri oldukları doğru.
    • Shawn tamamen haklı. Şu anda rekabet o kadar kızışmış durumda ki böyle bir esneklik yok. Tek bir müşteri 512 GPU'yu 3 yıl boyunca alıp götürebilir.
  • “Her biri K adet startup'ın ayrı ayrı N GPU'luk küme satın alması yerine, birlikte NK GPU'luk bir küme alıp hesaplamayı bir iş zamanlayıcıyla dağıtması” teoride AWS, Azure gibi bulut sağlayıcılarının modeline çok benziyor.
    Yapı şu: “Herkesin sabit donanımı ayrı ayrı satın alması yerine, biz devasa bir donanım havuzu alalım ve zaman paylaşımı yaptırıyoruz.” Bulut sağlayıcılarının net marj için fiyatları yükseltmek zorunda olması dışında, böyle bir projeyi gerekli kılacak kaçırdığım başka bir şey var mı merak ediyorum.

    • Esas olarak fiyat ve erişilebilirlik yüzünden.
      Birincisi, genel bulut yatırımcıları belirli bir marj yapısı bekliyor; bu yüzden Lambda veya Fluidstack'in marjlarıyla rekabet etmeleri zor. İkincisi, büyük bulutlar büyük dil modeli eğitimi için gereken ağ tarafında da bir ölçüde dezavantajlı. Bildiğim kadarıyla yalnızca Azure'da InfiniBand var; Oracle 3200Gbps ama InfiniBand değil, AWS'nin de benzer olduğunu düşünüyorum. GCP'den emin değilim ama A100 ağ hızının 1600Gbps değil 100Gbps olduğunu hatırlıyorum. Buna karşılık Lambda, Fluidstack ve CoreWeave'in hepsinde InfiniBand var. Üçüncüsü, Nvidia büyük bulutlara istedikleri kadar ürün tahsis etmiyor.
    • Büyük bulutlar da bunu yapıyor. Tüm büyük bulutlar kısa süreli talep/rezervasyon özellikleri hazırlıyor. Üretken yapay zekadan önce pek işe yarayan bir özellik değildi. Tek bir erişilebilirlik bölgesinde 48 saat boyunca 1000 CPU node'u istemek ne kadar sık olurdu ki?
      İkinci olarak, burada kaynak paylaşımıyla ilgili temel bir sorun var. Evan ve AI Grant'in bu projesinde de bir ekip tüm kümeyi sürekli kaplayacak paraya sahipse neden buna izin verilmesin sorusu ortaya çıkıyor. Sorun, adil kullanımın tam ölçütünün ne olduğu. Ağlarda TCP fairness gibi bant genişliği paylaşım algoritmaları var, ama bu tür büyük parça işler için pek uygun değiller.
      Önümüzdeki birkaç ay içinde AWS ve benzerleri, hesaplama parçalarını geçici olarak tahsis eden bir kuyruk servisi çıkarmaya çalışacak; muhtemelen ön ödeme ve yüksek maliyet gerektirecek. On-demand fiyatlardan bile pahalı olabilir.
    • AWS ve Azure, müşterilerin instance'ları havuzlayıp maliyet düşürmesinin bir yolunu yapmak yerine kendi boğazlarını kesmeyi tercih eder.
      Bu havuzlamayı kendileri yaparlar; müşteri ilişkisini ve kârı aracıya ya da müşteriye bırakmak istemezler.
  • CA'daki birkaç colocation tesisinde altyapı işletmiş biri olarak, mümkünse başka bir yere koymak daha iyi. Kaliforniya elektrik maliyeti ve diğer altyapı giderleri AZ veya NV'den çok daha yüksek.

    • Ucuz elektrik ve CAD-USD kur avantajı da düşünülünce Montreal uygun görünüyor.
    • GPU hesaplama maliyetinde elektriğin çok küçük bir payı var gibi görünüyor.
  • “Dünyadaki hiçbir bulut sağlayıcısı yalnızca birkaç hafta için 100 bin dolarlık hesaplama vermez” cümlesini gördüm; çok büyük ölçekli hesaplama satın almış değilim ama bunun bulutun özü olduğunu düşünürdüm.

  • https://lambdalabs.com/ ile farkının ne olduğunu merak ediyorum

    • Biz orta ölçekli hesaplama işlerini sıfır marjla işletme tarafındayız. Amacımız Fortune 500 şirketlerine satmak değil, yüksek lisans/doktora öğrencilerinin 50 bin dolarlık araştırma bütçesini kullanabilmesini sağlamak
      Şu anda birkaç A100/H100 bulmak oldukça kolay ve Lambda da bu kullanım için harika. Ama 24 veya daha fazlasını makul bir fiyata, kabaca saatlik 2 dolara bulmak çok zor. H100 üzerinde sadece 8 saatlik eğitim çalıştırmak isteseniz bile çoğu zaman 6 aydan uzun taahhüt isteniyor
      GPU aracılarının uzun vadeli rezervasyonları tercih etmesi iş açısından mantıklı bir karar; biz de onların yerinde olsak öyle yapabilirdik. Ama bizim hedefimiz farklı. İsyancıları silahlandırmak istiyoruz. BigCorp olmayan birilerinin de model eğitebilmesini istiyoruz
    • Fiyatlar çok benzer, ama model oldukça farklı görünüyor. Önemli fark, birden fazla GPU üzerinde sık sık kısa eğitimler çalıştırmanız gereken durumlar olabilir. Lambdalabs şu anda hemen 256 instance veremeyebilir
      Orijinal yazıdaki yöntem, 512 GPU'luk kümenin iş kuyruğuna iş koyma hakkını satın almaya daha yakın; dolayısıyla 256 GPU gerektiren işler de sorun olmaz. Ancak 512 GPU'luk bir iş çalıştıran birinin arkasında beklemek gerekebilir
      Lambdalabs'ın gerçek kapasitesinin ne olduğunu bilmiyorum. Orada 2-3'ten fazla instance ayağa kaldırmanın ne kadar kolay olduğunu bilen var mı merak ediyorum
    • Genelde uzun vadeli reserved instance taahhüdü vermediğiniz sürece H100'lerden aynı anda yalnızca birkaç tane alabiliyorsunuz
    • Taahhütsüz büyük bir blok elde etmenin pratik bir yolu yok. Hatırladığım kadarıyla H100 için minimum taahhüt 64 GPU, 3 yıl ve yaklaşık 3 milyon dolardı
    • H100 için saatlik 2 dolar daha esnek görünüyor, ama böyle bir servisten 10 bin GPU-saat aldığım olmadı. Muhtemelen darboğaz o noktada olabilir
  • Kişisel olarak yapay zekaya çok ilgi duyuyorum ve birkaç yıldır bu alanın içindeyim, ama şu anki gibi bir GPU kıtlığı görmedim. Hobi olarak makine öğrenmesi denemek isteyenlere vast.ai'ı şiddetle tavsiye ederim

    • Ek bulut seçenekleri olarak H100 ve A100 için Lambda, Fluidstack, RunPod, CoreWeave, Crusoe, Oblivus, Latitude var
      A100/H100 dışındaki GPU'lar için vast, TensorDock ve RunPod da var
    • Hobi kapsamını nasıl gördüğünüze bağlı, ama araçları ve kavramları öğrenmek için T4'ü birkaç dakikalığına çalıştırmada modal.com oldukça iyiydi
      Şu anda AWS ve GCP'yi yeniden satıyorlar ve A100 de var, ama şimdilik T4 yeterli
    • vast.ai, GPU'lar için gig economy tarzı bir pazar yerine daha yakın. Az önce ilk makineyi kullandım; iyi çalıştı, 512 GB RAM, 256 AMD CPU, A100 GPU vardı ve 0,05 dolarla yaklaşık 4 dakika kullandım. O tutar da ücretsiz verilmişti
  • AWS/GCP/Azure'da ek yük olduğunu ve birçok şirketin operasyonda bare metal seçmesinin nedenini anlıyorum. Kişisel olarak zaman ve emek harcamaya değen durumların nadir olduğunu düşünüyorum, ama ölçek büyükse tasarrufun ciddi olabileceğini kabul ediyorum
    Ancak yapay zeka eğitimi tarafında da genel bulutlar ani talep artışlarında rekabetçi değilse, marjları beklenenden çok daha yüksek demektir. Orijinal yazıdaki 10-20 kat maliyet düşüşünün neyle karşılaştırıldığını merak ediyorum. AWS baz alınmış olabilir mi

    • AWS'in p5.48xlarge'ı 8 H100 için saatlik 98,32 dolar; yani H100 başına saatlik 12,29 dolar. Kabaca 6 kat fiyat
  • SF'yi seven biri olarak isimle ilgili ilginç bir nokta olup olmadığını merak ediyorum. Donanımın gerçekten SF'de bulunup bulunmayacağını, meetup düzenleme ya da müşterileri bir araya getirip etkileşim kurdurma planınız olup olmadığını da merak ediyorum
    Henüz Xerces blue gibi yok olmuş değiliz; hâlâ varız
    https://en.wikipedia.org/wiki/Xerces_blue

    • Donanımı SF'de tutmayı planlamıyoruz. Çünkü en ucuz veri merkezi alanı orası değil
      Ama müşterilerimizin önemli bir kısmının burada olacağını düşünüyoruz. SF hâlâ startup kurmak için muhtemelen en iyi yer. Zor teknik problemleri çözen gerçekten çok insan var. SF'de yaşadığım her yerde üst ya da alt katta başka bir startup vardı
      Yüz yüze etkinlik düzenlemek de iyi bir fikir
  • Topluluk varlığı fikri hoşuma gitti. Bu, bir GPU kooperatifinin başlangıcı olabilir mi

    • Tüketici kartları için bunun benzeri zaten var. vast.AI ile kendi GPU'nuzdan para kazanabilirsiniz
      https://cloud.vast.ai/host/setup
    • Twitter'ın iç altyapısı hakkında hiçbir fikrim yok, ama reklam gelirindeki düşüş, kullanıcı etkileşimindeki azalma ve Threads'e geçiş gibi durumlara bakınca Twitter'ın altyapısının bir kısmını bu tür startup'ları desteklemek için kullanabileceğini düşünüyorum
      Rack alanı, VM, container, bağlantı — her şey olabilir. Temelde Twitter'ın 90'ların sonlarındaki colocation sağlayıcılarına gerilemesi gibi
      Fark etmeyenler için ekleyeyim: şakaydı
  • 512 adet H100 alacak parayı nasıl bulduklarını merak ediyorum

    • Yazının ilk cümlesinde açıkça belirtildiği gibi, bunlar yeni yatırım yaptıkları startup'lar için bunu yapan VC yatırımcıları ve başka katılımcılar da arıyorlar