1 puan yazan GN⁺ 2024-11-03 | 1 yorum | WhatsApp'ta paylaş
  • Gerçek zamanlı üretken videonun bir oyun gibi girdilere tepki verebilmesi için kare üretim hızı kritik; Oasis, 20fps etkileşimli yapay zeka dünyasını hedefleyerek tanıtıldı
  • Decart ve Etched, fizik, kurallar ve grafikleri ayrı motorlar yerine foundation model çıktısıyla üreten bir açık dünya deneyimi sergiledi
  • Yayınlanan içerik; canlı demo, kod, yerelde çalıştırılabilen 500M parametreli model ağırlıkları ve daha büyük checkpoint tabanlı demolardan oluşuyor
  • Mimari, Transformer tabanlı uzamsal otoenkoder ile latent diffusion omurgasından oluşuyor ve kullanıcı girdisine göre kareleri otoregresif olarak üretiyor
  • Uzak mesafe bulanıklığı, nesnelerin zamansal tutarlılığı, alan genellemesi, envanter kontrolü ve uzun bağlam işleme hâlâ sınırlamalar arasında; model/veri kümesi ölçekleme ve çıkarım iyileştirmeleri gerekiyor

Girdilere Tepki Veren Yapay Zeka Dünyası

  • Oasis, Decart ve Etched tarafından duyurulan gerçek zamanlı açık dünya yapay zeka modeli
  • Kullanıcının klavye girdilerini alarak hareket, zıplama, eşya toplama ve blok kırma gibi etkileşimli deneyimler üretiyor
  • Fizik, kurallar ve grafikler de model çıktısına dahil; ayrı bir fizik motoru olmadan, deneyim yalnızca foundation model ile kuruluyor
  • Paylaşılan kaynaklar şöyle
  • Sonuç örnekleri; inşa etme, ışık fiziği, envanter yönetimi, nesne anlama, hayvan etkileşimi, yemek yendiğinde can yenilenmesi ve küreğin elden daha hızlı çalışması gibi öğeleri içeriyor
  • Üretilebilen ortamlar arasında karanlık uzay benzeri yerler, gece sahneleri, çeşitli nesne yerleşimleri, envanter sandığı açma ve hayvanlarla karakterler bulunuyor
  • Deneyimi metin, ses ve diğer modalitelerle kontrol etmeye yönelik genişleme yönleri de mümkün

Transformer Mimarisi ve Gerçek Zamanlı Çıkarım

  • Model, uzamsal otoenkoder ve latent diffusion omurgasından oluşuyor
    • Her iki bileşen de Transformer tabanlı
    • Otoenkoder ViT tabanlı, omurga ise DiT tabanlı
    • GameNGen ve DIAMOND gibi aksiyon koşullu dünya modellerinden farklı olarak Transformer seçilmesinin nedenleri; istikrarlı ve öngörülebilir ölçeklenme ile Etched'in Transformer ASIC'i Sohu üzerindeki hızlı çıkarım
  • Sora gibi çift yönlü modellerden farklı olarak Oasis, kareleri otoregresif olarak üretiyor
    • Her kare kullanıcı girdisine koşullu olarak üretilebildiği için gerçek zamanlı etkileşim mümkün oluyor
    • Eğitimde, token başına bağımsız gürültü seviyeleriyle denoise yapan Diffusion Forcing kullanılıyor
  • Uzun süre boyunca çıktının doğal kalmasını sağlayan zamansal kararlılık başlıca zorluktu
    • Otoregresif modellerde hatalar birikir ve küçük kusurlar bozuk karelere dönüşebilir
    • Bunu azaltmak için çıkarım sırasında gürültüyü takvime göre ayarlayan dynamic noising kullanılıyor
    • İlk diffusion forward pass aşamasında hata birikimini azaltmak için gürültü enjekte ediliyor, sonraki pass'lerde ise önceki karelerin yüksek frekanslı detaylarını korumak için gürültü kademeli olarak kaldırılıyor

20fps Performans ve Donanım Darboğazı

  • Oasis, gerçek zamanlı çıktıyı 20fps ile üretiyor
    • Benzer DiT mimarisine sahip metinden videoya modeller olan Sora, Mochi-1 ve Runway, birden fazla GPU üzerinde bile 1 saniyelik video üretmek için 10 ila 20 saniye sürebiliyor
    • Gerçek zamanlı etkileşim için her 0,04 saniyede bir yeni kare üretilmesi gerekiyor; bu da 100 kattan fazla daha yüksek hız demek
    • Decart'ın çıkarım yığını sayesinde canlı kare hızıyla çalışmak mümkün oluyor
  • Daha hızlı ve büyük ölçekte maliyet verimli çalışma için yeni donanım gerekiyor
    • Oasis, Etched'in Transformer ASIC'i Sohu için optimize edildi
    • Sohu, 4K çözünürlükte 100B+ yeni nesil modellere kadar ölçeklenebiliyor
    • Oasis'in uçtan uca Transformer mimarisi Sohu üzerinde verimli çalışıyor ve 100B+ parametreli modellerde bile 10 kattan fazla kullanıcıyı destekleyebiliyor

Hâlâ Süren Sınırlamalar

  • Uzak mesafeli görüntülerde bulanıklık, belirsiz nesnelerin zamansal tutarlılığı, alan genellemesi, envanter üzerinde hassas kontrol, nesneler üzerinde hassas kontrol ve uzun zaman aralıklarında sınırlı bellek hâlâ temel sınırlamalar
  • Mimari bileşenler, veri ve model boyutuna dair duyarlılık analizinin ardından, birçok sorunun model ve veri kümesini ölçekleyerek çözülebileceği hipotezi ortaya konuyor
  • Daha büyük modeller geliştirilse bile gecikme ve maliyet dengesini korumak için yeni çıkarım teknikleri gerekecek

1 yorum

 
GN⁺ 2024-11-03
Hacker News yorumları
  • Minecraft’ta rüya görüyor olsaydınız, muhtemelen böyle hissettirirdi
    Nesne sürekliliği eksik olduğu için gerçekten rüya gibi geliyor. Işık seviyeleri de ilginç; karanlık bir yere uzun süre bakarsanız ya da “suya” girip ekran kararırsa siyah ekran dışında başka bir duruma geri dönmek zorlaşıyor. Denediğim bir oynanışta başaramadım. Epey tuhaf bir his.

  • Bu şekilde oyun tasarlayıp yayımlamanın nasıl olacağını pek bilmiyorum. Model ağırlıklarını doğrudan ayarlayarak oyun tasarlayamazsınız
    Bir gün nesne sürekliliği ya da uzun vadeli durum gibi eksik parçalar olmadan oyunları kopyalamak mümkün olabilir; ama çıkarım motorunu çalıştırmanın maliyeti, taklit ettiği oyun motorundan daha pahalı olma ihtimali yüksek. Uzun süredir AI ile uğraşan biri olarak bu teknolojinin nerede işe yarayacağını gerçekten merak ediyorum.

    • Doğru. Bu yüzden bir sonraki modelin temel hedefi, prompt ile yeni dünyaları “kodlayabilme” noktasına gelmek
      Yaratıcıların bu sistemin üzerinde yeni dünyalar veya oyunlar “geliştirmesinin”, kullanıcıların da o dünyalarla etkileşime girmesinin iyi bir yolu ortaya çıkarsa bu araçların inanılmaz yararlı olacağına katılıyorum. Sonuçta oyun motoru gibi bir “API” sunması gerekiyor. Yaratıcı dünyayı kurar, kullanıcı o dünyayla etkileşir. AI gerçekten bu rolü üstlenebilirse 1) “buraya uçan pembe bir fil ekle” demek kadar basit şekilde dünya ve oyun oluşturmak çok daha kolaylaşabilir, 2) her oynanış oturumuna göre değişen dünyalarla kullanıcıların etkileşebilmesi sayesinde gerçekten sonsuz dünyalar mümkün olur. Peki oraya vardık mı? Elbette hayır. Oasis v1 ilk kavram kanıtı; v2 için biraz daha beklemek yeter ;)
    • Elbette bu araç hemen piyasaya sürülebilir bir oyun üretmeyecek. AI’nin daha çok yolu var
      Ama “tasarım” açısından bakınca, çok fazla GPU kullansa bile oyunları hızlıca prototiplemenin ne kadar faydalı olabileceğini görmek zor değil. Bu tür makaleler o yöne giden basamaklardan ibaret.
    • Görsel artefaktlar rahatsız ediciydi. Birilerinin mesh/malzeme, kamera ya da ham OpenGL çağrıları gibi rasterleştirme öncesi oyun motoru çıktıları üzerinde model eğitip eğitmediğini merak ediyorum
      Gerçek bir render motoruna ya da oyun motoruna girdi üreten bir AI, görsel doğruluk sorununu çözebilir gibi görünüyor.
    • Kolay olduğunu düşünüyorum. AI görsellerinde yapılan yöntemin aynısını video oyunu dünya modellerine uygulamak yeter
      Birden fazla modeli birleştirip her oyun “dünya modeli”nden parçalar alarak bir araya getirirseniz, neredeyse tamamen yeni bir oyun yapmak gibi olur. Nesne sürekliliği veya uzun vadeli durum gibi eksik unsurlar çok daha küçük bir değişken kümesiyle eklenebilir. Zaten önceki karenin tamamını ve kullanıcı girdisini ağırlıklara koyuyorsunuz; basitleştirilmiş oyun durumunu da birlikte koyamamak için bir neden yok gibi.
    • Avatar gibi bir filmi alıp bir ölçüde etkileşimli bir deneyime dönüştürmek mümkün olabilir.
  • “Tamamen AI tarafından üretilmiş video oyunu” deniyor ama web sayfasında Ctrl-F ile arayınca Minecraft 0 kez çıkıyor. Nedenini bilmiyorum
    Bu bir video oyunu değil; gerçek bir video oyununun kaba bir kopyası ve adını söylemek ya da kredi vermek için bile çaba göstermemişler.

    • Hukuki sorunlardan kaçınmaya yönelik ilginç bir girişim gibi görünüyor
      “Minecraft” diyememelerinin nedeni bunun Microsoft’un ticari markası olması; ama Minecraft görsellerini eğitim verisi olarak kullanmanın mümkün olduğunu düşünüyorlar gibi. Microsoft dahil herkes kapalı verilerle difüzyon modelleri eğitiyor sonuçta. Çıktının açıkça Minecraft’a benzemesi sorunu var; ama Microsoft’un da Bing ve DALL-E’nin, korumalara rağmen ticari markalı şeylere bariz şekilde benzeyen görseller üretmesi gibi bir sorunu var.
    • Architecture bölümünün ikinci paragrafında Minecraft bir kez geçiyor. “...We train on a subset of open-source Minecraft video data collected by OpenAI[9].” yazıyor
      Bunun ilk yorumdan sonra eklenip eklenmediğini bilmiyorum.
    • Tuhaf. Counter Strike’ı açıkça anan https://diamond-wm.github.io/ ile karşılaştırınca daha da öyle
      Bilimsel bir çalışma bir eserden yararlanıp kredi vermiyorsa bu akademik dürüstlüğe aykırıdır. Başka bir veri kümesiyle de eğitilebilirlerdi; ama hangi kaynağı kullandılarsa onu alıntılamaları gerekir.
    • Modelin herhangi bir ortamı üretebiliyormuş gibi anlatılması, ama demonun sadece en çok veriye sahip oyunu göstermesi garip.
  • Gerçekten harika; bu modellerin hızla gelişmeye devam ettiğini görmek de güzel. Yine de uzun vadeli durumun nasıl işleyeceğini merak ediyorum
    Örneğin bir üs inşa edip daha sonra geri dönmek, geleneksel kodla zorlanan oyun kuralları, çok oyunculu yapı, kayıtlı oyunu yüklemek gibi yönlendirilmiş durumların nasıl ele alınacağını bilmiyorum. Temelde dış durum ile bellek/simülasyon farklı şeyler olduğu için, bunun sadece bağlam penceresini büyütmekle ya da modeli büyütmekle çözüleceğini sanmıyorum. Elbette yardımcı olur. Her hâlükârda bu tür modeller yakında hedef odaklı görevleri hayal etmek için kullanılacak gibi. Örneğin bilgisayarda belirli bir görseli bulması gereken bir ajan, şu an gördüğü durum ile istenen durum arasındaki yolu sürekli hayal edebilir. Bu model kullanıcı girdisi alıyor; ama böyle bir ajan o girdiyi de hayal edecektir. Anladığım kadarıyla bazı robot kontrol ağlarında pikseller olmadan buna benzer şeyler zaten oluyor.

    • Bu demoda durumun izleri bile neredeyse yok. “Sola dön” tuşunu tam bir tur boyunca basılı tutsanız bile başlangıç noktasına geri dönmüyorsunuz
      Birkaç tur döndükten sonra ayrıntılar kayboluyor ve kendinizi bomboş bir denizin ortasında buluyorsunuz. Bu teknolojiyle Minecraft bir yana, Mario’nun oynanabilir bir sürümünü bile asla yapamayacaklar gibi görünüyor.
  • Bu bir video oyunu değil; daha çok her kare arasındaki prompt’un giriş durumu ve önceki kare olduğu hızlı bir Minecraft ekran görüntüsü simülatörü
    Bir miktar tutarlılık benzeri bir şey var.

  • Temelde modeli Minecraft ile eğitmişler. Hiç genel amaçlı değil
    Oyun prompt’tan çıkmış değil; büyük olasılıkla Minecraft oynanışından oluşan dev bir veri kümesinden ve ince ayardan çıkmış. Dünyanın ya da oyunun prompt’tan çıktığı böyle bir çalışma görmek isterim.

    • Yakında çıkacak Oasis v2’yi bekleyin :)
      Bu arada Oasis ekibindeyim.
  • Oynanış sırasında kullanıcının doğrudan frame buffer’a çizim yapmasına izin verip bunu tekrar girdi olarak beslerseniz epey ilginç bir şey çıkabilir.

    • Elle Minecraft çizmek gerçekten zor olacağı için muhtemelen fena halde bozulur.
  • Kuyruk çok uzun olduğu için vazgeçtim. Piksellerin kendisini model mi üretiyor, yoksa yalnızca ortamı üretip “geleneksel” yöntemle mi render ediyor, merak ediyorum.

    • Geleneksel yöntemle render edilen bir ortam üretiyorsa, kısa süre başka yöne baktıktan sonra yeni bir şeyleri yeniden üretmek yerine nesne sürekliliği olması muhtemel olurdu: https://oasis-model.github.io/3_second_memory.webp
    • Tüm pikseller üretiliyor. Kullanıcı eylemi giriyor, pikseller çıkıyor; arada sadece Transformer var :)
      Neden ilginç derseniz, bugün itibarıyla çok ilginç olmayabilir. Oasis v1 sadece bir kavram kanıtı. Ama geleceği, kelimenin tam anlamıyla birkaç ay sonra çıkacak Oasis devam sürümlerini düşününce, şu anda bu mesajı okurken gördüğünüz pikseller dahil gördüğünüz tüm piksellerin üretildiği bir durumu hayal edebilirsiniz. Bu, insan ile makine arasında yeni bir iletişim arayüzü. LLM’lerin sohbette ilginç olmasının nedeni, insanlarla makinelerin insanların alışık olduğu bir biçimde, yani konuşma yoluyla etkileşmesine imkân vermesiyse; burada bilgisayarın dünyayı bizim gördüğümüz biçimde görüp, bize alışık olduğumuz biçimde geri gösterebilmesi söz konusu. Özetle bilgisayara “pembe bir fil oluştur” dediğinizde, bunun oynadığınız oyunda anında belirdiğini hayal edin.
    • Pikselleri üretiyor. Alttaki bulanık UI dahil.
  • Mario oyunuyla bir model eğitip Nintendo’nun “haklı bir dava” uğruna savaşmasını sağlamak gerekebilir.