1 puan yazan GN⁺ 2024-12-10 | 1 yorum | WhatsApp'ta paylaş
  • TRELLIS, metin veya görüntüyü koşul olarak alıp 3D varlıklar oluşturan bir üretici model; birleşik gizil temsil SLAT ile Rectified Flow Transformers’ı bir araya getirerek kaliteyi ve çıktı esnekliğini artırıyor
  • SLAT, seyrek 3D grid ile çoklu görünüm görsel özelliklerini birlikte barındırarak geometriyi ve dokuları temsil ediyor; Radiance Fields, 3D Gaussians ve meshes biçimlerine decode edilebiliyor
  • En fazla 2 milyar parametreli modelin 500 bin 3D varlıktan oluşan bir veri kümesiyle eğitildiği ve benzer ölçekteki en yeni yöntemler dâhil önceki yaklaşımlardan daha yüksek kalite sunduğu belirtiliyor
  • Metin-3D ve görüntü-3D üretiminin yanı sıra mevcut 3D varlıkların varyasyon üretimini ve yerel bölge düzenlemeyi destekliyor; kol kaldırma, silah ekleme, bacak değiştirme gibi işlemler gösteriliyor
  • Yayınlanan materyaller akademik ve araştırma amaçlarıyla sınırlı; internet tabanlı veri kümelerinden kaynaklanan potansiyel önyargılar ve gerçekçi gerçek dünya nesneleri üretmedeki sınırlamalar sürüyor

TRELLIS’in hedefi ve kapsamı

  • TRELLIS, ölçeklenebilir ve çeşitli 3D üretimi hedefleyen yerel bir 3D üretici modeldir
  • Proje sayfası TRELLIS’in tek resmi web sayfasıdır ve çalışma CVPR 2025 Highlight olarak belirtilmiştir
  • Metin veya görüntü koşullarından yüksek kaliteli 3D varlıklar oluşturmak, çeşitli çıktı formatları ve düzenleme işlevleri sunmak temel hedeftir
  • Kod, model ve veriler yayımlanacaktır

Structured LATent(SLAT) temsili

  • SLAT, yüksek kaliteli ve çok amaçlı 3D üretim için birleşik bir 3D gizil temsildir
  • Nesne yüzeyiyle kesişen aktif voxel’lerde (active voxel) yerel gizil vektörler tanımlar
  • Yerel gizil vektörler, 3D varlığın birden fazla görünümden yoğun biçimde render edilmesinin ardından görüntü özelliklerinin birleştirilip işlenmesiyle encode edilir
  • Bu özellikler önceden eğitilmiş bir görsel encoder’dan gelir; aktif voxel’lerin sağladığı kaba yapıyı tamamlayarak ayrıntılı geometriyi ve görsel özellikleri yakalar
  • Farklı decoder’lar uygulanarak SLAT birden fazla 3D temsile dönüştürülebilir
    • Radiance Fields
    • 3D Gaussians
    • meshes

Üretici model mimarisi ve eğitim

  • TRELLIS, SLAT üzerine kurulu büyük bir 3D üretici model ailesidir; metin prompt’larını veya görüntüleri koşul olarak kullanır
  • Üretim pipeline’ı 2 aşamaya ayrılır
    • Önce SLAT’in seyrek yapısı üretilir
    • Ardından boş olmayan hücrelerin gizil vektörleri üretilir
  • Omurga model Rectified Flow Transformers’tır ve SLAT’in seyrekliğini işleyecek şekilde uyarlanmıştır
  • Eğitim ölçeği en fazla 2 milyar parametredir ve 500 bin çeşitli 3D nesneden oluşan büyük ölçekli bir veri kümesi kullanır
  • Çıktılar ayrıntılı geometriye ve canlı dokulara sahip 3D varlıklardır; önceki yöntemlerin belirgin biçimde önünde olduğu belirtilir

Üretim, düzenleme örnekleri ve çıktı formatları

  • Metin-3D örnekleri GPT-4 tarafından oluşturulan metin prompt’larını kullanır
    • Vintage bakır çevirmeli telefon
    • Kırmızı çatılı ve çitli iki katlı tuğla ev
    • Taş kaide üzerindeki parlayan küre
    • Altın ve gümüş tasarımlı küresel robot
  • Görüntü-3D örnekleri DALL-E 3 tarafından oluşturulan görüntü prompt’larını kullanır
  • Sayfadaki görünüm ve geometri sırasıyla 3D Gaussians ve meshes üzerinden render edilir
  • GLB dosyası, 3D Gaussians görünümünün mesh’e bake edilmesiyle çıkarılır
  • Verilen bir 3D varlık için metin prompt’uyla tutarlı varyasyonlar üretilebilir
    • Metalik doku ve turuncu-beyaz boya kaplaması
    • Yeşil-mor renkte, örgü kumaşa benzer doku
    • Deri kayışlar ve mavi vurgulara sahip, ortaçağ silahı tarzında metalik doku
    • Şeffaf cam benzeri yüksek teknoloji yapısı
  • Yerel manipülasyon, belirli bir bölgeyi metin veya görüntü prompt’una göre düzenler
    • İnsansı savaş mecha’sından kol kaldırma
    • Devasa ışın silahı ekleme
    • Bacakları paletli şasiyle değiştirme
  • Üretilen 3D varlıklar birleştirilerek karmaşık ve canlı 3D art design oluşturulabilir

Araştırma amacı ve sınırlamalar

  • TRELLIS tamamen bir araştırma projesidir
  • Kullanılan veri kümesi halka açık bir veri kümesidir ve kişisel tanımlayıcı bilgi veya zararlı içerik içermemesi için incelenmiştir
  • Veri kümesi internetten toplandığı için potansiyel önyargılar kalmış olabilir
  • Mevcut model, sanatsal tarzdaki 3D varlıkların üretiminde güçlüdür
  • Gerçekçi gerçek dünya nesneleri üretme becerisi sınırlıdır
  • Sayfadaki materyaller yalnızca metin-3D ve görüntü-3D üretim teknolojilerini keşfetmeye yönelik akademik ve araştırma amaçları için sunulmaktadır
  • Ticari değerlendirme veya kullanım amaçlanmamıştır
  • İlgili makale, arXiv preprint’i Structured 3D Latents for Scalable and Versatile 3D Generation’dır

1 yorum

 
GN⁺ 2024-12-10
Hacker News görüşleri
  • Vay canına, gerçekten inanılmaz ama yapay zeka üretimi içerik görünce ilk kez midemin bulandığını hissettim
    O kadar iyi yapılmış ki, ruhsuz ama çok yüksek kaliteli seri üretim asset'ler gibi görünüyor; bu da içime bir hüzün çökertiyor
    Başarının kendisini küçümsemeye çalışmıyorum; aksine, elle yapılmış asset'lerin sonunu haber veriyor gibi hissettiriyor
    Sanatçılara acıdığımdan değil; daha çok, bir şeyin insan eliyle yapılmış olması özelliğini istediğim için kendime üzülüyorum
    Prosedürel üretim oyunlarını pek sevmememin nedeni de aynı. Birinin zihninden çıkmış bir dünyada yürümek istiyorum; belirli bir nedeni olmadan var olan prosedürel üretilmiş bir dünya isteseydim, dışarı çıkıp yürüyebilirdim
    İçerik ya da kurcalanacak eşya yığınları değil, çağdaş insanların kendi vizyonlarını, fikirlerini, değerlerini, içgörülerini ve kişiliklerini katarak bir amaçla yaptığı sanat eserleri istiyorum. Mutlaka bu kadar iyi görünmesi gerekmiyor; amaçla yapılmış olması yeterli

    • Şöyle de düşünülebilir. Artık AAA oyunlar yalnızca “grafikleri müthiş” diyerek farklılaşamayacak
      Açıkçası son çıkan yeni oyunların çoğu, aynı oynanışın sadece grafikleri yenilenmiş hâline oldukça yakın
      Ama yakında ben de böyle şeyler yapabilir hâle geleceksem, büyük stüdyoların bizi geri döndürmek için ne hazırlayacağını merak ediyorum
    • “Belirli bir nedeni olmadan var olan prosedürel üretilmiş bir dünya isteseydim dışarı çıkarım” sözü, birkaç yıl önce açık havada egzersize başladığım zamanı hatırlattı
      Ondan önce neredeyse hiç dışarı çıkmıyor, görece karanlık bir odada kalıyordum; bir gün gökyüzüne bakıp “Vay, bu bulutlar Horizon ya da Assassin's Creed gibi oyunlardaki bulutlara benziyor” diye düşünmüştüm
      Asset'lere bakınca da biraz hüzünlendim. “Kırmızı çatısı ve çiti olan iki katlı tuğla ev”i görünce three.js'in animasyon/keyframe örneği aklıma geldi
      three.js örneği bir insan tarafından elle yapılmıştı ve her seçimin arkasında gerçek bir niyet vardı; Trellis ise sanki internet ve oyunlarda bulunan işlerin bir karışımı, sadece “puf, işte burada” gibi görünüyor
      Yapay zekayla bazı değerler kaybolacak; ama bu yüzden el yapımı içerik daha da değerli hâle gelebilir. Yine de o değeri, sanatçıların sürdürülebilir şekilde yaşayabileceği kadar yeterince takdir edip etmeyeceğimiz şüpheli
      https://threejs.org/examples/#webgl_animation_keyframes
    • Oyun geliştiricilerinin hatırı sayılır bir kısmı seviye tasarımından nefret eder; prosedürel üretim kullanmamalarının nedeni de bunun zor olması, bu yüzden elle yapılmış dünyaları zorla inşa etmeleridir
      Ben de o taraftayım; biri oyunumu oynarken seviyelerin zihnimden “fışkırdığını” düşünse epey komik olurdu. Sanki derin bir sanatçıymışım gibi
      Oyun geliştirmenin başka kısımlarıyla büyük gurur duyuyorum ama seviye tasarımım bunlardan biri değil
    • Bu teknoloji yüzünden insanların rekabet alanının temelden değişeceğini sanmıyorum
      Yaygın kullanılmaya başladığında düşük kaliteli seri üretim işler yağacak; ama bir amaçla bir şeyler üretmek isteyen gerçek sanatçılar, bu teknolojiyi daha büyük bir şeye giden basamak olarak kullanmayı öğrenecek
      Martin Nebelong gibi insanlara bakınca, insanı döngünün içinde tutarak yapay zekadan yararlanmayı öğreniyorlar
      https://x.com/martinnebelong?s=21&t=cTpE-rRbCiocUlN0VaSheQ
    • 3D asset yapmayı bilmeyen biri için gerçekten iyi bir prototipleme aracı
      Unreal Blueprints gibi görsel betikleme araçlarının, programlamaya aşina olmayan insanlara oyun geliştirme ve modlamanın kapısını açmasına benziyor
      Bu yüzden Blender ya da Maya gibi araçları öğrenmeden prototipe koyacak modeller elde edilebiliyorsa bu iyi bir şey. Biraz tutarsız ve tuhaf görünse bile en azından içerik oluşuyor
  • Vay, sonuçlar harika. Uzman değilim ama ilk NeRF demosu çıktığından beri herkesin düşündüğü şeyin bu olduğunu sanıyorum
    Araştırırken, 5 yıl önce bunu umarak yazdığım bir yorumu da buldum: https://news.ycombinator.com/item?id=22642628
    Bir sonraki adım, modelin pivot yapabileceği veya dönebileceği “düğümleri” 3D görüntüye otomatik olarak eklemek. Böylece isteğe bağlı animasyon ve etkileşimli içerik hemen ortaya çıkar
    Çocukluk fotoğraflarını koyup anıları yeniden canlandırabilir, sevdiğiniz birinin ses örneğini ekleyip onun sizinle konuşmasını sağlayabilirsiniz. Daha fazla sürükleyicilik için gürültü engelleyen kulaklık takıp VR'a girmeniz yeterli
    Çok yakında! “Surrender Reality” bekleme listesine katılmak için buraya tıklayın

    • Bir sonraki adım, animasyon ve düzenleme yapılsa bile mesh'in bozulmayacağı daha kaliteli mesh topolojisine sahip modeller üretmek
      Çok retopoloji yaptım; bu modelleri olduğu gibi rig'lerseniz gölgeleme ve deformasyon sorunları her şekilde ortaya çıkar. Animasyon yapmasanız bile yakından bakınca üçgenleme epey belirgin
      Yine de yüksek kaliteli 3D varlık üretimi çok yakın gibi. Burada görülen yaklaşıma tahmini yön alanları ve özellik algılamaya dayalı yapay zeka dörtgen remeshing'i eklemek yeterli; bu alan da ürkütücü derecede iyiye gidiyor
    • Sezgisel olarak 3D motor ile bu teknolojinin birleşimi, doğrudan gizil uzaydan rasterleştirilmiş video render eden mevcut yaklaşımdan daha iyi bir çözüm gibi geliyor. Tesadüfen Sora da bugün çıktı
      Mesh'leri rig'lemek ve animasyonlamak, rastgele bir videonun tüm sahnesini “dijital ikiz” olarak kuracak şekilde ağı eğitmek gerçekçi olmayabilir
      Yine de böyle bir kurulum mümkün olursa, geri kalanını aynı bırakarak üretilen video üzerinde çok daha ince ayarlı kontrol sağlanabilir gibi
    • Burada bahsedilen “düğüm”ün tam olarak ne olduğunu pek bilmiyorum. Keyfi döndürme ya da yakınlaştırma/uzaklaştırma, yalnızca lazy susan veya dönüp duran Exorcist kafası istediğinizde teoride iyi görünür
      Bir sonraki adım muhtemelen daha düzgün simetrik topoloji, daha iyi UV haritaları ve kolay animasyon için otomatik rigging'e (FK/IK) daha yakın olur
    • Bunun oyun geliştirme stüdyolarındaki 3D sanatçıları nasıl etkileyeceğini merak ediyorum
      Stüdyolar bu tür araçları kullanırken sanatçıları tutup daha fazla içeriği daha hızlı ve kolay üretmelerini mi sağlayacak, yoksa yalnızca bir kısmını bırakıp kalan %80'i azaltarak bu araçla mı değiştirecek
    • Yalnızca isteğe bağlı animasyon ve etkileşimli içerik için değil, statik görüntü render'lama için de faydalı
      Şimdiye kadar yapay zekanın ürettiği 2D görüntülerde ışıklandırma da yanlış, hata da çok. Bir kez 3D sahneye dönüştüğünde ve Blender gibi ücretsiz bir araçla render edildiğinde ışıklandırma doğru ve ayarlanabilir hale gelir; hatalı ayrıntıları düzeltmek de kolaylaşır
      Zaten inanılmaz derecede güçlü araçlar var ve buradan sonra çok daha hızlı güçlenecekler gibi
  • Mükemmel değil ama şimdiye kadar kullandığım çoğu 3D model üreticisinden çok daha iyi
    Öncekilerde sonuçlar inanılmaz derecede kötüydü; bu sefer ortalamanın üstüne çıktı
    Şimdi tek gereken, Orca Slicer'a doğrudan koyabileceğim bir dosya biçimi vermesi

  • Etkileyici. layer diffusion ile böyle low-poly bir zeplin yaptım: https://image.non.io/b3f843be-b1b4-468a-a0ec-9d58b191beee.we...
    Sonuç şöyle: https://video.non.io/video-2732101706.mp4
    Açıkçası hiç fena değil ve oyun varlığı olarak kullanılabilecek noktaya yaklaşıyor

  • Wikipedia'daki F-117 stealth uçağı görselini denedim ama çıktı tamamen başarısızdı
    Proje sayfasındaki örneklerin nasıl üretildiğini anlayamadım; temel silüet bile tamamen yanlıştı
    Farklı açılardan çekilmiş görüntüler yükleyip düzeltme yapabilmeyi ummuştum ama böyle bir özellik yok gibi

    • F-117 sıra dışı görünümlü. Aslında neye benzediğini bilmiyorsanız, belirli bir açıdan tek bir görüntüye bakıp çıkarım yapmak insanlar için bile epey zor
      Veri kümesinde yoksa bu kadarı mazur görülebilir. Özellikle köşeli formu yüzünden uçak olmadığını sanması da kolay görünüyor
      Model kalitesinin geneli hakkında konuşmuyorum; F-117 neredeyse kesinlikle adil olmayan bir test olur
  • Birkaç gün önce de paylaşıldığını gördüm ama çok etkileyici bir demo olduğu için burada tartışılmasını isterim
    https://news.ycombinator.com/item?id=42342557

  • Potansiyel var ama koyduğum görüntüler eğitim dağılımının çok dışında kaldığından olsa gerek, yalnızca garip düz plakalar üretti

    • Karakterlere veya nesnelere yukarıdan bakan, izometrik oyun benzeri görüntülerde iyi çalışmasını sağlayabildim
      Önden bakan görüntüler kullanınca hepsi düz sonuç verdi
    • Bir başka mucizevi araç. Ta ki kendiniz test edene kadar
  • Görüntüye göre çok değişiyor ama hayvan kürkünü poligon mesh ve şeffaf dokuların yerinde bir kombinasyonuyla yeniden üretmesi gerçekten şaşırtıcıydı
    Sayfadaki örnekler de bu yeteneği göstermiyordu
    https://imgur.com/a/qJp4HNX

  • AlphaFold, tek boyutlu protein diziliminden 3D üreten bir model ve iç veri temsili gösterişli ve karmaşık
    Buna karşılık bu makalenin temelde girdi verisini voksele dönüştürüp çok sayıda farklı açıdan fotoğraf çekerek eğitim seti oluşturması ilginç

  • Bunu kullanarak yapay zeka üretimi bir görüntüden 3D baskıya gidebildim. Adımları burada özetledim: https://x.com/ryanlanciaux/status/1866163343788007619

    • Gerçekten gelecek gibi. Metinle bir görüntü oluşturup onu evde fiziksel bir nesneye dönüştürebiliyorsunuz; ama bu süreci açıklayan düz metin ve görseller, bozuk bir site yüzünden okunamıyor