1 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Black Forest Labs ve mimic robotics, görüntü, video ve sesi birlikte eğiten FLUX 3 omurgasına robot davranışı tahminini ekleyerek Audi üretim sahasında test edilip dağıtılan FLUX-mimic’i geliştirdi
  • Toplam eğitim hesaplamasının %95’inden fazlasını oluşturan video tahmini ile temas, hareket, ağırlık ve nedenselliği öğreniyor; düşük boyutlu robot davranışlarını da aynı fiziksel gerçekliği temsil eden ek bir modalite olarak ele alıyor
  • Davranış tahmini eklendikten hemen sonra video üretim kalitesi en fazla %10 düştü, ancak 3.500 adım sonra önceki seviyesine geri döndü; böylece tek bir omurgayla hem üretim hem de davranış tahmini yapılabildiği doğrulandı
  • Self-Flow ile üretim ve temsil öğrenimini birleştirip hafif bir davranış kod çözücüsü bağlayarak, tek bir NVIDIA RTX 5090 üzerinde omurga işlemede 80 ms’nin altında, toplam robot tepki süresinde ise 101 ms’ye ulaştı
  • Genel amaçlı video ve manipülasyon görevlerini büyük ölçekte öğrenen dünya modeli, az sayıda gösterimle yeni görevlere uyum sağlıyor ve başarısızlıktan sonra yeniden deniyor; böylece esnek parçalar ve hassas manipülasyon gibi mevcut otomasyonun maliyetli olduğu üretim işlerinde kullanılıyor

Tek bir omurgayla içerik üretimi ve robot kontrolü

  • FLUX 1 ve FLUX 2 görüntü üretimine odaklanırken, FLUX 3 görüntü, video ve sesi en baştan birlikte eğiterek görsel-işitsel içeriği ortak biçimde üretiyor
  • Black Forest Labs, FLUX 3’ün erken bir sürümünü mimic robotics ile paylaştı ve iki şirketin robot öğrenimi/dağıtımı ile temel model uzmanlığını birleştirerek FLUX-mimic’i geliştirdi
    • mimic, kendi robotları ve robot öğrenimi, incelikli manipülasyon ve üretim ortamlarına dağıtımdan sorumlu
    • Black Forest Labs, görsel tabanlı modeller ve çok modlu öğrenme/modelleme yetkinlikleri sağlıyor
  • FLUX-mimic, FLUX 3 omurgasına dayalı genel amaçlı manipülasyon için bir video-eylem modeli ve mimic’in uçtan uca dağıtım sistemine entegre edildi
  • Aynı omurga, görüntü, video ve ses içeriği üretirken Physical AI tarafında eylemleri gerçekleştiriyor

Video tahminiyle fiziksel dünyayı öğrenmek

  • FLUX 3 eğitim hesaplamasının %95’inden fazlası video tahmini için kullanılıyor
    • Gerçekçi video üretmek için temas, hareket, ağırlık, neden ve sonuç öğrenilmek zorunda; bunlar yanlış ele alınırsa sonuç video da doğal görünmüyor
    • Dünyayı doğru biçimde render etme süreci, dünyanın nasıl işlediğini öğrenme süreciyle bağlantılı
  • Ses, 720p sesli videoda token’ların %0,5’inden azını oluşturan düşük boyutlu bir modalite
    • Videoyu anlayan bir model, dudak hareketleriyle senkronize konuşmayı ve fiziksel olaylara bağlı ses efektlerinin nedensel ilişkisini öğrenebilir
  • Robot davranışı da görsel gözlemlerle sıkı biçimde birleşmiş düşük boyutlu bir durum temsilidir
    • Davranış, ses ve video kareleri tek bir fiziksel gerçekliğin kısmi temsilleridir
    • Davranış tahmini, ayrı bir temel model oluşturmak yerine mevcut dünya modeline bir gözlem biçimi daha bağlar

Davranış öğreniminden sonra geri kazanılan üretim kalitesi

  • Büyük ölçekli eğitime davranış tahmini eklenince metinden videoya ve görüntüden videoya üretimde insan değerlendirme puanları başlangıçta en fazla %10 düştü
  • Model davranış uzayının yapısını öğrendikçe ve iç dünya temsilini hizaladıkça kalite toparlandı; 3.500 adım sonra önceki video üretim seviyesine ulaştı ve aynı zamanda davranışı da tahmin eder hale geldi
  • Davranışı giriş ve çıkışlara entegre ederken geçici bir karışıklık yaşansa da mevcut yeteneklerin kapasitesi kalıcı olarak feda edilmedi
  • Video üretimi ve davranış tahmini için ayrı temel modellere gerek yok; aynı tek omurga iki görevi de yerine getiriyor

Dünya temsilinden davranışı çözen yapı

  • FLUX-mimic, FLUX 3’ün video üretimi için öğrendiği iç dünya temsilinden robot davranışını çözüyor
  • mimic-video’da ilk kullanılan yönteme göre FLUX’un video tahmini yolundan ara özellikler çıkarılıyor ve bunların üzerinde hafif bir davranış kod çözücüsü eğitiliyor
  • Performans, birbirine bağlı iki unsura bağlı
    • Dünya modeli kalitesi: Dünya nasıl hareket ettiğini anlamıyorsa doğru simülasyon da zordur ve bu, üretim kalitesiyle doğrudan bağlantılıdır
    • Temsil kalitesi: Modaliteler arasındaki nedensellik özellik uzayında doğrusal olmayan biçimde iç içe geçerse davranış kod çözücüsü bunu ham girdiler kadar zor yorumlamak zorunda kalır
  • Üretici model, yüksek kaliteli simülasyon ve hesaplama arttıkça öngörülebilir ölçeklenme yasaları sunar; ancak uzmanlaşmış temsil öğrenimi yöntemlerine göre daha az ayrışmış temsiller üreterek dünya anlayışı gerektiren sonraki görevlerde kullanılabilirliği sınırlayabilir

Self-Flow ile birleştirilen üretim ve temsil öğrenimi

  • Self-Flow, üretim öğrenimi ile temsil öğrenimini tek bir çerçevede birleştirir
  • Uygulandıktan sonra dünya modeli ve temsil kalitesi birlikte iyileşti
    • Video, görüntü ve ses üretim kalitesiyle ölçülen dünya modeli performansı arttı
    • Simülasyon robot kontrol görevlerindeki başarı oranıyla ölçülen temsil kalitesi de iyileşti
  • FLUX 3, Self-Flow’u genişleterek en baştan geniş kapsamlı dünya dinamikleri ve manipülasyon yeteneklerini öğreniyor
    • Genel video içeriği: on milyonlarca saat
    • İnsan ve robot manipülasyonuna odaklanan video içeriği: yüz binlerce saat
  • Bu büyük ölçekli eğitim, laboratuvardaki Self-Flow sonuçlarını gerçek üretim ve lojistik ortamlarına taşıyor

Fabrika görevleri ve benchmark performansı

  • mimic, FLUX-mimic’i gerçek fabrika işlerine dağıttı
    • Parçaları yapılandırılmış tepsilere yerleştirme için kitting
    • Elektronik kontrol ünitelerini toleransı düşük fikstürlere yerleştirme
    • Parça montajı
    • İplik ve kablo gibi yumuşak, esnek malzemelerin taşınması
  • FLUX omurgası tamamen dondurulduğunda bile davranış kod çözücüsü önceki görsel-dil-eylem modellerinden daha yüksek performans gösterdi; önceki modeller bu ayarda görevleri başaramadı
  • Omurga ve davranış kod çözücüsü birlikte ince ayarlandığında FLUX-mimic en üst düzey görev başarı oranına ulaştı
  • Büyük ölçekli eğitim, omurgaya dünya ve davranış hakkında bilgi sağlıyor; Self-Flow ise bu bilginin özellik temsilinden kolayca çözülmesini sağlıyor

Az gösterimle öğrenme ve başarısızlıktan toparlanma

  • Fizik yasaları zaten erişilebilir bir temsilde yer alıyorsa, yeni göreve uyum sağlama süreci dünyanın nasıl işlediğini yeniden öğrenmek yerine belirli bir görevi mevcut bilgiye bağlamaya dönüşür
  • Self-Flow deneylerinde aynı başarı oranına ulaşmak için gereken davranış tahmini eğitim adımları, Self-Flow kullanılmayan video modelinin yarısına indi
  • mimic-video makalesinde video-eylem modeli, görsel-dil-eylem modeline göre en fazla 10 kat daha yüksek örnek verimliliği gösterdi; FLUX-mimic ise bu iki etkiyi birleştiriyor
  • Robot bir nesneyi kavramakta başarısız olursa pozisyonunu düzelterek tekrar kavrayıp işi tamamlayan doğal başarısızlık toparlanması mümkün oluyor
    • Tüm başarısızlık türleri gösterim verisine dahil edilemeyeceğinden, gösterilmemiş toparlanma davranışı dünyanın nasıl işlediğini zaten öğrenmiş modelden geliyor

101 ms’de tepki veren robot sistemi

  • Gerçek ortamlarda modelin ortam değişim hızına uygun hareket etmesi gerekir ve FLUX-mimic’in hesaplama maliyetinin büyük bölümü en büyük bileşen olan omurgadan kaynaklanır
  • İyi yapılandırılmış dünya temsili, aynı performansın daha az parametreyle elde edilmesini sağlayarak daha küçük ve hızlı bir omurganın kullanılmasına olanak tanır
  • Optimize edilmiş omurga, tek bir NVIDIA RTX 5090 üzerinde girdiden dünya temsili üretimine kadar 80 ms’nin altında çalışır; bu, insanın görsel tepki süresiyle aynı ölçektedir
  • mimic, tüm dağıtım yığınında ek gecikmeyi azaltmak için şu unsurları optimize etti
    • Davranış kod çözücüsü
    • Sensör, model ve aktüatörler arasındaki süreçler arası gecikme
    • Tahmin ve yürütmeyi örtüştürerek robotta kesintileri önleyen gerçek zamanlı parçalama
  • Tüm optimizasyonlar uygulandığında bağımsız robot sisteminin nihai tepki süresi 101 ms oldu

Audi üretim sahasında uygulama

  • Audi, yüksek otomasyon seviyesine rağmen esnek parçaları ve hassas manipülasyon görevlerini manuel olarak yürütmeye devam ediyordu
  • Premium ürün üretimi çok sayıda varyanta sahip olduğundan, geleneksel yöntemlerle programlanmış robot hücrelerini her vaka için yeniden tasarlamanın maliyeti yüksektir
    • Öğrenme tabanlı sistemler bu maliyet yapısını değiştirir
  • Audi Production Lab, mimic ile iş birliği yaparak FLUX-mimic’i test edip dağıttı
    • Mevcut robotlarla mümkün olmayan karmaşık yumuşak nesne manipülasyonlarını gerçekleştiriyor
    • Çalışan desteği, verimlilik artışı ve üretim ile lojistikte esnek otomasyonun genişletilmesi için kullanılabilir
  • FLUX-mimic’in örnek verimliliği ve sağlamlığı, göreve özel mühendislikten değil FLUX 3 omurgası ve çözülebilir temsillerinden geliyor; görevler, sektörler ve donanımlar arasında aktarımı destekliyor
  • Tek bir görsel zeka temel modeli, görüntü, video ve ses üretirken aynı zamanda üretim hattındaki robotları çalıştırıyor

1 yorum

 
GN⁺ 3 시간 전
Hacker News görüşleri
  • İyi eğitilmiş bir multimodal video üretim modelinin içinde bir dünya temsili modeli oluşuyor ve bunu çıkarıp robotlara uyguladığınızda da iyi çalışıyor gibi görünüyor.
    Video modelinin maddeyi, ışığı ve dünyayı anladığı fikri yeni değil; ancak bir video laboratuvarının robotik laboratuvarına dönüşmesi nadir görülen bir durumdu. Video üretimiyle ölçeklenip ardından bu yeteneklerle robotları eğitmeye dayalı bir iş rotası olabilir.
    BFL’nin, içine çeşitli cihazlar gizlenmiş gibi duran eli de ilginç. Xiami’nin Robotics-1’i eğitim videolarını standart bir gripper ve gripper biçimli bir eldivenle oluşturuyor; fakat BFL modeli böyle ekipmanlara ihtiyaç duymuyor gibi görünüyor. Donanımın zor olduğu bir alan olduğundan, bundan sonra nasıl bir yaklaşım izleyeceklerini merak ediyorum.

  • 3 dakika 30 saniye civarında robot kolunun üç denemeden sonra pencere pervazını tekrar yerine takması oldukça şaşırtıcıydı. Böyle başarısızlıktan sonra problem çözme örneğini ilk kez görüyorum; bunun yeni bir teknoloji olup olmadığını merak ediyorum.

  • “Dünya anlayışı gerektiren görevlerde daha az ayrıştırılmış temsiller daha az kullanışlıdır” açıklamasında, ‘daha iç içe geçmiş’ kavramını ille de daha az ayrıştırılmış temsil diye ifade eden cümle komik. Gerçek dünyayı anlatırken kavramın kendisini de daha iç içe geçirmek LLM’lere özgü bir ifade gibi görünüyor.

    • Artık temelsiz biçimde her cümlede LLM izi arama noktasına gelindi. Her yazının bir ölçüde LLM yardımı aldığını varsayıp yalnızca çıktının kalitesini değerlendirme zamanı geldi.
    • İnsanlar da sık sık tuhaf cümleler kurar. Hatta bu tür ifadeler eğitim verilerinde nadir olduğundan, bunu LLM’in üretmiş olma ihtimali insana göre daha düşük bile olabilir.
    • Şakaydı.
    • Orijinal metindeki tireler de bu yorumu kesinlikle LLM’in yazdığının kanıtı /s
  • Teknoloji bu kadar gelişmişken filmlerin her zamankinden kötüleşmiş gibi görünmesi üzücü. İyi bir şey bulmak için onlarca yıl öncesinin filmlerini izlediğim oluyor; komik kuklalar kullanmalarına rağmen hikâye kurguları 1.000 kat daha iyiydi.

    • Kimsenin hatırlamadığı kötü eski filmleri izlemediğimiz için ortaya çıkan bir hayatta kalan yanılgısı olabilir.
    • Robin Rombach film yapımını bilmiyor diye BFL’ye yatırım yapmayı reddeder misiniz? Sora bitti ve Bill Peebles’ın film yapımını bilmediğini açıkça söylemeye cesaret edecek birini bulmak da zor.
      Bu yalnızca risk sermayesine özgü bir sorun değil; sözde Hollywood No ile bağlantılı. Tersine, Hollywood No’nun kendisi de sorun olabilir; oyun sektöründe buna toksik pozitiflik deniyor.
  • Avrupalı startup’lar arasındaki iş birliğini görmek sevindirici.

    • Flux, Meta tarafından satın alınmamış mıydı?
  • Bu hem gelecek hem de şimdiden bugün. Lütfen bunu yazılım geliştirme ve mühendisliğin dışında kalan tanıdıklarınızla da paylaşın.

  • Üretim araçlarına sahip olmayan insanların değerinin daha da düşeceği bir krize doğru dosdoğru ilerliyoruz. Kasvetli zamanlar yaklaşıyor gibi görünüyor.