1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Görüntü, video ve sesi tek bir mimaride birlikte eğiterek üretim, anlama ve eylem tahminini birleştirmeyi amaçlayan çok modlu bir temel model ve Early Access kapsamında ilk olarak FLUX 3 Video ile sunuluyor
  • Görüntülerin uzamsal yapısını, videonun zamansal ve fiziksel dinamiklerini, sesin olay-ses ilişkilerini karşılıklı kısıtlar olarak öğreniyor; Self-Flow temelinde veri ve hesaplama kaynaklarını ölçeklendiriyor
  • Yerel ses içeren videoları tek seferde en fazla 20 saniyeye kadar üretebiliyor; ilk değerlendirmelerde Grok Imagine Video'ya karşı en fazla %69, Runway Gen-4.5'e karşı %77, Luma Ray 3.2'ye karşı %93 oranında tercih edildi
  • Görüntü sentezi ve düzenlemeyi, ayrıca çok dilli metin render etmeyi destekliyor; önceden eğitilmiş video backbone'unu sınırlı görev verisiyle ince ayar yaparak robot eylem modeli olarak da kullanılabiliyor
  • Video·Image·Action ve açık ağırlıklı FLUX 3 Dev sürümleri kademeli olarak yayınlanacak; uzun vadeli hedef, algı, eylem ve dil tahminini tek bir modelde birleştirmek

Gerçekliği birlikte öğrenen çok modlu model

  • FLUX 3, görüntü, video ve sesi birbirinden ayrık unsurlar olarak değil, aynı gerçekliğin farklı sensörlerle gözlemlenmiş çıktıları olarak ele alıyor
    • Görüntü, belirli bir andaki uzamsal yapıyı ve ilişkileri yakalar
    • Video, zaman boyutunu geri getirerek hareketi, zamansal dinamikleri ve fizik yasalarını ortaya koyar
    • Ses, yalnızca görsellikle algılanması zor olan mekanik olayları ve akustiğin nedensel ilişkilerini gösterir
    • Dil, bu algıyı hedefler, soyutlamalar ve talimatlarla bağlar
  • Birden çok modaliteyi birlikte öğrenmek, sesin çarpışmalarla uyumlu olması, hareketin kütleye uyması ve geleceğin geçmişten devam etmesi gibi karşılıklı kısıtlardan yararlanmayı sağlıyor
  • FLUX 3, yalnızca bu ilkelerle kurulan ilk model olarak tanıtılıyor ve fiziksel ile dijital ortamlarda algılayan, öngören ve eyleyen gerçek dünya görsel zekasını hedefliyor
  • İçerik üretimi ve fiziksel AI alanında elde edilen ilk sonuçlar, bu yaklaşımın potansiyelini gösteriyor

Self-Flow tabanlı birleşik mimari

  • Self-Flow, çok modlu üretim ve anlamayı tek bir temel mimaride verimli biçimde hizalamaya yönelik bir yaklaşım
  • FLUX 3, Self-Flow üzerine kurularak hesaplama ve veri kaynaklarını büyük ölçüde genişletiyor ve video, görüntü ve sesi aynı anda eğitiyor
  • Açıklanan karşılaştırmalarda, modalite bazlı üretim hatalarını Flow Matching ölçütünde 100'e normalize eden Fréchet distance ile, ince ayar sonrası 4 görev grubundaki manipülasyon başarı oranı kullanıldı

Video ve yerel ses üretimi

  • FLUX 3, tek bir üretimle 20 saniyeye kadar çeşitli video ve sesler oluşturabiliyor
  • Destek kapsamı şöyle
    • Metinden videoya üretim
    • Başlangıç karesini devam ettiren veya görüntüyü görsel referans olarak kullanan görüntüden videoya üretim
    • Orijinal karakter gibi temel unsurları yeni sahne ya da bağlama taşıyan videodan videoya üretim
    • Girdi video ve sesini devam ettiren üretken video ve ses sürekliliği üretimi
    • Belirlenen sahneler arasındaki geçişi kontrol eden keyframe-to-video üretimi
    • Çok dilli diyalog
    • Geleneksel film formatlarının ötesine geçen çeşitli görsel stiller ve en-boy oranları
    • Ayrı klipleri daha uzun çok çekimli sekanslara bağlayan ajan tabanlı chaining
    • El kamerası görüntülerinden animasyon ve sinema görüntülerine uzanan geniş stil yelpazesi
    • Tipografi üretimi ve animasyon tasarımı
  • Tüm video çıktılarında yerel ses üretimi bulunuyor

İlk video değerlendirmesi

  • Ön değerlendirme, ses içeren 720p 10 saniyelik metinden videoya klipler ile yapıldı
  • Karşılaştırmalı değerlendirmede FLUX 3'ün tercih edilme oranları şöyle
    • Grok Imagine Video'ya karşı en fazla %69
    • Kling v3 Pro'ya karşı %60
    • Happy Horse v1'e karşı %59, Happy Horse 1.1'e karşı %57
    • Seedance 2.0 ve Gemini Omni Flash'a karşı ayrı ayrı %52
    • Runway Gen-4.5'e karşı %77
    • Luma Ray 3.2'ye karşı %93
  • Model ve çevresindeki harness hâlâ geliştirme aşamasında olduğu için sonuçlar ön nitelikte; Early Access sürecinde daha da iyileştirilmesi planlanıyor
  • Şu anda özellikle güçlü olduğu alanlar insan yüz ifadelerini yakalama, fiziksel olaylarla sesleri bağlama ve çok dilli işleme
  • Görsel referansla sahne genelinde karakter tutarlılığını korurken birden fazla klibi birleştirerek dakikalar süren sekanslar oluşturabiliyor
  • FLUX 3 Video Early Access olarak sunuluyor

Görüntü sentezi ve düzenleme

  • FLUX 3, farklı stiller, en-boy oranları ve çözünürlüklerde görüntü sentezleyip düzenleyebiliyor
  • Eğitimin ara aşamasındaki ön değerlendirmelerde, önceki FLUX sürümlerine kıyasla karmaşık prompt işleme ve metin üretme yeteneğinde büyük gelişme görüldü
  • Çeşitli çıktı stilleri üretebiliyor ve birçok dildeki metni yüksek doğrulukla render edebiliyor
  • Değerlendirme sonuçları henüz ön aşamada ve resmi çıkıştan önce ek iyileştirmeler planlanıyor
  • FLUX 3 Image Early Access'in önümüzdeki birkaç hafta içinde başlaması hedefleniyor

Eylem tahmini ve robot öğrenimi

  • Gerçeklik anlayışını eylem tahminine genişletmek için iki yol izleniyor
    • Self-Flow'un ilk çalışmalarını genişleterek FLUX 3'ün içine yerel eylem tahmini entegre etmek
    • Önceden eğitilmiş video backbone'unu dinamikleri anlayan bir temel olarak kullanıp, sınırlı görev verisiyle uzman eylem modellerini ince ayarlamak
  • İlk yaklaşım ortağı mimic robotics ile birlikte FLUX-mimic geliştirildi

Özelliklere göre kademeli yayın

  • Her özellik, sorunsuz yayın, geri bildirim toplama ve sıkı güvenlik testleri için Early Access sürecinden geçerek önümüzdeki haftalar ve aylarda sunulacak
  • Hepsi aynı çok modlu Flow Matching tabanlı modelden türetiliyor
    • FLUX 3 Video: API ve özel ağırlık erişimiyle video ve ses üretimi ile düzenleme
    • FLUX-mimic·FLUX 3 Action: eylem tahmini, mimic robotics ile başlayarak seçilmiş araştırma ve ticari ortaklara sunulacak
    • FLUX 3 Image: API ve özel ağırlık erişimiyle görüntü sentezi ve düzenleme
    • FLUX 3 Dev: video, ses, görüntü içerik üretimi ve eylem tahmini için çok modlu backbone'un açık ağırlıklı sürümü
  • Temel yaklaşımın ek teknik ayrıntıları da daha sonra paylaşılacak; Early Access başvurusu yapılabiliyor

Algı, eylem ve dilin birleşimi

  • Gelecekteki uygulama alanları olarak etkileşimli görüntü ve video düzenleme, simülasyon, bilgisayar kullanımı ve fiziksel AI öne çıkarılıyor
  • Mevcut yetenekler kademeli olarak yayınlanırken bir sonraki nesil model de geliştiriliyor
  • Nihai hedef, algı, eylem ve dil tahminini tek bir birleşik modelde bir araya getirmek

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • Açık ağırlıklı sürümün en iyi performans (SOTA) olmasını bekliyorum
    Önümüzdeki birkaç hafta ila birkaç ay içinde içerik üretimi ve davranış tahmini için çok modlu temel model FLUX 3 Dev'i açık ağırlıklarla sunmayı ve temel yaklaşımın teknik ayrıntılarını da paylaşmayı planladıklarını söylüyorlar

    • Açık ağırlık vaadi sevindirici, ama geçmişte de benzer vaatlerin gerçekleşmediği söylenmişti
      Temel model Dev sürümü olarak gelirse nelerin eksik olacağını da yalnızca gönderiden anlamak zor
  • İnsanları gösteren örnek neredeyse yok, dünya modeli terimini çok rahat kullanmışlar ve 20 saniyelik video iddia ederken aslında sadece jump cut göstermişler
    Sonuçta özeti şu: her şey “yakında paylaşılacak”

    • /r/stablediffusion'da çok sayıda video örneği paylaşılmış
    • Model tabanlı pekiştirmeli öğrenmede kullanılan dünya modeli ifadesi artık doğrusal regresyon kadar basit şeyleri bile kapsayabiliyor gibi görünüyor
      Pekiştirmeli öğrenme alanı da bu terimi davranış biliminden ödünç almış olabilir; o yüzden bunu olduğu gibi kabullenmek daha iyi olabilir. Filozoflar ve görsel sanatçıların nesne yönelimli ifadesini kendi usullerince yanlış kullanmasına benziyor
    • Paylaşım biçimi çok tuhaf olduğundan videoları nerede izlemek gerektiğini merak ettim
  • Buradaki tepki şaşırtıcı derecede olumsuz ve alaycı, ama benim gözüme bu modelin performansı oldukça etkileyici görünüyor
    Olumsuz insanların her zaman en önce kötü yorum bıraktığı da söylenir; ben biraz daha bekleyip göreceğim

    • HN hissiyatını zaman serisi olarak analiz etmek ilginç olabilir
      Son zamanlarda HN'de olumsuz havanın arttığını hissediyorum, umarım bana öyle geliyordur
    • Gerçekten iyi bir model olma ihtimali yüksek, ama Qwen-Image-3'ün LaTeX ile render edilmiş gibi görünen görseller ya da birden fazla öğeyi yan yana veya derinlikli biçimde düzenleme becerisini göstermesinden sonra yalnızca görsel kaliteye odaklanmanın tamamen doğru yön olup olmadığı şüpheli
    • En yeni yüksek performanslı LLM'leri kodlama ve otomasyon aracı yapımında yoğun biçimde kullanıyor, farklı açık kaynakları birbirine bağlayıp yeni projeler oluşturan zahmetli işleri onlara veriyorum
      Uygun çalışma ortamına sahipseniz ve modelin hatalı akıl yürütmeye sapıp sapmadığını ya da ince ama yanlış sonuçlar üretip üretmediğini anlayacak kadar alan bilgisine sahipseniz oldukça iyimserim. Buna karşılık sosyal medyanın korkunç yapay zeka üretimi görsel ve videolarla dolup taşmasını görünce, tamamen sentetik görsel ve video üreticilerinin gerçek hayatta faydalı kullanılma ihtimali konusunda çok daha karamsarım. Milyonlarca insanın eline geçtiğinde topluma faydadan çok zarar için kullanılıyor gibi görünüyor
    • Star Trek'teki holodeck ile kıyaslayınca bu kadar da ilgi çekici değil
    • Martin Scorsese artık danışman olarak yer aldığı için BFL kendisini film yapımcıları için bir laboratuvar olarak konumlandırmayı sürdürecek gibi görünüyor
      Bu video modeli Seedance 2.0 seviyesine yakınsa maliyet çok yüksek olacağından düşük kaliteli içerik üretimine uygun olmaz, daha çok bir projenin VFX hattına girmesi muhtemel
  • Modeline dokunsal veri öğreten bir yer olup olmadığını merak ediyorum
    Robotlardan en çok istediğim şey nesnelere dokunmaları, ama onlara sadece ses, video ve görsel veriliyor; bu yüzden hiç dokunmadığı bir şeyle nasıl temas kuracağını öğrenmesi gerekiyor. Robotların nesnelere dokunurken tereddütlü görünmesinin nedeni de bu olabilir

    • Gerçek dokunsal veri vermektense teması simüle etmek daha hızlıdır ve böylece çok daha hızlı öğrenirler
  • Flux 2 Dev Klein, genel ticari donanımda kullanılabilen modeller arasında fiilen en iyisiydi
    Flux 3'ün de buna karşılık gelen güncel bir açık ağırlık modeli içermesini umuyorum; aksi halde pek çok hobi kullanıcısı için büyük kayıp olur

  • Avrupa çıkışlı yapay zeka projeleri arasında bana ilk kez büyük umut veriyor

  • Freiburg im Breisgau'da işe alım yaptıklarını söylüyorlar; orada yerelden yetenek bulmak kolay mı merak ediyorum

    • Freiburg çok güzel bir yer
      Orada yaşayan bir arkadaşım çevredeki dağlarda yol bisikleti sürüyor, bir diğeri de kışın öğle arasında kros kayağı yapıyor
    • Yakında yaşıyorum; Almanya'nın en güneşli ve manzarası en güzel bölgelerinden biri
      Yetenek havuzu konusunda emin değilim ama bir üniversite var
    • University of Freiburg oldukça tanınmış bir yer
      SF dışındaki startup'ların üniversite şehirlerinde işe alım yapması yaygın bir yöntemdir
    • İnsanların oraya Flyburg im Nicegau demesinin bir sebebi var
    • Bugünlerde ABD'de olmamak, birçok potansiyel aday için tersine bir avantaj olabilir
  • Su basmış odada dans etmeye başlayana kadar bunun gerçek çekim video olduğunu sanmıştım

  • 2.3 sürümü harikaydı; erken erişim alan kişilerin paylaştığı videolar ve değerlendirmeler bu modelin ev kullanımı için yeni en iyi performans olacağını düşündürüyor, o yüzden çok heyecanlıyım

  • Model dünyanın ve olayların seslerini ifade etmeyi öğrenmek zorundaysa, eğlencesine eğitim sürecine gerçek dışı derecede fazla Wilhelm scream eklemelerini isterim

    • Kauçuk contaları fazla sert takarsanız çığlık atabilirler, o yüzden dikkatli davranmak gerekir