- Görüntü, video ve sesi tek bir mimaride birlikte eğiterek üretim, anlama ve eylem tahminini birleştirmeyi amaçlayan çok modlu bir temel model ve Early Access kapsamında ilk olarak FLUX 3 Video ile sunuluyor
- Görüntülerin uzamsal yapısını, videonun zamansal ve fiziksel dinamiklerini, sesin olay-ses ilişkilerini karşılıklı kısıtlar olarak öğreniyor; Self-Flow temelinde veri ve hesaplama kaynaklarını ölçeklendiriyor
- Yerel ses içeren videoları tek seferde en fazla 20 saniyeye kadar üretebiliyor; ilk değerlendirmelerde Grok Imagine Video'ya karşı en fazla %69, Runway Gen-4.5'e karşı %77, Luma Ray 3.2'ye karşı %93 oranında tercih edildi
- Görüntü sentezi ve düzenlemeyi, ayrıca çok dilli metin render etmeyi destekliyor; önceden eğitilmiş video backbone'unu sınırlı görev verisiyle ince ayar yaparak robot eylem modeli olarak da kullanılabiliyor
- Video·Image·Action ve açık ağırlıklı FLUX 3 Dev sürümleri kademeli olarak yayınlanacak; uzun vadeli hedef, algı, eylem ve dil tahminini tek bir modelde birleştirmek
Gerçekliği birlikte öğrenen çok modlu model
- FLUX 3, görüntü, video ve sesi birbirinden ayrık unsurlar olarak değil, aynı gerçekliğin farklı sensörlerle gözlemlenmiş çıktıları olarak ele alıyor
- Görüntü, belirli bir andaki uzamsal yapıyı ve ilişkileri yakalar
- Video, zaman boyutunu geri getirerek hareketi, zamansal dinamikleri ve fizik yasalarını ortaya koyar
- Ses, yalnızca görsellikle algılanması zor olan mekanik olayları ve akustiğin nedensel ilişkilerini gösterir
- Dil, bu algıyı hedefler, soyutlamalar ve talimatlarla bağlar
- Birden çok modaliteyi birlikte öğrenmek, sesin çarpışmalarla uyumlu olması, hareketin kütleye uyması ve geleceğin geçmişten devam etmesi gibi karşılıklı kısıtlardan yararlanmayı sağlıyor
- FLUX 3, yalnızca bu ilkelerle kurulan ilk model olarak tanıtılıyor ve fiziksel ile dijital ortamlarda algılayan, öngören ve eyleyen gerçek dünya görsel zekasını hedefliyor
- İçerik üretimi ve fiziksel AI alanında elde edilen ilk sonuçlar, bu yaklaşımın potansiyelini gösteriyor
Self-Flow tabanlı birleşik mimari
- Self-Flow, çok modlu üretim ve anlamayı tek bir temel mimaride verimli biçimde hizalamaya yönelik bir yaklaşım
- FLUX 3, Self-Flow üzerine kurularak hesaplama ve veri kaynaklarını büyük ölçüde genişletiyor ve video, görüntü ve sesi aynı anda eğitiyor
- Açıklanan karşılaştırmalarda, modalite bazlı üretim hatalarını Flow Matching ölçütünde 100'e normalize eden Fréchet distance ile, ince ayar sonrası 4 görev grubundaki manipülasyon başarı oranı kullanıldı
Video ve yerel ses üretimi
- FLUX 3, tek bir üretimle 20 saniyeye kadar çeşitli video ve sesler oluşturabiliyor
- Destek kapsamı şöyle
- Metinden videoya üretim
- Başlangıç karesini devam ettiren veya görüntüyü görsel referans olarak kullanan görüntüden videoya üretim
- Orijinal karakter gibi temel unsurları yeni sahne ya da bağlama taşıyan videodan videoya üretim
- Girdi video ve sesini devam ettiren üretken video ve ses sürekliliği üretimi
- Belirlenen sahneler arasındaki geçişi kontrol eden keyframe-to-video üretimi
- Çok dilli diyalog
- Geleneksel film formatlarının ötesine geçen çeşitli görsel stiller ve en-boy oranları
- Ayrı klipleri daha uzun çok çekimli sekanslara bağlayan ajan tabanlı chaining
- El kamerası görüntülerinden animasyon ve sinema görüntülerine uzanan geniş stil yelpazesi
- Tipografi üretimi ve animasyon tasarımı
- Tüm video çıktılarında yerel ses üretimi bulunuyor
İlk video değerlendirmesi
- Ön değerlendirme, ses içeren 720p 10 saniyelik metinden videoya klipler ile yapıldı
- Karşılaştırmalı değerlendirmede FLUX 3'ün tercih edilme oranları şöyle
- Grok Imagine Video'ya karşı en fazla %69
- Kling v3 Pro'ya karşı %60
- Happy Horse v1'e karşı %59, Happy Horse 1.1'e karşı %57
- Seedance 2.0 ve Gemini Omni Flash'a karşı ayrı ayrı %52
- Runway Gen-4.5'e karşı %77
- Luma Ray 3.2'ye karşı %93
- Model ve çevresindeki harness hâlâ geliştirme aşamasında olduğu için sonuçlar ön nitelikte; Early Access sürecinde daha da iyileştirilmesi planlanıyor
- Şu anda özellikle güçlü olduğu alanlar insan yüz ifadelerini yakalama, fiziksel olaylarla sesleri bağlama ve çok dilli işleme
- Görsel referansla sahne genelinde karakter tutarlılığını korurken birden fazla klibi birleştirerek dakikalar süren sekanslar oluşturabiliyor
- FLUX 3 Video Early Access olarak sunuluyor
Görüntü sentezi ve düzenleme
- FLUX 3, farklı stiller, en-boy oranları ve çözünürlüklerde görüntü sentezleyip düzenleyebiliyor
- Eğitimin ara aşamasındaki ön değerlendirmelerde, önceki FLUX sürümlerine kıyasla karmaşık prompt işleme ve metin üretme yeteneğinde büyük gelişme görüldü
- Çeşitli çıktı stilleri üretebiliyor ve birçok dildeki metni yüksek doğrulukla render edebiliyor
- Değerlendirme sonuçları henüz ön aşamada ve resmi çıkıştan önce ek iyileştirmeler planlanıyor
- FLUX 3 Image Early Access'in önümüzdeki birkaç hafta içinde başlaması hedefleniyor
Eylem tahmini ve robot öğrenimi
- Gerçeklik anlayışını eylem tahminine genişletmek için iki yol izleniyor
- Self-Flow'un ilk çalışmalarını genişleterek FLUX 3'ün içine yerel eylem tahmini entegre etmek
- Önceden eğitilmiş video backbone'unu dinamikleri anlayan bir temel olarak kullanıp, sınırlı görev verisiyle uzman eylem modellerini ince ayarlamak
- İlk yaklaşım ortağı mimic robotics ile birlikte FLUX-mimic geliştirildi
- FLUX 3 backbone'unu, mimic'in gelişmiş robot manipülasyonu eğitimi ve üretim ortamına dağıtım uzmanlığıyla birleştiren bir video-eylem modeli
- Audi'nin gerçek üretim işlerinde fiziksel AI ve içerik üretiminin ortak temelini sınayan çalışma da ayrıca paylaşıldı
Özelliklere göre kademeli yayın
- Her özellik, sorunsuz yayın, geri bildirim toplama ve sıkı güvenlik testleri için Early Access sürecinden geçerek önümüzdeki haftalar ve aylarda sunulacak
- Hepsi aynı çok modlu Flow Matching tabanlı modelden türetiliyor
- FLUX 3 Video: API ve özel ağırlık erişimiyle video ve ses üretimi ile düzenleme
- FLUX-mimic·FLUX 3 Action: eylem tahmini, mimic robotics ile başlayarak seçilmiş araştırma ve ticari ortaklara sunulacak
- FLUX 3 Image: API ve özel ağırlık erişimiyle görüntü sentezi ve düzenleme
- FLUX 3 Dev: video, ses, görüntü içerik üretimi ve eylem tahmini için çok modlu backbone'un açık ağırlıklı sürümü
- Temel yaklaşımın ek teknik ayrıntıları da daha sonra paylaşılacak; Early Access başvurusu yapılabiliyor
Algı, eylem ve dilin birleşimi
- Gelecekteki uygulama alanları olarak etkileşimli görüntü ve video düzenleme, simülasyon, bilgisayar kullanımı ve fiziksel AI öne çıkarılıyor
- Mevcut yetenekler kademeli olarak yayınlanırken bir sonraki nesil model de geliştiriliyor
- Nihai hedef, algı, eylem ve dil tahminini tek bir birleşik modelde bir araya getirmek
1 yorum
Hacker News yorumları
Açık ağırlıklı sürümün en iyi performans (SOTA) olmasını bekliyorum
Önümüzdeki birkaç hafta ila birkaç ay içinde içerik üretimi ve davranış tahmini için çok modlu temel model FLUX 3 Dev'i açık ağırlıklarla sunmayı ve temel yaklaşımın teknik ayrıntılarını da paylaşmayı planladıklarını söylüyorlar
Temel model Dev sürümü olarak gelirse nelerin eksik olacağını da yalnızca gönderiden anlamak zor
İnsanları gösteren örnek neredeyse yok, dünya modeli terimini çok rahat kullanmışlar ve 20 saniyelik video iddia ederken aslında sadece jump cut göstermişler
Sonuçta özeti şu: her şey “yakında paylaşılacak”
Pekiştirmeli öğrenme alanı da bu terimi davranış biliminden ödünç almış olabilir; o yüzden bunu olduğu gibi kabullenmek daha iyi olabilir. Filozoflar ve görsel sanatçıların nesne yönelimli ifadesini kendi usullerince yanlış kullanmasına benziyor
Buradaki tepki şaşırtıcı derecede olumsuz ve alaycı, ama benim gözüme bu modelin performansı oldukça etkileyici görünüyor
Olumsuz insanların her zaman en önce kötü yorum bıraktığı da söylenir; ben biraz daha bekleyip göreceğim
Son zamanlarda HN'de olumsuz havanın arttığını hissediyorum, umarım bana öyle geliyordur
Uygun çalışma ortamına sahipseniz ve modelin hatalı akıl yürütmeye sapıp sapmadığını ya da ince ama yanlış sonuçlar üretip üretmediğini anlayacak kadar alan bilgisine sahipseniz oldukça iyimserim. Buna karşılık sosyal medyanın korkunç yapay zeka üretimi görsel ve videolarla dolup taşmasını görünce, tamamen sentetik görsel ve video üreticilerinin gerçek hayatta faydalı kullanılma ihtimali konusunda çok daha karamsarım. Milyonlarca insanın eline geçtiğinde topluma faydadan çok zarar için kullanılıyor gibi görünüyor
Bu video modeli Seedance 2.0 seviyesine yakınsa maliyet çok yüksek olacağından düşük kaliteli içerik üretimine uygun olmaz, daha çok bir projenin VFX hattına girmesi muhtemel
Modeline dokunsal veri öğreten bir yer olup olmadığını merak ediyorum
Robotlardan en çok istediğim şey nesnelere dokunmaları, ama onlara sadece ses, video ve görsel veriliyor; bu yüzden hiç dokunmadığı bir şeyle nasıl temas kuracağını öğrenmesi gerekiyor. Robotların nesnelere dokunurken tereddütlü görünmesinin nedeni de bu olabilir
Flux 2 Dev Klein, genel ticari donanımda kullanılabilen modeller arasında fiilen en iyisiydi
Flux 3'ün de buna karşılık gelen güncel bir açık ağırlık modeli içermesini umuyorum; aksi halde pek çok hobi kullanıcısı için büyük kayıp olur
Avrupa çıkışlı yapay zeka projeleri arasında bana ilk kez büyük umut veriyor
Freiburg im Breisgau'da işe alım yaptıklarını söylüyorlar; orada yerelden yetenek bulmak kolay mı merak ediyorum
Orada yaşayan bir arkadaşım çevredeki dağlarda yol bisikleti sürüyor, bir diğeri de kışın öğle arasında kros kayağı yapıyor
Yetenek havuzu konusunda emin değilim ama bir üniversite var
SF dışındaki startup'ların üniversite şehirlerinde işe alım yapması yaygın bir yöntemdir
Su basmış odada dans etmeye başlayana kadar bunun gerçek çekim video olduğunu sanmıştım
2.3 sürümü harikaydı; erken erişim alan kişilerin paylaştığı videolar ve değerlendirmeler bu modelin ev kullanımı için yeni en iyi performans olacağını düşündürüyor, o yüzden çok heyecanlıyım
Model dünyanın ve olayların seslerini ifade etmeyi öğrenmek zorundaysa, eğlencesine eğitim sürecine gerçek dışı derecede fazla Wilhelm scream eklemelerini isterim