Görsel anagramlar: difüzyon modelleriyle üretilen çoklu bakış açılı optik illüzyonlar
(dangeng.github.io)- Tek bir görüntünün döndürme, çevirme, renk tersine çevirme gibi dönüşümlerden sonra farklı bir nesne gibi görünmesini sağlayan çoklu bakış açılı optik illüzyonlar, önceden eğitilmiş difüzyon modelleriyle zero-shot olarak üretiliyor
- Birden fazla dönüşüm bakış açısından gürültü ayrı ayrı tahmin edildikten sonra, ters bakış açısı dönüşümüyle koordinat sistemi hizalanıyor ve ortalama gürültüyle bir sonraki difüzyon adımı yürütülüyor
- Desteklenen dönüşümler döndürme, çevirme, renk tersine çevirme, eğme, yapboz yeniden düzenleme, rastgele yama permütasyonu ve 3 veya daha fazla bakış açısına kadar uzanıyor
- Dönüşüm fonksiyonlarının tersinir olması gerekiyor; ayrıca difüzyon modelinin gürültü varsayımıyla uyum için doğrusallık ve standart normal gürültüyle istatistiksel tutarlılık gerekiyor
- Ortogonal matris koşulunu sağlayan piksel permütasyonları ve renk tersine çevirme, kuramsal koşullara uyduğu için kullanımı kolay; ancak bakış açısı sayısı arttıkça iyi illüzyon elde etmek zorlaşıyor
Dönüştürülünce kimliği değişen görüntüler
- Visual Anagrams, tek bir görüntü belirli bir dönüşümden geçtiğinde görünüşünün ya da kimliğinin değişmiş gibi algılandığı çoklu bakış açılı optik illüzyonlar üretiyor
- Ayrı bir eğitim gerektirmeden mevcut difüzyon modellerini kullanan zero-shot bir yaklaşım
- Örnek dönüşümler şöyle çeşitleniyor
- Yapboz yeniden düzenleme: Yapboz parçaları bölünüp yeniden dizildiğinde başka bir görünüm ortaya çıkıyor; birden fazla çözümü olan bir yapboz gibi çalışıyor
- Çevirme ve 180 derece döndürme: Görüntü çevrildiğinde ya da 180 derece döndürüldüğünde görünüş değişiyor
- 90 derece döndürme: Görüntü 90 derece döndürülünce farklı bir şey olarak algılanıyor
- Renk tersine çevirme: Renkler ters çevrildiğinde görüntü değişiyor
- Eğme ve “inner circle rotations”: Diğer dönüşüm örnekleri arasında yer alıyor
- Rastgele yama permütasyonu: Yamalar yeniden düzenleniyor; (64 \times 64) yama sayısına çıkıldığında kalite düşse de tanınabilir sonuçlar elde ediliyor
- Sadece iki değil, üç bakış açılı illüzyonlar da üretilebiliyor; ancak iyi sonuç almak daha zor
- Dört bakış açılı illüzyonları çalıştırmak çok daha zordu ve yarı yarıya kabul edilebilir sonuç veren yalnızca bir örnek bulundu
Üretim süreci ve kuramsal koşullar
- Temel fikir, birden fazla dönüşüm bakış açısından difüzyon modelinin tahmin ettiği gürültüyü tek bir tahminde birleştirmek
- Her bakış açısı (v_i) için gürültü tahmin ediliyor
- Tahminlere ters bakış açısı (v_i^{-1}) uygulanarak aynı koordinat sistemine hizalanıyor
- Hizalanmış gürültü tahminlerinin ortalaması alınıyor
- Difüzyon adımı bu ortalama gürültü tahminiyle ilerletiliyor
- Her bakış açısı fonksiyonu bu yönteme uymaz; öncelikle (v_i) fonksiyonunun tersinir olması gerekir
- Difüzyon modeli, gürültü karışmış veri (\mathbf{x}_t)’yi saf sinyal (\mathbf{x}_0) ve gürültü (\epsilon)’un ağırlıklı toplamı olarak ele alır
- Dönüşüm (v), sinyal ile gürültü arasındaki bu ağırlıklı ilişkiyi koruyacaksa doğrusal dönüşüm olmalıdır
- Doğrusal dönüşüm bir (\mathbf{A}) matrisiyle ifade edilir
- Difüzyon modeli, gürültünün bağımsız ve özdeş dağılımlı standart normal dağılımdan geldiği varsayımıyla eğitilir
- Dönüştürülmüş gürültünün de (\mathbf{A}\epsilon \sim \mathcal{N}(0, I)) koşulunu sağlaması gerekir
- Doğrusal dönüşümlerde bu, (\mathbf{A})’nın ortogonal matris olmasıyla eşdeğerdir
- Dolayısıyla bu yöntemde bir dönüşümün çalışması için yeterli koşul, ortogonal dönüşüm olmasıdır
- Rastgele ortogonal dönüşümlerin çoğu görüntü üzerinde görsel olarak anlamlı değildir; ancak permütasyon matrisleri, ortogonal matrislerin bir alt kümesidir ve piksel yeniden düzenlemesi olarak yorumlanabilir
- Döndürme, çevirme, eğme, inner rotations, yapboz yeniden düzenleme ve yama permütasyonu belirli türde piksel yeniden düzenlemeleri olarak görülebilir
- Renk tersine çevirme bir permütasyon değildir, ancak piksel değerlerinin işaretini değiştirdiği için ortogonal dönüşüm sayılır
Makale ve çalıştırma kaynakları
- Paper: CVPR 2024 makale PDF’i
- arXiv: arXiv sayfası
- Code: Visual Anagrams kodu
- Colab: Çalıştırma için Colab
- Diffusion Illusions: score distillation sampling ile çoklu bakış açılı illüzyonlar ve diğer görsel efektler üretiyor
- Illusion-Diffusion Colab: Benzer bir fikir içeren Matthew Tancik Colab’ı; Visual Anagrams ise illüzyon kalitesi, dönüşüm kapsamı ve kuramsal analiz açısından geliştirmeler sunuyor
- Factorized Diffusion: Visual Anagrams’in devamı niteliğindeki çalışma; çeşitli hibrit illüzyon türleri üretiyor
- Images that Sound: Benzer bir teknikle görüntü gibi görünen spektrogramlar üretiyor
1 yorum
Hacker News yorumları
Erkek/kadın ters çevirmesini gerçekten sevdim
Aynı tekniği genişletince tek bir görüntü içinde okunabilir kaç permütasyon üretilebileceğini merak ediyorum. Matematiğe çok hâkim değilim ama iki ortogonal dönüşümü art arda uygulayınca sonuç yine ortogonal dönüşüm olduğu için mi çalışıyor?
Geçen yılın başlarında benzer bir fikrim vardı ve dama tahtası yöntemini de biraz kurcalamıştım
Burada ünlü ressamların tarzında 9 kedi resminden oluşan bir kedi var: https://twitter.com/marekgibney/status/1521500594577584141
Görmek için gözlerinizi biraz kısmanız gerekebilir. Birkaç tane yaptıktan sonra nedense ilgim söndü
Erkek/kadın renk ters çevirme örneği en etkileyicisiydi. Döndürmede, diğer bakış açısını görmek için görüntüyü kafanızda çevirebiliyorsunuz; renk ters çevirme ise zihinde yapmak çok zor
https://dangeng.github.io/visual_anagrams/static/videos/grid...
Buna karşılık döndürme gerçekten şaşırtıcı. Piksellerin değişmediği apaçık görülüyor. Ekranı fiziksel olarak çevirdiğinizde görüntü “değişiyor”. Difüzyon modeli görsellerinin mevcut görüntülerin yalnızca bir yankısı olmadığını bundan daha iyi gösteren bir örnek düşünmek zor. Elbette o yönü de var ama özünde “{istem} açıklamasına uyan piksel kümesini bul” probleminin çözümü. Burada ise “bu yönden {A}’ya, şu yönden {B}’ye uyan pikseller” bulunuyor
Bu teknik ve sonuçlar, birkaç ay önce meşhur olan “spiral” ControlNet görüntülerinden ayrı: https://arstechnica.com/information-technology/2023/09/dream...
Kod tarafında DeepFloyd-IF tabanlı; Stable Diffusion varyantları kadar kolay çalıştırılmıyor
Stable Diffusion çevresindeki ekosistem genel olarak gerçekten devasa
Buradakiler gibi fiziksel yapbozlar satın alınabiliyor mu?
Örneklerin her biri “eh... tamam, olabilir... bir ölçüde” hissi veriyor
Penguen/zürafa muhtemelen en iyisi; yaşlı kadın/elbise ise iki yönden de pek görünmüyor
Penguen/zürafa şuna çok yakın: https://www.pinterest.com/pin/giraffepenguin--13398215764267...
Diğeri de buradan doğrudan esinlenmiş ya da benzer; “young lady” istemi modelin elbiseyi seçmesine yol açmış gibi. Ayrıca gözü ve kulağı, ağzı ve gerdanlığı fotoğraf gerçekçiliğinde tamamen aynı yapmak imkânsız: https://www.reddit.com/r/RedditDayOf/comments/35cjn5/the_cla...
Yeniden düzenlenen ördek/tavşan kayan bulmacada kullanılsa gerçekten harika olurdu. İki geçerli çözümü olur
Kenarları, çıkıntı ve boşluklardan oluşan yönlü bağlı grafik düğümleri olarak düşünürseniz, olası çiftler birbirine bağlanır. Yer değiştirme iki çiftlik bir kümedir; ek bağlantı ise iki ucu açık dört elemanlı bir zincirdir. O bağlantı daha fazla çifte uzanırsa aynı çıkıntı ve boşluklardan oluşan daha büyük bir küme oluşabilir. Grafik özellikleri gereği muhtemelen çoğu böyle olacaktır. Nedeni için mahkûm paradoksuna bakın [0]
O zaman çıkıntıların çoğu boşlukların çoğuna uyar hâle gelir ve bulmacayı çözmek çok daha zorlaşır.
[0] Matt Parker’ın harika videosu https://www.youtube.com/watch?v=a1DUUnhk3uE de iyi ama ardından Veritasium’dan Derek’le yaptığı tartışmayı daha çok öneririm
Kırmızı/mavi ışık altında farklı şeyler gibi görünen böyle görüntüler yapmak güzel olurdu
Üretken yapay zekânın getirdiği yaratıcılık patlaması gerçekten şaşırtıcı