1 puan yazan GN⁺ 2023-12-01 | 1 yorum | WhatsApp'ta paylaş
  • Tek bir görüntünün döndürme, çevirme, renk tersine çevirme gibi dönüşümlerden sonra farklı bir nesne gibi görünmesini sağlayan çoklu bakış açılı optik illüzyonlar, önceden eğitilmiş difüzyon modelleriyle zero-shot olarak üretiliyor
  • Birden fazla dönüşüm bakış açısından gürültü ayrı ayrı tahmin edildikten sonra, ters bakış açısı dönüşümüyle koordinat sistemi hizalanıyor ve ortalama gürültüyle bir sonraki difüzyon adımı yürütülüyor
  • Desteklenen dönüşümler döndürme, çevirme, renk tersine çevirme, eğme, yapboz yeniden düzenleme, rastgele yama permütasyonu ve 3 veya daha fazla bakış açısına kadar uzanıyor
  • Dönüşüm fonksiyonlarının tersinir olması gerekiyor; ayrıca difüzyon modelinin gürültü varsayımıyla uyum için doğrusallık ve standart normal gürültüyle istatistiksel tutarlılık gerekiyor
  • Ortogonal matris koşulunu sağlayan piksel permütasyonları ve renk tersine çevirme, kuramsal koşullara uyduğu için kullanımı kolay; ancak bakış açısı sayısı arttıkça iyi illüzyon elde etmek zorlaşıyor

Dönüştürülünce kimliği değişen görüntüler

  • Visual Anagrams, tek bir görüntü belirli bir dönüşümden geçtiğinde görünüşünün ya da kimliğinin değişmiş gibi algılandığı çoklu bakış açılı optik illüzyonlar üretiyor
  • Ayrı bir eğitim gerektirmeden mevcut difüzyon modellerini kullanan zero-shot bir yaklaşım
  • Örnek dönüşümler şöyle çeşitleniyor
    • Yapboz yeniden düzenleme: Yapboz parçaları bölünüp yeniden dizildiğinde başka bir görünüm ortaya çıkıyor; birden fazla çözümü olan bir yapboz gibi çalışıyor
    • Çevirme ve 180 derece döndürme: Görüntü çevrildiğinde ya da 180 derece döndürüldüğünde görünüş değişiyor
    • 90 derece döndürme: Görüntü 90 derece döndürülünce farklı bir şey olarak algılanıyor
    • Renk tersine çevirme: Renkler ters çevrildiğinde görüntü değişiyor
    • Eğme ve “inner circle rotations”: Diğer dönüşüm örnekleri arasında yer alıyor
    • Rastgele yama permütasyonu: Yamalar yeniden düzenleniyor; (64 \times 64) yama sayısına çıkıldığında kalite düşse de tanınabilir sonuçlar elde ediliyor
  • Sadece iki değil, üç bakış açılı illüzyonlar da üretilebiliyor; ancak iyi sonuç almak daha zor
  • Dört bakış açılı illüzyonları çalıştırmak çok daha zordu ve yarı yarıya kabul edilebilir sonuç veren yalnızca bir örnek bulundu

Üretim süreci ve kuramsal koşullar

  • Temel fikir, birden fazla dönüşüm bakış açısından difüzyon modelinin tahmin ettiği gürültüyü tek bir tahminde birleştirmek
    • Her bakış açısı (v_i) için gürültü tahmin ediliyor
    • Tahminlere ters bakış açısı (v_i^{-1}) uygulanarak aynı koordinat sistemine hizalanıyor
    • Hizalanmış gürültü tahminlerinin ortalaması alınıyor
    • Difüzyon adımı bu ortalama gürültü tahminiyle ilerletiliyor
  • Her bakış açısı fonksiyonu bu yönteme uymaz; öncelikle (v_i) fonksiyonunun tersinir olması gerekir
  • Difüzyon modeli, gürültü karışmış veri (\mathbf{x}_t)’yi saf sinyal (\mathbf{x}_0) ve gürültü (\epsilon)’un ağırlıklı toplamı olarak ele alır
    • Dönüşüm (v), sinyal ile gürültü arasındaki bu ağırlıklı ilişkiyi koruyacaksa doğrusal dönüşüm olmalıdır
    • Doğrusal dönüşüm bir (\mathbf{A}) matrisiyle ifade edilir
  • Difüzyon modeli, gürültünün bağımsız ve özdeş dağılımlı standart normal dağılımdan geldiği varsayımıyla eğitilir
    • Dönüştürülmüş gürültünün de (\mathbf{A}\epsilon \sim \mathcal{N}(0, I)) koşulunu sağlaması gerekir
    • Doğrusal dönüşümlerde bu, (\mathbf{A})’nın ortogonal matris olmasıyla eşdeğerdir
    • Dolayısıyla bu yöntemde bir dönüşümün çalışması için yeterli koşul, ortogonal dönüşüm olmasıdır
  • Rastgele ortogonal dönüşümlerin çoğu görüntü üzerinde görsel olarak anlamlı değildir; ancak permütasyon matrisleri, ortogonal matrislerin bir alt kümesidir ve piksel yeniden düzenlemesi olarak yorumlanabilir
    • Döndürme, çevirme, eğme, inner rotations, yapboz yeniden düzenleme ve yama permütasyonu belirli türde piksel yeniden düzenlemeleri olarak görülebilir
    • Renk tersine çevirme bir permütasyon değildir, ancak piksel değerlerinin işaretini değiştirdiği için ortogonal dönüşüm sayılır

Makale ve çalıştırma kaynakları

  • Paper: CVPR 2024 makale PDF’i
  • arXiv: arXiv sayfası
  • Code: Visual Anagrams kodu
  • Colab: Çalıştırma için Colab
  • Diffusion Illusions: score distillation sampling ile çoklu bakış açılı illüzyonlar ve diğer görsel efektler üretiyor
  • Illusion-Diffusion Colab: Benzer bir fikir içeren Matthew Tancik Colab’ı; Visual Anagrams ise illüzyon kalitesi, dönüşüm kapsamı ve kuramsal analiz açısından geliştirmeler sunuyor
  • Factorized Diffusion: Visual Anagrams’in devamı niteliğindeki çalışma; çeşitli hibrit illüzyon türleri üretiyor
  • Images that Sound: Benzer bir teknikle görüntü gibi görünen spektrogramlar üretiyor

1 yorum

 
GN⁺ 2023-12-01
Hacker News yorumları
  • Erkek/kadın ters çevirmesini gerçekten sevdim
    Aynı tekniği genişletince tek bir görüntü içinde okunabilir kaç permütasyon üretilebileceğini merak ediyorum. Matematiğe çok hâkim değilim ama iki ortogonal dönüşümü art arda uygulayınca sonuç yine ortogonal dönüşüm olduğu için mi çalışıyor?

    • Erkek/kadın örneği benim de dikkatimi çekti; herhâlde on kez falan bakmışımdır. Sanırım bir yerlerde hüzünlü görünmesi de bunda etkiliydi
    • Ördek ve tavşan mozaiği gerçekten çok komikti
    • Burada sözü edilen “ortogonal dönüşüm” sıradan ortogonal doğrusal dönüşüm/matris anlamındaysa, cevap evet
  • Geçen yılın başlarında benzer bir fikrim vardı ve dama tahtası yöntemini de biraz kurcalamıştım
    Burada ünlü ressamların tarzında 9 kedi resminden oluşan bir kedi var: https://twitter.com/marekgibney/status/1521500594577584141
    Görmek için gözlerinizi biraz kısmanız gerekebilir. Birkaç tane yaptıktan sonra nedense ilgim söndü

    • Dürüst olmak gerekirse benim gözüme kediden çok cat-aclysm gibi görünüyor. Muhtemelen model birbiriyle çakışan gereksinimlerin altında ezilmiş; bu yüzden ne tekil görüntüler ne de birleşik görüntü pek iyi çıkmış. Yine de dediğin gibi, bir gün bunları da daha iyi yapabilir
    • Gerçekten harika. 3x3x3 de mümkün olur mu? Yani 9x9’da 81 adet 1 karelik kedi, 9 adet 9 karelik kedi ve 1 adet 81 karelik kedi olacak şekilde
  • Erkek/kadın renk ters çevirme örneği en etkileyicisiydi. Döndürmede, diğer bakış açısını görmek için görüntüyü kafanızda çevirebiliyorsunuz; renk ters çevirme ise zihinde yapmak çok zor

    • Müthiş. İlgilenenler için bağlantıyı bırakıyorum. Sayfada çok sayıda görsel var
      https://dangeng.github.io/visual_anagrams/static/videos/grid...
    • Bende tam tersi. Renk ters çevirme, 1990’larda moda olan morf animasyonlarından çok daha etkileyici gelmiyor. Piksel verisi düzeyinde renk ters çevirmenin ne kadar basit olduğunu anlıyorum ama o basitlik gözle görünmediği için. Alakasız bir alfa harmanlamadan da pek farklı görünmüyor
      Buna karşılık döndürme gerçekten şaşırtıcı. Piksellerin değişmediği apaçık görülüyor. Ekranı fiziksel olarak çevirdiğinizde görüntü “değişiyor”. Difüzyon modeli görsellerinin mevcut görüntülerin yalnızca bir yankısı olmadığını bundan daha iyi gösteren bir örnek düşünmek zor. Elbette o yönü de var ama özünde “{istem} açıklamasına uyan piksel kümesini bul” probleminin çözümü. Burada ise “bu yönden {A}’ya, şu yönden {B}’ye uyan pikseller” bulunuyor
    • Erkeği gördüğümde arayınca kadını görebiliyorum ama tuhaf biçimde tersi olmuyor
  • Bu teknik ve sonuçlar, birkaç ay önce meşhur olan “spiral” ControlNet görüntülerinden ayrı: https://arstechnica.com/information-technology/2023/09/dream...
    Kod tarafında DeepFloyd-IF tabanlı; Stable Diffusion varyantları kadar kolay çalıştırılmıyor

    • Henüz ayrıntılı bakmadım ama bu fikrin başka difüzyon ağlarına da uygulanabilmesi gerekmez mi? Yine de sağlanan kodda epey büyük değişiklikler gerekebilir. Elbette yanılıyorsam düzeltin
    • Bu fikrin nedense tam da o ControlNet modeliyle ortaya çıkmış olması bana hep tuhaf gelmişti. Aynı görüntüleri başka birçok ControlNet modeliyle birleştirince de harika ve çarpıcı sonuçlar çıkıyor
      Stable Diffusion çevresindeki ekosistem genel olarak gerçekten devasa
    • Görmedim; kötü şöhretli olan neydi?
    • Aslında ilgili olduğunu söylemek istemiş olabilir misin? Ugleh’in orijinal “spiral” görüntülerine “Related Links” bölümünde açıkça kredi verilmiş
  • Buradakiler gibi fiziksel yapbozlar satın alınabiliyor mu?

    • Kendiniz de yapabilirsiniz. Yalnız yukarıdaki yöntem büyük ölçekte genişletildiğinde ne kadar iyi oturur, bilmiyorum https://www.createjigsawpuzzles.com/
    • Bu araştırma DeepFloyd IF kullanıyor ve ticari kullanımı yasak. Satmak istiyorsanız başka uygun bir görüntü üreteci bulmanız ya da eğitmeniz gerekir
  • Örneklerin her biri “eh... tamam, olabilir... bir ölçüde” hissi veriyor
    Penguen/zürafa muhtemelen en iyisi; yaşlı kadın/elbise ise iki yönden de pek görünmüyor

    • O ikisi daha önce bilinen ambigramlara dayanıyor
      Penguen/zürafa şuna çok yakın: https://www.pinterest.com/pin/giraffepenguin--13398215764267...
      Diğeri de buradan doğrudan esinlenmiş ya da benzer; “young lady” istemi modelin elbiseyi seçmesine yol açmış gibi. Ayrıca gözü ve kulağı, ağzı ve gerdanlığı fotoğraf gerçekçiliğinde tamamen aynı yapmak imkânsız: https://www.reddit.com/r/RedditDayOf/comments/35cjn5/the_cla...
    • Hmm, penguen/zürafaya ilk baktığımda “ters çevrilmiş penguene benziyor; zürafa nerede?” diye düşündüm. Diğerlerinde neyin amaçlandığını hemen görebildim
  • Yeniden düzenlenen ördek/tavşan kayan bulmacada kullanılsa gerçekten harika olurdu. İki geçerli çözümü olur

    • Kontrol etmek gerekir ama bir çift “çıkıntı ve boşluğu” başka bir çiftle değiştirebiliyorsanız, iki çiftin hem şekli hem rengi aynı olmak zorunda. Ama birbirleriyle yer değiştirmek yerine ayrılıp farklı kenarlara bağlanıyorlarsa ek bağlantılar ortaya çıkar
      Kenarları, çıkıntı ve boşluklardan oluşan yönlü bağlı grafik düğümleri olarak düşünürseniz, olası çiftler birbirine bağlanır. Yer değiştirme iki çiftlik bir kümedir; ek bağlantı ise iki ucu açık dört elemanlı bir zincirdir. O bağlantı daha fazla çifte uzanırsa aynı çıkıntı ve boşluklardan oluşan daha büyük bir küme oluşabilir. Grafik özellikleri gereği muhtemelen çoğu böyle olacaktır. Nedeni için mahkûm paradoksuna bakın [0]
      O zaman çıkıntıların çoğu boşlukların çoğuna uyar hâle gelir ve bulmacayı çözmek çok daha zorlaşır.
      [0] Matt Parker’ın harika videosu https://www.youtube.com/watch?v=a1DUUnhk3uE de iyi ama ardından Veritasium’dan Derek’le yaptığı tartışmayı daha çok öneririm
    • Böyle yeniden düzenlenebilir öğe çok olursa, fotoğraf olmadan ayırt edilemeyecek çok sayıda “geçerli” çözüm üretebilirsiniz; bu da bulmacadan çok sanata dönüşür gibi
  • Kırmızı/mavi ışık altında farklı şeyler gibi görünen böyle görüntüler yapmak güzel olurdu

  • Üretken yapay zekânın getirdiği yaratıcılık patlaması gerçekten şaşırtıcı