2 puan yazan GN⁺ 2025-01-09 | 1 yorum | WhatsApp'ta paylaş
  • NeuralSVG, metin istemlerini sıralı ve düzenlenebilir şekillere dönüştürerek SVG üreten bir ICCV 2025 araştırmasıdır
  • Mevcut metinden vektör üretim yöntemleri, çıktıyı aşırı parametrik hale getirebilir veya katman yapısını ikincil ele alabilir; bu da pratikte düzenlenebilir vektör grafik olarak kullanımını zorlaştırabilir
  • Tüm SVG sahnesi küçük bir MLP ağı ağırlıklarına kodlanır ve metin koşuluna uyacak şekilde Score Distillation Sampling (SDS) ile optimize edilir
  • İç içe dropout düzenlileştirmesi, her şeklin bağımsız olarak anlamlı bir rol üstlenmesini teşvik eder; böylece yalnızca az sayıda şekil bırakıldığında bile sahnenin kabaca yapısı korunur
  • Tek bir eğitilmiş temsil ile arka plan rengine göre renk paleti, en-boy oranı ve eskiz çizgi sayısı çıkarım anında ayarlanabilir

Düzenlenebilir SVG üretimini hedefleyen yaklaşım

  • Vektör grafikler, çözünürlükten bağımsız ve düzenlenebilir görsel içerik üretmeye imkan tanıdığı için tasarımda önemli bir ortamdır
  • Görüntü-dil modelleri ve difüzyon modellerindeki ilerlemeler, metinden vektör grafik üretimine olan ilgiyi artırmıştır
  • Mevcut yaklaşımlar iki sınıra sahip olabilir
    • Çıktı aşırı parametrik hale gelir
    • Vektör grafiğin temel özelliği olan katman yapısı, ikincil bir hedef olarak ele alınır
  • NeuralSVG, katmanlı SVG temsilinin öneminden hareketle, metin istemlerinden vektör grafik üreten örtük sinirsel temsil önerir

Sahneyi küçük bir MLP'ye kodlama yöntemi

  • NeuralSVG, NeRF'ten ilham alarak tüm sahneyi küçük bir MLP ağının ağırlıklarına kodlar
  • Optimizasyonda Score Distillation Sampling (SDS) kullanılır
  • Sıralı bir temsil üretmek için dropout tabanlı bir düzenlileştirme tekniği sunulur
    • Her öğrenilmiş şeklin, tüm sahne içinde anlamlı ve sıralı bir role sahip olması teşvik edilir
    • Nihai render'da tutulan şekil sayısı değişse bile, az sayıda şekille sahnenin kabaca yapısı yakalanabilir

Çıkarım anında dinamik kontrol

  • Sinirsel temsil kullanımı sayesinde, üretilen SVG tek bir eğitilmiş temsil üzerinden kullanıcı girdisine göre dinamik olarak ayarlanabilir
  • Desteklenen kontrol örnekleri şunlardır
    • Arka plan rengi değiştirilerek sonuç SVG'nin renk paleti farklı biçimde render edilir
    • Eğitim sırasında görülen ve görülmeyen arka plan renkleri için sonuçlar sunulur
    • NeuralSVG'nin 1:1 ve 4:1 en-boy oranı ile optimize edilmiş sonuçları karşılaştırılır
    • Tek bir ağ ile farklı sayıda çizgiye sahip eskizler üretilir

Değerlendirme sonuçları ve materyaller

  • Niteliksel ve niceliksel değerlendirmelerde NeuralSVG, yapısal ve esnek SVG üretimi açısından mevcut yöntemlerden daha iyi sonuçlar gösterir
  • Proje materyalleri

1 yorum

 
GN⁺ 2025-01-09
Hacker News yorumları
  • Harika. Şimdiye kadar büyük ilgi gören DALL-E, Midjourney gibi raster üretimine kıyasla vektör üretiminin faydasının çok daha büyük olduğunu düşünüyorum.
    Raster çıktılar, gerçekten kullanılabilir sonuçlara doğru yinelemeli olarak iyileştirmek için sonraki üretken yapay zeka çağrılarıyla upscale veya inpainting gerektirdiğinden yönetmesi zor; oysa üretilen vektörler doğası gereği ölçeklenebilir ve düzenlemesi de kolay.
    Özellikle bu çıktılarda her şekil mümkün olduğunca az noktadan oluşan düşük karmaşıklıkta olduğu için, insanın araya girip düzenleme yapması açısından büyük avantaj var. Üretken görsellerde karmaşık ve dağınık ifadelerden ziyade sadeleştirilmiş ifadeler üretmenin daha zor ve daha değerli olduğunu düşünüyorum.

    • Son zamanlarda https://www.recraft.ai/’yi gördünüz mü merak ediyorum. Vektör çıktısının görüntü kalitesi epey iyileşmiş gibi.
      Elbette Midjourney’nin iyi olduğu yoğun dokular veya fotoğraf benzeri görüntüler üretmek için hâlâ uygun değil. Geçen yıl civarında https://gwern.net/dropcap için Midjourney ile üretip Recraft’tan geçirmek gibi biraz karmaşık bir akış kullanmak gerekiyordu; ama şimdi drop cap yapacak olsam, en yeni Recraft modeli tek başına yeterli olur gibi geliyor.
    • Bu tür görüntüleri rasterizasyon modeli için kılavuz olarak kullanma olasılığı da var. Önce manipülasyonu ve birleştirmesi kolay bir görüntü oluşturup, kompozisyondan memnun kalındıktan sonra ayrıntıları ekleme yöntemi.
    • Karmaşık ve dağınık ifadeler için küçük bir proje de var ;) https://github.com/KodeMunkie/shapesnap
      Devlerin omuzlarında duran bir çalışma; aslı bana ait değil. npm’de de kullanılabiliyor.
    • Sora.ai animasyon üretirken önce render için 3D model oluştursa ne kadar faydalı olurdu diye hep hayal ediyorum.
    • Tamamen katılıyorum. Ses codec’lerinin genelinde yaygın olan blok kodlama ve rasterleştirme tarzı yaklaşım, hatta modern “sinir ağı” yöntemleri bile müzisyenlerin istediği ince taneli kontrol için çıkmaz sokak gibi hissettiriyor.
      Elbette metinden müziğe arayüzler için fena değil. Şu anda çoğunlukla doğal seslere odaklanan seyrek bir ses codec’i yapıyorum ve seyrek temsili teşvik etmek için çok kaba da olsa fizik tabanlı varsayımlar kullanıyorum.
      https://blog.cochlea.xyz/sparse-interpretable-audio-codec-pa...
  • Bu tür aşamalı üretim yöntemlerini çok seviyorum. Dil, nihai ürünü tam olarak tarif edecek kadar hassas olmadığı için ara aşamaları üretmek çok güçlü bir yaklaşım.
    Müzik üretiminde de böyle bir yaklaşım görmek isterim. Suno gibi araçlar harika, ama kişisel olarak sesin kendisinden çok MIDI ve enstrüman ayarları üretmesini çok daha fazla isterim.
    Üretim araçları için iyi bir ders de olabilir. İyi bir başlangıç noktası üretmek mümkün, ama insanların gerçekten istediği şey uzun kuyrukta yer alıyor. Bu yüzden hassas düzeltme yeteneğinin dahil olup olmaması, hazırlanmış bir demo ile güçlü bir araç arasındaki farkı yaratıyor.
    “Code coming soon” denmiş; örnekler epey iyi ama yeniden üretilebilirliğin ne düzeyde olduğunu bilmiyorum.

    • MIDI ve enstrüman ayarları üreten bir araç arıyorsanız https://www.aiva.ai gibi bir şey uygun olabilir.
    • Yalnızca MIDI yetmez. MIDI + filtreler, ayrıca ayrı bir vokal parçası ve kullanıcı tanımlı ses parçası da istiyorum.
    • İyi nokta. Birkaç gün önce bu projeyi Glicol ile yeniden başlatsam mı diye düşünmüştüm.
      https://github.com/chaosprint/RaveForce
      RaveForce, müzik üretim deneyleri için OpenAI Gym tarzı bir araç takımı. Suno’yu seviyorum ama sonuçta çalışmak için MIDI ya da XML veya kayıpsız sample gerekiyor.
    • Mikrotonal MIDI olsa gerçekten harika olurdu.
  • Sonnet’i SVG animasyonlarına uygulamak bile etkileyiciydi; bu ise çok daha güçlü olabilir gibi görünüyor.
    Eğlenceli bir örnek: https://gist.github.com/scosman/701275e737331aaab6a2acf74a52...

  • Her zaman ara temsil üretiminin gidilecek yol olduğunu düşündüm. Somut sözdizimi üretmek yerine AST oluşturmak, PNG yerine SVG oluşturmak, animasyon için ardışık görüntüler üretmek yerine wireframe veya rigging ve script üretmek gibi.
    Ara temsil varsa değiştirip render edersiniz. Render sonucu varsa en sonda bir kat yapay zeka peri tozu serpersiniz.
    Bir gün üretici modeller yalnızca doğal dille ince kontrol sağlayacak kadar güçlü hâle gelebilir; ama o zamana kadar bu yöntemin kontrol edilebilirlik, Intellisense veya görüntü düzenleyiciler gibi mevcut araçlarla birlikte çalışabilirlik ve yüksek boyutlu piksel uzayıyla uğraşmak zorunda olmayan daha küçük, daha ucuz modeller gibi avantajları olacak gibi.

  • Simon Willison’ın LLM SVG üretim test prompt’u olan “bisiklete binen bir pelikan SVG’si oluştur” için bu modelin nasıl sonuç vereceğini merak ediyorum.
    Yapay zekanın gelişim hızı oldukça şaşırtıcı ve daha da iyiye gidecek; bu yüzden biraz ürkütücü de.

    • Claude ve ChatGPT o3’e “siyah dış çizgili ABD anakarası SVG’si oluştur” dedim.
      Birkaç model denedim ama feci şekilde yanlış yaptılar. Claude, “bisiklete binen bir pelikan SVG’si oluştur” konusunda fena olmayan bir iş çıkarıyor.
  • Çok iyi. Bir bit maskesini SVG’ye dönüştürmem gerekiyordu ve ara adımı atlamak istediğim için segmentasyon modelinin SVG çıktı verdiği makaleleri ararken bunu bulmuştum.
    https://arxiv.org/abs/2311.05276

  • Eskiz üretimi inanılmaz. Üstelik neredeyse bedavaya gelen bir şey gibi görünüyor.

  • Belge yazma araçları için pek çok fırsat açacak gibi. Gerçekten harika; kod yayımlanınca hemen denemek istiyorum.

    • Bunun belge yazımını nasıl güçlendirebileceğini merak ediyorum. Birkaç fikir verebilir misiniz?
  • Güzel. Benzer şekilde diyagramların metinle üretilmesini de bekliyorum. LLM çağının Pic/Pikchr’ı gibi.

    • PIC değil ve karmaşık diyagramlar için henüz pek uygun değil; ama Vizzlo’nun Chart Vizzard’ı ile desteklenen bazı grafik türlerini, örneğin Gantt grafiğini oluşturup grafik düzenleyicide düzenlemeye devam edebilirsiniz: https://vizzlo.com/ai
    • SQL’i Mermaid Markdown diyagramına dönüştürmede bir ölçüde başarı elde ettim.
  • Gerçekten harika. Claude ile SVG’ye animasyon ekliyordum ve gayet iyi sonuç veriyordu.

    • Paylaşabiliyorsanız örnekleri ve iş akışını görmek isterim.