2 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Qwen-Image serisinin üçüncü nesil temel görüntü üretim modeli; hoş görünen görüntülerin ötesine geçip üretkenlik işlerinde kullanılabilen “Real(实)”ı ana hedef olarak benimsiyor
  • En fazla 4.5k token girişi işleyerek gazete, storyboard, sınav kâğıdı gibi yüksek bilgi yoğunluklu yerleşimleri ve birden çok kavramın paralel ya da iç içe geçtiği görüntüleri tek seferde üretiyor
  • 10px boyutundaki metinleri ve LaTeX formüllerini, el yazısı notları okunabilir şekilde render ediyor; gözenek, saç, cilt ve fırça darbeleri gibi mikro dokuları da yeniden üretiyor
  • 12 dili ve birden çok yazı tipini, 100’den fazla sanat stilini, web/oyun/canlı yayın UI’larını destekliyor; ayrıca internetten güncel bilgileri arayıp görüntüye yansıtabiliyor
  • Gazete PDF’leri, kısa dizi storyboard’ları ve karmaşık UI’lar dahil olmak üzere tasarım, içerik üretimi, eğitim ve e-ticarette görüntü üretimini dağıtıma hazır bir üretkenlik aracına dönüştürmeyi amaçlayan bir model

“Real”a yönelik üçüncü nesil model

  • Qwen-Image-3.0, Qwen-Image serisinin üçüncü nesil temel görüntü üretim modelidir
  • Nesillere göre temel yönelimler şöyle:
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • “Real” üç yetenekten oluşur
    • Zengin içerik: En fazla 4.5k token girişi ve karmaşık yerleşim desteği
    • Gerçekçi ayrıntılar: 10px metinler ile gözenek ve saç gibi mikro öğelerin yeniden üretimi
    • Derin bilgi: 12 dil, çeşitli UI’lar ve dünya bilgisinden yararlanan üretim
  • Görüntü üretimini “kullanılabilir” olmaktan “pratik” olmaya, “güzel görünen” şeylerden faydalı şeylere taşımayı hedefler

Zengin içerik ve karmaşık yerleşim

  • Matematik slaytlarında mekânsal ilişkileri, matematik sembollerini, teorem açıklamalarını ve her öğenin göreli konumunu birlikte render edebilir
  • Yaklaşık 3.7k token uzunluğundaki bir yönergeyle, birden fazla görüntüyü birleştirmeden tek geçişte tek bir 3×3 grid oluşturur
    • Her hücre; Çince ve İngilizce cümleleri, formülleri, grafikleri ve çizgi karakterleri birleştiren karmaşık bir infografikten oluşur
    • Tünel güvenliği çizgi romanı, uzay geometrisi dersi, “Chu Shi Biao” üslup analizi, parabolik hareket, parazitoloji, sağ göğüs ağrısı tıbbi diyagramı, Sylow teoremi, banka iç kontrolü ve hücre DNA yapısı karşılaştırmasını tek bir görüntüye yerleştirir
  • En fazla 4.5k token uzunluğundaki yönergeleri alarak yüksek bilgi yoğunluklu görsel yerleşimleri anlar ve render eder
  • Yatay ölçeklenme

    • Tek bir tuvale birden çok paralel öğe yerleştirme yeteneğini ifade eder
    • Anlamsal yan yana koyma ve mekânsal kontrolü kullanarak birden çok kavramı birbirini engellemeyecek şekilde düzenler
  • Dikey derinlik

    • Anlamı ayrıştırma ve mantıksal olarak iç içe geçmiş arayüzleri aşama aşama ifade etme yeteneğidir
    • Tek bir yönergeyle VSCode programlama ekranı, Qwen Chat, WeChat ve el demleme kahve posterinin üst üste geldiği çok ekranlı bir yapı üretir
    • Her katman ilgili UI’ın stilini ve ayrıntı öğelerini korur

Küçük yazılardan resim restorasyonuna

  • Küçük yazılar ve karmaşık dizgi

    • 10px boyutundaki küçük metinleri bile okunabilir şekilde render eder
    • Balina köpekbalığı bilgi infografiği gibi metin ve illüstrasyonun yoğun olduğu alanları birlikte üretebilir
    • Bir cebirsel geometri makalesinin bir sayfasında LaTeX formüllerini, üst simge ve alt simgeleri, Yunan harflerini, teorem numaralarını, süslü parantezleri, kesir çizgilerini ve çok satırlı hizalamayı yeniden üretir
    • Küçük puntolarda bile formüllerin ve gövde metninin okunabilirliğini korur
    • Gerçekçi kâğıt dokusunu yoğun metinle birleştirerek gazete biçiminde görüntüler üretir
  • Düzenleme ve el yazısı

    • Kitap sayfasının üzerine kırmızı el yazısı notlar ekleyebilir
    • Alt çizgi, dalgalı çizgi, daire, ok ve kısa notları içerir
    • Lise öğrencisinin ders notlarına benzer doğal bir el yazısı stili uygular
  • Doku ifadesi ve restorasyon

    • Portre fotoğraflarında gözenek, saç ve cilt dokusu gibi mikro öğeleri betimler; diğer nesnelerin ince dokularını da ifade edebilir
    • Hasar görmüş ya da bazı bölümleri kaybolmuş geleneksel resimleri, özgün resim üslubuna ve fırça darbelerine uygun şekilde restore eder
    • Kartal savaş resmindeki mürekkep tonlarını, tüy dokusunu ve kompozisyon dengesini korurken küf lekelerini ve hasar izlerini giderir, eksik bölümleri tamamlar

Dil, UI ve dünya bilgisinden yararlanma

  • 12 dili, birden çok yazı tipini, 100’den fazla sanat stilini ve çeşitli UI arayüzlerini destekler
  • Japonca, Korece ve İspanyolcayı doğru şekilde render ettiği örnekler içerir
  • Web sayfaları, oyunlar ve canlı yayınlar gibi çeşitli gerçekçi UI ekranları üretebilir
  • Bilgi tabanlı infografikler

    • Gerçek böcek fotoğrafındaki ana özneyi korurken bunu araştırma amaçlı bir infografiğe genişletir
    • Taksonomi bilgileri, morfolojik özellik açıklamaları, büyütülmüş detay ekranı ve ölçek çubuğu içerir
    • Çıktıyı akademik yayında doğrudan kullanılabilecek bir araştırma diyagramı biçiminde düzenler
  • Güncel bilgi ve IP kullanımı

    • Modelin sahip olduğu bilginin yanı sıra internete bağlanarak güncel bilgileri arayabilir
    • 21 Temmuz Hangzhou hava durumunu arayıp bir hava tahmini görüntüsü üretir
    • Belirli IP karakterlerini bulup bunlara dayanarak görüntü oluşturabilir
    • Qi Baishi ve Van Gogh’un bir canlı yayın odasında Qwen-Image-3.0’ı tanıttığı bir sahne üretir

Üretkenlik işlerine genişleme

  • Üç temel yeteneği temel alarak gazete PDF’leri, kısa dizi storyboard’ları ve karmaşık UI arayüzleri gibi yüksek değerli işleri destekler
  • Görüntü üretim yeteneklerini tasarım, içerik üretimi, eğitim ve e-ticaret gibi daha fazla alanda üretkenlik değeriyle ilişkilendirmeyi hedefler

1 yorum

 
GN⁺ 3 시간 전
Hacker News yorumları
  • Böyle bir modeli çevrim içi alışverişte bu kadar zorlamak tuhaf geliyor. Kıyafetin vücuda iyi oturması için düzeltme yapıp ışığı da daha hoş hale getirdiği için, gerçek kıyafetin hissi ve kalıbını anlamak eskisi kadar zor olmaya devam ediyor

    • Kısa vadeli hedef ürün satmak, ama daha iddialı uzun vadeli hedef reklam ile gerçeklik arasındaki sınırı bulanıklaştırıp satın alma anında sıradan insanların artık bu tür soruları bile sormadığı kültürel normları değiştirmek
      50 yıl sonra “reklamın doğruluğu”nun kendisi bile geri getirilemeyecek ideal bir geçmiş olarak görülebilir
    • Bazılarının istediği şey üretici yapay zekanın kendisinden çok, “bunu yetkin bir fotoğrafçının çektiği gibi yap” tarzı bir görüntüden görüntüye dönüşüm olabilir
      Ama her ay 1.000 yeni ürün eklenen bir platformsa, satın alma dönüşümü açısından gerçek dünyanın kusurlu fotoğrafları daha avantajlı olabilir. Özellikle tüm renk varyantlarının aynı göründüğü 3D tarzı görseller tersine itici geliyor
    • Facebook Marketplace'teki ikinci el mobilya ilanlarında da benzer bir durum var. Görsellerin çoğu Pottery Barn kataloğu gibi yapay zekayla parlatılmış oluyor; ancak en sonda çizik ve hasarla dolu gerçek eşyanın dağınık bir garajda durduğu fotoğrafı gösteriliyor
    • Mevcut yönteme göre, yani profesyonel bir fotoğrafçının mükemmel ışık altında modele gömlek giydirip çekmesinden gerçekten daha az çarpıtıcı olup olmadığı da şüpheli
  • HTML'nin meta keywords alanında hentai, nudes gibi yetişkin içerikle ilgili 100'den fazla öğe olması ilginç

    • Bu anahtar kelimeler, ürünü cinsel içerikte kullanmamayı isteyen https://qwen.ai/usagepolicy gibi sayfalara da küresel olarak uygulanmış görünüyor
      Konsolda document.querySelector('meta[name="keywords"]').content çalıştırılırsa tüm etiket görülebiliyor
    • Görünüşe göre bazı SEO araçları meta keywords alanını otomatik eklemiş. qwen içeren yaygın aramaları toplarken, yetişkin içerik bağlamındaki gwen ya da ben gibi yazım hatalarını da dahil etmiş olabilir
    • Bugünlerde keywords meta etiketinin ne işe yaradığını bilmiyorum; sadece sayfaya 77 KB'den fazla gereksiz veri ekliyor
    • Qwen ekibi de, yetişkin içerik topluluklarının Civitai'de görüldüğü gibi yeni görüntü üretim modellerini hızla benimsediğinin farkındadır. Bu, modelin bu kişilerin zaten baktığı arama sonuçlarında görünmesini amaçlayan bir arama motoru optimizasyonu stratejisi gibi duruyor
  • Sanki GPT Image 1 çıktılarıyla eğitilmiş gibi; kendine özgü sarı ton çok belirgin
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1'de de başka görüntü üretim modellerinin çıktılarıyla eğitilmeden sarı ton oluşuyordu. İnsanlar yumuşak gün batımı ışıklı fotoğrafları seviyor ve tercih modeli bunu kolayca yakalayabildiği için, estetik çekicilik optimize edildiğinde kasıtlı olarak bastırılmadıkça tüm görsellerde hafif bir ton oluşuyor
    • Sarımsı ve kırmızımsı tonlar, eğitim fotoğraflarının kaynağından bağımsız olarak çok yaygın bir sorun. Fotoğraf odaklı startup'larda özgün görsellerle eğitim yapılsa bile ton oluşuyordu ve bunu engellemek sürekli zordu
    • Yapay zeka üretimi görseller artık zaten web'in bir parçası olduğundan, sıradan web scraping ile eğitim verisinde üretilmiş görsellerden kaçınmak mümkün değil
  • Kapak görselindeki Arapça başlık bariz şekilde bozuk, ama modeli gerçekten kullanınca durum böyle değil. Kapak görseli Qwen Image 3.0 ile üretilmemiş olabilir

    • Yeni modeli denemek için iyi bir ölçüt. Tamilce ve Arapça Kur'an ayetleriyle GPT Image 2 ve Nano Banana Pro'yu denediğimde düzgün üretmişlerdi; bunun nedeni çok büyük eğitim verisi olabilir
  • “3×3 ızgaranın tamamını doğru şekilde anlatmak için 3.700 token gerektiğini” söylediler ama prompt'u paylaşmadıkları için demoyu ikna edici bulmuyorum

  • Ağırlıkların ne zaman ve yayımlanıp yayımlanmayacağına dair hiçbir şey yok; bunun yazdığı başka bir yer var mı merak ediyorum

    • Qwen-Image-2.0 ağırlıkları da yayımlanmadığı için bunda da ihtimal düşük görünüyor
    • Z-Image ve ilk Qwen-Image'dan sonra tamamen kapalı modele geçmiş gibiler. Yalnızca yayımlanan görsellere bakınca Qwen-Image 3.0, gpt-image-2 ya da nb-pro gibi özel mülk modellerden daha kötü bir alternatif gibi duruyor
    • Yayımlasalar bile geliri Cursor, Azure ve Amazon elde edecek; bunu yapmaları için bir neden yok. OpenAI gerçekten açılmadıkça ihtimal zayıf
  • İki gerçek logo, eksiksiz bir tasarım dili spesifikasyonu ve üç uygulama ekran görüntüsü verdim ama sadece korkunç üç görsel çıktı; bunların hiçbiri sağlanan orijinal logolarla aynı değildi

  • chat.qwen.ai üzerinde denediğimde hem kompozisyon hem de anatomik doğruluk açısından Qwen Image 1 seviyesine bile ulaşmıyor. Üç bacaklı ya da parlayan gözlü sonuçlar veriyor; geri çekilmiş Microsoft Lens ayarında kalite

  • Üniversite yıllarımda böyle modeller olsaydı güzel olurdu. Görsel öğrenen biri olarak bazı konuları uzun yazılardan çok şemalar ve açıklayıcı görseller üzerinden çok daha kolay anlardım

    • Ama üretilen şemalar sadece taklit. Atomun bileşenlerini doğru anlatan bir poster istediğinizde, olasılık bulutuyla ilgili anlatım yerine kırmızı, mavi ve gri pinpon toplarının dairesel yörüngelerde döndüğü bir çizim geliyor; şanslıysanız bir elektron kabuğu diyagramı alırsınız
      Nano Banana 2'ye “atomun nasıl çalıştığını anlatan, lisans öğrencilerine yönelik bir infografik poster” istedim ve ortaokul fen kitabı gibi bir Bohr modeli üretti
    • Eşim tüm tariflerini ChatGPT görsel üretimine verip dergi tarzı sayfalara dönüştürdü ve sonuç harika. Çocukların küçükken yedikleri yemekleri öğrenebilmesi için bir aile yemek kitabı hazırlıyor
  • Görsellerin her yanında hâlâ sarımsı bir filtre kalmış