2 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Geçen yıl duyurulan Kimi Linear’ı 48B’den 2.8T’ye ölçekleyen bir üretim modeli; şu anda açık ağırlıklı modeller arasında en büyük ölçekli model
  • Yeni tanıtılan LatentMoE, büyük doğrusal katmanları down-projection ile sıkıştırıyor; genel yapı ise standart MoE ve attention’ı çıkarım verimliliği odaklı bileşenlerle değiştiriyor
  • Attention residuals, katmanlar arası residual bağlantıları attention skorlarına dayalı ağırlıklarla bağlayarak doğrulama kaybını ve downstream performansı tutarlı biçimde az da olsa iyileştiriyor
  • Attention residuals eğitim maliyetini yaklaşık %4, çıkarım maliyetini yaklaşık %2 artırıyor; tüm RoPE katmanları kaldırılıp genelinde NoPE uygulanıyor
  • Yerel multimodal destek de eklenerek, Kimi Linear’ın büyük ölçekli genişlemesiyle birlikte çıkarım verimliliği ve residual yol iyileştirmeleri hedefleniyor

Kimi Linear’dan 2.8T’ye ölçekleme

  • Kimi K3, Kimi Linear’ın 48B’den 2.8T’ye ölçeklenmiş üretim sürümüdür ve şu anda açık ağırlıklı modeller arasındaki en büyük ölçektedir
  • Kimi Linear’a kıyasla yeni eklenen LatentMoE, özünde Nemotron 3 Ultra’daki yöntemle aynıdır
  • Nemotron 3 ve DeepSeek V4 gibi modellerde görülen eğilim doğrultusunda çıkarım verimliliğini artırmaya odaklanır
    • Standart MoE yerine LatentMoE kullanır
    • Standart attention yerine multi-head latent attention ve Kimi Delta Attention kullanır

Residual yollar ve konum bilgisi

  • Attention residuals, verimlilik optimizasyonu değil residual yolları iyileştirme amaçlı bir bileşendir ve Kimi Linear’da da zaten uygulanmıştı
    • DeepSeek V4’ün mHC’si (manifold-constrained Hyper-Connections) residual yolları genişletirken, attention residuals katmanlar arasındaki residual bağlantıları bağlar
    • Her residual bağlantının önemini veya katkısını gösteren attention skorlarını bağlantı ağırlığı olarak kullanır
    • Teknik rapora göre doğrulama kaybı ve downstream performans tutarlı biçimde az da olsa iyileşir; ancak eğitim maliyeti yaklaşık %4, çıkarım maliyeti yaklaşık %2 artar
  • Tüm RoPE katmanları kaldırılıp NoPE, yani konum embedding’i yok, tüm katmanlara uygulanır
    • Son dönemde diğer mimarilerde sliding window attention gibi yerel attention’da RoPE, global katmanlarda ise NoPE kullanma eğilimi vardı
    • Yalnızca NoPE kullanan önceki mimariler de var; ancak Kimi K3, doğrulanan kapsamda bunu baştan sona uygulayan ilk frontier seviyesinde modeldir

Yerel multimodal destek

  • Kimi K3’e yerel multimodal destek de eklendi

1 yorum

 
GN⁺ 3 시간 전
Hacker News görüşleri
  • Batılı araştırma laboratuvarlarının başındakiler Kimi’yi sadece damıtma saldırısının bir ürünü gibi göstermeye çalışsa da, gerçekte yeni ve özgün yaklaşımlar getiriyor

  • Sebastian Raschka mükemmel bir büyük dil modeli araştırmacısı ve yazar; Substack’ini şiddetle tavsiye ederim

    • Daha önce fark etmemiştim ama ana noktayı doğrudan yakalarken aynı zamanda anlaşılır yazmasına hayran kaldım
    • Kabaca üretilmiş AI özetleriyle dolu bir alanda nadir bulunan bir cevher gibi, bu yüzden RSS feed’ime ekledim
  • “İlginç biçimde Kimi K3 tüm RoPE katmanlarını kaldırıyor ve bunun yerine her yerde NoPE(No Positional Embeddings) kullanıyor” deniyor
    Bunun gerçekten çalışması başlı başına şaşırtıcı. Konum bilgisi olmadan bunun bir token çorbasına dönüşüp dönüşmediğini, ikinci token’ın gömme uzayında bir şeyler biriktirmeyi öğrenmesinin gerçekten ikinci olduğunu anlayacak kadar attention’ın hassas olup olmadığını merak ediyorum

    • Nedensel maskeleme sayesinde model örtük konum gömmeleri öğrenebilir. Transformer bloklarının permütasyon değişmez olduğu yönündeki yaygın kanı aslında doğru değil
    • Decoder-only nedensel Transformer’larda konum gömmeleri zorunlu değil, ama orijinal Transformer makalesindeki encoder gibi nedensel olmayan modellerde kesinlikle gerekli
      Birikim sezgisi de yerinde. Attention head’lerin bir kısmı residual stream’in aynı bölgesine sürekli değer yazarsa, giriş token’ları arttıkça attention toplamasıyla değer birikir ve ayrı bir konum kodlaması olmadan bir tür indeks işlevi görebilir
    • Doğrusal katmanlar FIR filtresi benzeri sönümleme kullanarak doğal biçimde göreli konum sağlar. Böylece tam attention katmanları mesafeden bağımsız olarak kavramları birbirine bağlamaya odaklanabilir
    • Bu tür hibrit attention modellerinde, en azından durum uzayı modeli (SSM) katmanları döngüsel yapı üzerinden göreli konum gömmelerini zaten içselleştiriyor olmalı
  • Her yerde NoPE kullanılması ilginç. Diğer modeller genelde yerel katmanlarda RoPE bırakırken, burada Kimi Delta gibi doğrusal attention katmanları konum işlemeyi sessizce üstlendiği için bunun atlanabildiği anlaşılıyor. Bunun en ileri ölçekte de korunup korunmayacağını merak ediyorum

    • İsminin aksine Kimi Delta Attention(KDA), olağan anlamda bir attention’dan çok, eğitim sırasında verimli biçimde paralelleştirilebilen bir RNN’e daha yakın. Küçük, düzenlenebilir bir attention belleği gibi çalışan bir gizli duruma sahip RNN olan Gated DeltaNet’in hafifçe değiştirilmiş bir yapısı
      RNN’e benzediği için XYZ’de X, Y, Z sırasını özünde algılar. Temel Transformer ise sırasız bir küme işler, bu yüzden öğeler arasındaki konumu ayrıca belirtmek gerekir
      Her attention katmanı başına 3 KDA katmanı var ve ilk attention katmanından önce de 3 tane bulunuyor; dolayısıyla tüm token’lar ilk gerçek attention katmanına ulaşmadan önce kendi konum bilgilerini öğrenebiliyor
      RoPE bilgiyi kısmen bozduğu için, böyle atlanabilmesi avantajlı. Gemma-4 de küresel attention katmanı başına beş sliding window attention(SWA) katmanıyla benzer bir 5:1 yapıya sahip. SWA ucuz ve daha düşük performanslı olsa da yerel bilgiyi işler ve güçlü küresel katmanların arasını doldurur; bu modelde KDA aynı rolü üstleniyor
      Gemma’da yalnızca gerçek attention olan SWA’da RoPE gerekiyor, küresel attention’da ise atlanıyor. KDA attention olmadığı için konum gömmesine ihtiyaç duymuyor
      Bunun ötesinde ne kadar daha ileri bir ölçek gerektiğini bilmiyorum ama daha büyük ölçekte de çalışmaması için bir neden yok. Parametre sayısı arttıkça KDA katmanlarının konum bilgisini aktarması hatta daha da kolaylaşıyor
    • Kimi K3, benchmark’larda Opus ve Fable ile benzer aralıkta; bunun ötesinde daha büyük bir ölçeğin gerçekten son teknoloji sayılıp sayılmayacağı tartışılır. Hepsi 2–4 trilyon parametre aralığında ve ana farkın eğitim kalitesi ile mimari olması beklenir
    • Biraz garip bir yan etki de var. Denediğim sağlayıcılar KV cache’i en son giriş prompt’una kadar değil, 1.024 token’lık sabit artımlı bloklar halinde uygulamıştı. Bunun sonucunda her çıkarımda cache miss giriş token’larına en fazla 1.023 ek token daha ekleniyor