- Geçen yıl duyurulan Kimi Linear’ı 48B’den 2.8T’ye ölçekleyen bir üretim modeli; şu anda açık ağırlıklı modeller arasında en büyük ölçekli model
- Yeni tanıtılan LatentMoE, büyük doğrusal katmanları down-projection ile sıkıştırıyor; genel yapı ise standart MoE ve attention’ı çıkarım verimliliği odaklı bileşenlerle değiştiriyor
- Attention residuals, katmanlar arası residual bağlantıları attention skorlarına dayalı ağırlıklarla bağlayarak doğrulama kaybını ve downstream performansı tutarlı biçimde az da olsa iyileştiriyor
- Attention residuals eğitim maliyetini yaklaşık %4, çıkarım maliyetini yaklaşık %2 artırıyor; tüm RoPE katmanları kaldırılıp genelinde NoPE uygulanıyor
- Yerel multimodal destek de eklenerek, Kimi Linear’ın büyük ölçekli genişlemesiyle birlikte çıkarım verimliliği ve residual yol iyileştirmeleri hedefleniyor
Kimi Linear’dan 2.8T’ye ölçekleme
- Kimi K3, Kimi Linear’ın 48B’den 2.8T’ye ölçeklenmiş üretim sürümüdür ve şu anda açık ağırlıklı modeller arasındaki en büyük ölçektedir
- Kimi Linear’a kıyasla yeni eklenen LatentMoE, özünde Nemotron 3 Ultra’daki yöntemle aynıdır
- Multi-head latent attention ile benzer şekilde büyük doğrusal katmanları down-projection ile sıkıştırır
- Nemotron 3 ve DeepSeek V4 gibi modellerde görülen eğilim doğrultusunda çıkarım verimliliğini artırmaya odaklanır
- Standart MoE yerine LatentMoE kullanır
- Standart attention yerine multi-head latent attention ve Kimi Delta Attention kullanır
Residual yollar ve konum bilgisi
- Attention residuals, verimlilik optimizasyonu değil residual yolları iyileştirme amaçlı bir bileşendir ve Kimi Linear’da da zaten uygulanmıştı
- DeepSeek V4’ün mHC’si (manifold-constrained Hyper-Connections) residual yolları genişletirken, attention residuals katmanlar arasındaki residual bağlantıları bağlar
- Her residual bağlantının önemini veya katkısını gösteren attention skorlarını bağlantı ağırlığı olarak kullanır
- Teknik rapora göre doğrulama kaybı ve downstream performans tutarlı biçimde az da olsa iyileşir; ancak eğitim maliyeti yaklaşık %4, çıkarım maliyeti yaklaşık %2 artar
- Tüm RoPE katmanları kaldırılıp NoPE, yani konum embedding’i yok, tüm katmanlara uygulanır
- Son dönemde diğer mimarilerde sliding window attention gibi yerel attention’da RoPE, global katmanlarda ise NoPE kullanma eğilimi vardı
- Yalnızca NoPE kullanan önceki mimariler de var; ancak Kimi K3, doğrulanan kapsamda bunu baştan sona uygulayan ilk frontier seviyesinde modeldir
Yerel multimodal destek
- Kimi K3’e yerel multimodal destek de eklendi
1 yorum
Hacker News görüşleri
Batılı araştırma laboratuvarlarının başındakiler Kimi’yi sadece damıtma saldırısının bir ürünü gibi göstermeye çalışsa da, gerçekte yeni ve özgün yaklaşımlar getiriyor
Sebastian Raschka mükemmel bir büyük dil modeli araştırmacısı ve yazar; Substack’ini şiddetle tavsiye ederim
“İlginç biçimde Kimi K3 tüm RoPE katmanlarını kaldırıyor ve bunun yerine her yerde NoPE(No Positional Embeddings) kullanıyor” deniyor
Bunun gerçekten çalışması başlı başına şaşırtıcı. Konum bilgisi olmadan bunun bir token çorbasına dönüşüp dönüşmediğini, ikinci token’ın gömme uzayında bir şeyler biriktirmeyi öğrenmesinin gerçekten ikinci olduğunu anlayacak kadar attention’ın hassas olup olmadığını merak ediyorum
Birikim sezgisi de yerinde. Attention head’lerin bir kısmı residual stream’in aynı bölgesine sürekli değer yazarsa, giriş token’ları arttıkça attention toplamasıyla değer birikir ve ayrı bir konum kodlaması olmadan bir tür indeks işlevi görebilir
Her yerde NoPE kullanılması ilginç. Diğer modeller genelde yerel katmanlarda RoPE bırakırken, burada Kimi Delta gibi doğrusal attention katmanları konum işlemeyi sessizce üstlendiği için bunun atlanabildiği anlaşılıyor. Bunun en ileri ölçekte de korunup korunmayacağını merak ediyorum
RNN’e benzediği için XYZ’de X, Y, Z sırasını özünde algılar. Temel Transformer ise sırasız bir küme işler, bu yüzden öğeler arasındaki konumu ayrıca belirtmek gerekir
Her attention katmanı başına 3 KDA katmanı var ve ilk attention katmanından önce de 3 tane bulunuyor; dolayısıyla tüm token’lar ilk gerçek attention katmanına ulaşmadan önce kendi konum bilgilerini öğrenebiliyor
RoPE bilgiyi kısmen bozduğu için, böyle atlanabilmesi avantajlı. Gemma-4 de küresel attention katmanı başına beş sliding window attention(SWA) katmanıyla benzer bir 5:1 yapıya sahip. SWA ucuz ve daha düşük performanslı olsa da yerel bilgiyi işler ve güçlü küresel katmanların arasını doldurur; bu modelde KDA aynı rolü üstleniyor
Gemma’da yalnızca gerçek attention olan SWA’da RoPE gerekiyor, küresel attention’da ise atlanıyor. KDA attention olmadığı için konum gömmesine ihtiyaç duymuyor
Bunun ötesinde ne kadar daha ileri bir ölçek gerektiğini bilmiyorum ama daha büyük ölçekte de çalışmaması için bir neden yok. Parametre sayısı arttıkça KDA katmanlarının konum bilgisini aktarması hatta daha da kolaylaşıyor