1 puan yazan GN⁺ 1 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Kimi Linear, KDA ve MLA’yı 3:1 oranında yerleştiren hibrit bir yapıdır; aynı eğitim koşullarında tamamen MLA’ya kıyasla kısa ve uzun bağlam ile pekiştirmeli öğrenme değerlendirmeleri genelinde daha yüksek performans kaydetti
  • Çekirdek modül olan Kimi Delta Attention (KDA), Gated DeltaNet’in kafa bazlı unutma kapısını kanal bazına ayrıntılandırarak, sonlu RNN belleğindeki her özellik boyutunun bağımsız bir unutma oranına sahip olmasını sağlar
  • Özel Diagonal-Plus-Low-Rank (DPLR) geçiş matrisi ve parça bazlı paralel algoritma sayesinde genel DPLR’ye göre işlem miktarını azalttı; operatör verimliliği yaklaşık %100 arttı
  • 3B aktif parametreli ve 48B toplam parametreli model 1.4T token ile eğitilerek MMLU-Pro 4K’da 51,0 puan, RULER 128K’da 84,3 puan ve 3,98 kat hızlanma elde etti; 1M token’da ise MLA’ya göre çıktı token’ı başına süre 6,3 kat hızlandı
  • Uzun metin üretiminde KV önbelleğini en fazla %75 azaltırken, mevcut tam dikkat hattının önbellek ve zamanlama arayüzlerini değiştirmeden uygulanabilir; KDA çekirdeği, vLLM uygulaması ve model checkpoint’leri de yayımlandı

Uzun vadeli akıl yürütmede tam dikkatin oluşturduğu darboğaz

  • Ajan tipi LLM’ler ve pekiştirmeli öğrenme tabanlı test zamanı ölçeklendirme, çıkarım sırasında uzun yörüngeleri, araç kullanımı etkileşimlerini ve karmaşık karar verme alanlarını işlemek zorunda
  • Standart softmax dikkatinin zaman karmaşıklığı karesel olarak artar ve KV önbelleği bağlam uzunluğuyla orantılı büyüdüğü için iş hacmini, bağlam genişletmeyi ve gerçek zamanlı etkileşimi sınırlar
  • Lineer dikkat hesaplama karmaşıklığını düşürebilir, ancak ifade gücü sınırlı olduğundan kısa dizilerin dil modellemesinde bile softmax dikkatinden daha düşük performans gösterdi
  • Son dönemdeki kapılama ve sönümleme mekanizmaları ile delta kuralı (delta rule) orta uzunluktaki dizilerde kalite farkını azalttı; ancak saf lineer yapılar, sonlu durum kapasitesi nedeniyle uzun dizi modelleme ve bağlam içi aramada sınırlamalara sahip
  • Bazı küresel dikkat katmanları ile çok sayıda lineer katmanı birleştiren hibrit yapılar kalite ve verimlilik arasında bir uzlaşma olarak ortaya çıktı; ancak mevcut modeller ya sınırlı ölçekteydi ya da çeşitli benchmark değerlendirmeleri eksikti

Lineer dikkatten Gated DeltaNet’e

  • Temel lineer dikkat, matris biçimindeki döngüsel duruma anahtar-değer ilişkilerini sürekli biriktirir ve bunu geçici bir ilişkisel bellek olan hızlı ağırlık (fast weight) olarak kullanır
    • Hangi anıların silineceğini belirleyen bir ölçüt olmadığı için durum sınırsız biçimde birikir ve uzun bağlamlarda girişim oluşur
  • DeltaNet, durumun anahtarı değere geri döndürmesi için yeniden yapılandırma kaybına yönelik çevrimiçi gradyan inişi gerçekleştirir
    • Mevcut durumu sürekli düzelten klasik delta kuralını kullanır
    • Rank-1 güncellemesi genelleştirilmiş Householder dönüşümüne denktir ve parça bazında paralelleştirilebilir
  • Gated DeltaNet (GDN), eski ilişkileri sönümlemek için skaler unutma kapısı αt ekler
    • Kapı, hızlı ağırlıklar üzerinde ağırlık sönümlemesi gibi çalışır ve veriye bağlı L2 düzenlileştirmeye benzer bir unutma mekanizması uygular
    • Bellek ömrünü kontrol edip girişimi azaltırken DeltaNet’in paralelleştirme yapısını korur
  • GDN, geçiş matrisinin veriye bağlı ve öğrenilebilir olması bakımından, RoPE’nin ortogonallik kısıtını gevşeten çarpımsal bir konumsal kodlama olarak yorumlanabilir

Kimi Delta Attention’ın ayrıntılı bellek kontrolü

  • KDA, GDN’in tek skaler sönümlemesini köşegenleştirilmiş kanal bazlı kapıyla değiştirerek her özellik boyutunun bellek sönümlemesini ve konum bilgisini bağımsız biçimde kontrol eder
  • Kanal bazlı unutma oranı, sınırlı sonlu durum RNN belleğini daha hassas biçimde ayarlar ve Gated Linear Attention’a (GLA) benzer bir ayrıntı düzeyi sağlar
  • Geçiş dinamikleri özel bir DPLR matrisi ile parametreleştirilir ve klasik delta kuralıyla tutarlılığı korur
  • Bir dizi rank-1 matris dönüşümü yoğun bir gösterime sıkıştırılır; bu da köşegen kapılama altında bile kararlı parça bazlı paralel işlemeyi destekler

Parça bazlı paralel algoritma

  • Dizi sabit uzunluklu parçalara ayrılır ve her parçanın başlangıç durumu olarak önceki parçanın son durumu kullanılır
  • WY gösterimiyle birden çok rank-1 güncellemesi tek bir sıkıştırılmış gösterimde birleştirilir; Comba açılımını izleyerek sonraki hesaplamalarda ek matris tersine alma gereksinimini ortadan kaldırır
  • UT dönüşümü, matris çarpımı dışındaki işlemlerin FLOP sayısını azaltarak eğitim sırasında donanım kullanım oranını artırır
    • Alt üçgensel matrisin tersi, Gauss eliminasyonundaki ileri yerine koyma kullanılarak satır bazında hesaplanır
  • Durum güncellemesi parça bazlı matris biçiminde yapılır; çıktı aşamasında ise parçalar arası döngüsel işleme ile parça içi paralel işleme birleştirilir
  • Parça içi hesaplama matris çarpımı merkezli kurgulanarak Tensor Core iş hacminden yararlanılır

Genel DPLR’ye göre azaltılmış işlem miktarı

  • KDA ve genelleştirilmiş DPLR, her ikisi de ayrıntılı sönümlemeyi desteklediği için ifade kapasitesi açısından karşılık gelir
  • Ayrıntılı sönümleme, parça içi bölmede sayısal hassasiyet sorunlarına yol açabilir
    • GLA, logaritmik alanda hesaplama ve tam hassasiyetli ikincil parçalama kullanır; ancak yarı hassasiyetli matris çarpımından yararlanma sınırlı olduğu için operatör hızı düşer
  • KDA, DPLR geçişinin iki değişkenini de anahtar k ile bağlar
    • İkincil parça matrisi hesaplamalarını 4’ten 2’ye düşürür
    • 3 ek matris çarpımını ortadan kaldırır
  • Girdi uzunluğuna göre yapılan çekirdek ölçümlerinde KDA’nın operatör verimliliği genel DPLR’ye göre yaklaşık %100 arttı

Kimi Linear model yapılandırması

  • Model omurgası Moonlight’ı izler; token karıştırma katmanının arkasına MoE kanal karıştırma katmanı yerleştirilir
  • Her KDA kafasının sorgu, anahtar ve değerleri ShortConv ve Swish üzerinden hesaplanır
    • Sorgu ve anahtarlara özdeğer kararlılığı için L2 normalizasyonu eklenir
    • Anahtar ve değerin kafa boyutu tüm deneylerde 128 olarak ayarlanır
  • Kanal bazlı sönümleme kapısı, kafa boyutuyla aynı rank’e sahip düşük rank’li projeksiyonla parametreleştirilir ve GDN ile Mamba’ya benzer bir sönümleme fonksiyonu kullanır
  • Çıkış projeksiyonu öncesinde kafa bazlı RMSNorm ve veriye bağlı çıkış kapısı uygulanır
    • Çıkış kapısı da düşük rank’li kurularak tam rank’li kapıya benzer performans korunurken adil parametre karşılaştırması desteklenir
    • Bu kapı Attention Sink etkisini hafifletir

KDA ve MLA’nın 3:1 hibriti

  • Saf lineer dikkatin uzun bağlam aramadaki sınırlarını telafi etmek için KDA katmanları arasına tam küresel dikkat olan Full MLA katmanları yerleştirilir
  • Kafaları tek bir katman içinde karıştırmak yerine tüm katmanlar dönüşümlü yerleştirilir
    • Katman bazlı yapılandırma altyapı açısından basittir ve eğitim kararlılığı yüksektir
  • Deneylerde, 3 KDA’dan sonra 1 MLA’nın tekrarlandığı 3:1 oranı, kalite ve iş hacmi arasında en iyi dengeyi sağladı
  • Uzun metin üretiminde yalnızca tam dikkat katmanları KV önbelleğini tuttuğu için bellek ve KV önbelleği kullanımı en fazla %75 azalırken küresel bilgi akışı korunur

NoPE uygulaması ve değerlendirme sonuçları

  • Tüm MLA katmanlarında konumsal kodlama kullanmayan NoPE uygulanır; konum bilgisi ve güncellik yanlılığını KDA üstlenir
  • KDA, kısa konvolüsyon veya kayan pencere dikkati gibi yardımcı konum farkındalığı bileşenlerine benzer ya da daha güçlü bir rol oynar
  • NoPE kullanıldığında MLA, çıkarım sırasında verimli saf Multi-Query Attention’a (MQA) dönüştürülebilir
  • RoPE’nin frekans tabanlı ayarlaması veya YaRN gibi tekniklere gerek kalmadığından uzun bağlam eğitimi basitleşir
  • Aynı yöntemle 1.4T token üzerinde eğitilen karşılaştırmada Kimi Linear şu sonuçları kaydetti
    • MMLU-Pro 4K’da 51,0 puan ile MLA’nın 47,2 puanını ve GDN-H’nin 47,9 puanını geçti
    • RULER 128K’da 84,3 puan ve 3,98 kat hızlanma elde ederek MLA’nın 81,3 puanını ve GDN-H’nin 80,5 puanını aştı
    • 1M token’da çıktı token’ı başına süre (TPOT) 1,84 ms oldu; MLA’nın 11,48 ms değerinden 6,3 kat daha hızlı
    • Uzun dizilerde de düşük TPOT değerini koruyarak daha büyük batch’lerin kullanılmasını sağlar
  • Ön eğitim modeli 3B aktif parametreye ve 48B toplam parametreye sahiptir; kısa bağlam, uzun bağlam ve pekiştirmeli öğrenme tarzı sonradan eğitim görevlerinde tam MLA’yı tutarlı biçimde geride bıraktı
  • KDA çekirdeği, vLLM entegrasyonu ve Kimi-Linear-48B-A3B-Instruct checkpoint’i yayımlandı
    • Mevcut tam dikkat hattının önbellek veya zamanlama arayüzlerini değiştirmeden yerine kullanılabilir

1 yorum

 
GN⁺ 1 시간 전
Hacker News yorumları
  • Yakın zamanda yayımlanan Kimi K3 makalesine bakınca, burada ele alınan Kimi Linear’ı büyük ölçeğe genişleten; yerel görme yetenekleri ve pekiştirmeli öğrenme iyileştirmeleri gibi eklemeler yapan bir yapı olduğu görülüyor
    https://arxiv.org/abs/2607.24653

  • En ileri modellerde görülen zekânın gerçekten mimari ölçeklendiğinde ortaya çıkan bir belirim (emergence) olup olmadığını merak ediyorum
    Aynı yapıya sahip 1 milyon parametreli bir modelin temel bulmacaları bile çözemeyip, 1 trilyon parametreli bir modelin Jacobi varsayımına karşı örnekler bile üretebilmesi sezgilere aykırı görünüyor. Basit bir sıralama algoritmasına daha fazla hesaplama vermek onu quicksort’tan iyi yapmaz; ama modern LLM araştırması, aynı algoritma ve yapıyı sürekli büyütüp cevabın ortaya çıkmasını bekleyen bir yarış gibi görünüyor

    • Bu, makine öğrenmesinde Acı Ders (The Bitter Lesson) olarak iyi bilinen bir olgu. Hesaplama miktarı çok artsa da ölçeklenmeye devam eden genel yöntemlerin gücünü öğrenmek gerekiyor; bu yöntemlerin özü de arama ve öğrenme
      Kısa özgün metin de okunmaya değer: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
    • Artık bu alandan ayrıldım ve uzmanlığım da LLM’den çok pekiştirmeli öğrenmeye yakın; ama sonuçta anlam ve zekânın iç temsillerde bulunduğunu düşünüyorum. Küçük bir model, girdiyi anlam ve çıktıyla bağlayan iç eşlemeyi baştan öğrenmek için yeterli kapasiteye sahip olmayabilir ya da basit sıralama gibi teoride mümkün olsa bile pratikte başa çıkılamayacak kadar uzun zaman gerektirebilir
      Büyük modelin bu iç temsil uzayında dayanak noktaları oluşturması daha kolaydır; optimizasyon tamamlandıktan sonra ağırlıkların çoğu pek bir şey yapmıyor da olabilir. Bu uzayı öğrenmek için gereken ifade gücü hâlâ net değil, ancak şu ana kadar milyarlarca parametre gerekiyor gibi görünüyor
      Daha ilginç soru, modelin veriye karşı ne kadar değişmez olması gerektiği. Matematiksel akıl yürütme ve programlamanın genel performansı ciddi ölçüde artırmasının nedeni, geniş bir görev kümesinde tekrarlanabilir beceriler olmaları bence. Dilden veya görevden bağımsız programlama mantığını yoğun biçimde öğretmek, daha küçük modellere giden yol olabilir
    • Model ölçeğini büyütmek, zekâyı artırmanın en tutarlı ve güvenilir yollarından biri. Yapay zeka eğitimi, algoritmalarla başka algoritmaları hesaplamalı olarak bulma ve iyileştirme süreci; ölçeği büyütmek, hedefe uygun daha iyi algoritmaları aramak için daha fazla kaynak sağlar
      Benzetmeyle, küçük bir model kapasite ve öğrenme sinyali kısıtları nedeniyle içeride bubble sort düzeyinde kalırken, büyük model daha derin arama yapıp quicksort’a daha yakın bir yöntem bulabilir
      Zekâ ikili değildir; 1 milyar parametreli model de 10 trilyon parametreli model de bir ölçüde zekâya sahiptir. İlki istatistiksel düzenliliklere fazla yaslandığı için görmezden gelmesi kolaydır; ikincisi ise çözülememiş bir varsayıma yeni karşı örnekler bulacak kadar gelişmiştir. İkisi arasındaki fark da ani bir sıçramadan çok, küçük iyileşmelerin birikip çığa dönüşmesine benzer
      Matematik yeteneği gibi somut başarılar bir anda sıçrıyormuş gibi görünse de, altında hataları azaltma ve hatalardan toparlanma gibi genel yetenekler kademeli olarak birikir. Bu yetenekler yeterince iyileştiğinde, tamamen yeni türde mantık problemleri de çözülmeye başlar
    • Derin öğrenme teorisi açısından bakıldığında zekâ ağırlıklı olarak ölçek büyütmeden gelir; iyi tasarlanmış bir model-optimizatör birleşimi basitliğe doğru güçlü bir örtük önyargıya sahipse, model boyutu arttıkça performans da artmaya devam edebilir
      Marcus Hutter’ın laboratuvarı bunu Solomonoff çıkarımıyla ifade ederek bu önyargının evrensel olarak etkili olduğunu gösterdi. Etkili bir önyargı, boyutluluk lanetini tersine kullanarak; veri arttıkça daha iyi cevaplar almaya benzer şekilde, büyük modellerde performansı sürekli yükseltebilir
      Ancak bu özelliği gösteren model sınıfları son derece dar; biraz da şans eseri o noktaya ulaşmışız gibi. Genel istatistik ilkelerinin hâlâ bu tür davranışı çoğunlukla beklememeyi öğretmesinin nedeni de bu
    • İnsanların temel problemler ve çok zor problemler diye ayırdığı şeyler mutlak ölçekte birbirine çok yakın olabilir. Fark daha çok, problemi çözebilen insanların oranından kaynaklanır; insan yeteneğinin alt sınırı bile oldukça yüksektir. Çoğu insan için temel olan problemleri çözebilen hayvanlar nadirdir, ama karmaşık davranış ve öğrenme mümkündür; nöron ölçeği de insanla akıl almaz derecede farklı değildir
      1 milyondan 1 trilyon parametreye artış 1 milyon kat ölçekleme demektir. Bu, insan beynini her yönde %1 boyuta, yani birkaç mm düzeyine küçültmeye benzer
  • Kimi Linear ile kurum içi bir model yapmaya başlamıştım; sonrasında çıkan Gated Deltanet 2 ifade gücü açısından gelişmiş bir sürüm gibi görünüyordu ve kendi testlerimizde de gerçekten daha iyiydi
    https://arxiv.org/abs/2605.22791

    • Okuyunca LSTM’i yeniden uygulamışlar gibi hissettim
  • Araştırma için KDA çekirdeğini ve vLLM uygulamasını açık kaynak yayımlamaları, ayrıca ön eğitim ve talimat ince ayarı yapılmış model checkpoint’lerini bile dağıtmaları harika

  • Kimi’nin başarısının yalnızca distillation attack kaynaklı olduğuna inanmak istiyorsanız bu araştırmayı görmezden gelebilirsiniz

    • Artık buna distillation attack demeyi bırakmak iyi olurdu
    • Çinli laboratuvarların etkileyici inovasyonlar yaptığı gerçeği ile distillation’dan fayda sağlamış olma ihtimalleri aynı anda doğru olabilir. Hangisinin ne kadar katkı yaptığı bilinmez; ama yalnızca birinin doğru olması gerektiğini söylemek sahte ikilemdir
    • Distillation’ı kınamak, bir kumarhanenin kart saymayı kınaması gibi geliyor
    • ABD’nin yapay zeka yarışını kazanmasını istiyorum; ama günümüzdeki icatların çoğunun da geçmiş bilginin distillation’ı olup olmadığını anlamakta zorlanıyorum. Anthropic’in, aldığı verilerin ticari sır olduğunu mu iddia ettiğini merak ediyorum
    • En ileri modeller tek bir unsurla yapılamaz. Bu yalnızca kademeli bir iyileştirme; modelin tüm başarısını açıklamaz ve distillation konusundaki görüşten bağımsız olarak eğitim veri kümesi muazzam derecede önemlidir
  • Aynı boyuttaki tam attention modeline kıyasla uzun bağlam araması, özellikle needle-in-a-haystack veya RULER performansının nasıl olduğunu merak ediyorum. Verimlilik artışı harika; ama lineer attention hibrit modelleri genellikle bu noktada çöküyor

  • Bu tür standart dışı Transformer’lar yaygın kullanılmaya başlarsa Etched gibi şirketlerin zor durumda kalıp kalmayacağını merak ediyorum

  • Bu makale 2025 tarihli ve üzerinden şimdiden 9 ay geçti; bu arada önemli modeller yeni yayımlandı

    • K3 hakkında şu makaleyi okumak daha iyi: https://arxiv.org/abs/2607.24653
      K3 makalesinin temel katkısı Stable LatentMoE. Bazı başka modeller gibi katmanlar arasında aktarılan veriyi sıkıştırdığı için router’da belirli koşullar gerekiyor; K3 ise daha dengeli bir uzman seçimi stratejisiyle performansı artırıyor
    • O dönemde yeterince tartışılmamıştı: https://news.ycombinator.com/item?id=45766937
    • Yeni Kimi K3’te 69 KDA katmanı ve 24 Gated MLA katmanı bulunduğu için yeniden gündeme getirilmiş gibi görünüyor. Bildiğim kadarıyla önceki büyük Kimi modeli yalnızca MLA katmanları kullanıyordu