1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Moonshot AI’ın Kimi K3 modeli; toplam 2.8T, aktif 104B parametreye, yerel görüntü desteğine ve 1 milyon token bağlamına sahip açık ağırlıklı bir modeldir; Unsloth yerelde çalıştırma için GGUF quantization sunar
  • Tam hassasiyetli çıkarım 1.56 TB gerektirir; ancak Dynamic 1-bit UD-IQ1_S, 594 GB’ta yaklaşık %78.9 Top-1 doğruluğa, 861.3 GB’lık 2-bit UD-Q2_K_XL ise yaklaşık %90’a ulaşır
  • Kimi K3, düşünme izlerini koruyan yalnızca düşünme modelidir; Instant modunu desteklemez. reasoning_effort ile "low", "high"", "max" seçilebilir ve en fazla 1,048,576 token işleyebilir
  • Unsloth Studio, RAM offloading’i ve çoklu GPU algılamayı otomatikleştirir; görüntü özelliklerini kullanan llama.cpp çalıştırmaları için Kimi K3’e yönelik Unsloth fork’u gerekir
  • Önerilen UD-IQ1_S çalıştırması için en az 610 GB RAM gerekir; genel olarak RAM+VRAM’in quantization dosya boyutu kadar olması gerekir, yetersiz kalırsa disk offloading nedeniyle ciddi biçimde yavaşlar

Model özellikleri ve yerel çalıştırma gereksinimleri

  • Moonshot AI’ın Kimi K3 modeli; kodlama, ajanlar, uzun bağlam ve sohbet için hedeflenen 2.8T parametreli açık ağırlıklı bir modeldir ve çıkarım sırasında 104B parametreyi etkinleştirir
  • Yerel görüntü desteğini ve 1 milyon token bağlam penceresini destekler; MoE ağırlıklarında MXFP4 kullanır
  • Tam hassasiyetli çıkarım için 1.56 TB depolama alanı gerekir
  • Kimi-K3-GGUF, Unsloth Studio veya llama.cpp üzerinde çalıştırılabilir
  • NVIDIA DGX Station’da veya 128 GB RAM’li bir cihaza bağlı Mac Studio’da da çalıştırılabilir
  • Donanım gereksinimi RAM ve VRAM’in ya da birleşik belleğin toplamı olarak hesaplanır; yapılandırma aralığı 610 GB~1.6 TB’dir

GGUF uygulama yöntemi

  • llama.cpp PR temel alınarak uygulanmıştır; Unsloth fork’u görüntü desteği ve hata düzeltmeleri ekler
  • Görüntü kulesi Kimi K2.5’e benzerdir, ancak şu farklara sahiptir
    • RMSNorm kullanır ve bias yoktur
    • Birleşik QKV kare değildir ve qkv width != n_embd’dir
    • projector’dan sonra normalizasyon uygular
  • Büyük batch’lerde n_tokens * 40 bütçesi başarısız olduğu için n_tokens * 160 değerine çıkarılmıştır
  • Kimi sohbet şablonu Jinja biçimine dönüştürülmüştür
  • Varsayılan eğitim ayarı preserved thinking’i etkinleştirdiğinden, düşünme izleri silinmeden korunur

Quantization yöntemi ve kalite

  • UD-Q8_K_XL, MoE ağırlıklarının MXFP4 ve kalan ağırlıkların BF16 yapılandırmasını aynen izlediği için kayıpsız quantization sayılır
  • UD-Q4_K_XL, normalizasyon tensörleri vb. hariç bazı artık tensörleri Q8_0 olarak saklar; tam hassasiyete yakındır ve 1.51 TB boyutundadır
  • Kayıpsız UD-Q8_K_XL, 1.56 TB ile UD-Q4_K_XL’den 50 GB daha büyüktür
  • Başlıca quantization sonuçları şöyledir
    • UD-IQ1_S: 594.0 GB, perplexity 2.5789, Top-1 doğruluk %78.875±0.107
    • UD-IQ1_M: 648.9 GB, perplexity 2.3639, Top-1 doğruluk %81.219±0.103
    • UD-IQ2_XXS: 711.1 GB, perplexity 2.1266, Top-1 doğruluk %84.127±0.096
    • UD-Q2_K_XL: 861.3 GB, perplexity 1.7359, Top-1 doğruluk %90.390±0.077
    • UD-Q4_K_XL: 1,510 GB, perplexity 1.4579
    • UD-Q8_K_XL: 1,560 GB, perplexity 1.4581
  • imatrix üretimi ve quantization kalibrasyonu için 1.56 TB’lık kayıpsız UD-Q8_K_XL kullanılmıştır
  • Dynamic 1-bit, kayıpsız sürümden %62 daha küçükken yaklaşık %79 Top-1 doğruluğa ulaşır
  • 2-bit UD-Q2_K_XL, %45 daha küçükken yaklaşık %90 doğruluk kaydeder
  • 1-bit boyutu 553.2 GiB’dir; modeli bozmadan 512 GiB altına indirmenin mümkün olup olmadığı araştırılmaktadır
  • Topluluk quantization’larıyla karşılaştırma

    • 618.9 GB’lık topluluk IQ1_M, 594 GB’lık UD-IQ1_S’den daha büyüktür, ancak perplexity 54.56’ya çıkarak 21 kat kötüleşir
    • Topluluk IQ2_XXS, 725 GB’ta perplexity 96 kaydederken Unsloth sürümü 711 GB’ta 2.12 kaydeder; yaklaşık 45 kat fark vardır
    • Dinamik quantization ve doğru kalibrasyon, dosya boyutunu ve kaliteyi birlikte belirler

Çıkarım ayarları ve performans

  • Kimi K3, yalnızca düşünme modelidir; preserve_thinking her zaman etkindir ve varsayılan düşünme seviyesi max’tir
  • Instant modu desteklenmez; reasoning_effort istek alanında "low", "high", "max" belirtilebilir
  • Bağlam uzunluğu en fazla 1,048,576 token’dır ve Unsloth üzerinde üç düşünme seviyesi arasında geçiş yapılabilir
  • Çıkarım ayarları temperature=1.0, top_p=0.95 veya top_p=1.0 içerir
  • Model belleğe sığdığında B200 üzerinde yaklaşık 20 token/sn üretim, 120 token/sn üzerinde işleme hacmi elde edilebilir
  • Boyut ve kalite dengesi dikkate alınarak 594 GB’lık UD-IQ1_S önerilir
  • RAM ve VRAM toplamı quantization dosya boyutuna yakın olmalıdır; yetersiz olsa da çalıştırmak mümkündür, ancak disk offloading nedeniyle ciddi biçimde yavaşlar

Unsloth Studio’da çalıştırma

  • Unsloth Studio, yerel yapay zeka için açık kaynaklı bir web UI’dır; macOS, Windows ve Linux’u destekler
  • GGUF ve safetensors modellerini arar, indirir ve çalıştırır; llama.cpp tabanlı CPU+GPU çıkarımı sağlar
  • RAM offloading’i ve çoklu GPU yapılandırmalarını otomatik olarak algılar
  • Kurulum ve çalıştırma komutları şöyledir
# macOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh


# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex

unsloth studio
  • Çalıştırdıktan sonra tarayıcıda http://127.0.0.1:8888 veya gösterilen adres açılır; ilk çalıştırmada hesap koruması için bir parola oluşturulur
  • Ücretsiz Cloudflare tüneli üzerinden HTTPS ile çalıştırmayı da destekler
unsloth studio --secure
  • Model hub’da Kimi K3 aranarak istenen quantization indirilip çalıştırılır
  • Çıkarım parametreleri otomatik ayarlanır, ancak düşünme seviyesi, bağlam uzunluğu, sohbet şablonu vb. elle değiştirilebilir
  • Ayrıntılı ayarlar Unsloth Studio çıkarım kılavuzunda görülebilir

llama.cpp ile çalıştırma

  • CPU dahil hızlı yerel çıkarım için llama.cpp kullanılır
  • Kimi K3 görüntü desteğini etkinleştirmek için genel sürüm değil, Unsloth’a özel fork derlenmelidir
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
    --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
  • GPU yoksa veya yalnızca CPU çıkarımı kullanılacaksa -DGGML_CUDA=OFF olarak değiştirilir
  • Apple Mac ve Metal cihazları da -DGGML_CUDA=OFF kullanır; Metal desteği varsayılan olarak etkindir
  • llama.cpp’nin modeli doğrudan indirip çalıştırması sağlanabilir, ancak indirme çok yavaş olabilir
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
    --temp 1.0 \
    --top-p 0.95
hf download unsloth/Kimi-K3-GGUF \
    --local-dir unsloth/Kimi-K3-GGUF \
    --include "*mmproj-BF16*" \
    --include "*UD-IQ1_S*"
  • Kayıpsız sürüm gerekiyorsa indirme deseni *UD-Q8_K_XL* olarak değiştirilir
  • Yerel dosya ve görüntü projector’ı belirtilerek sohbet modunda çalıştırılabilir
./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
    --temp 1.0 \
    --top-p 0.95
  • Metin sorgularının yanı sıra mmproj-BF16.gguf kullanılarak görüntü girdisi de desteklenir

Benchmark kapsamı

  • Değerlendirme akıl yürütme-bilgi, kodlama, ajanlar ve görüntü alanlarını kapsar
  • Kullanılan benchmark’lar GPQA Diamond, HLE-Full, DeepSWE, Terminal-Bench 2.1, BrowseComp, GDPval-AA v2, OSWorld 2.0, MMMU-Pro ve MathVision’dır
  • DeepSWE sonuçlarında Kimi K3 verimli performans gösterir

1 yorum

 
plumpmath 20 분 전

Deneyince gördüm, çoook iyiymiş~ Artık tek gereken tangjjamyeon & takuan.