- Moonshot AI’ın Kimi K3 modeli; toplam 2.8T, aktif 104B parametreye, yerel görüntü desteğine ve 1 milyon token bağlamına sahip açık ağırlıklı bir modeldir; Unsloth yerelde çalıştırma için GGUF quantization sunar
- Tam hassasiyetli çıkarım 1.56 TB gerektirir; ancak Dynamic 1-bit
UD-IQ1_S, 594 GB’ta yaklaşık %78.9 Top-1 doğruluğa, 861.3 GB’lık 2-bit UD-Q2_K_XL ise yaklaşık %90’a ulaşır
- Kimi K3, düşünme izlerini koruyan yalnızca düşünme modelidir; Instant modunu desteklemez.
reasoning_effort ile "low", "high"", "max" seçilebilir ve en fazla 1,048,576 token işleyebilir
- Unsloth Studio, RAM offloading’i ve çoklu GPU algılamayı otomatikleştirir; görüntü özelliklerini kullanan
llama.cpp çalıştırmaları için Kimi K3’e yönelik Unsloth fork’u gerekir
- Önerilen
UD-IQ1_S çalıştırması için en az 610 GB RAM gerekir; genel olarak RAM+VRAM’in quantization dosya boyutu kadar olması gerekir, yetersiz kalırsa disk offloading nedeniyle ciddi biçimde yavaşlar
Model özellikleri ve yerel çalıştırma gereksinimleri
- Moonshot AI’ın Kimi K3 modeli; kodlama, ajanlar, uzun bağlam ve sohbet için hedeflenen 2.8T parametreli açık ağırlıklı bir modeldir ve çıkarım sırasında 104B parametreyi etkinleştirir
- Yerel görüntü desteğini ve 1 milyon token bağlam penceresini destekler; MoE ağırlıklarında MXFP4 kullanır
- Tam hassasiyetli çıkarım için 1.56 TB depolama alanı gerekir
- Kimi-K3-GGUF, Unsloth Studio veya
llama.cpp üzerinde çalıştırılabilir
- NVIDIA DGX Station’da veya 128 GB RAM’li bir cihaza bağlı Mac Studio’da da çalıştırılabilir
- Donanım gereksinimi RAM ve VRAM’in ya da birleşik belleğin toplamı olarak hesaplanır; yapılandırma aralığı 610 GB~1.6 TB’dir
GGUF uygulama yöntemi
- llama.cpp PR temel alınarak uygulanmıştır; Unsloth fork’u görüntü desteği ve hata düzeltmeleri ekler
- Görüntü kulesi Kimi K2.5’e benzerdir, ancak şu farklara sahiptir
- RMSNorm kullanır ve bias yoktur
- Birleşik QKV kare değildir ve
qkv width != n_embd’dir
- projector’dan sonra normalizasyon uygular
- Büyük batch’lerde
n_tokens * 40 bütçesi başarısız olduğu için n_tokens * 160 değerine çıkarılmıştır
- Kimi sohbet şablonu Jinja biçimine dönüştürülmüştür
- Varsayılan eğitim ayarı
preserved thinking’i etkinleştirdiğinden, düşünme izleri silinmeden korunur
Quantization yöntemi ve kalite
UD-Q8_K_XL, MoE ağırlıklarının MXFP4 ve kalan ağırlıkların BF16 yapılandırmasını aynen izlediği için kayıpsız quantization sayılır
UD-Q4_K_XL, normalizasyon tensörleri vb. hariç bazı artık tensörleri Q8_0 olarak saklar; tam hassasiyete yakındır ve 1.51 TB boyutundadır
- Kayıpsız
UD-Q8_K_XL, 1.56 TB ile UD-Q4_K_XL’den 50 GB daha büyüktür
- Başlıca quantization sonuçları şöyledir
UD-IQ1_S: 594.0 GB, perplexity 2.5789, Top-1 doğruluk %78.875±0.107
UD-IQ1_M: 648.9 GB, perplexity 2.3639, Top-1 doğruluk %81.219±0.103
UD-IQ2_XXS: 711.1 GB, perplexity 2.1266, Top-1 doğruluk %84.127±0.096
UD-Q2_K_XL: 861.3 GB, perplexity 1.7359, Top-1 doğruluk %90.390±0.077
UD-Q4_K_XL: 1,510 GB, perplexity 1.4579
UD-Q8_K_XL: 1,560 GB, perplexity 1.4581
- imatrix üretimi ve quantization kalibrasyonu için 1.56 TB’lık kayıpsız
UD-Q8_K_XL kullanılmıştır
- Dynamic 1-bit, kayıpsız sürümden %62 daha küçükken yaklaşık %79 Top-1 doğruluğa ulaşır
- 2-bit
UD-Q2_K_XL, %45 daha küçükken yaklaşık %90 doğruluk kaydeder
- 1-bit boyutu 553.2 GiB’dir; modeli bozmadan 512 GiB altına indirmenin mümkün olup olmadığı araştırılmaktadır
-
Topluluk quantization’larıyla karşılaştırma
- 618.9 GB’lık topluluk
IQ1_M, 594 GB’lık UD-IQ1_S’den daha büyüktür, ancak perplexity 54.56’ya çıkarak 21 kat kötüleşir
- Topluluk
IQ2_XXS, 725 GB’ta perplexity 96 kaydederken Unsloth sürümü 711 GB’ta 2.12 kaydeder; yaklaşık 45 kat fark vardır
- Dinamik quantization ve doğru kalibrasyon, dosya boyutunu ve kaliteyi birlikte belirler
Çıkarım ayarları ve performans
- Kimi K3, yalnızca düşünme modelidir;
preserve_thinking her zaman etkindir ve varsayılan düşünme seviyesi max’tir
- Instant modu desteklenmez;
reasoning_effort istek alanında "low", "high", "max" belirtilebilir
- Bağlam uzunluğu en fazla 1,048,576 token’dır ve Unsloth üzerinde üç düşünme seviyesi arasında geçiş yapılabilir
- Çıkarım ayarları
temperature=1.0, top_p=0.95 veya top_p=1.0 içerir
- Model belleğe sığdığında B200 üzerinde yaklaşık 20 token/sn üretim, 120 token/sn üzerinde işleme hacmi elde edilebilir
- Boyut ve kalite dengesi dikkate alınarak 594 GB’lık
UD-IQ1_S önerilir
- RAM ve VRAM toplamı quantization dosya boyutuna yakın olmalıdır; yetersiz olsa da çalıştırmak mümkündür, ancak disk offloading nedeniyle ciddi biçimde yavaşlar
Unsloth Studio’da çalıştırma
- Unsloth Studio, yerel yapay zeka için açık kaynaklı bir web UI’dır; macOS, Windows ve Linux’u destekler
- GGUF ve safetensors modellerini arar, indirir ve çalıştırır;
llama.cpp tabanlı CPU+GPU çıkarımı sağlar
- RAM offloading’i ve çoklu GPU yapılandırmalarını otomatik olarak algılar
- Kurulum ve çalıştırma komutları şöyledir
# macOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh
# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex
unsloth studio
- Çalıştırdıktan sonra tarayıcıda
http://127.0.0.1:8888 veya gösterilen adres açılır; ilk çalıştırmada hesap koruması için bir parola oluşturulur
- Ücretsiz Cloudflare tüneli üzerinden HTTPS ile çalıştırmayı da destekler
unsloth studio --secure
- Model hub’da Kimi K3 aranarak istenen quantization indirilip çalıştırılır
- Çıkarım parametreleri otomatik ayarlanır, ancak düşünme seviyesi, bağlam uzunluğu, sohbet şablonu vb. elle değiştirilebilir
- Ayrıntılı ayarlar Unsloth Studio çıkarım kılavuzunda görülebilir
llama.cpp ile çalıştırma
- CPU dahil hızlı yerel çıkarım için llama.cpp kullanılır
- Kimi K3 görüntü desteğini etkinleştirmek için genel sürüm değil, Unsloth’a özel fork derlenmelidir
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
--target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
- GPU yoksa veya yalnızca CPU çıkarımı kullanılacaksa
-DGGML_CUDA=OFF olarak değiştirilir
- Apple Mac ve Metal cihazları da
-DGGML_CUDA=OFF kullanır; Metal desteği varsayılan olarak etkindir
llama.cpp’nin modeli doğrudan indirip çalıştırması sağlanabilir, ancak indirme çok yavaş olabilir
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
--temp 1.0 \
--top-p 0.95
hf download unsloth/Kimi-K3-GGUF \
--local-dir unsloth/Kimi-K3-GGUF \
--include "*mmproj-BF16*" \
--include "*UD-IQ1_S*"
- Kayıpsız sürüm gerekiyorsa indirme deseni
*UD-Q8_K_XL* olarak değiştirilir
- Yerel dosya ve görüntü projector’ı belirtilerek sohbet modunda çalıştırılabilir
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
--temp 1.0 \
--top-p 0.95
- Metin sorgularının yanı sıra
mmproj-BF16.gguf kullanılarak görüntü girdisi de desteklenir
Benchmark kapsamı
- Değerlendirme akıl yürütme-bilgi, kodlama, ajanlar ve görüntü alanlarını kapsar
- Kullanılan benchmark’lar GPQA Diamond, HLE-Full, DeepSWE, Terminal-Bench 2.1, BrowseComp, GDPval-AA v2, OSWorld 2.0, MMMU-Pro ve MathVision’dır
- DeepSWE sonuçlarında Kimi K3 verimli performans gösterir
1 yorum
Deneyince gördüm, çoook iyiymiş~ Artık tek gereken tangjjamyeon & takuan.