- Kimi K3, 2,8 trilyon parametreye ve 1.048.576 token bağlama sahip açık ağırlıklı, yerel çok modlu bir ajan modeli olup uzun süreli kodlama, bilgi çalışması ve akıl yürütmeyi destekler
- Kimi Delta Attention (KDA), Attention Residuals ve Stable LatentMoE'yi birleştirerek 896 uzmandan token başına 16'sını etkinleştirir ve Kimi K2'ye kıyasla genel ölçekleme verimliliği yaklaşık 2,5 kat daha yüksektir
- Açık değerlendirmelerde GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1 elde etti; ancak model bazında harness, akıl yürütme ayarları ve donanım farkları birlikte dikkate alınmalıdır
- MXFP4 ağırlıklar ve MXFP8 aktivasyonlar ile nicemleme farkındalıklı eğitim aldı; Transformers, vLLM, SGLang, Docker ve OpenAI ile Anthropic uyumlu API üzerinden çalıştırılabilir
- Çok turlu kullanım ve araç çağrılarında, API'nin döndürdüğü
reasoning_contentvetool_callsdahil tüm assistant mesajı aynen yeniden iletilmelidir; kod ve ağırlıklar Kimi K3 License ile yayımlanmıştır
Model mimarisi ve ölçeği
- Kimi K3, uzun süreli kodlama, bilgi çalışması ve akıl yürütme için tasarlanmış açık ağırlıklı, yerel çok modlu bir ajan modelidir
- Toplam parametre sayısı 2.8T, etkin parametre sayısı 104B'dir ve 93 katmandan oluşur
- 1 Dense katman, 69 KDA katmanı ve 24 Gated MLA katmanı kullanır
- Attention hidden dimension 7.168, attention head sayısı 96'dır
- Stable LatentMoE, 896 uzmandan token başına 16'sını seçer ve 2 paylaşılan uzman kullanır
- Latent MoE dimension 3.584, uzman başına MoE hidden dimension 3.072'dir
- Kimi K2 ile karşılaştırıldığında genel ölçekleme verimliliği yaklaşık 2,5 kat artmıştır
- Sözlük boyutu 160K, bağlam uzunluğu 1.048.576 token ve aktivasyon fonksiyonu SiTU-GLU'dur
- Görsel kodlayıcı olarak 401M parametreli MoonViT-V2 kullanılır
- Başlıca yetenekler arasında metin, görüntü ve video anlama yer alır; ancak model özet tablosundaki modality alanında yalnızca Text ve Image yazılıdır
Uzun süreli kodlama ve bilgi çalışması
- Minimum insan gözetimiyle uzun mühendislik oturumlarını sürdürürken büyük depoları keşfeder ve terminal araçlarını koordine eder
- GPU kernel optimizasyonu ve derleyici geliştirmeyi destekler
- Görsellikten yararlanan oyun geliştirme, CAD ve çip tasarımı da hedef alanlara dahildir
- Ajan tabanlı bilgi çalışmasında, derin araştırmayla birlikte etkileşimli görselleştirmeler, widget'lar ve panolar üretir
- Hareket tasarımı ve video düzenleme de destek kapsamındadır
- Kodlama ajanı çerçevesi olarak Kimi Code CLI önerilir ve terminalde
/modelkomutuyla Kimi K3 seçilebilir
Değerlendirme sonuçları
- Tüm Kimi K3 sonuçları
reasoning_effort="max", temperature 1.0 ile ölçülmüştür- GPQA Diamond, HLE-Full ve araçsız görsel değerlendirmeler gibi tek adımlı görevlerde top-p 0.95 kullanılmıştır
- Ajan görevlerinde top-p 1.0 uygulanmıştır
- Akıl yürütme ve bilgi değerlendirmelerinde GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7 elde edilmiştir
- HLE-Full araçsız 43.5, araç kullanıldığında 56.0'dır
- Kodlama değerlendirmelerinde ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2 elde edilmiştir
- DeepSWE, Kimi Code harness'ında 67.5, mini-SWE-agent harness'ında 67.3'tür
- SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9 elde edilmiştir
- Ajan değerlendirmelerinde BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2 elde edilmiştir
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8'dir
- Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2 olarak ölçülmüştür
- Görsel değerlendirmelerde OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1 elde edilmiştir
- MMMU-Pro araçsız 81.6, araç kullanıldığında 83.4'tür
- MathVision, Python kullanıldığında 94.3'ten 97.8'e yükselir
- ZeroBench pass@5, araç kullanımıyla 23.0'dan 41.0'a çıkar
Değerlendirme koşulları ve karşılaştırma kısıtları
- Karşılaştırma modelleri arasında Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2 yer alır; ancak değerlendirme harness'ları modele göre farklı olabilir
- Kimi K3 çoğunlukla Kimi Code veya Claude Code kullanır
- GPT ailesi çoğunlukla Codex, diğer Claude ve GLM modelleri ise Claude Code ya da Terminus 2 gibi araçlar kullanır
- SWE-Marathon, nihai v1.1 öncesinde 9 Temmuz 2026 tarihli görevleri H20'ye uyarlanmış bir branch üzerinde değerlendirmiştir
- Docker image, GPU performans ölçütleri ve referans oracle H20 için yeniden kalibre edilmiştir; ancak doğruluk ve hile önleme denetleyicileri değiştirilmemiştir
- Claude Fable 5, görevlerin %35'inde fallback yaşadığı için ölçülen performansı olumsuz etkilenmiş olabilir
- PostTrainBench, resmi ortamdaki H100 yerine H20 GPU üzerinde maksimum akıl yürütme çabasıyla çalıştırılan 3 sonucun ortalamasıdır
- Kimi Code Bench 2.0, siber güvenlik ve güvenlik görevlerini içerir
- Claude Fable 5, 80 görevde 13 fallback ve 1 ret yaşamıştır
- GPT-5.6 Sol 10 görevi, GPT-5.5 ise 3 görevi reddetmiştir
- BrowseComp 91.2, 300K token'da çalışan bir bağlam sıkıştırma stratejisi kullanılarak elde edilmiştir
- Ayrı bir bağlam yönetimi olmadan tüm 1M token penceresi kullanıldığında 90.4 elde edilir
- Çok modlu değerlendirmelerde ZeroBench hariç 3 çalıştırmanın ortalaması kullanılmıştır
- ZeroBench, resmi ayarlara göre 5 kez çalıştırılmıştır
- PerceptionBench, atomik görsel algı yeteneğini ölçen kurum içi bir benchmark'tır
Yerel nicemleme
- SFT aşamasından itibaren nicemleme farkındalıklı eğitim uygulanmıştır
- Ağırlıklarda MXFP4, aktivasyonlarda MXFP8 kullanılarak geniş donanım uyumluluğu hedeflenmiştir
Dağıtım ve çalıştırma yöntemleri
kimi-k3seçilerek Kimi API'ye erişilebilir ve OpenAI ile Anthropic uyumlu API sunulur- Hugging Face Transformers içinde
pipeline("image-text-to-text", ...)veyaAutoModel.from_pretrained(...)ile yüklenebilir- Özel model kodunu kullanmak için
trust_remote_code=Truegerekir
- Özel model kodunu kullanmak için
- Yerel sunum için vLLM ve SGLang desteklenir
- Her iki motor da OpenAI uyumlu
/v1/chat/completionsendpoint'inde metin ve görüntü isteklerini işleyebilir
- Her iki motor da OpenAI uyumlu
- Docker Model Runner'da
docker model run hf.co/moonshotai/Kimi-K3ile çalıştırılır - Model HuggingChat, Google Colab ve Kaggle üzerinde de kullanılabilir
Akıl yürütme durumunu koruyan API kullanımı
- Kimi K3'te thinking mode her zaman etkindir ve
reasoning_contentdöndürür - Üst düzey istek alanı
reasoning_effort,"low","high","max"değerlerini destekler ve varsayılan değer"max"tir - Çok turlu diyaloglar ve araç çağrıları, korunan düşünme geçmişi yaklaşımına uymalıdır
- API'nin döndürdüğü assistant mesajı
messagesiçine aynen yeniden iletilmelidir - Yalnızca
contentdeğil,reasoning_contentvetool_callsda dahil edilmelidir
- API'nin döndürdüğü assistant mesajı
- Görsel girdi, yapılandırılmış çıktı, partial mode, araç seçimi, dinamik araç yükleme ve bağlam önbellekleme için Kimi K3 Quickstart ve Thinking Effort sayfalarına bakılabilir
Lisans
- Kod deposu ve model ağırlıkları Kimi K3 License ile yayımlanmıştır
2 yorum
Umarım bunu yurt içinde sunan bir sağlayıcı çıkar.
Hacker News yorumları
3 trilyon parametreli model için üçüncü taraf ara fiyatlandırması belli olduğunda, gerçek servis maliyetini ve laboratuvarın API tokenlarını sübvanse edip etmediğini daha iyi tahmin edebiliriz
MXFP4 yerel olduğu için yaklaşık 1.5TB VRAM gerekiyor; bu da 8×B200 sınırına dayanıyor, bağlam uzunluğu ve iş hacmi optimizasyonu da hesaba katılınca pratikte 16 kart gerekiyor gibi görünüyor
Siber güvenlik AISI benchmark’ında GLM 5.2’nin üstünde ama en ileri kapalı modellerle arasında büyük fark var; bu yüzden ince ayar gerekebilir. Cursor’ın Kimi 2.6/2.7 ince ayarlı Composer serisi ve Grok 4.5 ile doğrudan karşılaştıracak şekilde yeniden eğitilip eğitilmeyeceği de merak konusu
Tüm olasılık dağılımını öğrenen düzgün bir bilgi damıtma ile küçük model üretme ihtimali de umut verici. Özellikle düşük servis maliyetli DSV4-Kimi gelecek vaat ediyor gibi duruyor
İkinci el 4U sunucu ve 32 adet 64GB ECC DIMM ile 3TB RAM kurmak 30 bin doların altına mümkün, bu da gerçek GPU ekipmanına göre büyük fiyat farkı yaratıyor. Henüz tam hassasiyetli ağırlıklar ya da Unsloth’un Q8/Q8-XL kuantize sürümleri yok ama geniş bağlam kullanmak için 1,536GB’yi aşıp 2TB, mümkünse 2.5~3TB gerektiği anlaşılıyor
Q4 ve Q6, bilgi ve doğruluktan kaybettirirken yavaş ve güvenilmez kalan en kötü uzlaşma olabilir; bu yüzden düşük bütçeli sistemlerde akıllı ama yavaş model çalıştırılacaksa Q8 gerekli görünüyor
https://github.com/woct0rdho/transformers5-qwen3.5-recipe adresinde bunun kavram kanıtı hazırlanmış; CPU offloading olmadan Qwen3.5-35B-A3B 16GiB VRAM, DeepSeek-V4-Flash 284B-A13B ise 90GiB VRAM ile ince ayarlanabiliyor. Strix Halo gibi birleşik bellekli sistemlerde de iyi çalışıyor
Yine de Kimi-K3 sınıfı modeller için birden fazla GPU ve düğüm gerekiyor; yani tek GPU eğitimine kıyasla çözülmesi gereken çok daha fazla konu var
Bu yayında fiyatlandırmadan çok daha ilginç olan kısım özelleştirme. Startup’lar da ağırlıkları indirip değiştirebilir ve ince ayar yapabilir; asıl avantaj maliyetten çok kendi verilerindeki performans ve fikri mülkiyet egemenliği tarafında. Kimi ekibi için büyük başarı
Bireylerin LLM çalıştırması için donanımın kullanım amacına uygun kurulmadığı hissediliyor. Ya birleşik bellekte saniyede 5~10 token’a razı olmak ya da yüzlerce GB VRAM ve 1kW üzeri tüketen veri merkezi kartlarına gitmek gerekiyor
180~250W TDP’ye sahip, 128GB ya da 256GB VRAM’li yarı profesyonel GPU yok; oysa böyle iki kart ve yaygın bir NVLink düzeyi bağlantı bile oldukça kullanışlı olurdu. Kimi K3’ü yerelde çalıştırmak devasa bir homelab ve büyük maliyet gerektirecektir ama GLM 5.2’yi tek oturumda saniyede yaklaşık 100 token, birden çok alt ajan kullanıldığında ise yaklaşık 60 token ile çalıştırabilmek güzel olurdu
En güncel
llama-serverile--no-mmapkullanılarak yapılan ölçümlerde DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiB görünüyorBu durum, masaüstü işlerinin de aralıklı olmasına rağmen gereken hesaplama gücünün yeterince ucuzlaması sayesinde masa üstünde boşta kalırken bile aşırı güçlü cihazlar bulundurabilmemizle tezat oluşturuyor
gpt-ossgibi istisnalar dışında açık modellerin çalıştırılmasını zorlaştırırken bir yandan demokratikleşmeden söz ediyor; bu da özellikle haksız görünüyorBirkaç bin dolarlık GPU alabilecek durumdaysanız, varlıklı bir teknoloji meraklısı olarak elbette alabilirsiniz; ama bunun spor araba gibi son derece verimsiz bir lüks olduğunu kabul etmek gerekir. Asıl talihsizlik, paylaşımlı donanımı güvenilir biçimde işletecek bilgi işlem teknolojisinin ya da buna izin verecek siyasi-toplumsal kurumların eksik olmasıdır
Lisans şartlarına göre, lisans sahibi veya bağlı şirketleri hizmet olarak model işi yürütüyorsa ve ardışık 12 ayın toplam geliri 20 milyon doları aşıyorsa, yazılımı veya türevlerini ticari olarak kullanmadan önce Moonshot AI ile ayrı bir sözleşme imzalamak zorunda
https://app.fireworks.ai/models/fireworks/kimi-k3 adresinde kullanılabiliyor; fiyatı önbelleksiz girişte 1 milyon token başına 3 dolar, önbellekli girişte 0,30 dolar ve çıkışta 15 dolar
Şu anda Moonshot'a kıyasla gecikme çok daha düşük ama kullanım da çok daha az, bu yüzden bunun sürüp sürmeyeceğini görmek lazım. Yine de aynı gün dağıtım etkileyici
Rekabet nedeniyle GLM 5.2 fiyatı, 16 Haziran'daki çıkışından yaklaşık 1,5 ay sonra yaklaşık %45 düştü ve yeni sağlayıcılar hâlâ fiyat rekabeti yapıyor: https://openrouter.ai/z-ai/glm-5.2#providers
Ekonomik olarak fiyatın toplam maliyetin değil, marjinal maliyetin altına düşmemesi gerekir; GPU kullanım oranı düşük bir veri merkezinde bu kabaca elektrik maliyetine denk gelir. Küçük veri merkezlerindeki fazla kapasite ve rekabet nedeniyle yakında token'ları elektrik maliyeti ile GPU amortismanının toplamından daha ucuza satan yerler de çıkabilir diye tahmin ediyorum
Hugging Face'te “Tell me about yourself” diye sorduğumda Kimi K3'ün kendisini Anthropic'in yaptığı Claude olarak tanıtması ilginçti
En ileri seviye modellerin arşiv amacıyla indirilmesini öneririm. 1,5 TB olsa bile ucuz bir diske koyup torrent seed etmek daha faydalı
Geçmişte kriptografik algoritmaları kontrol etmeye çalıştıkları gibi modeller de düzenlemelerle kapatılabilir; açık yazılımın hayatta kalması için geniş çapta dağıtılması gerekir. Zamanla, teknikler ve donanım üretimine yapılan devasa yatırımlar sayesinde pratik çalıştırma mümkün hâle gelecek; o sırada dağıtım yasadışı hâle gelirse ve düzenleyici yakalama maliyetini ödemek gerekirse bu üzücü olur
Magnet adresi:
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2FannounceLisansı inceleyip gerçek donanımda test ettikten sonra, sağlayıcıların Moonshot fiyatından %60-70 daha ucuza sunmasının zor göründüğü sonucuna vardım. Biraz aşağı çekilebilir ama işlem hızından ciddi ödün vermeden GLM düzeyinde indirim zor görünüyor
Kimi'nin marjı, GPU'ların pahalı kiralama fiyatlarıyla alındığı varsayımında bile yaklaşık %40-50 olarak tahmin ediliyor; kendi ekipmanları varsa daha da yüksek olabilir. Ama bazı tahminlerde geçen Anthropic'in %90'ın üzerindeki marjına ulaşmıyor ve Anthropic API'nin %80 marjı bile şüpheli
Eğer tek maliyet elektrik olsaydı %80-90 da mümkün olurdu ama şu anda sunulan saniye başına token sayısına bakınca bu kolay görünmüyor. Yalnızca B200'de test ettim, B300 bulamadım; model zaten quantized durumda ve 1 milyon token bağlam da kullanılmadığı için anlık bellek optimizasyonu alanı da sınırlı görünüyor. R100 erişimi olan birinin maliyeti doğrulaması iyi olurdu
Büyük sağlayıcıların Kimi ile sözleşme yapması gerektiği için, Kimi en iyi açık model olduğu sürece büyük indirimler beklemek zor
Orijinal bağlantı 404 döndürüyor; engellendi mi ya da kendi kendine sansür mü uygulandı diye merak ediyorum
Devlet kontrolü nedeniyle bir anda ortadan kaybolma ihtimaline karşı arşivlemek isteyen bir talep olacaktır muhtemelen. Çin de yakın zamanda model ihracat kontrollerini tartışmaya başladı; artık geri kalmış modeller değil, en ileri seviye modeller ortaya koymaya başladıkları için durum farklı