- Kimi K3-256k, K3'ün çıktı kalitesini 256k bağlamda korurken, 1M bağlamlı
k3e göre yaklaşık yarı kota tüketen günlük kodlama modeli - Kimi Code, K3 ve K2.7 Code'u 4 model ID ile sunuyor;
k32.8T parametre ve en fazla 1M bağlamı desteklerkenkimi-for-coding-highspeedyaklaşık 5~6 kat daha hızlı çıktı karşılığında kotayı 3 kat kullanıyor k3tenk3-256ke geçerken mevcut bağlam 256k'yi aşıyorsa veya video içeriyorsa, temel bilgileri koruyup uyumluluğu sürdürmek için önce compact çalıştırılmalı- Model ya da
reasoning_effortdeğiştirildiğinde mevcut bağlam önbelleği geçersiz olur ve yeniden prefill gerektiği için kullanım artabilir; bu yüzden yeni bir oturumda geçiş önerilir - Kullanılabilen modeller ve bağlam planlara göre değişir; yetki aşılırsa
401döner. Üçüncü taraf araçlarda doğru model ID ile bağlam boyutu ve akıl yürütme düzeyi doğrudan ayarlanmalıdır
Kimi Code'un model yapısı
- Kimi Code, Kimi K3 ve Kimi K2.7 Code'u 4 model ID ile sunar
k3: 2.8T parametreli amiral gemisi kodlama modeli; üst planlarda en fazla 1M bağlamı desteklerk3-256k: Kimi K3'ün 256k bağlam sürümü; tüketimi azaltmaya odaklanırkimi-for-coding: kod tamamlama ve günlük geliştirme işleri için uygun Kimi K2.7 Codekimi-for-coding-highspeed: aynı kodlama yeteneğiyle yaklaşık 5~6 kat daha hızlı çıktı sunan K2.7 Code HighSpeed
- Model bazında özellikler ve kullanım koşulları şöyle
k3- Normal hızda çalışır ve üst üyeliklerde en fazla 1M bağlam sunar
reasoning_effortiçinlow,high,maxdesteklenir; varsayılanhighdır- Moderato ve üstünde kullanılabilir, 1M bağlam ise Allegretto ve üstünde sunulur
- Görsel ve video girişi alabilir
k3-256k- Normal hızda çalışır ve bağlam 256k'ye sabittir
reasoning_effortiçinlow,high,maxdesteklenir; varsayılanhighdır- Moderato ve üstü üyeler kullanabilir
- Yalnızca görsel girişi alabilir; video desteklenmez
kimi-for-coding- Normal hız ve 256k bağlam sunar; tüm üyeler kullanabilir
Thinking:ONile çalışır ve görsel ile videoyu destekler
kimi-for-coding-highspeed- 256k bağlamda yaklaşık 6 kat daha hızlı çıktı verir ama kotayı 3 kat kullanır
- Allegretto ve üstünde kullanılabilir;
Thinking:ON, görsel ve video girişini destekler
K3-256k'nin kullanım alanı ve model geçişi
k3-256k, 256k bağlam aralığındak3ile aynı sonucu verirken 1M sürümün yaklaşık yarısı kadar kota tüketir- Günlük soru-cevap, kod tamamlama, genel özellik geliştirme, tek dosya ya da küçük ölçekli dosya düzenleme için uygundur; ancak video girişi desteklemez
-
K3'ten K3-256k'ye geçiş
- Mevcut oturum bağlamı 256k'yi aşarsa Kimi Code CLI ve Claude Code gibi bazı araçlar kendi içinde compact uygular
- Aracı araçtan araca değiştiği için, geçişten önce compact'i elle bir kez çalıştırıp bağlamı 256k içine sıkıştırmak önerilir
- Böylece işin temel içeriği korunurken oturum sürdürülebilir
- Geçiş sonrasında kota daha uzun süre kullanılabilir
- Sohbet geçmişinde video dosyası varsa doğrudan
k3-256kye geçilemez; önce compact çalıştırılmalıdır
-
K3-256k'den K3'e geçiş
k3-256k256k sınırına yaklaştıysa ve compact kaynaklı bilgi kaybından kaçınmak isteniyorsa doğrudank31M'e geçilebilir- Mevcut sürümde 256k'den 1M'e geçmek önbelleği etkilemez
Önbellek ve kullanım yönetimi
- Model değiştirildiğinde önceki modelde oluşturulan bağlam önbelleği tutmaz ve ilgili bağlam yeniden prefill edilmelidir
- Bu yüzden geçişten hemen sonra kullanım artmış gibi görünebilir. Yeni modeli kullanırken yeni bir oturum başlatmak, daha iyi sonuçlar ve daha düşük tüketim açısından avantajlıdır
-
Akıl yürütme düzeyi değişim maliyeti
reasoning_effortdeğiştirildiğinde de mevcut bağlam önbelleği geçersiz olur ve yeniden prefill gerekir- İşe uygun akıl yürütme düzeyi seçildikten sonra tek oturum içinde tutarlı biçimde korunması önerilir
- Farklı bir akıl yürütme düzeyi gerçekten gerekiyorsa, uzun bir oturumda tekrar tekrar geçiş yapmak yerine yeni bir oturum başlatmak daha iyidir
Plan yetkileri ve 401 hatası
- Doğru model ID kullanılsa bile istenen özellik plan yetkisini aşıyorsa sunucu
401döndürür- K3 erişimi yok: Moderato altı planlarda
k3vek3-256kçağrılamaz - 1M erişimi yok: Moderato'da
k3en fazla 256k'yi destekler; en fazla 1M ise Allegretto ve üstünde kullanılabilir k3-256knin bağlam sınırı plan fark etmeksizin 256k'ye sabittir- HighSpeed erişimi yok:
kimi-for-coding-highspeediçin Allegretto ve üstü gerekir
- K3 erişimi yok: Moderato altı planlarda
- Tüm hata mesajları ve çözüm yolları Error Reference sayfasında görülebilir
HighSpeed neden hızlı hissettirmeyebilir?
- HighSpeed model ID tam olarak
kimi-for-coding-highspeedolmalıdır- Yanlış girilirse hata vermeden standart
kimi-for-codinge düşer ve hız artışı görülmez
- Yanlış girilirse hata vermeden standart
- HighSpeed yalnızca model çıktısını hızlandırır
- Dosya okuma-yazma, komut çağrıları ve script çalıştırma hızlanmaz
- Tek bir işte araç veya script çalıştırmanın payı yüksekse toplam hız artışı sınırlı hissedilebilir
İstemcide model değiştirme
- Model ID değiştirilince bağlam önbelleği geçersiz olur. Ek token tüketiminden kaçınmak ve en iyi deneyimi elde etmek için yeni bir oturum başlatmak önerilir
- Çağrı sırasında model sürüm adı değil, şu model ID'lerinden biri girilmelidir
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
Kimi K3veyaK2.7 Codegibi sürüm adları girilirse çağrı başarısız olur- K3 veya K2.7'de Thinking kapatılırsa istek K2.6'ya yönlendirilir; bu yüzden K3 veya K2.7 Code kullanmak için Thinking açık olmalıdır
-
Resmî istemciler
- Kimi Code CLI'de
/modelyazarak ek ayar değiştirmeden model değiştirilebilir - En yeni model listede yoksa
/logoutsonrası/loginile yeniden giriş yapılmalıdır - VS Code için Kimi Code'da model, giriş alanındaki açılır menüden seçilir
- Model görünmüyorsa VS Code yeniden başlatılmalı veya eklenti tekrar kurulmalıdır
- Kimi Code CLI'de
Üçüncü taraf araç ayarları
- Kimi Code Console üzerinden API Key oluşturduktan sonra araca Base URL ve model ID girilir
- Kimi Code API, OpenAI uyumlu protokolü ve Anthropic uyumlu protokolü birlikte destekler
- OpenAI uyumlu Base URL:
https://api.kimi.com/coding/v1 - Anthropic uyumlu Base URL:
https://api.kimi.com/coding/
- OpenAI uyumlu Base URL:
- Araç bazında ayar yöntemleri şu belgelerde bulunabilir
- Claude Code: Anthropic'in komut satırı kodlama yardımcısı
- OpenCode: terminal tabanlı kodlama ajanı
- Codex: OpenAI'ın kodlama ajanı
-
K3 bağlam ayarı
- Bazı üçüncü taraf araçlarda varsayılan bağlam, K3'ün azami 1M değerinden küçüktür
- En fazla 1M bağlam kullanmak için
context-windowalanı doğrudan1048576olarak ayarlanmalıdır
-
K3 akıl yürütme düzeyi eşlemesi
- K3,
low,high,maxdestekler ve aracın gönderdiği değerler şu şekilde eşlenir nullveyaundefined: varsayılanhigh- Bilinmeyen diğer değerler: HTTP
400hatası ultra,max,xhigh:maxhigh,medium: önerilen düzey olanhighlow,minimum,light:lownone:thinking.typedevre dışı bırakılır
- K3,
1 yorum
Hacker News görüşleri
Codex, 256k bağlamı çok iyi kullanıyor. 1M rahat bir pay sağlıyor ama hâlâ pahalı ve varsayılan olarak gereksiz görünüyor
LLM’ler hızla genel amaçlı metaya dönüşüyor ve OpenAI gibi ABD’li yapay zeka araştırma laboratuvarlarının hendeği zayıflıyor. Sonunda ucuz token satabilen hyperscaler’ların ve veri merkezi sahiplerinin kazanması muhtemel
k3-256kyayımlandı ve 256k bağlam içinde aynı sonuçları veriyor.k3 (1M),k3-256kye göre kotayı yaklaşık iki kat tüketiyorİyi bir değişiklik. Genelde bağlamı 200k altında tutmaya çalışıyorum
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
O zaman tüm kullanıcılar bağlam 256k’ye ulaşana kadar Kimi’yi birdenbire yarı fiyatına mı kullanacak, merak ediyorum. Doğruysa devasa bir değişiklik
k3-256kkullanırken 256k’de 1M modele geçilirse cache’in geçersizleşeceğini ve mevcut 256k token için de 1M model fiyatından yeniden ödeme yapılacağını düşünmüştümAma bu yanlışmış; bağlam sınırına yaklaşınca cache geçersizleşmeden 1M modele geçilebiliyor. Mevcut sürümde
k3-256kdenk3 (1M)e geçmek cache’i etkilemiyorBu yazı yayımlanalı 38 dakika oldu ve 20 dakika öncesinden beri Anthropic’in birkaç hizmeti büyük çaplı kesinti durumunda görünüyor. Muhtemelen alakası yoktur ama biraz komik geldi
Modelin kendisi aynı, sadece API düzeyinde bir değişiklik gibi görünüyor
Belirli bir bağlam uzunluğunu geçince fiyat kademesinin değiştiği OpenAI yaklaşımına işlevsel olarak benziyor. Eşik de yaklaşık 272k, yani
2^18veya 256k civarıAktif bağlam büyüdükçe çıktı token’ı başına gereken hesaplama ve okunması gereken bayt miktarı artar; bu yüzden maliyeti kullanıcıya yansıtmak mantıklı. Yine de kademeli eşik yerine yumuşak bir fiyat eğrisi kullanmamaları şaşırtıcı
Kısa bağlam yapılandırmasında örnek başına daha az prefill’e özel node olur ve büyük KV cache’i destekleme ihtiyacı olmadığından toplam node sayısı da azaltılabilir. Ayrık çıkarım kullanılırsa prefill ve decoding’e ayrılacak hesaplama oranı da ayrı ayrı ayarlanabilir
Bu değişiklikle altyapı yükünün azalmasını umuyorum. Son zamanlarda modellerin hepsi belirgin şekilde yavaşladı ama destek ekibi ilgilenmiyor. İsteklerin kayda değer bir kısmını quantize edilmiş modellerle işliyor olabilirler diye şüpheleniyorum
Quantize edilmiş bir model değil de sadece bağlam penceresinin 256k’ye düşürülüp düşürülmediğini merak ediyorum