1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Kimi K3-256k, K3'ün çıktı kalitesini 256k bağlamda korurken, 1M bağlamlı k3e göre yaklaşık yarı kota tüketen günlük kodlama modeli
  • Kimi Code, K3 ve K2.7 Code'u 4 model ID ile sunuyor; k3 2.8T parametre ve en fazla 1M bağlamı desteklerken kimi-for-coding-highspeed yaklaşık 5~6 kat daha hızlı çıktı karşılığında kotayı 3 kat kullanıyor
  • k3ten k3-256ke geçerken mevcut bağlam 256k'yi aşıyorsa veya video içeriyorsa, temel bilgileri koruyup uyumluluğu sürdürmek için önce compact çalıştırılmalı
  • Model ya da reasoning_effort değiştirildiğinde mevcut bağlam önbelleği geçersiz olur ve yeniden prefill gerektiği için kullanım artabilir; bu yüzden yeni bir oturumda geçiş önerilir
  • Kullanılabilen modeller ve bağlam planlara göre değişir; yetki aşılırsa 401 döner. Üçüncü taraf araçlarda doğru model ID ile bağlam boyutu ve akıl yürütme düzeyi doğrudan ayarlanmalıdır

Kimi Code'un model yapısı

  • Kimi Code, Kimi K3 ve Kimi K2.7 Code'u 4 model ID ile sunar
    • k3: 2.8T parametreli amiral gemisi kodlama modeli; üst planlarda en fazla 1M bağlamı destekler
    • k3-256k: Kimi K3'ün 256k bağlam sürümü; tüketimi azaltmaya odaklanır
    • kimi-for-coding: kod tamamlama ve günlük geliştirme işleri için uygun Kimi K2.7 Code
    • kimi-for-coding-highspeed: aynı kodlama yeteneğiyle yaklaşık 5~6 kat daha hızlı çıktı sunan K2.7 Code HighSpeed
  • Model bazında özellikler ve kullanım koşulları şöyle
    • k3
      • Normal hızda çalışır ve üst üyeliklerde en fazla 1M bağlam sunar
      • reasoning_effort için low, high, max desteklenir; varsayılan highdır
      • Moderato ve üstünde kullanılabilir, 1M bağlam ise Allegretto ve üstünde sunulur
      • Görsel ve video girişi alabilir
    • k3-256k
      • Normal hızda çalışır ve bağlam 256k'ye sabittir
      • reasoning_effort için low, high, max desteklenir; varsayılan highdır
      • Moderato ve üstü üyeler kullanabilir
      • Yalnızca görsel girişi alabilir; video desteklenmez
    • kimi-for-coding
      • Normal hız ve 256k bağlam sunar; tüm üyeler kullanabilir
      • Thinking:ON ile çalışır ve görsel ile videoyu destekler
    • kimi-for-coding-highspeed
      • 256k bağlamda yaklaşık 6 kat daha hızlı çıktı verir ama kotayı 3 kat kullanır
      • Allegretto ve üstünde kullanılabilir; Thinking:ON, görsel ve video girişini destekler

K3-256k'nin kullanım alanı ve model geçişi

  • k3-256k, 256k bağlam aralığında k3 ile aynı sonucu verirken 1M sürümün yaklaşık yarısı kadar kota tüketir
  • Günlük soru-cevap, kod tamamlama, genel özellik geliştirme, tek dosya ya da küçük ölçekli dosya düzenleme için uygundur; ancak video girişi desteklemez
  • K3'ten K3-256k'ye geçiş

    • Mevcut oturum bağlamı 256k'yi aşarsa Kimi Code CLI ve Claude Code gibi bazı araçlar kendi içinde compact uygular
    • Aracı araçtan araca değiştiği için, geçişten önce compact'i elle bir kez çalıştırıp bağlamı 256k içine sıkıştırmak önerilir
    • Böylece işin temel içeriği korunurken oturum sürdürülebilir
    • Geçiş sonrasında kota daha uzun süre kullanılabilir
    • Sohbet geçmişinde video dosyası varsa doğrudan k3-256kye geçilemez; önce compact çalıştırılmalıdır
  • K3-256k'den K3'e geçiş

    • k3-256k 256k sınırına yaklaştıysa ve compact kaynaklı bilgi kaybından kaçınmak isteniyorsa doğrudan k3 1M'e geçilebilir
    • Mevcut sürümde 256k'den 1M'e geçmek önbelleği etkilemez

Önbellek ve kullanım yönetimi

  • Model değiştirildiğinde önceki modelde oluşturulan bağlam önbelleği tutmaz ve ilgili bağlam yeniden prefill edilmelidir
  • Bu yüzden geçişten hemen sonra kullanım artmış gibi görünebilir. Yeni modeli kullanırken yeni bir oturum başlatmak, daha iyi sonuçlar ve daha düşük tüketim açısından avantajlıdır
  • Akıl yürütme düzeyi değişim maliyeti

    • reasoning_effort değiştirildiğinde de mevcut bağlam önbelleği geçersiz olur ve yeniden prefill gerekir
    • İşe uygun akıl yürütme düzeyi seçildikten sonra tek oturum içinde tutarlı biçimde korunması önerilir
    • Farklı bir akıl yürütme düzeyi gerçekten gerekiyorsa, uzun bir oturumda tekrar tekrar geçiş yapmak yerine yeni bir oturum başlatmak daha iyidir

Plan yetkileri ve 401 hatası

  • Doğru model ID kullanılsa bile istenen özellik plan yetkisini aşıyorsa sunucu 401 döndürür
    • K3 erişimi yok: Moderato altı planlarda k3 ve k3-256k çağrılamaz
    • 1M erişimi yok: Moderato'da k3 en fazla 256k'yi destekler; en fazla 1M ise Allegretto ve üstünde kullanılabilir
    • k3-256knin bağlam sınırı plan fark etmeksizin 256k'ye sabittir
    • HighSpeed erişimi yok: kimi-for-coding-highspeed için Allegretto ve üstü gerekir
  • Tüm hata mesajları ve çözüm yolları Error Reference sayfasında görülebilir

HighSpeed neden hızlı hissettirmeyebilir?

  • HighSpeed model ID tam olarak kimi-for-coding-highspeed olmalıdır
    • Yanlış girilirse hata vermeden standart kimi-for-codinge düşer ve hız artışı görülmez
  • HighSpeed yalnızca model çıktısını hızlandırır
    • Dosya okuma-yazma, komut çağrıları ve script çalıştırma hızlanmaz
    • Tek bir işte araç veya script çalıştırmanın payı yüksekse toplam hız artışı sınırlı hissedilebilir

İstemcide model değiştirme

  • Model ID değiştirilince bağlam önbelleği geçersiz olur. Ek token tüketiminden kaçınmak ve en iyi deneyimi elde etmek için yeni bir oturum başlatmak önerilir
  • Çağrı sırasında model sürüm adı değil, şu model ID'lerinden biri girilmelidir
    • k3
    • k3-256k
    • kimi-for-coding
    • kimi-for-coding-highspeed
  • Kimi K3 veya K2.7 Code gibi sürüm adları girilirse çağrı başarısız olur
  • K3 veya K2.7'de Thinking kapatılırsa istek K2.6'ya yönlendirilir; bu yüzden K3 veya K2.7 Code kullanmak için Thinking açık olmalıdır
  • Resmî istemciler

    • Kimi Code CLI'de /model yazarak ek ayar değiştirmeden model değiştirilebilir
    • En yeni model listede yoksa /logout sonrası /login ile yeniden giriş yapılmalıdır
    • VS Code için Kimi Code'da model, giriş alanındaki açılır menüden seçilir
    • Model görünmüyorsa VS Code yeniden başlatılmalı veya eklenti tekrar kurulmalıdır

Üçüncü taraf araç ayarları

  • Kimi Code Console üzerinden API Key oluşturduktan sonra araca Base URL ve model ID girilir
  • Kimi Code API, OpenAI uyumlu protokolü ve Anthropic uyumlu protokolü birlikte destekler
  • Araç bazında ayar yöntemleri şu belgelerde bulunabilir
    • Claude Code: Anthropic'in komut satırı kodlama yardımcısı
    • OpenCode: terminal tabanlı kodlama ajanı
    • Codex: OpenAI'ın kodlama ajanı
  • K3 bağlam ayarı

    • Bazı üçüncü taraf araçlarda varsayılan bağlam, K3'ün azami 1M değerinden küçüktür
    • En fazla 1M bağlam kullanmak için context-window alanı doğrudan 1048576 olarak ayarlanmalıdır
  • K3 akıl yürütme düzeyi eşlemesi

    • K3, low, high, max destekler ve aracın gönderdiği değerler şu şekilde eşlenir
    • null veya undefined: varsayılan high
    • Bilinmeyen diğer değerler: HTTP 400 hatası
    • ultra, max, xhigh: max
    • high, medium: önerilen düzey olan high
    • low, minimum, light: low
    • none: thinking.type devre dışı bırakılır

1 yorum

 
GN⁺ 2 시간 전
Hacker News görüşleri
  • Codex, 256k bağlamı çok iyi kullanıyor. 1M rahat bir pay sağlıyor ama hâlâ pahalı ve varsayılan olarak gereksiz görünüyor

  • LLM’ler hızla genel amaçlı metaya dönüşüyor ve OpenAI gibi ABD’li yapay zeka araştırma laboratuvarlarının hendeği zayıflıyor. Sonunda ucuz token satabilen hyperscaler’ların ve veri merkezi sahiplerinin kazanması muhtemel

    • Diğer ürünleri çok denemedim ama Codex harness geçiş yapmayı zorlaştıracak kadar cazip. Bu kalitede bir harness sunan başka yer var mı merak ediyorum
    • Her bir modele devasa sermaye ve karmaşık Ar-Ge yatıran frontier yapay zeka şirketlerine içten minnettarım. Bu noktaya gelmenin ne kadar büyük maliyet gerektirdiğini şimdiden unutmak kolay
  • k3-256k yayımlandı ve 256k bağlam içinde aynı sonuçları veriyor. k3 (1M), k3-256kye göre kotayı yaklaşık iki kat tüketiyor

  • İyi bir değişiklik. Genelde bağlamı 200k altında tutmaya çalışıyorum

    • Bu haberin Reddit başlığında da aynı cümle en üst yorum
      https://www.reddit.com/r/kimi/s/BFa1TR9vNg
    • İş kapsamına göre değişir ama bence ideal nokta 500k altı. Claude’da 500 bin token, baştan bugüne tüm bağlamı koruyarak epey büyük ölçekli bir proje inşa etmeye yetiyor
    • 256k herkes için yeterli olmalı
  • O zaman tüm kullanıcılar bağlam 256k’ye ulaşana kadar Kimi’yi birdenbire yarı fiyatına mı kullanacak, merak ediyorum. Doğruysa devasa bir değişiklik

    • Ayrı bir model olduğu için k3-256k kullanırken 256k’de 1M modele geçilirse cache’in geçersizleşeceğini ve mevcut 256k token için de 1M model fiyatından yeniden ödeme yapılacağını düşünmüştüm
      Ama bu yanlışmış; bağlam sınırına yaklaşınca cache geçersizleşmeden 1M modele geçilebiliyor. Mevcut sürümde k3-256kden k3 (1M)e geçmek cache’i etkilemiyor
    • Ben öyle olmadığını anlıyorum. Bağlam penceresi küçük olduğunda zamanla biriken giriş token’ları azalıyor, bu da genel olarak daha ucuz olduğu anlamına geliyor gibi
  • Bu yazı yayımlanalı 38 dakika oldu ve 20 dakika öncesinden beri Anthropic’in birkaç hizmeti büyük çaplı kesinti durumunda görünüyor. Muhtemelen alakası yoktur ama biraz komik geldi

  • Modelin kendisi aynı, sadece API düzeyinde bir değişiklik gibi görünüyor

  • Belirli bir bağlam uzunluğunu geçince fiyat kademesinin değiştiği OpenAI yaklaşımına işlevsel olarak benziyor. Eşik de yaklaşık 272k, yani 2^18 veya 256k civarı
    Aktif bağlam büyüdükçe çıktı token’ı başına gereken hesaplama ve okunması gereken bayt miktarı artar; bu yüzden maliyeti kullanıcıya yansıtmak mantıklı. Yine de kademeli eşik yerine yumuşak bir fiyat eğrisi kullanmamaları şaşırtıcı

    • Maksimum dizi uzunluğuna göre iki farklı altyapı yapılandırması işletmeleri muhtemel, bu yüzden kademeli eşik şaşırtıcı değil
      Kısa bağlam yapılandırmasında örnek başına daha az prefill’e özel node olur ve büyük KV cache’i destekleme ihtiyacı olmadığından toplam node sayısı da azaltılabilir. Ayrık çıkarım kullanılırsa prefill ve decoding’e ayrılacak hesaplama oranı da ayrı ayrı ayarlanabilir
  • Bu değişiklikle altyapı yükünün azalmasını umuyorum. Son zamanlarda modellerin hepsi belirgin şekilde yavaşladı ama destek ekibi ilgilenmiyor. İsteklerin kayda değer bir kısmını quantize edilmiş modellerle işliyor olabilirler diye şüpheleniyorum

    • Dayanağı olmayan komplo teorileri Reddit’te olabilir ama HN’ye yakışmıyor
  • Quantize edilmiş bir model değil de sadece bağlam penceresinin 256k’ye düşürülüp düşürülmediğini merak ediyorum

    • 256k bağlam penceresi ile quantize edilip edilmemesi ayrı konular. Dışarıdan doğrudan doğrulamak zor olduğundan gerçekten quantize edilmiş olma ihtimali de dışlanamaz