1 puan yazan GN⁺ 3 시간 전 | 2 yorum | WhatsApp'ta paylaş
  • Kimi K3, 2,8 trilyon parametreye ve 1.048.576 token bağlama sahip açık ağırlıklı, yerel çok modlu bir ajan modeli olup uzun süreli kodlama, bilgi çalışması ve akıl yürütmeyi destekler
  • Kimi Delta Attention (KDA), Attention Residuals ve Stable LatentMoE'yi birleştirerek 896 uzmandan token başına 16'sını etkinleştirir ve Kimi K2'ye kıyasla genel ölçekleme verimliliği yaklaşık 2,5 kat daha yüksektir
  • Açık değerlendirmelerde GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1 elde etti; ancak model bazında harness, akıl yürütme ayarları ve donanım farkları birlikte dikkate alınmalıdır
  • MXFP4 ağırlıklar ve MXFP8 aktivasyonlar ile nicemleme farkındalıklı eğitim aldı; Transformers, vLLM, SGLang, Docker ve OpenAI ile Anthropic uyumlu API üzerinden çalıştırılabilir
  • Çok turlu kullanım ve araç çağrılarında, API'nin döndürdüğü reasoning_content ve tool_calls dahil tüm assistant mesajı aynen yeniden iletilmelidir; kod ve ağırlıklar Kimi K3 License ile yayımlanmıştır

Model mimarisi ve ölçeği

  • Kimi K3, uzun süreli kodlama, bilgi çalışması ve akıl yürütme için tasarlanmış açık ağırlıklı, yerel çok modlu bir ajan modelidir
  • Toplam parametre sayısı 2.8T, etkin parametre sayısı 104B'dir ve 93 katmandan oluşur
    • 1 Dense katman, 69 KDA katmanı ve 24 Gated MLA katmanı kullanır
    • Attention hidden dimension 7.168, attention head sayısı 96'dır
  • Stable LatentMoE, 896 uzmandan token başına 16'sını seçer ve 2 paylaşılan uzman kullanır
    • Latent MoE dimension 3.584, uzman başına MoE hidden dimension 3.072'dir
    • Kimi K2 ile karşılaştırıldığında genel ölçekleme verimliliği yaklaşık 2,5 kat artmıştır
  • Sözlük boyutu 160K, bağlam uzunluğu 1.048.576 token ve aktivasyon fonksiyonu SiTU-GLU'dur
  • Görsel kodlayıcı olarak 401M parametreli MoonViT-V2 kullanılır
  • Başlıca yetenekler arasında metin, görüntü ve video anlama yer alır; ancak model özet tablosundaki modality alanında yalnızca Text ve Image yazılıdır

Uzun süreli kodlama ve bilgi çalışması

  • Minimum insan gözetimiyle uzun mühendislik oturumlarını sürdürürken büyük depoları keşfeder ve terminal araçlarını koordine eder
    • GPU kernel optimizasyonu ve derleyici geliştirmeyi destekler
    • Görsellikten yararlanan oyun geliştirme, CAD ve çip tasarımı da hedef alanlara dahildir
  • Ajan tabanlı bilgi çalışmasında, derin araştırmayla birlikte etkileşimli görselleştirmeler, widget'lar ve panolar üretir
    • Hareket tasarımı ve video düzenleme de destek kapsamındadır
  • Kodlama ajanı çerçevesi olarak Kimi Code CLI önerilir ve terminalde /model komutuyla Kimi K3 seçilebilir

Değerlendirme sonuçları

  • Tüm Kimi K3 sonuçları reasoning_effort="max", temperature 1.0 ile ölçülmüştür
    • GPQA Diamond, HLE-Full ve araçsız görsel değerlendirmeler gibi tek adımlı görevlerde top-p 0.95 kullanılmıştır
    • Ajan görevlerinde top-p 1.0 uygulanmıştır
  • Akıl yürütme ve bilgi değerlendirmelerinde GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7 elde edilmiştir
    • HLE-Full araçsız 43.5, araç kullanıldığında 56.0'dır
  • Kodlama değerlendirmelerinde ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2 elde edilmiştir
    • DeepSWE, Kimi Code harness'ında 67.5, mini-SWE-agent harness'ında 67.3'tür
    • SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9 elde edilmiştir
  • Ajan değerlendirmelerinde BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2 elde edilmiştir
    • MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8'dir
    • Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2 olarak ölçülmüştür
  • Görsel değerlendirmelerde OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1 elde edilmiştir
    • MMMU-Pro araçsız 81.6, araç kullanıldığında 83.4'tür
    • MathVision, Python kullanıldığında 94.3'ten 97.8'e yükselir
    • ZeroBench pass@5, araç kullanımıyla 23.0'dan 41.0'a çıkar

Değerlendirme koşulları ve karşılaştırma kısıtları

  • Karşılaştırma modelleri arasında Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2 yer alır; ancak değerlendirme harness'ları modele göre farklı olabilir
    • Kimi K3 çoğunlukla Kimi Code veya Claude Code kullanır
    • GPT ailesi çoğunlukla Codex, diğer Claude ve GLM modelleri ise Claude Code ya da Terminus 2 gibi araçlar kullanır
  • SWE-Marathon, nihai v1.1 öncesinde 9 Temmuz 2026 tarihli görevleri H20'ye uyarlanmış bir branch üzerinde değerlendirmiştir
    • Docker image, GPU performans ölçütleri ve referans oracle H20 için yeniden kalibre edilmiştir; ancak doğruluk ve hile önleme denetleyicileri değiştirilmemiştir
    • Claude Fable 5, görevlerin %35'inde fallback yaşadığı için ölçülen performansı olumsuz etkilenmiş olabilir
  • PostTrainBench, resmi ortamdaki H100 yerine H20 GPU üzerinde maksimum akıl yürütme çabasıyla çalıştırılan 3 sonucun ortalamasıdır
  • Kimi Code Bench 2.0, siber güvenlik ve güvenlik görevlerini içerir
    • Claude Fable 5, 80 görevde 13 fallback ve 1 ret yaşamıştır
    • GPT-5.6 Sol 10 görevi, GPT-5.5 ise 3 görevi reddetmiştir
  • BrowseComp 91.2, 300K token'da çalışan bir bağlam sıkıştırma stratejisi kullanılarak elde edilmiştir
    • Ayrı bir bağlam yönetimi olmadan tüm 1M token penceresi kullanıldığında 90.4 elde edilir
  • Çok modlu değerlendirmelerde ZeroBench hariç 3 çalıştırmanın ortalaması kullanılmıştır
    • ZeroBench, resmi ayarlara göre 5 kez çalıştırılmıştır
    • PerceptionBench, atomik görsel algı yeteneğini ölçen kurum içi bir benchmark'tır

Yerel nicemleme

  • SFT aşamasından itibaren nicemleme farkındalıklı eğitim uygulanmıştır
  • Ağırlıklarda MXFP4, aktivasyonlarda MXFP8 kullanılarak geniş donanım uyumluluğu hedeflenmiştir

Dağıtım ve çalıştırma yöntemleri

  • kimi-k3 seçilerek Kimi API'ye erişilebilir ve OpenAI ile Anthropic uyumlu API sunulur
  • Hugging Face Transformers içinde pipeline("image-text-to-text", ...) veya AutoModel.from_pretrained(...) ile yüklenebilir
    • Özel model kodunu kullanmak için trust_remote_code=True gerekir
  • Yerel sunum için vLLM ve SGLang desteklenir
    • Her iki motor da OpenAI uyumlu /v1/chat/completions endpoint'inde metin ve görüntü isteklerini işleyebilir
  • Docker Model Runner'da docker model run hf.co/moonshotai/Kimi-K3 ile çalıştırılır
  • Model HuggingChat, Google Colab ve Kaggle üzerinde de kullanılabilir

Akıl yürütme durumunu koruyan API kullanımı

  • Kimi K3'te thinking mode her zaman etkindir ve reasoning_content döndürür
  • Üst düzey istek alanı reasoning_effort, "low", "high", "max" değerlerini destekler ve varsayılan değer "max"tir
  • Çok turlu diyaloglar ve araç çağrıları, korunan düşünme geçmişi yaklaşımına uymalıdır
    • API'nin döndürdüğü assistant mesajı messages içine aynen yeniden iletilmelidir
    • Yalnızca content değil, reasoning_content ve tool_calls da dahil edilmelidir
  • Görsel girdi, yapılandırılmış çıktı, partial mode, araç seçimi, dinamik araç yükleme ve bağlam önbellekleme için Kimi K3 Quickstart ve Thinking Effort sayfalarına bakılabilir

Lisans

  • Kod deposu ve model ağırlıkları Kimi K3 License ile yayımlanmıştır

2 yorum

 
treestae 1 시간 전

Umarım bunu yurt içinde sunan bir sağlayıcı çıkar.

 
GN⁺ 3 시간 전
Hacker News yorumları
  • 3 trilyon parametreli model için üçüncü taraf ara fiyatlandırması belli olduğunda, gerçek servis maliyetini ve laboratuvarın API tokenlarını sübvanse edip etmediğini daha iyi tahmin edebiliriz
    MXFP4 yerel olduğu için yaklaşık 1.5TB VRAM gerekiyor; bu da 8×B200 sınırına dayanıyor, bağlam uzunluğu ve iş hacmi optimizasyonu da hesaba katılınca pratikte 16 kart gerekiyor gibi görünüyor
    Siber güvenlik AISI benchmark’ında GLM 5.2’nin üstünde ama en ileri kapalı modellerle arasında büyük fark var; bu yüzden ince ayar gerekebilir. Cursor’ın Kimi 2.6/2.7 ince ayarlı Composer serisi ve Grok 4.5 ile doğrudan karşılaştıracak şekilde yeniden eğitilip eğitilmeyeceği de merak konusu
    Tüm olasılık dağılımını öğrenen düzgün bir bilgi damıtma ile küçük model üretme ihtimali de umut verici. Özellikle düşük servis maliyetli DSV4-Kimi gelecek vaat ediyor gibi duruyor

    • GPU olmadan, yalnızca 1.5~3TB RAM’e sahip çift ya da dört soketli Xeon sunucularda elde edilebilecek düşük hızlı çıkarım performansı merak ediliyor. İş 4~6 saatlik uzun görevlerse, saniyede 5~6 token bile kullanım amacına göre işe yarayabilir
      İkinci el 4U sunucu ve 32 adet 64GB ECC DIMM ile 3TB RAM kurmak 30 bin doların altına mümkün, bu da gerçek GPU ekipmanına göre büyük fiyat farkı yaratıyor. Henüz tam hassasiyetli ağırlıklar ya da Unsloth’un Q8/Q8-XL kuantize sürümleri yok ama geniş bağlam kullanmak için 1,536GB’yi aşıp 2TB, mümkünse 2.5~3TB gerektiği anlaşılıyor
      Q4 ve Q6, bilgi ve doğruluktan kaybettirirken yavaş ve güvenilmez kalan en kötü uzlaşma olabilir; bu yüzden düşük bütçeli sistemlerde akıllı ama yavaş model çalıştırılacaksa Q8 gerekli görünüyor
    • Günümüzde ince ayar genelde bnb 4-bit tabanlı modeller üzerinde LoRA ile yapılıyor ama artık temel biçimi GGUF’a çevirme zamanı gelmiş gibi. GGUF, yeni model mimarilerini ve daha agresif kuantizasyonu aktif biçimde destekliyor
      https://github.com/woct0rdho/transformers5-qwen3.5-recipe adresinde bunun kavram kanıtı hazırlanmış; CPU offloading olmadan Qwen3.5-35B-A3B 16GiB VRAM, DeepSeek-V4-Flash 284B-A13B ise 90GiB VRAM ile ince ayarlanabiliyor. Strix Halo gibi birleşik bellekli sistemlerde de iyi çalışıyor
      Yine de Kimi-K3 sınıfı modeller için birden fazla GPU ve düğüm gerekiyor; yani tek GPU eğitimine kıyasla çözülmesi gereken çok daha fazla konu var
    • Anthropic ve OpenAI’nin, Çin laboratuvarlarının sahip olmadığı optimizasyon yenilikleri var; dolayısıyla bu fiyat maliyetin üst sınırını gösterebilir ama alt sınırını göstermez
    • Yerel MXFP4 model olduğu için donanım tarafı da ilginç. 8×AMD MI355X düğümüne rahatça sığıyor, bu da token fiyatını daha da düşürme ihtimali yaratıyor
    • Eğitim maliyeti bilinmeden, bu tür modelleri servis etmenin yalnızca marjinal maliyeti çıkarılabilir; laboratuvarın API tokenlarını sübvanse edip etmediği anlaşılamaz. Kapalı modellerin gerçek boyutları da bilinmiyor; Fable’ın 10 trilyon mu yoksa 1 trilyon parametre mi olduğu bile belli değil
  • Bu yayında fiyatlandırmadan çok daha ilginç olan kısım özelleştirme. Startup’lar da ağırlıkları indirip değiştirebilir ve ince ayar yapabilir; asıl avantaj maliyetten çok kendi verilerindeki performans ve fikri mülkiyet egemenliği tarafında. Kimi ekibi için büyük başarı

  • Bireylerin LLM çalıştırması için donanımın kullanım amacına uygun kurulmadığı hissediliyor. Ya birleşik bellekte saniyede 5~10 token’a razı olmak ya da yüzlerce GB VRAM ve 1kW üzeri tüketen veri merkezi kartlarına gitmek gerekiyor
    180~250W TDP’ye sahip, 128GB ya da 256GB VRAM’li yarı profesyonel GPU yok; oysa böyle iki kart ve yaygın bir NVLink düzeyi bağlantı bile oldukça kullanışlı olurdu. Kimi K3’ü yerelde çalıştırmak devasa bir homelab ve büyük maliyet gerektirecektir ama GLM 5.2’yi tek oturumda saniyede yaklaşık 100 token, birden çok alt ajan kullanıldığında ise yaklaşık 60 token ile çalıştırabilmek güzel olurdu

    • İstenen Q8 büyük model, en fazla 128GB RAM’li 3,995 dolarlık sisteme sığmıyor ve pratik bağlam alanı da bırakmıyor. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8, Laguna S 2.1 Q8; tam bağlam dahil 170~190GB RAM istiyor, yani GPU’suz 256GB çift soketli workstation ya da sunucuya sığıyor
      En güncel llama-server ile --no-mmap kullanılarak yapılan ölçümlerde DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiB görünüyor
    • Tek kullanıcılı LLM çıkarımı, genel tüketici donanımına özellikle uygun değil. Yük aralıklı geliyor ama ağırlıkların her zaman bellekte durması gerekiyor; bu yüzden ağırlıkları sürekli bellekte tutan çok kullanıcılı bir sunucunun, kullanıcı başına yalnızca KV cache eklemesi çok daha verimli oluyor ve pahalı GPU çekirdekleri de zamanın çoğunda boş kalmıyor
      Bu durum, masaüstü işlerinin de aralıklı olmasına rağmen gereken hesaplama gücünün yeterince ucuzlaması sayesinde masa üstünde boşta kalırken bile aşırı güçlü cihazlar bulundurabilmemizle tezat oluşturuyor
    • Kripto patlamasından sonra GPU üreticileri, fiyat ayrımcılığı için VRAM ile pazarı bölmeye başladı. Nvidia, bulut işletmecilerinin tüketici kartlarını toplayıp kullanmasını engellemek için bu kartların belleğini küçük tuttu ve özünde aynı donanımı PC ve veri merkezi pazarlarına çok farklı fiyatlarla satarak iki taraftan da kâr alabildi
    • Modeller büyüdükçe, sanki PC devriminin ters yönüne gidiyoruz. Ön cephedeki laboratuvarlar kapalı modeller yayımlamayı sürdürüp gpt-oss gibi istisnalar dışında açık modellerin çalıştırılmasını zorlaştırırken bir yandan demokratikleşmeden söz ediyor; bu da özellikle haksız görünüyor
    • Bu tür LLM’leri evde çalıştırmak, tasarımda bir kırılma yaşanmadıkça pratik olmaya pek uygun değil. Makul çalıştırma biçimi yalnızca paylaşımlı donanım üzerinde büyük batch’lerle işlem yapmak gibi görünüyor
      Birkaç bin dolarlık GPU alabilecek durumdaysanız, varlıklı bir teknoloji meraklısı olarak elbette alabilirsiniz; ama bunun spor araba gibi son derece verimsiz bir lüks olduğunu kabul etmek gerekir. Asıl talihsizlik, paylaşımlı donanımı güvenilir biçimde işletecek bilgi işlem teknolojisinin ya da buna izin verecek siyasi-toplumsal kurumların eksik olmasıdır
  • Lisans şartlarına göre, lisans sahibi veya bağlı şirketleri hizmet olarak model işi yürütüyorsa ve ardışık 12 ayın toplam geliri 20 milyon doları aşıyorsa, yazılımı veya türevlerini ticari olarak kullanmadan önce Moonshot AI ile ayrı bir sözleşme imzalamak zorunda

    • Meta'nın ilk Llama modellerinde uyguladığı yaklaşıma benziyor. Ayrıca aylık aktif kullanıcı sayısı 100 milyonu veya aylık geliri 20 milyon doları aşan ticari ürün ve hizmetlerde yazılım ya da türevleri kullanılırsa kullanıcı arayüzünde Kimi K3'ün belirgin şekilde gösterilmesi gerektiğini söyleyen madde de akıllıca bir pazarlama hamlesi
  • https://app.fireworks.ai/models/fireworks/kimi-k3 adresinde kullanılabiliyor; fiyatı önbelleksiz girişte 1 milyon token başına 3 dolar, önbellekli girişte 0,30 dolar ve çıkışta 15 dolar

    • Fireworks'ün Kimi öncelikli tarifesi de OpenRouter'da 1 milyon token başına 3,75 dolardan sunuluyor: https://openrouter.ai/moonshotai/kimi-k3#providers
      Şu anda Moonshot'a kıyasla gecikme çok daha düşük ama kullanım da çok daha az, bu yüzden bunun sürüp sürmeyeceğini görmek lazım. Yine de aynı gün dağıtım etkileyici
    • Claude Opus 5'te önbelleksiz giriş 5 dolar, önbellekli giriş 0,50 dolar ve çıkış 25 dolar; ayrıca önbellek yazımı için 5 dakikalık ölçütte %25, 1 saatlik ölçütte %100 ek ücret var
    • Fireworks piyasaya sürdükten birkaç saat sonra bunu platformumuzdaki kullanıcılara sunabildik. Ancak isteğe bağlı Flux modelini durdurmaları nedeniyle artık görsel üretimini nerede yapacağımız belirsiz
    • Together.ai'de de aynı satış fiyatıyla kullanılabiliyor; ilk baktığımız yerler Fireworks ve Together oldu
  • Rekabet nedeniyle GLM 5.2 fiyatı, 16 Haziran'daki çıkışından yaklaşık 1,5 ay sonra yaklaşık %45 düştü ve yeni sağlayıcılar hâlâ fiyat rekabeti yapıyor: https://openrouter.ai/z-ai/glm-5.2#providers
    Ekonomik olarak fiyatın toplam maliyetin değil, marjinal maliyetin altına düşmemesi gerekir; GPU kullanım oranı düşük bir veri merkezinde bu kabaca elektrik maliyetine denk gelir. Küçük veri merkezlerindeki fazla kapasite ve rekabet nedeniyle yakında token'ları elektrik maliyeti ile GPU amortismanının toplamından daha ucuza satan yerler de çıkabilir diye tahmin ediyorum

    • Token'ları ucuza satıp ardından kullanıcıların token verilerini başka yerlere yeniden satan bir yapı da olabilir
    • %45 düşüş rakamı şüpheli. OpenRouter'daki ucuz sağlayıcılar, resmî Z.ai'nin FP8'inin aksine FP4 kullanıyor. Novita gibi ucuz FP8 sağlayıcıları da var ama arayüzde geçici indirim gibi görünüyor ve normal fiyatları resmî Z.ai ile neredeyse aynı
    • SemiAnalysis, yaklaşık 2 trilyon parametreli bir modelin maliyetini 1 milyon token başına 1 doların altında tahmin ediyor. Bu, throughput ve quantization'a göre değişir ama büyük sağlayıcıların maliyeti yeterince düşükse GLM 5.2'nin şu anki en düşük fiyatı olan 2,42 dolar bile büyük kâr bırakabilir
  • Hugging Face'te “Tell me about yourself” diye sorduğumda Kimi K3'ün kendisini Anthropic'in yaptığı Claude olarak tanıtması ilginçti

    • Aynı soruya “Moonshot AI tarafından geliştirilen Kimi” diye normal şekilde yanıt verdi
    • Bu tür yanıtların pek bir anlamı yok. Opus'a aynı soruyu Çince sorarsanız bazen kendisinin DeepSeek olduğunu da söylüyor; çünkü eğitim verileri karışıyor ve model halüsinasyon görüyor
    • Şaşılacak bir durum değil. Bilgi damıtımı yaygın ve tüm laboratuvarlar bunu kasıtlı ya da kasıtsız şekilde kullanıyor. Çünkü ChatGPT sonrasındaki eğitim külliyatında her zaman yapay zeka tarafından üretilmiş içerik bulunuyor
  • En ileri seviye modellerin arşiv amacıyla indirilmesini öneririm. 1,5 TB olsa bile ucuz bir diske koyup torrent seed etmek daha faydalı
    Geçmişte kriptografik algoritmaları kontrol etmeye çalıştıkları gibi modeller de düzenlemelerle kapatılabilir; açık yazılımın hayatta kalması için geniş çapta dağıtılması gerekir. Zamanla, teknikler ve donanım üretimine yapılan devasa yatırımlar sayesinde pratik çalıştırma mümkün hâle gelecek; o sırada dağıtım yasadışı hâle gelirse ve düzenleyici yakalama maliyetini ödemek gerekirse bu üzücü olur

    • Torrent dosyası https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent adresinde
      Magnet adresi: magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce
    • Yetkililer sonunda bu tür modelleri çalıştıracak donanım satın alımını da kısıtlayacaktır
    • Artık ucuz disk de yok ve belirsiz düzenleme kaygıları yüzünden yüzlerce dolar harcamak istemiyorum
  • Lisansı inceleyip gerçek donanımda test ettikten sonra, sağlayıcıların Moonshot fiyatından %60-70 daha ucuza sunmasının zor göründüğü sonucuna vardım. Biraz aşağı çekilebilir ama işlem hızından ciddi ödün vermeden GLM düzeyinde indirim zor görünüyor
    Kimi'nin marjı, GPU'ların pahalı kiralama fiyatlarıyla alındığı varsayımında bile yaklaşık %40-50 olarak tahmin ediliyor; kendi ekipmanları varsa daha da yüksek olabilir. Ama bazı tahminlerde geçen Anthropic'in %90'ın üzerindeki marjına ulaşmıyor ve Anthropic API'nin %80 marjı bile şüpheli
    Eğer tek maliyet elektrik olsaydı %80-90 da mümkün olurdu ama şu anda sunulan saniye başına token sayısına bakınca bu kolay görünmüyor. Yalnızca B200'de test ettim, B300 bulamadım; model zaten quantized durumda ve 1 milyon token bağlam da kullanılmadığı için anlık bellek optimizasyonu alanı da sınırlı görünüyor. R100 erişimi olan birinin maliyeti doğrulaması iyi olurdu
    Büyük sağlayıcıların Kimi ile sözleşme yapması gerektiği için, Kimi en iyi açık model olduğu sürece büyük indirimler beklemek zor

  • Orijinal bağlantı 404 döndürüyor; engellendi mi ya da kendi kendine sansür mü uygulandı diye merak ediyorum

    • Birkaç dakika öncesine kadar ağırlıkların açıklanmasına yönelik geri sayım sayfası vardı ve bitmesine 19 dakika kalmıştı, sonra birden 404 oldu
    • Geçiş sürecindeki teknik bir sorun olma ihtimali yüksek. Neredeyse kimse çalıştıramayacak olsa bile çok sayıda kullanıcı birkaç TB büyüklüğündeki modeli indirmeye kalkarsa Hugging Face'te neler olacağını görmek de ilginç olurdu
      Devlet kontrolü nedeniyle bir anda ortadan kaybolma ihtimaline karşı arşivlemek isteyen bir talep olacaktır muhtemelen. Çin de yakın zamanda model ihracat kontrollerini tartışmaya başladı; artık geri kalmış modeller değil, en ileri seviye modeller ortaya koymaya başladıkları için durum farklı
    • Komplo teorisi gibi gelebilir ama ABD ya da Çin için nüfuzunu göstermek adına iyi bir fırsat ve bunun ABD olma ihtimali daha yüksek görünüyor