- Kimi K3 talebi beklenenden çok daha fazla arttı; son 48 saatte GPU kullanımı mevcut kapasite sınırına yaklaştı
- Mevcut abonelerin kullanım deneyimini korumak için yeni abonelikleri geçici olarak durduruyor ve hesaplama kaynaklarını öncelikli olarak mevcut üyelere ayırıyor
- Mevcut ücretli aboneler etkilenmeyecek; Moonshot AI altyapı kapasitesini artırmayı hızlandırıyor
- Ek kapasite sağlanır sağlanmaz yeni abonelikler partiler halinde yeniden açılacak
- Ayrıca kullanım amacına göre üyelikleri iki özel fiyatlandırma planına ayırmayı planlıyor
- Kimi Membership: Kimi Web, App ve Work için
- Kimi Code Membership: kodlama iş akışları için
- Bu adım, hizmet bazındaki talebe göre hesaplama kaynaklarını daha doğru dağıtmayı ve istikrarlı bir kullanım deneyimini sürdürmeyi amaçlıyor
1 yorum
Hacker News yorumları
Son 48 saatte talep mevcut kapasitenin sınırına yaklaşınca mevcut abonelerin kullanım deneyimini korumak için yeni abonelikleri geçici olarak durdurup işlem kaynaklarını mevcut üyelere öncelikli ayırdıklarını söylemeleri gerçekten hoş
Hızlı büyümeden ziyade mevcut müşteri memnuniyetine öncelik veren bir şirket
Dün Claude kullanım hakkımı bitirdim ve Kimi’yi denemek için 20 dolarlık planı satın aldım. Kimi Code’da K3’ü seçip depodaki donanım, G/Ç, thread kontrolü ve ağla ilgili tüm girdi ayarlarını bulup bir rapor yazmasını istedim; 12 dakika düşündükten sonra günlük kotanın tamamını kullandığımı söyledi
Ertesi gün Fable aynı işi 3 dakikada bitirdi; yani K3 kullanacaksanız 20 dolarlık planı almamak daha iyi
Web arayüzünde haftalık kullanımın da %23’ünü harcadı; oysa aylık 20 dolarlık Cursor’da çok daha fazla iş yapmama rağmen hiç uyarı almadım. Başta sorunun OpenCode’da olduğunu düşündüm ama Kimi Code’da da aynıysa öyle görünmüyor
Kimi’de tam attention katmanlarına kıyasla RNN ve lineer attention katmanlarının 3 kat fazla olması özellikle ilginç. Henüz kullanmadım ama uzun bağlam işleri için çok makul bir yapı gibi görünüyor
Parametre sayısının fazla olması, hesaplama açısından optimize edilmiş xLSTM’lerin de çok parametreli olmasının aynı nedeninden kaynaklanıyor gibi görünüyor ve bu modelin başarısını görünce Avrupa’da dev bir xLSTM ailesi modelinin geliştirilememiş olması üzücü. Ekip, iç değerlendirmelerde iyi çalışanı seçen pragmatik bir ekip olduğu için normal attention katmanlarını da korumuş ve uygulamanın da ideal olduğunu söylemek mümkün değil; yine de Kimi, büyük ölçekli LLM eğitimi için süper bilgisayarlar doğru araştırmacılara verilse nelerin mümkün olabileceğini gösteriyor. Sonuçta çoğu Hochreiter’in alanı olan RNN
Yaklaşık 6 aydır kodlama işlerinde Kimi kullanıyorum ve memnun olduğum için başka modellere dönüp bakmadım. Bir şeyi kaçırıp kaçırmadığımı görmek için ara sıra aynı işi Claude’la deniyorum
OpenRouter kullanıyorum ve LLM kullanım alanım dar olduğu için maliyet farkı hangi tarafta olursa olsun ihmal edilebilir düzeyde
Google gibi, kullanıcıların abonelik değerinin düştüğünü fark etmemesini umarak limitleri sessizce azaltmak yerine yeni abonelikleri durdurmaları ferahlatıcı
Gemini Apps, kapasite kısıtları veya etkinlik artışı olduğunda kaliteyi korumak için limitleri önceden haber vermeden değiştirebileceğini açıkça belirtiyor: https://support.google.com/gemini/answer/16275805
Çoklu ajan oyun kodlama değerlendirmelerinde Çin modelleri genelde tek atımlık akıl yürütmede zayıf ama araç kullanımı ve yinelemeli iyileştirmeyle bunu telafi ediyor. Kimi K3 de tek seferlik kodlamada 19. sıradaydı ama çalışma ortamı ve araçlar verilip birden çok kez çağrılan ajan tabanlı kodlamada 3. sıraya çıktı; ortalama gönderimler bazında sadece Sol ve Fable öndeydi
Yazılım mühendisleri için en ilgili senaryo ajan tabanlı kodlama ama hız da önemli ve bu şu anda Kimi için gerçek bir kullanılabilirlik sorunu. Fireworks gibi harici çıkarım sağlayıcıları önceki modellerde bu farkı azaltmıştı. Açık ağırlıklı frontier modellerin standart hâline gelmesi ilginç; yalnızca frontier model sahibi olmakla rekabet etmek giderek zorlaşacak
Veriler: https://gertlabs.com/rankings?mode=agentic_coding
Bu modelin kalitesi beklentilerin üzerinde ve özellikle kod inceleme ile PR incelemesinde iyi. Ancak aşırı talep ve büyük model boyutu nedeniyle şu anda fazla yavaş; nispeten basit kod incelemeleri bile çok uzun sürüyor
Bu son Kimi çılgınlığının, bol arzın daha fazla tüketim doğurduğu Jevons paradoksuna göre net artış mı olduğunu, yoksa sadece daha ucuz modellere geçiş mi olduğunu merak ediyorum
Çeşitli laboratuvarlar ve OpenRouter genelinde toplam token tüketimini gösteren iyi bir veri olup olmadığını da merak ediyorum
Anthropic ve OpenAI’nin, bir süre daha bu ölçekte talebi kaldırabilen tek şirket olmaları nedeniyle rekabetçi kalıp kalmayacağını merak ediyorum. Maliyetler zaten yüksekken kesintiler yüzünden çalışan zamanının boşa gitmesi kurumsal müşterilerin hoşuna gitmeyecektir
Görünüşe göre müşterilere asgari hizmet kalitesini garanti edemeyebileceklerini düşündükleri için aboneliği durdurmuşlar