1 puan yazan GN⁺ 19 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Kimi K3 talebi beklenenden çok daha fazla arttı; son 48 saatte GPU kullanımı mevcut kapasite sınırına yaklaştı
  • Mevcut abonelerin kullanım deneyimini korumak için yeni abonelikleri geçici olarak durduruyor ve hesaplama kaynaklarını öncelikli olarak mevcut üyelere ayırıyor
  • Mevcut ücretli aboneler etkilenmeyecek; Moonshot AI altyapı kapasitesini artırmayı hızlandırıyor
  • Ek kapasite sağlanır sağlanmaz yeni abonelikler partiler halinde yeniden açılacak
  • Ayrıca kullanım amacına göre üyelikleri iki özel fiyatlandırma planına ayırmayı planlıyor
    • Kimi Membership: Kimi Web, App ve Work için
    • Kimi Code Membership: kodlama iş akışları için
  • Bu adım, hizmet bazındaki talebe göre hesaplama kaynaklarını daha doğru dağıtmayı ve istikrarlı bir kullanım deneyimini sürdürmeyi amaçlıyor

1 yorum

 
Hacker News yorumları
  • Son 48 saatte talep mevcut kapasitenin sınırına yaklaşınca mevcut abonelerin kullanım deneyimini korumak için yeni abonelikleri geçici olarak durdurup işlem kaynaklarını mevcut üyelere öncelikli ayırdıklarını söylemeleri gerçekten hoş
    Hızlı büyümeden ziyade mevcut müşteri memnuniyetine öncelik veren bir şirket

    • GitHub geçmişte aynısını yaptığında birçok kişi kızmıştı ama o zaman da şimdi de doğru karar buydu
    • Herhangi bir web sitesinde “Login” düğmesinin “Sign Up” düğmesinden küçük olmasından hep nefret etmişimdir
    • O halde Hetzner de talep ve arzı fiyat artırarak dengelemek yerine yeni kayıtları durdurmalı mıydı?
    • Fazla heyecanlanmaya gerek yok. Girişim sermayesi firmaları yapay zekaya devasa para akıtıyor; bu yüzden OpenAI veya Anthropic veri setlerini distile etmeye çalışırken token tüketim makinesine para basıyor da olabilirler
  • Dün Claude kullanım hakkımı bitirdim ve Kimi’yi denemek için 20 dolarlık planı satın aldım. Kimi Code’da K3’ü seçip depodaki donanım, G/Ç, thread kontrolü ve ağla ilgili tüm girdi ayarlarını bulup bir rapor yazmasını istedim; 12 dakika düşündükten sonra günlük kotanın tamamını kullandığımı söyledi
    Ertesi gün Fable aynı işi 3 dakikada bitirdi; yani K3 kullanacaksanız 20 dolarlık planı almamak daha iyi

    • Codex limite ulaşsa bile akıl yürütmeye devam edip isteğe yanıt veriyor
    • Yalnızca tamamen self-hosted modeller kullandığım için ortam farklı olabilir ama 12 dakika hiçbir geri bildirim olmadan beklemenin gerçek iş akışlarında yaygın olup olmadığını merak ediyorum. Ben modelin izlediği yolu sürekli takip ederim; çıkmaza girerse durdurur veya yönünü değiştiririm
    • Ben de tam olarak aynı şeyi yaşadım. Kimi.com’un aylık 20 dolarlık planını yıllık olarak ödedim ve OpenCode üzerinden API ile Kimi K2.7’ye basit bir istek gönderdim ama 5 saatlik kotanın tamamını tüketti; Cursor ise aynı isteği birkaç dakikada tamamladı
      Web arayüzünde haftalık kullanımın da %23’ünü harcadı; oysa aylık 20 dolarlık Cursor’da çok daha fazla iş yapmama rağmen hiç uyarı almadım. Başta sorunun OpenCode’da olduğunu düşündüm ama Kimi Code’da da aynıysa öyle görünmüyor
    • Birkaç gün önce Claude’da da nispeten basit bir iş, yanıt üretmeden 5 saatlik kotanın tamamını tüketti; tamamen zaman kaybı gibi hissettirdi
    • Hedef uygulamanın ölçeğini merak ediyorum. Metin dosyalarını veritabanı gibi kullanan bir Node.js yapılacaklar uygulaması mı, yoksa 1971’de yazılmış 1 milyon satırlık COBOL spagetti kodu mu olduğuna göre değişir
  • Kimi’de tam attention katmanlarına kıyasla RNN ve lineer attention katmanlarının 3 kat fazla olması özellikle ilginç. Henüz kullanmadım ama uzun bağlam işleri için çok makul bir yapı gibi görünüyor
    Parametre sayısının fazla olması, hesaplama açısından optimize edilmiş xLSTM’lerin de çok parametreli olmasının aynı nedeninden kaynaklanıyor gibi görünüyor ve bu modelin başarısını görünce Avrupa’da dev bir xLSTM ailesi modelinin geliştirilememiş olması üzücü. Ekip, iç değerlendirmelerde iyi çalışanı seçen pragmatik bir ekip olduğu için normal attention katmanlarını da korumuş ve uygulamanın da ideal olduğunu söylemek mümkün değil; yine de Kimi, büyük ölçekli LLM eğitimi için süper bilgisayarlar doğru araştırmacılara verilse nelerin mümkün olabileceğini gösteriyor. Sonuçta çoğu Hochreiter’in alanı olan RNN

    • Transformer mimarisinin asıl amaçlarından biri paralelleştirilemeyen RNN’leri ortadan kaldırmak değil miydi? Uzman değilim, sadece birkaç yıl önce birkaç makale okumuştum
    • Yaklaşık 1,5 yıl önce Hochreiter’e milyarlarca parametreli deneylerde kalmaması, xLSTM’yi LLM ölçeğine çıkarması gerektiğini söylemiştim ama yatırım ve ilgi çekmek için artık çok geç olduğunu düşünüyordu galiba. Avrupa’nın hırsı buysa üzücü
    • Bunun RNN mi, Qwen veya Mamba gibi bir state space model mi, yoksa RWKV’ye daha mı yakın olduğunu merak ediyordum; kontrol edince Qwen’in kullandığı Linear DeltaNet’e benzer olduğunu gördüm
  • Yaklaşık 6 aydır kodlama işlerinde Kimi kullanıyorum ve memnun olduğum için başka modellere dönüp bakmadım. Bir şeyi kaçırıp kaçırmadığımı görmek için ara sıra aynı işi Claude’la deniyorum
    OpenRouter kullanıyorum ve LLM kullanım alanım dar olduğu için maliyet farkı hangi tarafta olursa olsun ihmal edilebilir düzeyde

    • Hangi plan olduğunu merak ediyorum. Benim deneyimimde Kimi’nin aylık 20 dolarlık planı da Qwen’in aylık 30 dolarlık planı da ana araç olarak kullanmak için fazlasıyla yetersizdi, ama K3 yüzünden aylık 49 veya 99 dolarlık planları denemek istiyorum
  • Google gibi, kullanıcıların abonelik değerinin düştüğünü fark etmemesini umarak limitleri sessizce azaltmak yerine yeni abonelikleri durdurmaları ferahlatıcı
    Gemini Apps, kapasite kısıtları veya etkinlik artışı olduğunda kaliteyi korumak için limitleri önceden haber vermeden değiştirebileceğini açıkça belirtiyor: https://support.google.com/gemini/answer/16275805

  • Çoklu ajan oyun kodlama değerlendirmelerinde Çin modelleri genelde tek atımlık akıl yürütmede zayıf ama araç kullanımı ve yinelemeli iyileştirmeyle bunu telafi ediyor. Kimi K3 de tek seferlik kodlamada 19. sıradaydı ama çalışma ortamı ve araçlar verilip birden çok kez çağrılan ajan tabanlı kodlamada 3. sıraya çıktı; ortalama gönderimler bazında sadece Sol ve Fable öndeydi
    Yazılım mühendisleri için en ilgili senaryo ajan tabanlı kodlama ama hız da önemli ve bu şu anda Kimi için gerçek bir kullanılabilirlik sorunu. Fireworks gibi harici çıkarım sağlayıcıları önceki modellerde bu farkı azaltmıştı. Açık ağırlıklı frontier modellerin standart hâline gelmesi ilginç; yalnızca frontier model sahibi olmakla rekabet etmek giderek zorlaşacak
    Veriler: https://gertlabs.com/rankings?mode=agentic_coding

  • Bu modelin kalitesi beklentilerin üzerinde ve özellikle kod inceleme ile PR incelemesinde iyi. Ancak aşırı talep ve büyük model boyutu nedeniyle şu anda fazla yavaş; nispeten basit kod incelemeleri bile çok uzun sürüyor

    • Kimi K3 artık opencode-go fiyat listesinde görünüyor, yani kullanılabiliyor olmalı ama henüz doğrulamadım. Zen’de yok
    • OpenRouter yolunu denemeye değer: https://openrouter.ai/moonshotai/kimi-k3
  • Bu son Kimi çılgınlığının, bol arzın daha fazla tüketim doğurduğu Jevons paradoksuna göre net artış mı olduğunu, yoksa sadece daha ucuz modellere geçiş mi olduğunu merak ediyorum
    Çeşitli laboratuvarlar ve OpenRouter genelinde toplam token tüketimini gösteren iyi bir veri olup olmadığını da merak ediyorum

    • Eğer eğilim daha ucuz modellere geçiş olsaydı DeepSeek v4 Flash’a gidilirdi. En yeni Kimi, diğer Çin modellerinin çoğundan daha pahalı; bu yüzden bu daha çok “yeni model gerçekten iyi, gidip deneyin” türü bir trendi takip etme etkisi gibi görünüyor. Asıl soru, sıkı doğrulamaya ne kadar dayanacağı; ABD laboratuvarları da muhtemelen epey gergindir
  • Anthropic ve OpenAI’nin, bir süre daha bu ölçekte talebi kaldırabilen tek şirket olmaları nedeniyle rekabetçi kalıp kalmayacağını merak ediyorum. Maliyetler zaten yüksekken kesintiler yüzünden çalışan zamanının boşa gitmesi kurumsal müşterilerin hoşuna gitmeyecektir

    • İş yerinde de aynı eğilim görülüyor. Yazılımın kendisi ucuz ama hosting uzmanlığı ve uptime sorumluluğu yüzünden gerçek dağıtım hâlâ birkaç sağlayıcıda yoğunlaşıyor. Yine de kişisel dizüstünde çalışan bir sürü vibe coding üretkenlik aracı da çıkıyor
    • Anthropic de sadece birkaç ay önce talep sorunları nedeniyle yoğun ve yoğun olmayan saat kullanımını ayırarak kullanıcıları bezdirmiş, ayrıca sık sık kesinti yaşamıştı. Sonrasında xAI ile anlaşma yaptıktan sonra genel olarak istikrara kavuştu; Moonshot da şu anda işlem kaynağı anlaşmaları peşinde
    • OpenAI ve Anthropic’in işlem kaynaklarının önemli bir kısmı aslında hyperscaler şirketlere ait. Uzun vadeli sözleşmelerle güvence altına aldıkları kaynak erişimine marj ekleyebilirler ama hyperscaler’lar daha düşük fiyat verebildiği için bunun uzun sürmesi zor görünüyor
    • Kimi açık ağırlıklı bir model olduğu için Moonshot dışında hosting sağlayıcıları hızla ortaya çıkacaktır; bu sorunun açık ağırlık benimsenmesi için büyük bir engel olması beklenmez
    • Synthetic kullanıyorum; Kimi3’ü host etmeyi planladıklarını biliyorum. Açık modeller çıkarımı dağıtabilir
  • Görünüşe göre müşterilere asgari hizmet kalitesini garanti edemeyebileceklerini düşündükleri için aboneliği durdurmuşlar

    • Tam olarak yalnızca yeni abonelikleri geçici olarak durdurdular ve işlem kaynaklarını mevcut üyelere öncelikli ayırdılar