2 puan yazan GN⁺ 1 일 전 | 1 yorum | WhatsApp'ta paylaş
  • Günlük kodlama işlerinde Kimi K3 ve Claude birlikte kullanıldığında, çıktı kalitesi ile yanıt için gereken token sayısında pratikte ayırt edilmesi zor farklar görüldü
  • Kimi K3 API, 1 milyon token başına girişte $3, çıkışta $15 fiyatlandırılıyor; bu da sırasıyla $10 ve $50 olan Claude'un en üst modelinden belirgin şekilde daha ucuz
  • Kimi aylık $19'dan başlıyor ve aylık $39'lık kodlama katmanı da oldukça cömert; buna karşılık Claude'da ajan işlerinde kullanım limiti hızla tükeniyor ve aylık $20 planda Fable erişimi de korunamadı
  • Semgrep'in siber güvenlik benchmark'ında, kısıtlı Claude bazı görevleri reddederken GLM 5.2 bunları yerine getirerek öne çıktı; ayrıca MIT lisansıyla yayımlandı ve en yeni Opus'tan daha ucuz
  • Yalnızca ABD modellerine uygulanan kısıtlamalar, ABD'li müşterilerin seçeneklerini azaltıyor ama denizaşırı açık modellerin rekabetini engellemiyor; kalite benzer, fiyat daha düşükken Claude'a ödeme yapmayı sürdürmek için daha az neden kalıyor

Kimi K3 ve Claude'un kalite·fiyat karşılaştırması

  • Kimi K3, genel kodlama işlerinde Claude ile birlikte kullanıldığında aynı görev ve çıktı kalitesi ile neredeyse aynı token kullanımını gösterdi
    • Bu, açık modellerin daha dağınık sonuç vereceği veya aynı yanıtı almak için daha fazla token tüketeceği beklentisinden farklıydı
  • API fiyatı Kimi K3 için 1 milyon giriş token başına $3, 1 milyon çıkış token başına $15
    • Claude'un en üst modeli aynı ölçekte sırasıyla $10 ve $50
  • Kimi'nin ücretli planları aylık $19'dan başlıyor ve aylık $39'lık kodlama katmanı, benzer fiyatlı Claude ürünlerine göre daha geniş kullanım sunuyor
    • Claude planlarında kullanım sınırı katı; sıradan ajan işleriyle bile öğle olmadan kota tükenebiliyor
    • Claude, aylık $20 planda Fable erişimini sürdüremediği için bunu kapatıp Opus'a geçti, ancak Kimi katmanında aynı koşul yok

ABD yapay zeka politikası ve açık model rekabeti

  • ABD hükümeti Fable'ın çıkışını geciktirdi ve nihai modele de çeşitli görev kategorilerini reddeden kısıtlamalar uyguladı; buna karşılık Çin laboratuvarlarının öncü düzey açık modelleri indirilebildiği için ABD hükümetinin düzenleme alanının dışında kalıyor
  • Semgrep'in siber güvenlik benchmark'ında GLM 5.2, Claude'un önüne geçti
    • Kısıtlı model görevleri reddederken açık model bunları yerine getirdi ve bu fark sonuca yansıdı
  • GLM 5.2, MIT lisansıyla yayımlandı; kendini öncü model olarak pazarlamasa da gerçek işlerde en yeni Opus'tan daha iyi sonuç veriyor ve maliyeti de çok daha düşük
  • OpenAI'ın GPT-5.6 modeli de hükümet kısıtlama sürecinden geçti, ancak OpenAI ana modelini aylık $20 planda sunabildiği için Anthropic'e kıyasla daha fazla hareket alanına sahip
  • Gelecekte ABD hükümeti, otomotiv sektöründe kullandığı sübvansiyon·kurtarma paketi·korumacı gümrük tarifesi yaklaşımını yapay zeka ve açık kaynağa da uygulayabilir
    • Kamu-özel sektör iş birliğiyle, yalnızca ABD içinde kullanılan ve uluslararası ölçekte rekabet edemeyen yerli modeller desteklenebilir
    • Bunun sonucu olarak ABD'deki kullanıcılar en yüksek kaliteyi ya da en düşük fiyatı değil, yerli modelleri satın almak zorunda kalabilir ve en iyi modellere en iyi fiyatla erişemeyebilir

1 yorum

 
GN⁺ 1 일 전
Hacker News yorumları
  • İster distillation ile aynı düzey performansa ulaşmış olsun, ister en baştan bağımsız geliştirilmiş olsun, ABD’deki frontier laboratuvarların sonu zaten baştan belliydi. Distillation bir saldırı değildir; frontier laboratuvarlar da insanlığın yazdığı bilgiyi modellere distill ettiğine göre, daha sonra gelen laboratuvarların bunu daha ucuz modellere sıkıştırması doğal bir süreçtir.
    Sohbetlerin kaydedilip kendi modellerini eğitmek için kullanılmasını pratikte engellemenin de yolu olmadığından, model şirketleri yerine donanım şirketlerine yatırım yapmak daha mantıklı görünüyor.

    • Bunun bu kadar apaçık olduğu iddiası sonradan yapılan tarih revizyonuna yakın. Distillation hâlâ aktif bir araştırma alanı ve bugün modellerin bu kadar kolay distill edilebilmesi ilginç bir başarı; 12 ay öncesinden kaçınılmaz görülen bir sonuç değildi.
      Daha 6 ay önce bile model çıktıları eğitim verisi olarak kullanılırsa döngüsel eğitim felaketi yüzünden tüm modellerin başarısız olacağı yönünde çok sayıda öngörü vardı; bu yüzden baştan beri barizmiş gibi anlatmamak gerekir.
    • Distillation’ın bir saldırı olmadığı öncülüne güçlü biçimde katılıyorum, ancak K3, Fable veya Sol’un distill edilmiş sürümü değil. Fable daha yeni yayımlandı, Sol ise yeni piyasaya çıktı; Arena kullanıcı değerlendirmelerinde K3 bazı alanlarda ikisinden de daha iyi.
      API distillation, yeni alanlarda pekiştirmeli öğrenmede cold start aşamasını hızlı aşmak için yararlıdır; gerçekte daha önemli olan ise modelin öğrendiği pekiştirmeli öğrenme ortamlarının kalitesi ve çeşitliliğidir.
    • Distillation saldırılarının etkisi biraz abartılıyor gibi. Artık fine-tuning verilerinin çoğu sentetik veri; aynı içeriği basitçe tekrar edemeyeceğiniz için, başka bir LLM’nin bir konuyu eksik bırakmadan ayrıntılı açıklayan ders materyali yazmasına daha çok benziyor.
    • Neredeyse tüm piyasalar, ‘yalnızca hırsızlığı yasaklayıp gerisini serbest bırakma’dan tüm tedarikte ağır regülasyon istemeye kadar bir biçimde düzenlemeye dayanır.
      ABD henüz Çin’in nadir toprak elementleri tarzı kontrollerini seçmedi; ancak distillation yaygınlaşırsa bunu yapmayan tarafın da erişim engelleme veya aşırı kontrol gibi regülasyon maliyetlerini üstlenme olasılığı yüksek. Müzik kopyalamaya hoşgörülü davranıp görsel sanatta öfkelenmemizde olduğu gibi, bunun hırsızlık mı yoksa olağan iş pratiği mi sayılacağı nihayetinde toplumsal uzlaşıya bağlı; büyük bir atılım olmazsa fark kapanacaktır.
    • Anthropic, geçmiş konuşmalara kaydırarak gitmeyi veya düşünce token’larını ve alt ajanları kontrol etmeyi bile zorlaştırıyor. Amaç, herkesin sürekli kendi hizmetlerine geri dönmesini sağlamak, ama kendi kuyularını kazmayı öğrenmelerine izin vermemek gibi.
  • Bu noktaya beklenenden çok daha hızlı geldik. Batılı hükümetler açık ağırlıklı frontier modellere erişimi ulusal güvenlik riski olarak tanımlayıp kullanımını terör eylemi sayarsa nasıl bir dünya ortaya çıkar merak ediyorum.
    Kimi K3, yasa dışı olduğunu bilmesine rağmen herkesin kullandığı Napster gibi olabilir; ya da mahalleden birinin eBay parçalarıyla bodrumunda kurduğu 8×5090 sistemi sayaç usulü kiraladığı, esrar piyasasına benzer bir yeraltı pazarı doğabilir. Tersi olur ve kontrol başarılı olursa, açık seçenekler zayıflatılmış Cohere ve Mistral’dan ibaret kalır; Çin’in gerisindeki Anthropic ve OpenAI’ın ‘American Frontier’ modellerine pahalı ücretler ödemek zorunda kalabiliriz.
    Reklam sübvansiyonlu Kindle Fire gibi, etkisini en yüksek teklifi verene satan bir Kindle AI ortaya çıkıp tütün şirketi propagandasının eğitim pipeline’ına girmesi ve LLM’nin sigara içmenin sağlıklı olduğunu söylemesi de mümkün.

    • Dünya dijital bloklara ayrılmış yeni bir Demir Perde ile karşı karşıya kalır. Etkileşim kesintisi uzadıkça, açık internet ve bilim birbirleriyle uyumsuz ekosistemlere bölünme ihtimali artar.
      ABD hükümeti yakın zamanda NSF bilimsel iş birliklerine Wolf Amendment benzeri kısıtlamalar ilan edip yetki alanını askeri tarafa kaydırdı; Çin’i dışlamayı amaçlayan Pax Silica’ya çeşitli ülkeleri çekmeye çalışırken müttefiklerine de işlevleri sınırlanmış kendi ürünlerini dayatmak istiyor. ABD ve AB kullanıcılarının hukuki dezavantaj yaşamadan perdenin ötesini kullanabileceği İsviçre veya Singapur gibi tarafsız bölgeler kalabilir.
      https://nitter.net/RnaudBertrand/status/2069574934972797089
    • Yüksek kapasiteli RAM’e sahip Mac Studio cihazlarının ortadan kaybolması muhtemelen tesadüftür.
    • Açık kaynak modelleri yasa dışı ilan etmek yalnızca ABD şirketlerini dezavantajlı duruma düşürür. Dünyanın geri kalanı açık kaynak kullanmaya devam eder ve ABD şirketlerine karşı arbitraj fırsatları elde eder.
    • ‘Batılı hükümetler’ derken özellikle ABD’nin kastedilip kastedilmediğini merak ediyorum. Çin konusunda ABD kadar kaygılı olmayan diğer ülkelerin bu meseleyi aynı şekilde dert etmesi için belirgin bir neden yok.
    • 8×RTX Pro 6000’de bile VRAM yalnızca 768GB; K3’ü nasıl çalıştıracaklarını bilmiyorum.
  • Normalde tüm modellerle denediğim işi Kimi K3'e verdiğimde çok daha uzun düşündü ve 19 dolarlık planın 5 saatlik kullanım hakkını neredeyse tamamen tüketti. Aynı işi OpenAI'ın 20 dolarlık planında yapmak yalnızca birkaç dakika sürüyor ve kullanım hakkı neredeyse hiç azalmıyor.
    Abonelik limitleri token gibi karşılaştırılabilir sayılar sunmadığı için ölçmesi zor; ama küçücük bir iş yüzünden gerçek iş yapacak kullanım hakkının yok olduğu, 20 dolar bandında bu kadar sıkı bir abonelikle ilk kez karşılaştım. Yavaş ve iş başına maliyeti de yüksek görünüyordu, ancak Gemini 3.5 Flash'ın kafasına göre oluşturduğu hatayı buldu.

    • Kimi sürekli kendinden şüphe edip gereğinden fazla uzun düşünme eğiliminde. Küçük bir ayrıntı için “bir dakika, aslında…” gibi paragrafları tekrar ederek çok fazla token harcıyor.
      GLM 5.2'ye yaklaşık 50 satırlık JavaScript'i Python'a taşıttığımda da web araması ve yeniden kontrolü tekrarlayarak API maliyetinde 0,25 dolar harcadı; ilk çalıştırma başarısız oldu ama ikincisinde çalıştı. Claude Code/Fable çok daha hızlıydı ama aynı hatayı yaptı; açık modellerin aşırı özdenetiminin azalmasını ya da prompt yöntemlerinin iyileşmesini umuyorum.
    • Ölçüt olarak milyon token başına fiyatı kullanmayı bırakmak gerekiyor. Gösterilen token birim fiyatından çok, fiilen kullanılan token sayısı maliyeti daha fazla etkiliyor; bu yüzden önemli olan zekâya kıyasla iş başına maliyet eğrisi.
      Çin modelleri bu ölçüte henüz ulaşmıyor ve verimlilikten çok benchmark puanlarını en üst düzeye çıkarmaya odaklanıyor gibi görünüyor.
    • Kimi K3 şu anda çıkarım yoğunluğunu yalnızca max olarak destekliyor, ancak diğer seviyeleri de yakında sunmayı planlıyor. Benchmark izleme kayıtlarında “bir dakika, ama…” gibi geri dönüşler ve belirsizlik çok görülüyordu; GPT 5.6 ve Fable'ın xhigh·max seviyelerinde de daha az ölçüde benzeri vardı.
      Daha düşük çıkarım yoğunluğu desteklendiğinde token verimsizliğinin iyileşme ihtimali var.
      https://platform.kimi.ai/docs/guide/use-thinking-effort
    • Claude Code/Fable'a bir özellik geliştirme işi verdiğimde, yaklaşık 60 dakika içinde 100 euroluk aboneliğin 5 saatlik oturumunun %30'unu kullandı. Sonrasında ayrı bir terminalde temiz bir oturumda yalnızca /code-review çalıştırdım; kod değişikliği olmadan kullanım %99'a fırladı ve kalan %1 ile review.md bile yazılamadı.
      Normalde inceleme %10-20 kullanıyor, ama bazen 15 dakikada %65-69'un kaybolması gibi kullanım oynaklığı çok yüksek.
    • Yapay zeka abonelik fiyatları tuhaf. Kullanım modele göre değişiyor, sağlayıcı arayüzünün ya da modelin keyfi biçimde tükettiği opak token'larla ölçülüyor; bunun üstüne bir de opak zaman penceresi limitleri uygulanıyor.
  • Kimi ücretli planlarında 1 milyon token bağlam uzunluğu yalnızca ayda 79 dolar ve üzeri planlarda sunuluyor; bunun altında 256 bin token ile sınırlı. Yıllık ödeme indirimine göre aylık 15 dolarlık en düşük planda şu anda K3'ün kendisi desteklenmiyor.
    https://www.kimi.com/code/docs/en/kimi-code/models.html

    • Yalnızca API kullanmak istiyorum, ama DeepSeek'te Reasonix/whale araçlarıyla yüksek cache isabet oranı birleşince pratikte neredeyse ücretsiz oluyor; bu yüzden başka bir hizmete geçmek kolay olmayacak gibi.
  • Bence tam tersine. Kimi K3 2,8 trilyon parametreli; ChatGPT 5.6 veya Opus 4.8'in ölçeği açıklanmadı ama benzer olma ihtimali var, Fable·Mythos'un ise yaklaşık 10 trilyon olduğu söylentisi var.
    Milyon token başına giriş/çıkış fiyatı K3 için 3 dolar·15 dolar, ChatGPT 5.6 Sol için 5 dolar·30 dolar, Opus 4.8 için 5 dolar·25 dolar; fark büyük değil. Tarihî bir dönüm noktasından ziyade, rakiplerin aynı performansa yakınsayıp biraz daha ucuza satması gibi. Şu anda K3 ağırlıkları da kapalı, bu yüzden durum değişecek gibi görünmüyor.

    • Resmî duyuruya göre model ağırlıklarının tamamı 27 Temmuz 2026'ya kadar yayımlanacak.
    • OpenAI'ın 5 saatlik limiti kaldırıp haftalık kotayı sık sık sıfırladığı da düşünülürse, Kimi'nin efektif fiyatta gerçekten daha ucuz olup olmadığı şüpheli.
  • Bu başlıkta da Kimi'nin gerçek faydası konusunda görüşler karışık. Kişisel olarak Fable ve 5.6 Sol'dan geride olduğunu düşünüyorum; ama tartışmanın odağı performanstan çok ABD hükümetinin düzenleyici hamlelerine yönelik tepkiye benziyor.
    Mevcut duruma duyulan öfke ve hayal kırıklığı nedeniyle Kimi'nin daha iyi olmasını isteme psikolojisi de işliyor gibi.

    • K3 oldukça iyi ve Sol ile Fable arasına konabilir. Sol'un UI tasarım yeteneği etkileyici değil ama K3 bu alanda güçlü; Fable ise genel olarak en hızlı ve en tutarlı performansı veriyor.
      İşin türüne ve kullanım biçimine çok bağlı, ancak K3'ün ABD'nin en uç modelleriyle aynı seviyede olmadığı değerlendirmesi benim kullanım deneyimimle örtüşmüyor.
    • DeepSeek döneminin tekrarı gibi görünüyor. v3 çıktığında da ABD şirketlerinin bittiği yönünde değerlendirmeler yağmıştı, ama sonunda her şey aynen devam etti.
    • Frontier modellerin açık ağırlıklı modellerden 6 aydan fazla ileride olduğu sözünü sayısız kez duydum, ama artık bu doğru değil. Bu yüzden değerlendirme ölçütü yer değiştiriyor.
    • ABD hükümetinin bu yıl yapay zeka konusunda yaptıklarını kabullenmek zor olduğu için böyle tepkilerin gelmesini de anlayabiliyorum.
  • Burada ‘Claude’ derken Opus mu Fable mı kastediliyor ve çıkarım yoğunluğunun hangi seviyede olduğu netleştirilmeli.

    • ‘Günlük kodlama işlerinde’ farkı anlayamadığını söylemek, çıktıyı ayırt edecek kadar iyi anlamadığı bir işi modele verdiği anlamına geliyor gibi.
    • Karşılaştırılanlar Fable High ve K3 High idi; ana kullanım alanı oyun geliştirme. Belirsiz görsel hataları düzeltme, sahnenin ya da modelin görünümünü değiştirme, büyük özellikler ekleme gibi işler verdim.
      İlk ifade doğru değildi; Fable veya K3'ü zamanın çoğunda kullanmıyorum, genelde kapsamı küçük işleri yaptırıp sonra kendim inceliyorum.
  • Gizlilik politikası da küçük bir mesele değil. Kimi aboneliğini kullanırsanız etkileşimlerin model eğitimi için kullanıldığını, yalnızca API fiyatıyla doğrudan API kullanıldığında kullanılmadığını belirtiyorlar. Buna güvenip güvenmemek ayrı konu.
    OpenRouter’da başka sağlayıcılar görünene kadar bekleyip güvenilirliği ona göre değerlendirmeyi düşünüyorum. Onlara çok güvenmesem bile, modeli doğrudan eğitmeyen bir sağlayıcıysa verilerin eğitime kullanılması olasılığı daha düşük olur.

    • Bu tür endişeler giderek daha gülünç görünmeye başladı. Girdilerin çoğu, aynı modelin daha önce ürettiği çıktılar ve “hatasız düzelt” gibi gelişigüzel yazılmış insan komutlarından ibaret; gelecekteki modeller iyileşecekse bunların eğitimde kullanılması sorun değil.
      Kullanıcıların %99’u endişelenmeyi gerektirecek özel bir fikri mülkiyet ile uğraşmıyor.
    • Hobi amaçlı kullanıcıların tamamı açık ağırlıklı modeller kullansa bile kurumsal sıfır veri saklama pazarı, ABD şirketlerine yeterli iş fırsatı sunacaktır.
    • Bu politika, hizmeti kullanmama sebebi. Açık ağırlıklar sayesinde mümkün olacak bağımsız sağlayıcı hizmetleri çıkana kadar beklemeyi düşünüyorum.
  • Şimdiye kadar her şey nihayetinde damıtmaydı. Suhail’in dediği gibi, yapay zeka modellerinden elde edilen kârı neredeyse sıfıra indirmek gerekiyor.
    İnsanlığın verileriyle eğitildikleri için insanlığın kendisine verilen bir hediye olmalılar; az sayıda kişinin insanlığı kontrol etmesini engellemenin yolu da bu.

    • Çin’in büyük modellerini hâlâ yalnızca “damıtılmış sürüm” olarak görmek gülünç. Devasa verileri kullanıp kullanıcıları sansürlenmiş ve performansı kısıtlanmış modellere bağımlı kılmaya çalışan ABD’li öncü araştırma laboratuvarlarını vuracak dalgayı birçok kişi hâlâ fark etmiş değil.
  • Açık kaynak modeller zaten en iyi ticari modeller seviyesine ulaştı. Son darboğaz donanım, ancak o eşik de hızla aşağı iniyor.
    Kimi K3’ü evde çalıştırmak hâlâ çok pahalı, ancak makul donanımlarda çalışabilen yetenekli ücretsiz modeller şimdiden çok sayıda var ve bu eğilim devam edecek.