1 puan yazan GN⁺ 4 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Yaklaşık 1.030 ajan görevi üzerinde Kimi K3 ile Fable 5 karşılaştırıldığında, görev bazlı yönlendirme %93 doğrulukla tekil modellerden daha yüksek kaliteye ulaştı
  • SWE, terminal, algoritma, çok dilli ve hukuk görevlerinde genel performans benzerdi; ancak iki modelin güçlü olduğu görev alanları birbirinden farklıydı
  • Oracle yönlendirme, görevlerin %72–96’sını K3’e atadı; K3, 5 görev grubunun tamamında Fable’dan daha maliyet verimliydi
  • Uzun ajan döngülerinde K3, yalnızca Fable kullanımına kıyasla yaklaşık 50 kata kadar daha yüksek maliyet verimliliği gösterdi; ancak yürütme adımları fazla olduğunda işlem süresi uzayabilir
  • Ucuz açık modeli varsayılan alıp zor görevleri başka modellere gönderen iş yüküne özel bir yönlendirici, kaliteyi ve maliyeti birlikte iyileştirebilir

Gerçek ajan görevleriyle ölçüm

  • Kimi K3 ve Fable 5 aynı harness üzerinde çalıştırılarak gerçek ajan döngüsü biçiminde yaklaşık 1.030 görev gerçekleştirildi
    • SWE: gerçek depolardaki hata düzeltmelerine benzer 460 görev
    • Terminal: güvenlik, kriptografi, tersine mühendislik, sistem yönetimi gibi uzun süreli ajan görevlerinden 89 adet
    • Algoritma: LeetCode ve AtCoder türü 100 problem
    • Çok dilli: 6 dilde uygulama geliştirme görevlerinden 225 adet
    • Hukuk: avukatlar tarafından puanlanan 120 hukuk ajanı görevi
  • Birden fazla görev türünü kapsayan benchmark sonuçlarının ortalaması alınarak iki model karşılaştırıldı

Oracle yönlendirmenin anlamı ve sınırları

  • Oracle yönlendirme, her görevi tüm modellerde çalıştırdıktan sonra doğru yanıt veren seçenekler arasından en ucuz modeli seçen teorik bir ölçüm yöntemidir
  • Gerçek bir yönlendirici, görevleri önceden birden fazla modelde çalıştıramayacağı için maliyet ve kalite dengesi en iyi olan modeli baştan tahmin etmelidir
  • Bu yöntemde tüm görevlerin %72–96’sında K3 seçildi
  • Gündelik görevler ile en üst seviye model gerektiren uzun kuyruk görevleri ayıran bir yönlendirici mümkün olabilir
    • Bunu kesinleştirmek için tek haneli ölçekte değil, 10 kat düzeyinde ek yönlendirme verisi ve gerçek ortamda performans doğrulaması gerekir

Genel performans benzer, güçlü yanlar farklı

  • Temsili SWE sonucu K3 için %92,4, Fable için %92,6 ile neredeyse aynıydı
  • 5 görev türü genelinde de iki model arasındaki fark çoğunlukla birkaç yüzde puanı içindeydi; Fable çok dilli kodlama kapsamındaki görevlerde biraz öndeydi
  • Benzer genel puanlara rağmen ayrıntılı görevlerde her modelin belirgin biçimde üstün olduğu alanlar görüldü

Görev alanlarına göre farklar

  • SWE problem alanlarına ayrıldığında K3 sembolik matematik ve geliştirici araçlarında, Fable ise web ve veri görselleştirme görevlerinde üstündü
  • Çok dilli görevlerde Fable Java, Python ve C++’ta öne geçti; K3 JavaScript ve Rust’ta başa baştı
  • Onlarca kez shell etkileşimi gerektiren uzun terminal görevlerinde K3 güçlüydü
    • Fable’ın çözemediği 7z hash, FEAL kripto analizi, sızdırılmış gizli bilgiler, gerçek güvenlik açıkları ve kontrolden çıkan asenkron görevleri çözdü
  • Doğruluk ve maliyet birlikte karşılaştırıldığında Fable çok dilli görevlerde, K3 ise terminal ve hukukta öndeydi; diğerleri genel olarak benzerdi

Maliyet farkını oluşturan yapı

  • K3’ün maliyet avantajı token fiyatı, prompt caching ve görev bazlı kaynak kullanımından kaynaklanıyor
  • Bir SWE görevi başına K3 yaklaşık 55 tur ve 1,3 milyon token kullanırken, Fable yaklaşık 21 tur ve 130 bin token kullandı
  • Uzun terminal görevlerinde ise tersine Fable yaklaşık 64 tur ve 1,5 milyon token’a kadar çıktı, zaman zaman zaman aşımına ulaştı
  • K3, SWE’de 10 kat daha fazla token okusa da prompt cache isabetleri sayesinde çalıştırma maliyeti Fable’dan düşüktü
  • Yürütme adımları arttığında gerçek işlem süresi uzayabilir
    • 2 saniye içinde yanıt verilmesi gereken görevlerde gecikme önemlidir
    • Büyük ölçekli arka plan ajanlarında ise daha düşük fatura maliyeti daha önemli hâle gelir

İki modeli birleştirmenin sonucu

  • Her görevi daha uygun modele gönderdiğinizde iki modelin orta seviyesi değil, her bir tekil modelden daha yüksek performans elde edilebilir
  • Görev bazlı oracle yönlendirme, tekil model çalıştırmalarından her zaman daha yüksek performans gösterdi ve toplam doğruluk %93’e ulaştı
  • Trafiğin %72–96’sını maliyet açısından optimize model olan K3’e gönderirken toplam kalite her modelden daha yüksek, maliyet ise yalnızca K3 kullanımına yakın hâle geldi
  • K3, 5 görev grubunun tamamında Fable’dan daha maliyet verimliydi; uzun ajan döngülerinde yaklaşık 50 kata kadar daha yüksek maliyet verimliliği kaydetti

Tekil model yerine iş yüküne göre yönlendirme

  • Kimi K3 ve Fable birlikte yönlendirildiğinde farklı güçlü yanlardan yararlanırken maliyet düşürülebilir
  • Modellerin fiyatları ve uzmanlık alanları farklı olduğundan, en yüksek kaliteli yapay zeka tek bir sağlayıcıdan çok birden fazla modelin kombinasyonundan gelebilir
  • Maliyeti 50 kata kadar düşük olan ve oracle’ın trafiğin çoğunu atadığı K3 gibi açık modeller varsayılan seçenek yapılabilir
  • Yönlendirici gerçek iş yüküne göre uyarlanmalı ve görev-model uygunluğunu sürekli öğrenmelidir

1 yorum

 
GN⁺ 4 시간 전
Hacker News görüşleri
  • Doğrudan çalıştırıp denediğinizde bu modellerin hepsi benchmark’lara aşırı uyum sağlamış durumda. Bazı metriklerde ön cephe modellerine yaklaşsalar bile gerçek işlerde dağılıyorlar ve token verimlilikleri de akıl almaz derecede düşük.
    Fireworks, kapalı modellerin aksine K3 barındırmadan büyük kazanç elde ettiği için böyle bir başlık atma konusunda çok güçlü bir teşvike sahip.

    • Birkaç gün K3, Qwen 3.8 Max Preview, Fable ve Sol’u denedikten sonra benchmark’lara güvenmenin zor olduğu, Çin modellerinin yavaş ve token verimliliğinin de düşük olduğu konusunda kısmen katılıyorum.
      Yine de önceki nesil üst seviye modeller olan Opus 4.8 ve GPT 5.5 ile kabaca benzerler; https://senko.net/vibecode-bench/ üzerinden de karşılaştırılabilir.
      Resmî API’leri ve her birinin kodlama araçlarını kullanarak, yalnızca ayrıntılı spesifikasyonlarla basit ama hiç de kolay olmayan bir web uygulaması yaptırdığımda K3, Qwen 3.8 ve Fable’ın sonuçları kullanıcı testlerinde neredeyse aynıydı; Sol’un kod incelemesinde de hepsi makuldü, Fable biraz öndeydi.
      Pratikte hâlâ Opus 4.8 ve Sol’u tercih ediyorum, ama bir alternatife ihtiyaç varsa K3 ve Qwen 3.8 de gayet kullanılabilir.
    • Hepsi benchmark’lara aşırı uyum sağlamış durumda, ama asıl mesele birbirlerine kıyasla ne kadar aşırı uyum sağladıkları.
      Doğru cevap kümesi olmadan, ajanların birbirini etkilediği açık uçlu çok ajanlı ortamlarda ağırlıklı olarak kodlama becerisini değerlendiriyorum; Çin modelleri genelde reklamı yapılan model kartlarına göre ABD modellerine kıyasla daha düşük çıkıyor.
      Kimi K3 istisnai biçimde gerçekten ön cepheye yakın, ama çok yavaş. Muse Spark 1.1, Fable ve Sol’dan sonra en güçlü model; üstelik maliyet verimliliği de en yüksek, Llama 4’ten sonra büyük bir tersine dönüş yaptı. Veriler https://gertlabs.com/rankings adresinde.
    • Fable oldukça büyük kod tabanlarında bile çok iyi çalışıyor. Birkaç kez düzeltmem ya da yön vermem gerekti, ama çoğu zaman sebep prompt’taki gereksinimlerin yetersiz olmasıydı; gerçekten yanlış yaptığı durum ise yalnızca iki kez civarındaydı, yani hata oranı benim meslek kariyerimden daha düşük.
      Kod kalitesi benim yazacağım seviyede, aşina olmadığım alanlarda ise daha iyi. Refactoring, entegrasyon ve regresyon testleri, denetim günlükleri ile hata uyarılarının kontrolü gibi insanların ertelediği ya da sıkıcı bulduğu işleri de istikrarlı biçimde yaparak genel yazılım mühendisliği seviyesini yükseltiyor.
      PostgreSQL kullanan nispeten karmaşık bir Ruby on Rails gerçek üretim hizmeti; aylık 200 dolarlık Max planında token bütçesi sorun olmadı ve maliyeti de kesinlikle değerdi.
    • Yazıyı okumadım ama çıkarım hizmeti sağlayıcısının kendi sunduğu Mythos sınıfı modeli öne çıkaran başlığı baştan şüpheli geldi. Kimi K3’ün parametrelerinin üçte birinden bile azına sahip GLM 5.2 hâlâ ana model.
    • Bu değerlendirmelerin hepsine şimdilik kaydını düşmek gerekiyor. Trende bakınca, kodlama için yeterince iyi seviyede olmasa bile yakında oraya varacağı açık; açık modellerin neredeyse tüm yazılım işlerini yaptığı bir dünyaya hazırlanmak gerekiyor.
  • Yaklaşık 1.000 görevi yazılım mühendisliği, hukuk vb. 5 alana ayırarak Kimi K3 ve Fable’ı test etmeleri ilginç.
    Öne, doğru cevabı üretmek için hangi modelin daha ucuz olacağını tahmin eden bir router modeli koyuyorlar; nihayetinde bunun herkesin kendi iş yüküyle sürekli eğitilmesi gerektiğini düşünüyorum.
    Router, alana göre görevlerin %72 ila %96’sında Kimi’yi seçmiş ve alana bağlı olarak 1,5 ila 50 kat maliyet tasarrufu sağlamış.

    • Buradaki router, iki modeli de çalıştırıp geçip geçmediğini kontrol ettikten sonra daha ucuz modeli seçen bir oracle temel ölçütü.
      Fireworks’ün varsayımı, aynı sonucu önceden tahmin eden bir router mevcut olduğunda maliyetin düşürülebileceği yönünde; böyle bir router’ın var olup olmadığı ise büyük bir ön kabul.
    • Benzer router’lardan https://openrouter.ai/openrouter/auto gibi birkaç tane var.
  • İnsan gibi sohbet eden bir modelse benchmark puanında %5 düşüşü göze alabilirim.

    • Ben aksine insan gibi konuşmaya çalışmayan modelleri tercih ederim.
    • %5’ten vazgeçmeye gerek yok; Fable çıktısını Gemini Flash’e verip daha okunabilir cümlelerle yeniden yazdırabilirsiniz.
    • Modelin benim insani konuşma tarzımı taklit etmemesini güçlü biçimde tercih ederim. Claude’un arkadaş gibi davranıp şakalara LOL diye cevap vermesi yalnızca komik değil, zararlı bile.
    • Opus varsayılan olarak benim Claude dili dediğim üslupta çıktı veriyor. Aşırı basitleştirilmiş ve dilbilgisi açısından eksik cümleler olduğu için okumak acı verici; model için okunması ve yazması kolay olabilir ama insanlar için öyle değil.
      Örneğin uzun bir makale yönergesini “şimdi bir kez göz at ve Part II’yi okurken tekrar başvur” gibi emir kipindeki parçalar, kalın anahtar kelimeler ve oklarla sıkıca birbirine bağlanmış tek bir satır olarak çıktılamıştı.
    • LLM insan değil; illa insan gibi konuşması için bir neden yok.
  • Anthropic, Roma İmparatorluğu’nu hızlı ileri sarma görüntüsü veriyor; daha IPO bile yapmadan zirveyi geçip düşüş aşamasına girmiş gibi.

  • Kimi K3 kodlama planına abone olurken veri yönetişimi ve gizlilikin nasıl uygulandığını merak ediyorum. Anthropic’ten geçmek istiyorum

    • https://platform.kimi.ai/docs/agreement/modeluse adresine göre içerik; hizmetin sunulması, sürdürülmesi, geliştirilmesi ve iyileştirilmesi gibi amaçlarla kullanılabiliyor; eğitim kısıtlamasına ihtiyaç duyan müşterilerin ayrı bir kurumsal sözleşme veya yazılı mutabakat görüşmesi gerekiyor
      Claude’un aksine model eğitimi için vazgeçme seçeneği yok; şartlara göre Kimi müşteri kodunu eğitimde kullanabilir
    • Batılı sağlayıcılar barındırmaya başlayana kadar beklemek gerekiyor
    • En basit yöntem OpenRouter’a kaydolup sıfır veri saklama (ZDR) olmayan tüm sağlayıcıları hariç tutmak. Ancak API ücretleri kodlama planından daha pahalı olabilir; MiniMax’in aylık 20 dolarlık planında sunduğu 1,7 milyar token, girdi-çıktı ve cache oranına bağlı olarak API bazında 200–500 doların üzerinde değere sahip
      Çinli şirketlerle doğrudan muhatap olmak istemiyorsanız AtlasCode ayda 20 dolara, OpenCode Go ayda 10 dolara, Cline Pass ayda 10 dolara bazı popüler açık ağırlıklı modellerde 2–6 kat kullanım sunuyor
      Kişisel olarak Z.ai’ye ayda 17 dolara aboneyim; MiMo v2.5, Hy3, Qwen 3.7 Plus ve DeepSeek v4 için de her bir asıl sağlayıcıya API ücreti ödüyorum
    • Gizlilik şartlarına https://www.kimi.com/user/agreement/zh/userPrivacy adresinden bakılabilir
  • Açık modelleri öne çıkarmak için para alıp böyle yazılar yazmanın mümkün olup olmadığını, mümkünse amacın ne olduğunu merak ediyorum
    Modern SaaS ürünlerinde FastAPI·Python ve Spring Boot·Java işleri yapmış biri olarak, hem iyi hem verimli olan tek açık model Qwen 3.7 Max idi
    GLM 5.2 ve Kimi, kod yazmadan önce neredeyse 70–80 bin token boyunca kod tabanını arayıp yine de çoğu zaman kodu bozuyor. Bir yıl önceki gibi çok ayrıntılı spesifikasyon verildiğinde iyi iş çıkarıyorlar ama Qwen 3.7 fazladan uğraş gerektirmeden işi bitiriyor

    • İyi bir içerik pazarlaması. Fireworks, Kimi K3 erişimi satan büyük bir model çıkarım sağlayıcısı
    • Fireworks açık modelleri hızlı çalıştırma konusunda uzmanlaşmış ve gelirinin büyük kısmını Çin modellerinden elde ediyor; dolayısıyla ekonomik teşvik zaten tüm iş modelinin kendisi
    • Teknoloji alanındaki etki işinde çok para var, ama bunun çoğu OpenAI’ın tbpn satın alması veya bazı influencer’lara erken erişim gibi büyük oyunculardan geliyor
    • Lin Qiao, Fireworks AI’ın kurucu ortağı ve CEO’su. LLM’ler ABD-Çin Soğuk Savaşı’nın uzay yarışı sayılır; bu yüzden para yerine ulusal/medeniyetsel üstünlüğü kanıtlama motivasyonu daha büyük olabilir
  • Burada Kimi’nin özel olarak daha iyi olduğu bir yan var mı merak ediyorum. Fiyatının Sonnet 5’e benzer olduğunu biliyorum; o zaman Sonnet 5 ve Fable kullanmak ya da daha ucuz Grok 4.5 kullanmak nasıl olur diye düşünüyorum

    • Yazıda Kimi’nin bazı işlerde Fable’dan iyi olduğu söyleniyor, ama bunun Sonnet için geçerli olma ihtimali düşük
    • Açık modellerin avantajı, büyük şirketlerin kendi veri merkezlerinde yerel çalıştırma ve ince ayar yapabilmesi
  • Çin modellerini çok seviyorum ve yalnızca DeepSeek kullanıyorum; artık Kimi K3’ü de ileri seviye kodlama işlerinde harika bir planlama yardımcısı olarak kullanıyorum
    DeepSeek v4 Flash çok hızlı ve Rust, PostgreSQL, Angular, Terraform’da verdiğim işlerin neredeyse tamamını hallediyor
    Bifrost’u LLM gateway’i olarak kendim barındırıyorum; ama sağlayıcıların ön ödemeli bakiye ve otomatik bakiye yükleme yerine VPS gibi aylık/günlük gerçek kullanımı otomatik faturalandırmasını isterdim. Birden fazla sağlayıcıda iade edilmeyen minimum bakiye tutmak yerine yalnızca kesin kullanımı ödemek istiyorum
    OpenRouter yardımcı oluyor ama hizmetin kendisini ve ek ücretlerini sevmiyorum

    • Bu aralar DeepSeek v4 Pro’yu ana model olarak kullanıyorum; aynı anda çok iş olduğu için hız daha az önemli. Başarısız olursa konuşma sırasında GPT 5.5’e geçip sorunu bulduruyor, sonra o analizi bağlamda bırakarak tekrar DeepSeek’e dönüyorum
      Kimi k2.5/6 daha yavaşladı ve performansı da kötüleşti; ayrıca engine overloaded hataları arttı. k3 uzun süre düşünüyor ama sonuçlar belirgin biçimde iyileşmiyor. Hesaplama kaynağı baskısı yüzünden modeli geçici olarak quantize etmiş olabileceklerini düşünüyorum
      Son dönemde ağırlıklı olarak DeepSeek v4 Pro kullanıyorum; güçlü bir model gerektiğinde GPT 5.5’e başvuruyorum. GLM 5.2 bazı işlerde iyi ama başka işlerde çok kötüydü; Google veya Anthropic modelleri ise henüz etkileyici gelmedi
    • reasonix veya whale gibi araçlar kullanınca yaklaşık %98 cache isabet oranı elde edilip istek maliyeti fiilen ücretsiz denecek kadar düşüyor. Cloudflare veya DigitalOcean gibi sübvansiyonsuz ABD sağlayıcılarında bile mümkün
    • Ön ödemeli sistem, kullanıcıların çıkarım kaynaklarını büyük ölçekte tüketip sonra kartı iptal ederek ortadan kaybolmasını engelliyor. VPS uzun vadeli bir yatırım olduğu için geçiş daha zor; bazı kullanıcılar bir aylık ücreti ödemese bile sağlayıcının maliyeti görece küçük kalıyor
    • Bifrost’u değerlendiriyorum; neden LLM gateway’i seçtiğinizi merak ediyorum
      OpenRouter neredeyse tüm modelleri çıktığı ilk günden sunuyor, ama Bifrost kullanırsam daha sonra OpenRouter’dan ayrılsam bile teknik kurulumun geri kalanına dokunmak zorunda kalmayacak olmam cazip. Kendi kendine barındırma gerçekçi hale gelirse OpenAI, Anthropic ve OpenRouter bağımlılığını azaltabilir, bağımlı olunan bir modelin aniden kaldırılması riskini de düşürebilirim
    • Ek ücretler dışında OpenRouter hizmetinin hangi yönünü beğenmediğinizi merak ediyorum
  • Açık model barındırma şirketinin açık modeller harika dediği bir durum

    • Metodolojiyi ve sonuçları yayımladılar; başka yerde görmediğim Kimi ile Fable’ın göreli güçlü ve zayıf yanlarını öğrendim. Model barındırma işi yapıyor olmaları, sonuçları paylaşma ehliyetlerini ortadan kaldırmaz
    • Fireworks yalnızca açık ağırlıklı modelleri barındırmuyor; büyük bir haberin yeni müşteri çekebilecek olması içeriği yalan yapmaz
    • Bizzat denemiş olanlar, değerlendirmelerinin doğru olduğunu bilir
  • Yazıda açıklandığı gibi Claude Code ile birlikte kullanılabilecek bir yönlendirme aracı ya da başka iyi bir yönlendirme platformu aranıyor. Bu yazıdaki yönlendiricinin oracle yaklaşımı kullandığını biliyorum

    • https://github.com/code-yeongyu/oh-my-openagent özgün metindeki oracle desenini 11 rol genelinde uyguluyor
      Her rol için birden fazla sağlayıcıdan önerilen LLM sıralaması var; örneğin ana orkestratör olarak Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5) kullanılıyor