- Değerlendirilen 170 model arasında Claude Opus 5 Adaptive Reasoning·Max Effort, Intelligence Index’te 61 puanla 1. sırayı aldı; Xhigh Effort ve Claude Fable 5 ise sırasıyla 60 puanla onu izledi
- Intelligence Index v4.1, ajan görevleri, kodlama, bilimsel akıl yürütme, bilgi güvenilirliği ve uzun bağlam akıl yürütmesini kapsayan 9 değerlendirmeyi birleştiriyor; akıl yürütme modellerinin uzatılmış düşünme süresini de performans ölçümüne dahil ediyor
- Çıktı hızında Mercury 2 901,6 tokens/s ile en hızlı model; ilk token gecikmesinde Gemini 2.5 Flash-Lite 0,34 saniye ile en kısa süreye sahip; Llama 4 Scout ise 10M token’lık maksimum bağlam penceresi sunuyor
- Fiyatlandırma yalnızca token birim fiyatıyla değil, girdi, cache hit, cache write, akıl yürütme ve yanıt token’larını ağırlıklandıran görev başına maliyet ile karşılaştırılıyor; cache write ve depolama maliyetleri sağlayıcıya göre değişiyor
- Açık ağırlıklı modeller arasında GLM-5.2 (max) 51 puanla en yüksek skoru alıyor ancak genel 1. sıradan 10 puan düşük; bu nedenle model seçerken zekânın yanı sıra maliyet, hız, gecikme ve bağlam penceresi de dikkate alınmalı
Claude Opus 5’in zeka sıralaması
- Claude Opus 5 (Adaptive Reasoning, Max Effort), Intelligence Index’te 61 puanla değerlendirilen 170 model arasında 1. sırada
- İlk 5 model şöyle
- Claude Opus 5 (Adaptive Reasoning, Max Effort): 61 puan
- Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60 puan
- Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60 puan
- GPT-5.6 Sol (max): 59 puan
- Claude Opus 5 (Adaptive Reasoning, High Effort): 59 puan
- Max Effort yapılandırması, 126 akıl yürütme modeli arasında da 1. sırada; akıl yürütme modelleri yanıtlamadan önce karmaşık problemleri ele almak için uzatılmış düşünme gerçekleştiriyor
Intelligence Index v4.1’in değerlendirme yapısı
- Intelligence Index v4.1 aşağıdaki 9 değerlendirmeyi birleştiriyor
- GDPval-AA v2: ajan tabanlı gerçek iş görevleri
- 𝜏³-Banking: ajan araç kullanımı
- Terminal-Bench v2.1: ajan kodlama ve terminal kullanımı
- SciCode: kodlama
- Humanity's Last Exam: akıl yürütme ve bilgi
- GPQA Diamond: bilimsel akıl yürütme
- CritPt: fizik akıl yürütmesi
- AA-Omniscience: bilgi doğruluğu ve halüsinasyon yapmama oranı
- AA-LCR: uzun bağlam akıl yürütmesi
- Kullanım amacına bağlı olarak belirli değerlendirme sonuçları, genel zeka puanından daha önemli olabilir
- Ayrı değerlendirme kalemleri arasında şu benchmark’lar da yer alıyor
- AA-Briefcase: ajan bilgi işi
- AutomationBench-AA: ajan SaaS iş akışı
- Harvey LAB-AA: hukuki ajan görevleri
- EnterpriseOps-Gym-AA: ajan iş operasyonları
- IFBench: talimata uyma
- APEX-Agents-AA: uzun vadeli ajan görevleri
- ITBench-AA: Kubernetes olaylarında kök neden analizi
- MMMU-Pro: görsel akıl yürütme
Bilgi işi, güvenilirlik ve açıklık metrikleri
- AA-Briefcase Elo, analiz kalitesi Elo’su, sunum Elo’su ve değerlendirme kriterlerini geçme oranını birleştiriyor
- Geçme oranı, sentetik bire bir karşılaşmalar yoluyla Elo’ya dönüştürülüyor
- Elo ve %95 güven aralığı sınırları 0’ın altına düşmeyecek şekilde sınırlanıyor
- AA-Omniscience Index, bilgi güvenilirliğini ve halüsinasyonu -100 ile 100 puan arasında ölçüyor
- Doğru yanıtlara ödül, halüsinasyonlara ceza veriyor; yanıtlamayı reddetmeye ise ceza vermiyor
- 0 puan, doğru ve yanlış yanıt sayısının eşit olduğu; negatif değerler ise yanlışların doğrulardan fazla olduğu anlamına geliyor
- Openness Index, modelin açıklığını 0–100 arasında normalize edilmiş bir puanla değerlendiriyor; puan yükseldikçe model daha açık kabul ediliyor
- Ağırlıkların açık olup olmadığı ayrıştırılıyor; ağırlıkları açık olsa da ticari kullanım için ücretli lisans vb. gerektiren modeller
Commercial Use Restrictedolarak gösteriliyor
Açık ağırlıklı model sıralaması
- Değerlendirilen 170 modelin 94’ü açık ağırlıklı model
- Açık ağırlıklı modellerde Intelligence Index’in üst sıraları şöyle
- GLM-5.2 (max): 51 puan
- MiniMax-M3: 44 puan
- DeepSeek V4 Pro (Reasoning, Max Effort): 44 puan
- GLM-5.2 (max), açık ağırlıklı modeller arasında en yüksek puanı aldı
Çıktı hızı ve görev işleme süresi
- Mercury 2, 901,6 tokens/s ile en yüksek çıktı hızına sahip
- Gemini 3.5 Flash-Lite: 435,1 tokens/s
- HyperNova 60B 2605: 427,6 tokens/s
- Granite 4.0 H Small da üst sıralarda yer alıyor
- Çıktı hızı, streaming modellerde ilk chunk alındıktan sonra model token üretirken alınan saniye başına token sayısıdır
- Intelligence Index’te görev başına süre, görev başına çıktı token sayısının çıktı hızına bölünüp her benchmark’ın göreli ağırlığı uygulanarak hesaplanıyor
- İlk token’a varış süresi (TTFT) ve diğer ek yükler hariç tutuluyor
- Kendi API’si varsa ilgili API’nin performansı kullanılıyor; Meta Llama gibi kendi API’si olmayanlarda birden fazla sağlayıcının medyanı kullanılıyor
Gecikme ve uçtan uca yanıt süresi
- İlk yanıt token’ına varış süresi en kısa model, 0,34 saniye ile Gemini 2.5 Flash-Lite (Non-reasoning)
- Command A+: 0,42 saniye
- North Mini Code: 0,49 saniye
- Gemini 2.5 Flash da gecikmesi düşük modeller arasında
- İlk token gecikmesi, API isteğinden sonra ilk yanıt token’ını almaya kadar geçen süredir
- Akıl yürütme modellerinde yanıt öncesi düşünme süresi de dahildir
- Streaming desteklemeyen modellerde, tüm yanıtı alma süresi uygulanır
- 500 token’lık uçtan uca yanıt süresi şu unsurların toplamıdır
- İlk yanıt token’ını almaya kadarki giriş süresi
- Akıl yürütme modellerinin yanıt öncesinde kullandığı düşünme süresi
- Çıktı hızına bağlı olarak 500 yanıt token’ı üretme süresi
- Düşünme token sayısı, birbirinden farklı 60 prompt üzerinde ölçülen ortalama kullanılarak hesaplanır
Fiyat ve görev başına maliyet
- Fiyat karşılaştırmasında cache hit, girdi ve çıktı token’ları için 1 milyon token başına dolar birim fiyatı kullanılıyor
- Listede Devstral 2 ve North Mini Code, 1 milyon token başına $0.00 olarak gösteriliyor; onları Gemma 3 4B ve Gemma 3 27B izliyor
- Karma birim fiyat bazında en ucuz modeller şöyle
- Nova Micro: $0.03/1M tokens
- Sarvam 30B (high): $0.03/1M tokens
- Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
- Intelligence Index’te görev başına maliyet, her değerlendirmenin girdi, cache hit, cache write, akıl yürütme ve yanıt token fiyatlarının görev sayısına bölünüp Index içindeki değerlendirme ağırlıkları uygulanarak hesaplanıyor
- Tüm Index’i çalıştırma maliyeti, tekrar çalıştırmalar hariç değerlendirme başına token kullanımı ve her token türünün fiyatı üzerinden hesaplanıyor
- Gösterilen karma cache fiyatı yalnızca cache hit maliyetini kullanıyor; diğer cache maliyetleri sağlayıcıya göre değişiyor
- Anthropic, cache write maliyetini ayrıca ücretlendiriyor; 5 dakika ve 1 saat TTL için oranlar farklı ve 1 saat daha pahalı
- Google Vertex/Gemini, cache hit fiyatına ek olarak saatlik depolama maliyeti alıyor
- Bazı sağlayıcılar 200K token’ı aşan prompt’lara kademeli fiyatlandırma uyguluyor
- OpenAI ve DeepSeek gibi sağlayıcılar genellikle write/depolama maliyeti olmadan yalnızca cache hit fiyatı alıyor
Token kullanımı ve bağlam penceresi
- Görev başına çıktı token sayısı, her değerlendirmenin çıktı token’larının Intelligence Index içindeki göreli ağırlıkla çarpılıp tekrarlar hariç görev sayısına bölünmesiyle hesaplanıyor
- Bağlam penceresinde üst sıradaki modeller şöyle
- Llama 4 Scout: 10M token
- Grok 4.20 0309: 2M token
- Gemini 1.5 Pro (May)
- Grok 4.1 Fast
- Bağlam penceresi, girdi ve çıktı token’larının toplamına uygulanan maksimum sınırdır; çıktı token sınırı genellikle bundan çok daha küçüktür ve modele göre değişir
- Büyük bağlam pencereleri, büyük veri yığınlarından bilgi arama ve akıl yürütme yapan RAG iş akışlarıyla ilişkilidir
Açık ağırlıklı modellerin boyutu
- Model boyutu, eğitilebilir ağırlıklar ve bias’ların toplamı olan toplam parametreler ile gerçek çıkarımda çalışan aktif parametreler olarak ayrılır
- Mixture of Experts modellerinde routing mekanizması her token için uzmanların yalnızca bir kısmını seçtiğinden aktif parametre sayısı toplamdan azdır
- Dense modeller tüm parametreleri kullandığı için aktif parametreler ve toplam parametreler aynıdır
Karşılaştırma kapsamı ve kullanım şekli
- Modeller zeka, fiyat, çıktı hızı, ilk token gecikmesi, uçtan uca yanıt süresi, bağlam penceresi boyutu gibi birçok boyutta karşılaştırılıyor
- Performans metrikleri, 586 model üzerinde standartlaştırılmış prompt’lar kullanılarak doğrudan ölçülüyor
- Her modelin detay sayfasında ayrıntılı metrikler ve benzer modeller arasında doğrudan karşılaştırmalar görülebilir; model seçiciyle grafikte gösterilecek modeller ayarlanabilir
1 yorum
Hacker News görüşleri
Bu sıralama, son kullanıcıların hangi modeli ne zaman kullanacağına karar vermesi açısından fiilen anlamsız hale geldi.
Her modelin belirli alanlarda ve görevlerde güçlü ve zayıf yanları farklı olduğundan tek metrikli sıralama işe yaramıyor; artık tek bir “en iyi model” de yok ve görevin karmaşıklığına bağlı olarak en iyi modele ihtiyaç bile olmayabilir.
Örneğin UI tasarımı için Fable, backend sistem tasarımı için Sol, zafiyet geliştirme için Kimi K3 kullanılabilir; bu tür metrikler de nihayetinde model şirketlerinin gösteriş sayıları olmaya daha yakın.
Ama aynı aileden daha eski ve daha küçük bir model de bunu iyi yaparken 3 kat hızlı ve maliyeti 9'da 1 idi; o anda durumu fark ettim.
2026'da bir Elixir/Phoenix projesini en idiomatik şekilde en iyi hangi modelin ele aldığı gibi, biraz öznel olsa bile, tüm modelleri sürekli bizzat karşılaştırmanın zor olduğu ve performans farklarının da büyük olduğu bir durumda yararlı olabilir.
Her istatistikte çarpıklık vardır ama hiçbir şey bilmemekten iyidir; benchmark'ın birçok görevin ortalamasını göstermesi de zaten istatistiğin doğası gereği özetleme amaçlı olduğu anlamına gelir.
Ancak bunları tek bir sonuca indirgerseniz tüm nüanslar kaybolur, geriye sadece gösteriş amaçlı sıralama kalır.
Google yöneticisi olsam, sırf çok iş olduğu için değil, insanların karşısına çıkmaya utanacağım için de ofiste uyumam gerekirdi diye düşünüyorum.
Uzun zamandır sorulara doğru yanıtı en hızlı şekilde vermenin en büyük öncelikleri olduğunu söylüyorlar.
Üçü arasında AGI'ye tapıp çile çekmeyen tek şirket gibi görünüyor.
Belki de tek hedefleri budur.
Zekâ endeksinin üst sıralarında Claude Opus 5 Max 61 puan, Opus 5 Xhigh 60 puan, Claude Fable 5 Max ve Opus 4.8 yedek model kombinasyonu 60 puan, GPT-5.6 Sol Max 59 puan, Opus 5 High 59 puan yer alıyor.
Dolayısıyla Opus 5 Xhigh, Sol Max'ten yüksek, Opus 5 High ise Sol Max ile aynı; bu yüzden iki modelin fiyat ve hız farkını merak ediyorum.
DeepSwe'de Opus 5, Fable'ı geçiyor ama Sol'un gerisinde kalıyor; FrontierCode'da ise hepsini eziyor, fakat akıl yürütme çabasını Medium'un üstüne çıkarınca Sonnet seviyesine keskin şekilde düşüyor.
Özellikle yüzeysel yaklaşıyor; ona uygulamanın ya da framework'ün tamamını öğretmek gerekiyor ve zaten başka biçimde desteklenen bir özelliği tekrar eklemek gibi aptalca işlerle başlıyor.
Bileşenlerden AA-Omniscience Index ilginç.
Bilgi güvenilirliğini ve halüsinasyonu ölçüyor; doğru yanıtlara ödül verip halüsinasyonlarda puan kırıyor ama yanıtlamayı reddetmede puan kırmıyor ve parametre ölçeğini ya da yoğunluğunu kabaca gösteren bir metrik gibi görünüyor.
Sıralama Claude Fable 5 yedek model kombinasyonu, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash, GPT-5.6 Sol Max şeklinde; Gemini 3.x'te uzun zamandır büyük modele özgü bir his vardı.
Gemini 3.6 Flash'ın görüntü analizi de sağlam, fakat kodlama veya ajan görevlerinde yetersiz.
3.x Flash'ın tek bir TPU 8i'ye sığdığı söyleniyor ve işleme hızı da 234,7 token/sn ile Sol'un 64,4'ünden ve Opus'un 56,3'ünden açık ara yüksek; 3.1 Pro da 113,9 token/sn ile çok daha hızlı.
AA-Omniscience Accuracyde dev Fable %61 ile lider, ardından Sol, GPT-5.5, Opus gibi büyük frontier modeller geliyor; bu da beklentiye daha uygun.
Gemini kodlamada en yüksek puandan çok genel bilgiye ve işletme maliyeti verimliliğine odaklanmış gibi; normalize edilmiş alan bazlı puanlarda yalnızca yazılım tarafında rekabet gücü düşük.
Heyecanlanmadan önce zekâya karşı maliyet matrisine bakmak gerekir: https://artificialanalysis.ai/models?intelligence-index-toke...
Maliyet epey düşecek gibi.
Meta Muse Sparka yeni bir gözle bakmaya başladım.
Hiçbir alanda en iyi değil ama sıralamanın birçok yerinde makul noktalarda konumlanıyor; maliyet ve performans dengesi iyi.
Listede olmayan Poolside Laguna S'in nerede konumlandığını da merak ediyorum; kişisel olarak iyi çalışan ve maliyet açısından verimli modellere daha çok ilgi duyuyorum.
Kıl payı birincilik olsa bile, sansür anlamına gelen “güvenlik önlemleri” yanıtı reddetmesin ya da başka bir modele düşürmesin diye dikkat etmek gerekiyorsa faydası büyük ölçüde azalır
Bu yüzden mevcut iş akışımın bazı kısımları dışında Claude kullanmayı neredeyse bıraktım; 61 puanla 57 puan arasındaki farktan çok güvenilirlik önemli
Sansür ve bizzat yaşamadığım kimlik doğrulama da hesaba katıldığında Claude en çok bozulmuş ve en istikrarsız model; son sürümdeki küçük benchmark optimizasyonları buna değmez
Tüm modellere oyun yapma testi uyguluyorum; Opus 5, nesil değişmiş gibi bir sıçrama hissi verdi ve benchmark’lar gerçek tabloyu doğru göstermediği için doğrudan test etmek gerekiyor
Anthropic’in neden otomatik ve sessiz alt modele geçişe bu kadar takıntılı olduğunu anlamıyorum; yanıt reddi yerine performansın otomatik düşürülmesini isteyen tek bir kullanıcı var mı, şüpheliyim
Aynı işi Opus 4.5~4.8 ile Fable, Codex 5.4·5.5 ve Sol 5.6 sorunsuz yaptı
Opus 5 aşırı temkinli, üretken şekilde kullanmak zor ve ek ayar gerekiyor
Opus 5’in 4.8 gibi her şeyi baştan açıklamaması iyi
GPT-5.6 Sol, önemsiz işlerde bile aşırı derin akıl yürütürken Opus 5 mükemmel bir model ve Anthropic iyi iş çıkarmış
Spesifikasyon vermeden kendi başına yapmasını isteyince 2 saat 30 dakika boyunca haftalık kullanımın %30’unu harcadı; ama spesifikasyon verince 30 dakika içinde yalnızca %2 kullandı ve sonuç yapı, uzunluk, doğrulama, kapsam ve maliyet açısından da daha iyiydi
Sol’u kendi haline bırakırsanız kontrolden çıkıyor; bu yüzden artık spesifikasyonu Sol yazıyor, uygulamayı Terra yapıyor ve bu yöntem iyi çalışıp toplam kullanımı da azalttı
Daha ilginç sonuç, Opus 5’in Fable 5’ten sonra açık ara en pahalı model olması
GPT-5.6 ve Kimi K3, yarı maliyetle 1~2% farkla benzer puanlar alıyor
Medium’da maliyet K3’ün neredeyse yarısına kadar düşüyor ve kodlama işlerinin %95’i için yeterli olma olasılığı yüksek
Taraf tutmuyorum ama bu sonuçlarda GPT-5.6 Sol Max daha iyi görünüyor
Neredeyse aynı performansı yaklaşık yarı maliyetle sunuyor; Opus 5’in bile GPT-5.6’dan bu kadar pahalı olması Fable’ın fiyatının ne kadar yüksek olduğunu gösteriyor