5 puan yazan dunward 4 시간 전 | 1 yorum | WhatsApp'ta paylaş

Anthropic, 24 Temmuz 2026'da Claude Opus 5'i tanıttı. Opus katmanında "nesil değişimi" düzeyinde bir iyileştirme olarak konumlanan modelin temel iddiası, Fable 5'e (frontier model) yakın zekayı yarı fiyatına sunması.

Temel özet

  • Konumlandırma: Fable 5'in frontier düzeyi zekasına yaklaşırken fiyatı yarısı. Claude Max'in yeni varsayılan modeli ve Claude Pro'da kullanılabilen en güçlü model olarak belirlendi.
  • Benchmark'lar: Frontier-Bench, GDPval-AA gibi kodlama ve bilgi işi değerlendirmelerinde yeni SOTA elde etti. Ancak siber güvenlik görevlerinde hâlâ Mythos 5'in (Anthropic'in en üst düzey modeli) gerisinde kalıyor.
  • Kodlama performansı: Frontier-Bench v0.1'de tüm modeller arasında en yüksek performansı gösterdi; Opus 4.8'e göre 2 kattan fazla iyileşme sağladı (üstelik maliyet daha düşük). CursorBench'in en verimli ayarında, Fable 5'in en yüksek puanına 0,5% farkla yarı maliyetle ulaştı.
  • Bilgi işi / problem çözme: ARC-AGI 3'te ikinci sıradaki modele göre 3 kat puan, Zapier AutomationBench'te ikinci sıraya göre yaklaşık 1,5 kat geçiş oranı, OSWorld 2.0'da (bilgisayar kullanımı benchmark'ı) Fable 5'in en iyi sonucunu yaklaşık üçte bir maliyetle geçti.
  • Bilimsel araştırma: Yaşam bilimleri değerlendirmelerinin tamamında Opus 4.8'e göre iyileşti. Organik kimyada (spektral veriden molekül yapısı çıkarımı) +10,2 puan, protein dizi-işlev tahmininde +7,7 puan.
  • Çalışma tarzı: Öz doğrulama ve yineleme yeteneği büyük ölçüde güçlendirildi. Görsel bilgi olmadan sadece çizimlerden 3D CAD modeli kodla yeniden oluşturma ya da topluluk yamasının kaçırdığı kök nedeni bulup düzeltme gibi örnekler paylaşıldı.
  • Hizalama (Alignment): Kendi davranış denetimlerinde şimdiye kadarki en iyi hizalanmış model olarak değerlendirildi. Opus 4.8, Sonnet 5 ve Fable 5'e göre aldatıcı davranış oranı daha düşük; geri döndürülemez riskli davranışlardan kaçınma yeteneği de en üst düzeyde.
  • Güvenlik: Biyoloji ve saldırgan siber güvenlik alanlarında Mythos 5'in gerisinde. Zafiyet tespiti Mythos 5'e yakın olsa da exploit geliştirme yeteneği belirgin biçimde daha düşük (siber görevlere yönelik eğitimin kasıtlı olarak dışarıda bırakılmasının sonucu).
  • Koruma mekanizmaları: Fable 5'e kıyasla siber sınıflandırıcı müdahalesi yaklaşık %85 daha az. Kaynak kod zafiyet tespitine izin verilirken binary tabanlı tarama, penetration test ve exploit üretimi engelleniyor. Fable 5'te engellenen bazı biyoloji istekleri artık Opus 5'e yönlendiriliyor.

Fiyat ve sunum

  • Bugünden itibaren tüm platformlarda kullanılabiliyor; API adı claude-opus-5
  • Fiyat: 1 milyon token başına giriş $5 / çıkış $25 (Opus 4.8 ile aynı)
  • Fast modu mevcut (varsayılana göre yaklaşık 2,5 kat hızlı, fiyatı 2 kat)
  • Veri saklama gereksinimi yok (genel kullanım için)

Aynı anda çıkan 2 beta özelliği

  • Konuşma sırasında araç değiştirme: prompt cache geçersiz kılınmadan konuşma ortasında kullanılabilir araçlar değiştirilebiliyor
  • Otomatik fallback: güvenlik sınıflandırıcısına takılan istekler otomatik olarak başka bir modele yönlendiriliyor (varsayılan davranış engellemek yerine kullanılabilir en iyi modeli seçmek)

GN⁺ ek özeti

Neo, orijinal metni temel alarak ek derleme yaptı

  • Fable 5'e yakın zekayı görev başına yarı maliyetle sunuyor; Claude Max'in varsayılan modeli ve Claude Pro'nun en yüksek performanslı modeli olarak konumlanıyor
  • Frontier-Bench ve GDPval-AA gibi kodlama ve bilgi işi değerlendirmelerinde üst düzey sonuçlar aldı; ARC-AGI 3 puanı ikinci sıradaki modelin 3 katına ulaşıyor
  • Görevleri kendi kendine doğrulayıp başarıya ulaşana kadar yineleyerek bilgisayarlı görü pipeline'ı kurma, açık kaynak hata kök nedenini düzeltme ve piyasa veri akışıyla test harness uygulama gibi işler yapabiliyor
  • 1 milyon giriş tokenı başına $5, 1 milyon çıkış tokenı başına $25 ile Opus 4.8 ile aynı fiyatlandırmaya sahip; yaklaşık 2,5 kat hızlı Fast mode ise temel fiyatın 2 katı
  • Riskli çift kullanımlı yetenekleri Mythos 5'ten daha düşük; zafiyet bulmaya izin verirken binary tarama, penetration test ve exploit üretimini engelliyor; işaretlenen isteklerde Opus 4.8 otomatik ikamesi uygulanabiliyor

Performans ve maliyet verimliliği

  • Claude Opus 5, önceki model Opus 4.8 ile aynı fiyata daha yüksek performans sunuyor
    • effort ayarıyla zekayı önceliklendiren veya token tasarrufu sağlayan daha hızlı ve ucuz çalıştırmalar seçilebiliyor
    • Claude Max'in varsayılan modeli ve Claude Pro'daki en güçlü model olarak sunuluyor
  • Frontier-Bench v0.1'de diğer tüm modelleri geçti ve görev başına daha düşük maliyetle Opus 4.8 performansının 2 katından fazlasına ulaştı
    • Bu sonuç, mini-SWE-agent harness ve GKE backend üzerinde görev başına 5 denemenin ortalama ödülüyle ölçülen dahili yürütmeye dayanıyor
    • Opus 5 ve Fable 5'in güvenlik sınıflandırıcısı nedeniyle reddettiği isteklerde ikame model olarak Opus 4.8 kullanıldı
  • CursorBench 3.2'de max effort ayarında Fable 5'in en yüksek puanına %0,5 içinde kalırken görev başına maliyet yarıya iniyor
    • high, xhigh ve max effort ayarlarının tamamında aynı maliyet bazında diğer tüm modellerden daha yüksek performans gösteriyor
  • Bilgi işi ve problem çözme değerlendirmelerinde de yüksek maliyet verimliliği sunuyor
    • ARC-AGI 3'te yeni problemleri çözme puanı ikinci sıradaki modelin 3 katı
    • Zapier AutomationBench'te aynı görev başına maliyet bazında geçiş oranı ikinci sıradaki modelin yaklaşık 1,5 katı; en düşük effort'ta bile diğer tüm modellerden daha fazla görevi geçiyor
    • OSWorld 2.0'da tüm maliyet aralıklarında diğer modelleri geçti ve Fable 5'in en iyi sonucunu biraz daha fazla maliyetin üçte biriyle aştı

Bilimsel araştırma ve görsel çıktılar

  • Yapısal biyoloji, organik kimya ve biyoinformatik dahil tüm yaşam bilimi değerlendirmelerinde Opus 4.8'den daha yüksek performans gösterdi
    • Spektral veriden molekül yapısı çıkarmaya yönelik dahili organik kimya benchmark'ında 10,2 puan daha yüksek
    • Protein dizi varyasyonlarının işlev üzerindeki etkisini tahmin etmede 7,7 puan daha yüksek
  • Önceki modellere göre çok daha güçlü görsel çıktılar üretebiliyor

Görev doğrulama ve otonom yineleme

  • Sonuçları doğrudan doğrulama ve başarılı olana kadar dikkatlice yineleme yeteneği güçlendirildi
  • Frontier-Bench'in FreeCAD görevinde, makine parçası çizimlerini doğrudan göremediği koşullarda kendi bilgisayarlı görü pipeline'ını yazarak ham piksellerden şekli çıkarıp 3D parçayı yeniden oluşturdu
    • Birkaç yineleme sonunda başarıya ulaştı; aynı koşullardaki rakip modeller ise 5 denemeden sonra bile çözemedi
  • Yaygın kullanılan bir açık kaynak paket yöneticisindeki gerçek bir hatada, kök nedeni bulup topluluk yamasının kaçırdığı uç durumları da düzeltti
    • Rakip modeller yalnızca yüzeysel semptomları giderip hatanın çözüldüğünü varsaydı
  • Bir trading şirketinin mühendisi, tek bir oturumda yeni bir borsa için piyasa veri akışı oluşturdu
    • Önceki modeller, mühendis ayrıntılı plan verse bile görevi tamamlayamıyordu
    • Doğrulamak için gerçek zamanlı akış olmayınca, borsa verisinin doğru parse edilip edilmediğini kontrol etmek üzere kendi test harness'ini oluşturdu

Erken kullanıcıların kodlama ve agent değerlendirmeleri

  • Devin'in FrontierCode 1.1 değerlendirmesinde, yarı maliyetle Fable düzeyine yaklaştı ve zor debugging ile kök neden analizinde güçlü yön gösterdi
  • CursorBench'te Fable 5'in biraz gerisinde kalsa da benzer davranış özellikleri sergiledi; Opus'un hız ve maliyetiyle Fable 5'e yakın zeka sundu
  • Zapier AutomationBench'te önceki Claude modellerinden daha fazla token kullanmadan 1. oldu
    • Hesap durumu workbook'unda riskli müşterileri belirleme, sorumluları uyarma ve müşteri tutma ekibi için özet çıkarma dahil churn önleme prosedürünü sonuna kadar yürüterek %100 başarı elde etti
  • Genom analizi görevlerinde, uygun istatistiksel testlerle karıştırıcı etkenleri dışarıda bırakıp sonuçları bağımsız yöntemlerle çapraz doğruladı ve uzun çok aşamalı analizleri sürdürebildi
  • Lovable iç değerlendirmesinde en zor agent kodlama görevleri Opus 4.7'ye göre %22 iyileşti; çalıştırmalar arası varyans da azaldı
  • Aynı full-stack uygulama geliştirme görevinde, Opus ailesi içinde en iyi animasyon, oyun ve 3D işleri üretti; Opus 4.5'ten bu yana en büyük iyileşme olarak değerlendirildi
  • Açık uçlu analizlerde, görev ne kadar zor ve belirsizse Opus 4.8'e göre iyileşme o kadar büyük oldu; yanıtlar daha net ve kısa hâle geldi, yüksek effort'ta verimlilik de arttı
  • Geliştirme ortamlarını yönetirken kendi monitörünü oluşturup her ortamı manipüle ediyor, yalnızca insan kararı gerektiren konularda yardım istiyor
  • Fundamental Research Assistant codebase'inde geri bildirime göre büyük ölçekli değişiklikler yapıyor ve normalde birkaç parçaya bölünecek işleri tek bir agent iş akışında tamamlıyor
  • Frontend değerlendirmesinde, masaüstü ve telefon genişliklerinde sayfayı doğrudan açıp mobil ekranın altında gizlenen ürünleri ve ekran dışında kalan ödeme düğmesini bulup düzeltti
  • PR devrinden önce branch, template ve test etkilerini kontrol etti; önceki modeller gibi doğrulama yapmadan aceleyle yayınlamadı
  • Yeniden tasarım sürecinde, önerilen tasarımın güçlü yanları ile tekil sorunu ayırıp kusurları düzeltirken bu avantajları koruyan bir uzlaşma çözümü önerdi
  • Kod değişikliklerinde gereksiz kod bırakmadan kısa diff'ler oluşturdu; codebase'e özgü ince riskleri daha iyi tespit ederek production iş yüklerinde kullanılmaya başlandı
  • Entegre agent platformu Cosmos'taki çeşitli kullanım senaryoları ve code review süreçlerinin Opus 5'e taşınması planlanıyor
  • JetBrains değerlendirmesinde, kod yazmadan önce daha derin inceleme yapıyor, planlama aşamasında mantık hatalarını yakalıyor ve yalnızca cevabın çalışıp çalışmadığını değil neden doğru olduğunu da değerlendiriyor
  • Trading benchmark'ında Opus ailesinin en yüksek performansını gösterirken Opus 4.8'e kıyasla reasoning token'larını yaklaşık 7'de 1'e, gecikmeyi ise yarının altına indirdi

Kurumsal ve profesyonel iş değerlendirmeleri

  • Finans araştırmalarında sayısal akıl yürütme, tablo çalışmaları ve hassas eleştirel düşünme Opus 4.8'e göre iyileşti
  • Box iç değerlendirmesinde profesyonel kurumsal içerik analiz performansı Opus 4.8'den %8 daha yüksek
    • Veri analizi iş akışı %11, due diligence ise %17 iyileşti
    • Teknik, sağlık ve kamu sektörlerinde kullanılan iş akışları hedef alındı
  • Zor finansal modelleme görevlerinde effort seviyeleri genelinde doğruluk ortalama 9 puan arttı; konuşma turu ve araç çağrıları üçte bir azaldı, geçen süre %60 düştü
  • Hukuki agent görevlerinde kurumsal yönetişim ve tahkim alanlarında özellikle belirgin iyileşme görüldü
    • Opus 4.8'in max reasoning ayarına göre ortalama %26 daha az token kullanarak benzer kaliteyi korudu
  • İlk denemede sözleşme revizyon önerilerinde test edilen modeller arasında en yüksek puanı aldı ve Opus 4.8'in neredeyse 2 katına ulaştı
    • NDA revizyonlarını da doğruluğu koruyarak veya artırarak, daha az zaman ve yinelemeyle tamamladı
  • Uzun görevlerde, tüm sunumu oluşturup ardından düzenleme yeteneği gelişti; görsel anlayış, biçimlendirme ve slayt hataları açısından da daha iyi sonuç verdi

Hizalama ve risk yetenekleri

  • Dağıtımdan önce yapılan otomatik davranış denetimlerinde Opus 5, Anthropic modelleri arasında en yüksek hizalama düzeyini gösterdi
    • Claude'un Anayasası'na Opus 4.8, Sonnet 5 ve Fable 5'ten daha iyi uyuyor
    • Aldatıcı davranış oranı ve kötüye kullanıma yönlendirilme kırılganlığı en düşük
    • Geri döndürülmesi zor yan etkiler doğurabilecek pervasız davranışlardan da en iyi şekilde kaçınıyor
  • Riskli çift kullanımlı yeteneklerin sınırını yukarı taşımadı; sivil ve kamu ortaklarıyla yapılan değerlendirmelerde biyoloji araştırması ve saldırgan siber güvenlikte Mythos 5'ten daha düşük performans gösterdi
    • Ayrıntılı değerlendirme System Card'da yer alıyor
  • Opus 4.8'de olduğu gibi siber görevler için kasıtlı eğitim verilmedi; ancak genel yetenekler geliştikçe ilgili performans da belirgin biçimde arttı
    • Zafiyet bulma performansı Mythos 5'e yaklaşıyor
    • Bulunan zafiyetleri gerçek tehdide dönüştüren exploit geliştirme tarafında ise Mythos 5'in belirgin biçimde gerisinde
  • OSS-Fuzz değerlendirmesinde Opus 5 ve Mythos 5 benzer başarı oranıyla zafiyet buldu; ancak exploit geliştirme puanı Opus 5'te çok daha düşük kaldı

Siber güvenlik ve biyoloji koruma önlemleri

  • Koruma önlemleri, siber güvenlik ve biyolojide yararlı kullanımlara izin verecek şekilde tasarlandı; dar kapsamlı bazı siber görevlerde daha güçlü kısıtlar eklenmesi dışında Opus 4.8'e benziyor
  • Siber sınıflandırıcı, Fable 5'e göre nispeten daha az kısıtlayıcı
    • Kaynak kodda zafiyet bulmaya izin veriyor
    • Kötü niyetli aktörlerle ilişkili olma ihtimali yüksek binary tabanlı zafiyet taraması, penetration test ve exploit üretimini engelliyor
    • Anthropic testlerine göre Fable 5'ten yaklaşık %85 daha az sınıflandırıcı müdahalesi bekleniyor
  • Claude.ai, Claude Code ve Claude Cowork'te işaretlenen istekler varsayılan olarak Opus 4.8'e yönlendiriliyor; bu davranış API'de de etkinleştirilebiliyor
  • Cyber Verification Program'a katılan şirketler ve araştırmacılar, güvenlik kısıtları daha az olan Opus 5'e hemen erişebiliyor
  • Biyoloji tarafında Opus 4.8'e benzer koruma önlemlerini korurken, genel kullanıma açık modeller arasında en güçlü bilimsel araştırma modeline dönüşüyor
    • Uzun süreli otonom araştırmalarda hâlâ önemli sınırlamalar var ve bu tür biyoloji görevlerinde Mythos 5 daha güçlü
    • Fable 5'te engellenen biyoloji istekleri artık Opus 4.8 yerine Opus 5'e yönlendiriliyor

Fiyatlandırma ve geliştirici özellikleri

  • Tüm platformlarda sunuluyor ve Claude API'deki model tanımlayıcısı claude-opus-5
    • 1 milyon giriş tokenı başına $5, 1 milyon çıkış tokenı başına $25 ile Opus 4.8 ile aynı fiyatlandırmaya sahip
    • Genel erişimde, önceki Opus modellerinde olduğu gibi veri saklama gereksinimi bulunmuyor
  • Fast mode, temel hızın yaklaşık 2,5 katı ile çalışıyor
    • Claude Platform'da temel fiyatın 2 katı, Claude Code'da ise kullanım kredisiyle sunuluyor
  • Claude Platform'daki beta konuşma sırasında araç değiştirme özelliği sayesinde, prompt cache geçersiz kılınmadan konuşma sırasında Claude'un kullanacağı araçlar değiştirilebiliyor
  • API'deki beta otomatik fallback etkinleştirildiğinde, Opus 5 veya Fable 5 isteği güvenlik sınıflandırıcısı tarafından işaretlenirse otomatik olarak başka bir modele yönlendiriliyor
    • İsteği engellemek yerine varsayılan olarak kullanılabilir en iyi modele yönlendiriyor
  • Modelin nasıl kullanılacağına dair bilgiler Opus 5 prompting guide'da bulunabilir

1 yorum

 
GN⁺ 3 시간 전
Hacker News görüşleri
  • Buradaki asıl nokta, mutlak performanstan çok kurumların 30 günlük veri saklama zorunluluğu olmadan Fable seviyesinde bir model kullanabilecek hâle gelmesi
    Opus 5'te, önceki Opus'ta olduğu gibi genel erişim için veri saklama şartı yok; Fable'ın ARC-AGI puanına sahip olmamasının nedeni de bu saklama politikası
    https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344

    • İş başına maliyet de çok daha düşük ve hatta Sonnet'ten bile ucuz görünüyor
    • Opus 5'in lansman için cilalandığına dair söylentiler doğru çıktı; GDPval-AA v2 performansı da büyük ölçüde iyileşti, bu da bilgi çalışanı temelli ajan işleri için faydalı
      Fable 5'in yalnızca krediyle erişilebilir kalması da sevindirici; bundan sonra en üst seviye modellerin kullandıkça ödemeli API veya kredi duvarının arkasında tutulup diğer modellerin aylık abonelikle desteklenmesi daha yaygın hâle gelebilir
    • Fable'ın guardrail'leriyle ilgili olarak bakmaya değer bir içerik: https://x.com/cheatyyyy/status/2080693704290140330
    • Şirket veri saklamayan kurumsal lisans kullanıyor ama Claude geçmiş konuşmaları hatırlıyor
      Bu durumda bilgi bir yerde saklanıyor olmalı; bu yüzden veri saklama yöntemini anlamak zor
    • Belgeler yalnızca 2 haftadan daha uzun süre önce güncellenmiş; ancak ZDR uyumluluğunu açıkça belirten bir ifade bulamıyorum, bu yüzden ek doğrulama gerekli
  • Şu anda görüntü→HTML dönüşümü deneniyor; daha önce Fable en iyisiydi, Gemini 3.1 Pro ise şaşırtıcı biçimde 2. sıradaydı
    Opus 5, Fable'dan daha doğru biçimde özgün tasarımı takip ediyor; butonları kapsül yerine yuvarlatılmış dikdörtgen olarak uyguluyor ve üretilen görseller de aslına daha yakın
    Orijinal: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
    Opus 5: https://html.non.io/solaraOpus/
    Fable 5: https://html.non.io/solara/

  • Sayısız lansmana bakınca model yönlendirmenin yapay zekada en hızlı büyüyen alan olması da şaşırtıcı değil
    10'dan fazla şirkette farklı format ve boyutlarda modeller, akıl yürütme seviyeleri, ajan·Pro·yüksek hızlı modlar, standart·esnek·toplu çalıştırma ve farklı girdi·çıktı·cache token fiyatları var
    Prompt'ları en uygun ve en ekonomik kombinasyona gönderen şirketler, model geliştiricilerinin görmezden geldiği boşlukta büyük değer topluyor

    • Model yönlendirme sonunda modelin kendisi tarafından daha iyi yapılacak ve yönlendirme sürecinde bağlam kaybolduğu için maliyet ve belirsizlik artıyor
      Bu, Bitter Lesson'ın tekrarı ve lider şirketler sonunda bu özelliği doğrudan kendileri sunacak gibi görünüyor
    • Geliştiriciler bu boşluğu bilerek görmezden geliyor gibi duruyor
      Çoğu ofis işi için aşırı güçlü AGI gerekmiyor, bu yüzden trafik ucuz modellere kayıyor; ama önde gelen laboratuvarlar hem güçlü AGI'yi hem de beyaz yaka ikamesini yalnızca kendilerinin yapabileceği şekilde konumlanıyor
      Düşük maliyetli modellere yönlendirme bu anlatıda gedik açabilir
    • Müşterinin kim olduğu merak konusu
      Herhangi bir işte en yeni en yüksek performanslı model dışında bir şeyi kabul etmek zor ve gereken tek kural sabit ücretli kotada hakkı kalan en güçlü modeli seçmek gibi görünüyor
    • Kodlamada yönlendiriciye güvenmek zor ve gerçekten büyük miktarda tasarruf sağladığının kanıtlanması gerekiyor
      Maliyetten tasarruf etmek karşılığında ciddiyeti ve sıklığı ölçülemeyen hataları kabullenmek gerekiyor; ayrıca tüm muhakemeyi en üst düzey modele bırakmanın sigorta değeriyle sonradan düzeltme maliyeti de bilinmiyor
      Proje düzeyinde farklı bir model kullanılsaydı kodun ne kadar farklı olacağını test etmenin de yolu yok
    • Bu alanın ayrı yönlendirici şirketlerinden çok istemcinin yürütme çerçevesine ait hale gelmesi de mümkün görünüyor
  • Yaklaşık 190 sayfalık PDF'yi okumak istemeyenler için bu blog yazısı var: https://www.anthropic.com/news/claude-opus-5

    • Fable'dan biraz daha düşük sayılara rağmen Opus 5'i ajan kodlama için en iyi model diye öne çıkarmaları ilginç
    • Bu benchmark'a bakınca Anthropic'in Fable'ı neden Max aboneliğine dahil etmemeye devam ettiğini anlar gibi oluyorum
    • FrontierCode v1.1 verilerinde Opus 5'in neden Fable 5'ten daha yüksek çıktığını merak ediyorum
    • Dil modelinin uzun belge üretip kullanıcıların bunu okumadan tekrar bir dil modeliyle özetlettiği durumun kusursuz bir örneği gibi görünüyor
  • Opus 5 ile Fable 5'in üslubunu karşılaştırınca, Fable'ın uzaklaştığı Claude'a özgü ifadeleri Opus 5'in 4.8 gibi kullanmayı sürdürdüğü görülüyor
    “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” gibi ifadeler tekrar ediyor; bu yüzden “sinir bozucu İngilizce” benchmark'ına ihtiyaç var
    Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
    Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...

    • Fable bu tür ifadeleri daha az kullanıyor olabilir ama yazısı hâlâ kötü ve okuması yorucu
    • Opus 4.8 ile Fable 5'in üslubu rahatsız ediciydi, bu yüzden eğitim amaçlı kullanmaları zordu; GPT 5.6 Sol çok daha iyiydi
    • Claude'a özgü ayırt edilebilir bir üslup olması aslında iyi; çünkü yapay zeka metnini insan yazmış gibi göstermeyi zorlaştırıyor
    • 4.6, 4.8'e göre üslup talimatlarına daha iyi uydu; 5.0 içinse biraz daha beklemek gerekiyor
      Claude'a özgü üslup kısmen konuşmayı ya da işi ‘proaktif biçimde’ ilerletme eğiliminden geliyor gibi ve prompt bazında üslup aralığını nicelleştiren bir benchmark da faydalı olabilir
    • Opus 5, aslında Opus 4.8 tabanına Kimi K3'ün uzun akıl yürütme tekniği uygulanmış bir model gibi; hiçbir şekilde Fable değilmiş gibi duruyor
  • Anthropic'in %55,7'si ile OSWorld 2.0 makalesindeki yaklaşık %21 farklı metriklermiş
    Opus 4.8 yaklaşık her 5 görevden 1'ini tamamen başarıp %20,6 tamamlama oranı kaydetti, kalanlarda da kısmi puan alarak %54,8 kısmi puan elde etti
    Ancak bu tür metrik farkları yüzünden, makaleler arasında benchmark'ların makul hata payı içinde karşılaştırılıp karşılaştırılamayacağı sorgulanıyor: https://arxiv.org/pdf/2606.29537

    • Tamamlama oranı, %100 başarılan görevlerin oranı; puan oranı ise mümkün olan kısmi puanın ne kadarının alındığıdır
      Benchmark hazırlayanlar gelişim alanını göstermek için düşük sayıları, model üreticileri ise yetenekleri vurgulamak için yüksek sayıları tercih eder; ama Anthropic'in %55,7'si ile makaledeki %54,8 aslında fiilen aynı sonuç
    • Dil modelleri genelde deterministik olmadığından belli bir dağılım beklenir, ama fark bu düzeydeyse ek açıklama gerekir
  • “Opus 5 genel olarak Fable 5'ten üstün değil” denip blogda çoğu benchmark'ta daha iyi olduğu sıralanınca iletişim kafa karıştırıcı hale geliyor
    Sistem kartı da yapay zeka Ar-Ge yeteneğinin sınırsız Fable kabul edilen Claude Mythos 5'e benzer olduğunu söylüyor

    • Bu kez güçlü olduğunu vurgularken bir yandan da devletin ek gözetiminden kaçınmaya çalışan bir uzlaşma gibi görünüyor
      Opus 5 yazılım açıklarını istismar etmeyi öğrenmediği için bulma yeteneği Mythos 5'e yakın, ama bunu gerçek siber tehdide dönüştüren istismar yeteneğinde ciddi biçimde geride kalıyor
    • Bu, Fable'ın zeki ama benchmark'a optimize edilmemiş, Opus'un ise daha az zeki ama benchmark optimizasyonu yapılmış olduğu şeklinde açıklanabilir
    • Yapay zeka Ar-Ge yetenekleri benzer ama Fable tartışmasını doğuran hackleme yetenekleri aynı değil denmek isteniyor gibi; ifade ise kafa karıştırıcı
    • Devlet gözetiminden kaçınmak için Fable'dan daha iyi olduğunu açıkça söylemiyor da olabilir
  • Anthropic’in kıyametçi tanıtımı olmadığı için, Fable’dan çok daha üstün görünen bir model bile sorunsuz biçimde yayımlandı
    Teoride Anthropic’in ölçütlerine göre AGI düzeyinde olması gerekirdi ama gerçekte sıradan bir cumadan ibaret

    • Raporun güvenlik önlemleri kısmını okuyunca nedeni anlaşılabiliyor
      Bu modeller sıkı biçimde korunuyor ve güvenlik önlemi olmayan Mythos’un bu yüzden yayımlanamadığı söylenmiş
      OpenAI de güvenlik önlemi olmayan bir modelin HuggingFace sunucularına sızdığını duyurduğunda benzerdi
    • “Bir sonraki model AGI” abartısı azalmış gibi görünüyor
      GPT-6 yazın çıksa bile artık AGI bekleyen neredeyse kimse yok; abartı döngüsünü nasıl sürdüreceklerini merak ediyorum
    • Gerçek kıyamet yaşanmazsa bunun uyarılardan duyulan memnuniyetsizlik anlamına mı geldiğini, yoksa kıyametle ilgili tutmayan tahminlerin tanıtım olarak görülüp görülmediğini merak ediyorum
    • Fable cepheyi zaten açmıştı; Opus 5 sadece yetişti
  • Opus 5’in tek bir oturumda yeni bir borsa için piyasa veri akışı ve doğrulama araçları oluşturduğuna dair tanıtım örneği, ilginç şekilde trading şirketlerinde stajyerlere sık verilen bir proje

  • Frontier Code grafiğinde orta düzey düşünme modunun görev başına verimliliği ezici biçimde yüksek; akıl yürütme miktarı arttıkça değerlendirme sonuçlarının neden ciddi biçimde kötüleştiğini merak ediyorum
    En üst düzeyde hafif bir düşüş olması görülebilir ama bu kadarı sıra dışı: https://imgur.com/a/Nv8V7Ry

    • Metrik görev başına maliyet olduğu için, daha iyi yapmaya çalışırken token’ları fazla hızlı tüketen bir aşırı mühendislik durumu olabilir
      Öznel olarak, geçen haftaki Opus 4.8’e kıyasla bugünkü Opus 4.8 Medium ile duyuru sonrası Opus 5 Medium bana 5 saatlik kullanım aralığında daha verimli hissettiriyor
    • Yüksek akıl yürütme düzeylerinde çıktı uzayabilir ve alakasız ayrıntılara fazla odaklanarak hata yüzeyini büyütebilir
      Ajan yerine daha çok prompt odaklı kullanıldığında bu tür sınırlamalar görülebilir; orta seviyenin daha dengeli olması mümkün
    • Benchmark komut çalıştırma sayısını veya gerçek geçen süreyi ceza olarak sayıyorsa, yüksek akıl yürütme çabası daha düşük puana yol açabilir
    • Performansın belirli bir gevşeme düzeyinde arttığı Ballmer Peak benzeri bir durum da olabilir
    • Ortada düşüp en üst düzeyde tekrar yükselen şekil de ilginç
      Fazla düşünmek kötü ama aşırı derecede daha fazla düşününce yeniden iyi mi oluyor diye düşündürüyor