Anthropic, 24 Temmuz 2026'da Claude Opus 5'i tanıttı. Opus katmanında "nesil değişimi" düzeyinde bir iyileştirme olarak konumlanan modelin temel iddiası, Fable 5'e (frontier model) yakın zekayı yarı fiyatına sunması.
Temel özet
- Konumlandırma: Fable 5'in frontier düzeyi zekasına yaklaşırken fiyatı yarısı. Claude Max'in yeni varsayılan modeli ve Claude Pro'da kullanılabilen en güçlü model olarak belirlendi.
- Benchmark'lar: Frontier-Bench, GDPval-AA gibi kodlama ve bilgi işi değerlendirmelerinde yeni SOTA elde etti. Ancak siber güvenlik görevlerinde hâlâ Mythos 5'in (Anthropic'in en üst düzey modeli) gerisinde kalıyor.
- Kodlama performansı: Frontier-Bench v0.1'de tüm modeller arasında en yüksek performansı gösterdi; Opus 4.8'e göre 2 kattan fazla iyileşme sağladı (üstelik maliyet daha düşük). CursorBench'in en verimli ayarında, Fable 5'in en yüksek puanına 0,5% farkla yarı maliyetle ulaştı.
- Bilgi işi / problem çözme: ARC-AGI 3'te ikinci sıradaki modele göre 3 kat puan, Zapier AutomationBench'te ikinci sıraya göre yaklaşık 1,5 kat geçiş oranı, OSWorld 2.0'da (bilgisayar kullanımı benchmark'ı) Fable 5'in en iyi sonucunu yaklaşık üçte bir maliyetle geçti.
- Bilimsel araştırma: Yaşam bilimleri değerlendirmelerinin tamamında Opus 4.8'e göre iyileşti. Organik kimyada (spektral veriden molekül yapısı çıkarımı) +10,2 puan, protein dizi-işlev tahmininde +7,7 puan.
- Çalışma tarzı: Öz doğrulama ve yineleme yeteneği büyük ölçüde güçlendirildi. Görsel bilgi olmadan sadece çizimlerden 3D CAD modeli kodla yeniden oluşturma ya da topluluk yamasının kaçırdığı kök nedeni bulup düzeltme gibi örnekler paylaşıldı.
- Hizalama (Alignment): Kendi davranış denetimlerinde şimdiye kadarki en iyi hizalanmış model olarak değerlendirildi. Opus 4.8, Sonnet 5 ve Fable 5'e göre aldatıcı davranış oranı daha düşük; geri döndürülemez riskli davranışlardan kaçınma yeteneği de en üst düzeyde.
- Güvenlik: Biyoloji ve saldırgan siber güvenlik alanlarında Mythos 5'in gerisinde. Zafiyet tespiti Mythos 5'e yakın olsa da exploit geliştirme yeteneği belirgin biçimde daha düşük (siber görevlere yönelik eğitimin kasıtlı olarak dışarıda bırakılmasının sonucu).
- Koruma mekanizmaları: Fable 5'e kıyasla siber sınıflandırıcı müdahalesi yaklaşık %85 daha az. Kaynak kod zafiyet tespitine izin verilirken binary tabanlı tarama, penetration test ve exploit üretimi engelleniyor. Fable 5'te engellenen bazı biyoloji istekleri artık Opus 5'e yönlendiriliyor.
Fiyat ve sunum
- Bugünden itibaren tüm platformlarda kullanılabiliyor; API adı
claude-opus-5 - Fiyat: 1 milyon token başına giriş $5 / çıkış $25 (Opus 4.8 ile aynı)
- Fast modu mevcut (varsayılana göre yaklaşık 2,5 kat hızlı, fiyatı 2 kat)
- Veri saklama gereksinimi yok (genel kullanım için)
Aynı anda çıkan 2 beta özelliği
- Konuşma sırasında araç değiştirme: prompt cache geçersiz kılınmadan konuşma ortasında kullanılabilir araçlar değiştirilebiliyor
- Otomatik fallback: güvenlik sınıflandırıcısına takılan istekler otomatik olarak başka bir modele yönlendiriliyor (varsayılan davranış engellemek yerine kullanılabilir en iyi modeli seçmek)
GN⁺ ek özeti
Neo, orijinal metni temel alarak ek derleme yaptı
- Fable 5'e yakın zekayı görev başına yarı maliyetle sunuyor; Claude Max'in varsayılan modeli ve Claude Pro'nun en yüksek performanslı modeli olarak konumlanıyor
- Frontier-Bench ve GDPval-AA gibi kodlama ve bilgi işi değerlendirmelerinde üst düzey sonuçlar aldı; ARC-AGI 3 puanı ikinci sıradaki modelin 3 katına ulaşıyor
- Görevleri kendi kendine doğrulayıp başarıya ulaşana kadar yineleyerek bilgisayarlı görü pipeline'ı kurma, açık kaynak hata kök nedenini düzeltme ve piyasa veri akışıyla test harness uygulama gibi işler yapabiliyor
- 1 milyon giriş tokenı başına $5, 1 milyon çıkış tokenı başına $25 ile Opus 4.8 ile aynı fiyatlandırmaya sahip; yaklaşık 2,5 kat hızlı Fast mode ise temel fiyatın 2 katı
- Riskli çift kullanımlı yetenekleri Mythos 5'ten daha düşük; zafiyet bulmaya izin verirken binary tarama, penetration test ve exploit üretimini engelliyor; işaretlenen isteklerde Opus 4.8 otomatik ikamesi uygulanabiliyor
Performans ve maliyet verimliliği
- Claude Opus 5, önceki model Opus 4.8 ile aynı fiyata daha yüksek performans sunuyor
effortayarıyla zekayı önceliklendiren veya token tasarrufu sağlayan daha hızlı ve ucuz çalıştırmalar seçilebiliyor- Claude Max'in varsayılan modeli ve Claude Pro'daki en güçlü model olarak sunuluyor
- Frontier-Bench v0.1'de diğer tüm modelleri geçti ve görev başına daha düşük maliyetle Opus 4.8 performansının 2 katından fazlasına ulaştı
- Bu sonuç, mini-SWE-agent harness ve GKE backend üzerinde görev başına 5 denemenin ortalama ödülüyle ölçülen dahili yürütmeye dayanıyor
- Opus 5 ve Fable 5'in güvenlik sınıflandırıcısı nedeniyle reddettiği isteklerde ikame model olarak Opus 4.8 kullanıldı
- CursorBench 3.2'de max effort ayarında Fable 5'in en yüksek puanına %0,5 içinde kalırken görev başına maliyet yarıya iniyor
- high, xhigh ve max effort ayarlarının tamamında aynı maliyet bazında diğer tüm modellerden daha yüksek performans gösteriyor
- Bilgi işi ve problem çözme değerlendirmelerinde de yüksek maliyet verimliliği sunuyor
- ARC-AGI 3'te yeni problemleri çözme puanı ikinci sıradaki modelin 3 katı
- Zapier AutomationBench'te aynı görev başına maliyet bazında geçiş oranı ikinci sıradaki modelin yaklaşık 1,5 katı; en düşük effort'ta bile diğer tüm modellerden daha fazla görevi geçiyor
- OSWorld 2.0'da tüm maliyet aralıklarında diğer modelleri geçti ve Fable 5'in en iyi sonucunu biraz daha fazla maliyetin üçte biriyle aştı
Bilimsel araştırma ve görsel çıktılar
- Yapısal biyoloji, organik kimya ve biyoinformatik dahil tüm yaşam bilimi değerlendirmelerinde Opus 4.8'den daha yüksek performans gösterdi
- Spektral veriden molekül yapısı çıkarmaya yönelik dahili organik kimya benchmark'ında 10,2 puan daha yüksek
- Protein dizi varyasyonlarının işlev üzerindeki etkisini tahmin etmede 7,7 puan daha yüksek
- Önceki modellere göre çok daha güçlü görsel çıktılar üretebiliyor
Görev doğrulama ve otonom yineleme
- Sonuçları doğrudan doğrulama ve başarılı olana kadar dikkatlice yineleme yeteneği güçlendirildi
- Frontier-Bench'in FreeCAD görevinde, makine parçası çizimlerini doğrudan göremediği koşullarda kendi bilgisayarlı görü pipeline'ını yazarak ham piksellerden şekli çıkarıp 3D parçayı yeniden oluşturdu
- Birkaç yineleme sonunda başarıya ulaştı; aynı koşullardaki rakip modeller ise 5 denemeden sonra bile çözemedi
- Yaygın kullanılan bir açık kaynak paket yöneticisindeki gerçek bir hatada, kök nedeni bulup topluluk yamasının kaçırdığı uç durumları da düzeltti
- Rakip modeller yalnızca yüzeysel semptomları giderip hatanın çözüldüğünü varsaydı
- Bir trading şirketinin mühendisi, tek bir oturumda yeni bir borsa için piyasa veri akışı oluşturdu
- Önceki modeller, mühendis ayrıntılı plan verse bile görevi tamamlayamıyordu
- Doğrulamak için gerçek zamanlı akış olmayınca, borsa verisinin doğru parse edilip edilmediğini kontrol etmek üzere kendi test harness'ini oluşturdu
Erken kullanıcıların kodlama ve agent değerlendirmeleri
- Devin'in FrontierCode 1.1 değerlendirmesinde, yarı maliyetle Fable düzeyine yaklaştı ve zor debugging ile kök neden analizinde güçlü yön gösterdi
- CursorBench'te Fable 5'in biraz gerisinde kalsa da benzer davranış özellikleri sergiledi; Opus'un hız ve maliyetiyle Fable 5'e yakın zeka sundu
- Zapier AutomationBench'te önceki Claude modellerinden daha fazla token kullanmadan 1. oldu
- Hesap durumu workbook'unda riskli müşterileri belirleme, sorumluları uyarma ve müşteri tutma ekibi için özet çıkarma dahil churn önleme prosedürünü sonuna kadar yürüterek %100 başarı elde etti
- Genom analizi görevlerinde, uygun istatistiksel testlerle karıştırıcı etkenleri dışarıda bırakıp sonuçları bağımsız yöntemlerle çapraz doğruladı ve uzun çok aşamalı analizleri sürdürebildi
- Lovable iç değerlendirmesinde en zor agent kodlama görevleri Opus 4.7'ye göre %22 iyileşti; çalıştırmalar arası varyans da azaldı
- Aynı full-stack uygulama geliştirme görevinde, Opus ailesi içinde en iyi animasyon, oyun ve 3D işleri üretti; Opus 4.5'ten bu yana en büyük iyileşme olarak değerlendirildi
- Açık uçlu analizlerde, görev ne kadar zor ve belirsizse Opus 4.8'e göre iyileşme o kadar büyük oldu; yanıtlar daha net ve kısa hâle geldi, yüksek effort'ta verimlilik de arttı
- Geliştirme ortamlarını yönetirken kendi monitörünü oluşturup her ortamı manipüle ediyor, yalnızca insan kararı gerektiren konularda yardım istiyor
- Fundamental Research Assistant codebase'inde geri bildirime göre büyük ölçekli değişiklikler yapıyor ve normalde birkaç parçaya bölünecek işleri tek bir agent iş akışında tamamlıyor
- Frontend değerlendirmesinde, masaüstü ve telefon genişliklerinde sayfayı doğrudan açıp mobil ekranın altında gizlenen ürünleri ve ekran dışında kalan ödeme düğmesini bulup düzeltti
- PR devrinden önce branch, template ve test etkilerini kontrol etti; önceki modeller gibi doğrulama yapmadan aceleyle yayınlamadı
- Yeniden tasarım sürecinde, önerilen tasarımın güçlü yanları ile tekil sorunu ayırıp kusurları düzeltirken bu avantajları koruyan bir uzlaşma çözümü önerdi
- Kod değişikliklerinde gereksiz kod bırakmadan kısa diff'ler oluşturdu; codebase'e özgü ince riskleri daha iyi tespit ederek production iş yüklerinde kullanılmaya başlandı
- Entegre agent platformu Cosmos'taki çeşitli kullanım senaryoları ve code review süreçlerinin Opus 5'e taşınması planlanıyor
- JetBrains değerlendirmesinde, kod yazmadan önce daha derin inceleme yapıyor, planlama aşamasında mantık hatalarını yakalıyor ve yalnızca cevabın çalışıp çalışmadığını değil neden doğru olduğunu da değerlendiriyor
- Trading benchmark'ında Opus ailesinin en yüksek performansını gösterirken Opus 4.8'e kıyasla reasoning token'larını yaklaşık 7'de 1'e, gecikmeyi ise yarının altına indirdi
Kurumsal ve profesyonel iş değerlendirmeleri
- Finans araştırmalarında sayısal akıl yürütme, tablo çalışmaları ve hassas eleştirel düşünme Opus 4.8'e göre iyileşti
- Box iç değerlendirmesinde profesyonel kurumsal içerik analiz performansı Opus 4.8'den %8 daha yüksek
- Veri analizi iş akışı %11, due diligence ise %17 iyileşti
- Teknik, sağlık ve kamu sektörlerinde kullanılan iş akışları hedef alındı
- Zor finansal modelleme görevlerinde effort seviyeleri genelinde doğruluk ortalama 9 puan arttı; konuşma turu ve araç çağrıları üçte bir azaldı, geçen süre %60 düştü
- Hukuki agent görevlerinde kurumsal yönetişim ve tahkim alanlarında özellikle belirgin iyileşme görüldü
- Opus 4.8'in max reasoning ayarına göre ortalama %26 daha az token kullanarak benzer kaliteyi korudu
- İlk denemede sözleşme revizyon önerilerinde test edilen modeller arasında en yüksek puanı aldı ve Opus 4.8'in neredeyse 2 katına ulaştı
- NDA revizyonlarını da doğruluğu koruyarak veya artırarak, daha az zaman ve yinelemeyle tamamladı
- Uzun görevlerde, tüm sunumu oluşturup ardından düzenleme yeteneği gelişti; görsel anlayış, biçimlendirme ve slayt hataları açısından da daha iyi sonuç verdi
Hizalama ve risk yetenekleri
- Dağıtımdan önce yapılan otomatik davranış denetimlerinde Opus 5, Anthropic modelleri arasında en yüksek hizalama düzeyini gösterdi
- Claude'un Anayasası'na Opus 4.8, Sonnet 5 ve Fable 5'ten daha iyi uyuyor
- Aldatıcı davranış oranı ve kötüye kullanıma yönlendirilme kırılganlığı en düşük
- Geri döndürülmesi zor yan etkiler doğurabilecek pervasız davranışlardan da en iyi şekilde kaçınıyor
- Riskli çift kullanımlı yeteneklerin sınırını yukarı taşımadı; sivil ve kamu ortaklarıyla yapılan değerlendirmelerde biyoloji araştırması ve saldırgan siber güvenlikte Mythos 5'ten daha düşük performans gösterdi
- Ayrıntılı değerlendirme System Card'da yer alıyor
- Opus 4.8'de olduğu gibi siber görevler için kasıtlı eğitim verilmedi; ancak genel yetenekler geliştikçe ilgili performans da belirgin biçimde arttı
- Zafiyet bulma performansı Mythos 5'e yaklaşıyor
- Bulunan zafiyetleri gerçek tehdide dönüştüren exploit geliştirme tarafında ise Mythos 5'in belirgin biçimde gerisinde
- OSS-Fuzz değerlendirmesinde Opus 5 ve Mythos 5 benzer başarı oranıyla zafiyet buldu; ancak exploit geliştirme puanı Opus 5'te çok daha düşük kaldı
Siber güvenlik ve biyoloji koruma önlemleri
- Koruma önlemleri, siber güvenlik ve biyolojide yararlı kullanımlara izin verecek şekilde tasarlandı; dar kapsamlı bazı siber görevlerde daha güçlü kısıtlar eklenmesi dışında Opus 4.8'e benziyor
- Siber sınıflandırıcı, Fable 5'e göre nispeten daha az kısıtlayıcı
- Kaynak kodda zafiyet bulmaya izin veriyor
- Kötü niyetli aktörlerle ilişkili olma ihtimali yüksek binary tabanlı zafiyet taraması, penetration test ve exploit üretimini engelliyor
- Anthropic testlerine göre Fable 5'ten yaklaşık %85 daha az sınıflandırıcı müdahalesi bekleniyor
- Claude.ai, Claude Code ve Claude Cowork'te işaretlenen istekler varsayılan olarak Opus 4.8'e yönlendiriliyor; bu davranış API'de de etkinleştirilebiliyor
- Cyber Verification Program'a katılan şirketler ve araştırmacılar, güvenlik kısıtları daha az olan Opus 5'e hemen erişebiliyor
- Biyoloji tarafında Opus 4.8'e benzer koruma önlemlerini korurken, genel kullanıma açık modeller arasında en güçlü bilimsel araştırma modeline dönüşüyor
- Uzun süreli otonom araştırmalarda hâlâ önemli sınırlamalar var ve bu tür biyoloji görevlerinde Mythos 5 daha güçlü
- Fable 5'te engellenen biyoloji istekleri artık Opus 4.8 yerine Opus 5'e yönlendiriliyor
Fiyatlandırma ve geliştirici özellikleri
- Tüm platformlarda sunuluyor ve Claude API'deki model tanımlayıcısı
claude-opus-5- 1 milyon giriş tokenı başına $5, 1 milyon çıkış tokenı başına $25 ile Opus 4.8 ile aynı fiyatlandırmaya sahip
- Genel erişimde, önceki Opus modellerinde olduğu gibi veri saklama gereksinimi bulunmuyor
- Fast mode, temel hızın yaklaşık 2,5 katı ile çalışıyor
- Claude Platform'da temel fiyatın 2 katı, Claude Code'da ise kullanım kredisiyle sunuluyor
- Claude Platform'daki beta konuşma sırasında araç değiştirme özelliği sayesinde, prompt cache geçersiz kılınmadan konuşma sırasında Claude'un kullanacağı araçlar değiştirilebiliyor
- API'deki beta otomatik fallback etkinleştirildiğinde, Opus 5 veya Fable 5 isteği güvenlik sınıflandırıcısı tarafından işaretlenirse otomatik olarak başka bir modele yönlendiriliyor
- İsteği engellemek yerine varsayılan olarak kullanılabilir en iyi modele yönlendiriyor
- Modelin nasıl kullanılacağına dair bilgiler Opus 5 prompting guide'da bulunabilir
1 yorum
Hacker News görüşleri
Buradaki asıl nokta, mutlak performanstan çok kurumların 30 günlük veri saklama zorunluluğu olmadan Fable seviyesinde bir model kullanabilecek hâle gelmesi
Opus 5'te, önceki Opus'ta olduğu gibi genel erişim için veri saklama şartı yok; Fable'ın ARC-AGI puanına sahip olmamasının nedeni de bu saklama politikası
https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344
Fable 5'in yalnızca krediyle erişilebilir kalması da sevindirici; bundan sonra en üst seviye modellerin kullandıkça ödemeli API veya kredi duvarının arkasında tutulup diğer modellerin aylık abonelikle desteklenmesi daha yaygın hâle gelebilir
Bu durumda bilgi bir yerde saklanıyor olmalı; bu yüzden veri saklama yöntemini anlamak zor
Şu anda görüntü→HTML dönüşümü deneniyor; daha önce Fable en iyisiydi, Gemini 3.1 Pro ise şaşırtıcı biçimde 2. sıradaydı
Opus 5, Fable'dan daha doğru biçimde özgün tasarımı takip ediyor; butonları kapsül yerine yuvarlatılmış dikdörtgen olarak uyguluyor ve üretilen görseller de aslına daha yakın
Orijinal: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5: https://html.non.io/solaraOpus/
Fable 5: https://html.non.io/solara/
Responsive davranışta sapmalar vardı ama bitmiş ürünün yaklaşık %90'ına ulaşmış gibi hissettiriyor
Orijinal: https://image.non.io/9d5fed20-b476-49d3-841b-37eb553fb88e.we...
Opus 5: https://html.non.io/neonRamen/
Inkling pek iyi değildi: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
En yeni Kimi3'ün selefi olan Kimi 2.7 ise çok iyiydi: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Test ortamı: https://huggingface.co/spaces/abidlabs/vlm-screenshot-to-web...
Modelin insan tasarımını bozup bozmadan ne kadar iyi aktardığını görmek daha faydalı
Sayısız lansmana bakınca model yönlendirmenin yapay zekada en hızlı büyüyen alan olması da şaşırtıcı değil
10'dan fazla şirkette farklı format ve boyutlarda modeller, akıl yürütme seviyeleri, ajan·Pro·yüksek hızlı modlar, standart·esnek·toplu çalıştırma ve farklı girdi·çıktı·cache token fiyatları var
Prompt'ları en uygun ve en ekonomik kombinasyona gönderen şirketler, model geliştiricilerinin görmezden geldiği boşlukta büyük değer topluyor
Bu, Bitter Lesson'ın tekrarı ve lider şirketler sonunda bu özelliği doğrudan kendileri sunacak gibi görünüyor
Çoğu ofis işi için aşırı güçlü AGI gerekmiyor, bu yüzden trafik ucuz modellere kayıyor; ama önde gelen laboratuvarlar hem güçlü AGI'yi hem de beyaz yaka ikamesini yalnızca kendilerinin yapabileceği şekilde konumlanıyor
Düşük maliyetli modellere yönlendirme bu anlatıda gedik açabilir
Herhangi bir işte en yeni en yüksek performanslı model dışında bir şeyi kabul etmek zor ve gereken tek kural sabit ücretli kotada hakkı kalan en güçlü modeli seçmek gibi görünüyor
Maliyetten tasarruf etmek karşılığında ciddiyeti ve sıklığı ölçülemeyen hataları kabullenmek gerekiyor; ayrıca tüm muhakemeyi en üst düzey modele bırakmanın sigorta değeriyle sonradan düzeltme maliyeti de bilinmiyor
Proje düzeyinde farklı bir model kullanılsaydı kodun ne kadar farklı olacağını test etmenin de yolu yok
Yaklaşık 190 sayfalık PDF'yi okumak istemeyenler için bu blog yazısı var: https://www.anthropic.com/news/claude-opus-5
Opus 5 ile Fable 5'in üslubunu karşılaştırınca, Fable'ın uzaklaştığı Claude'a özgü ifadeleri Opus 5'in 4.8 gibi kullanmayı sürdürdüğü görülüyor
“carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” gibi ifadeler tekrar ediyor; bu yüzden “sinir bozucu İngilizce” benchmark'ına ihtiyaç var
Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
Claude'a özgü üslup kısmen konuşmayı ya da işi ‘proaktif biçimde’ ilerletme eğiliminden geliyor gibi ve prompt bazında üslup aralığını nicelleştiren bir benchmark da faydalı olabilir
Anthropic'in %55,7'si ile OSWorld 2.0 makalesindeki yaklaşık %21 farklı metriklermiş
Opus 4.8 yaklaşık her 5 görevden 1'ini tamamen başarıp %20,6 tamamlama oranı kaydetti, kalanlarda da kısmi puan alarak %54,8 kısmi puan elde etti
Ancak bu tür metrik farkları yüzünden, makaleler arasında benchmark'ların makul hata payı içinde karşılaştırılıp karşılaştırılamayacağı sorgulanıyor: https://arxiv.org/pdf/2606.29537
Benchmark hazırlayanlar gelişim alanını göstermek için düşük sayıları, model üreticileri ise yetenekleri vurgulamak için yüksek sayıları tercih eder; ama Anthropic'in %55,7'si ile makaledeki %54,8 aslında fiilen aynı sonuç
“Opus 5 genel olarak Fable 5'ten üstün değil” denip blogda çoğu benchmark'ta daha iyi olduğu sıralanınca iletişim kafa karıştırıcı hale geliyor
Sistem kartı da yapay zeka Ar-Ge yeteneğinin sınırsız Fable kabul edilen Claude Mythos 5'e benzer olduğunu söylüyor
Opus 5 yazılım açıklarını istismar etmeyi öğrenmediği için bulma yeteneği Mythos 5'e yakın, ama bunu gerçek siber tehdide dönüştüren istismar yeteneğinde ciddi biçimde geride kalıyor
Anthropic’in kıyametçi tanıtımı olmadığı için, Fable’dan çok daha üstün görünen bir model bile sorunsuz biçimde yayımlandı
Teoride Anthropic’in ölçütlerine göre AGI düzeyinde olması gerekirdi ama gerçekte sıradan bir cumadan ibaret
Bu modeller sıkı biçimde korunuyor ve güvenlik önlemi olmayan Mythos’un bu yüzden yayımlanamadığı söylenmiş
OpenAI de güvenlik önlemi olmayan bir modelin HuggingFace sunucularına sızdığını duyurduğunda benzerdi
GPT-6 yazın çıksa bile artık AGI bekleyen neredeyse kimse yok; abartı döngüsünü nasıl sürdüreceklerini merak ediyorum
Opus 5’in tek bir oturumda yeni bir borsa için piyasa veri akışı ve doğrulama araçları oluşturduğuna dair tanıtım örneği, ilginç şekilde trading şirketlerinde stajyerlere sık verilen bir proje
Frontier Code grafiğinde orta düzey düşünme modunun görev başına verimliliği ezici biçimde yüksek; akıl yürütme miktarı arttıkça değerlendirme sonuçlarının neden ciddi biçimde kötüleştiğini merak ediyorum
En üst düzeyde hafif bir düşüş olması görülebilir ama bu kadarı sıra dışı: https://imgur.com/a/Nv8V7Ry
Öznel olarak, geçen haftaki Opus 4.8’e kıyasla bugünkü Opus 4.8 Medium ile duyuru sonrası Opus 5 Medium bana 5 saatlik kullanım aralığında daha verimli hissettiriyor
Ajan yerine daha çok prompt odaklı kullanıldığında bu tür sınırlamalar görülebilir; orta seviyenin daha dengeli olması mümkün
Fazla düşünmek kötü ama aşırı derecede daha fazla düşününce yeniden iyi mi oluyor diye düşündürüyor