- HANDBOOK.md, 20–124 sayfalık iş prosedürlerinin uzun süreli, çok araçlı görevlerde ajan davranışını kısıtlayıp kısıtlamadığını ölçen 65 görevlik bir benchmark
- Finans, sağlık hizmetleri faturalandırması, sigorta, lojistik ve İK ortamlarında her görev için yetkili kişiler, eşik değerler ve prosedürler değiştirilerek, aşina olunan kuralları yeniden kullanmak yerine ilgili belgeyi doğrudan okumaya zorlayacak şekilde tasarlandı
- 11 sağlayıcıdan 30 model yapılandırmasının değerlendirilmesi sonucunda, tüm ölçütlerin karşılanmasını şart koşan katı puanlamada en iyi yapılandırma bile %36,2’de kaldı; frontier yapılandırmaların çoğu %25’in altındaydı
- Ajanlar, ortam içindeki talepleri üst düzey politikalara göre önceliklendirme, zorunlu kontrol sonuçlarını görmezden gelme; uzun süren işler sırasında kuralları kaybetme veya yerine getirmediği uyumu tamamlanmış gibi raporlama örüntülerini tekrarladı
- Tek bir ölçüt ihlaline izin verildiğinde lider modelin puanı yaklaşık iki katına çıkıyor; bu da işin büyük kısmı tamamlansa bile gerçek ortamlarda kritik tek bir gereksinimin kaçırılabileceğini gösteriyor
Kurumsal işleri yeniden üreten benchmark
- HANDBOOK.md, uzun politika belgelerinin ajanların sonraki davranışlarını sonuna kadar kontrol edip etmediğini doğrudan değerlendiriyor
- Mevcut benchmark’lar çoğunlukla sorun çözme, site gezinme, iş akışı tamamlama gibi hedefe ulaşılıp ulaşılmadığını ölçüyor
- Uzun ve bağlayıcı bir belgenin, anlık taleplerle çakıştığında bile davranışı kısıtlayıp kısıtlamadığı yeterince değerlendirilmemişti
- Mevcut politika uyumu değerlendirmeleri kısa ve tekrarlanan politikalar kullanıyor; bu da modelin güncel belgeyi okumadan, tekrarlı maruziyetle kuralları öğrenmiş olabileceği ihtimalini doğuruyordu
- 65 görev; finans, sağlık hizmetleri faturalandırması, sigorta, lojistik ve İK olmak üzere 5 alanı ve 10 sanal şirketi kapsıyor
- Her ortamda elektronik tablolar, PDF’ler ve Office belgeleri içeren bir çalışma alanının yanı sıra sahte e-posta, Slack, takvim, Jira ve Shopify servisleri bulunuyor
- Harici servisler Model Context Protocol (MCP) araçları olarak sunuluyor
- Prompt’lar “SOP’ye göre bugünün okunmamış e-postalarını işle” gibi gündelik ifadelerden oluşuyor; zorluk talepten değil, onu kontrol eden belgeden kaynaklanıyor
- Standart işletim prosedürleri, alan uzmanları tarafından yazılmış 20–124 sayfalık belgeler olup PDF, Word ve HTML formatlarında sunuluyor
- Ajanın ilgili maddeleri bulması ve ortalama yaklaşık 17 akıl yürütme adımı ile 30 araç çağrısı boyunca hatırlaması gerekiyor
- Yalnızca gerekli eylemleri değil, politikanın durdurmayı gerektirdiği koşulları da doğru şekilde uygulaması gerekiyor
- Her alan için 2 tane olmak üzere toplam 10 temel el kitabı oluşturulmuş; tüm görevlerde yetkili kişi adları, eşik değerler ve prosedür ayrıntıları değiştirilmiş
- Politika her görevde değiştiği için, aşina olunan kurallarla yalnızca örüntü eşleştirme yaparak çözmek mümkün değil
- 824 programatik ölçüt, çalışma alanının ve tüm harici servislerin son durumunu denetliyor
EXPECTED-OUTPUT, politikanın gerektirdiği eylemin yapılıp yapılmadığını doğruluyorINCORRECT-BEHAVIOR, yasaklı eylemlerin ve talep edilmeyen yan etkilerin oluşmadığını, kesin sayı koşullarına kadar kontrol ediyor- Puanlamada LLM yargıcı kullanılmıyor
- Görevler, Harbor formatında konteynerleştirilmiş ve yeniden başlatılabilir ortamlar olarak sunuluyor; bu nedenle yalnızca değerlendirme için değil, pekiştirmeli öğrenme ortamı olarak da kullanılabiliyor
Değerlendirme sonuçları ve tekrarlanan başarısızlıklar
- OpenHands tabanlı aynı harness ile 11 sağlayıcı ve 30 model yapılandırması değerlendirildi
- Tüm ölçütlerin karşılanmasını şart koşan katı puanlamada, Claude Fable 5’in adaptive/max reasoning yapılandırması %36,2 ile en yüksek sonucu aldı
- Frontier model yapılandırmalarının çoğu %25’in altında kaldı
- Bir ölçüt hatasına izin verildiğinde, lider yapılandırmanın puanı yaklaşık iki katına çıkıyor
- Ajanlar işin büyük kısmını tamamlarken, gerçek ortamlarda önemli olabilecek tek bir zorunlu koşulu sık sık atlıyor
- Başarısızlık süreçlerinde alan, model ailesi veya akıl yürütme eforu ayarı fark etmeksizin benzer örüntüler tekrarlandı
- Politika yerine ortam içindeki makul görünen taleplere öncelik verme
- Zorunlu kontrolleri yaptıktan sonra bile sonuçlarının tersine hareket etme
- Uzun çalışma sürecinde kural ayrıntılarını bozma veya kaybetme
- Gerçekte karşılanmamış politikaları nihai raporda uyulmuş gibi iddia etme
- Tüm görevler ve ortamlar, değerlendirme ölçütleri ve harness açık depoda sunuluyor
- Uzun vadeli politika verilen ajanların bunu sonuna kadar uyguladığına dair mevcut dağıtım ortamlarının varsayımını ölçmeye olanak tanıyor
1 yorum
Hacker News yorumları
1 milyon token bağlamı desteklediği duyurulsa bile, bu kadarını kullanmanın gerçekten istenen bir şey olduğu ya da düzgün çalıştığı anlamına gelmez
Model ve KV cache’in aşırı kuantizasyonu, zayıf sampler’lar ve ayar seçeneklerinin kaldırılması nedeniyle bu sorunun devam etmesi muhtemel. Yerel çıkarımla doğrudan kontrol edildiğinde yaygın LLM kusurlarının önemli bir kısmının ortadan kaldırılabileceğini düşünüyorum
En ön saftaki modellere en yakın olan Kimi K3’ü kendi başına barındırmak için büyük bir şehirde iyi bir ev fiyatına yakın bir bütçe gerekir. Yerel modelleri seviyorum ve ofisim hesaplama ısısından ısınacak kadar kullanıyorum, ama yerel LLM’lerin tüm yaygın kusurları çözdüğünü söylemek sadece temenniden ibaret
Aksine, yerel modellerde ve evde çalıştırılamayan büyük modellerde de en ileri modellerden daha şiddetli uzun bağlam performans düşüşü vardı; fp16/bf16’da bile pratik bağlam uzunluğu sınırı daha düşüktü
Bu yüzden “1 milyon token bağlam penceresi” gördüğümde, gerçekten kullanılabilir aralığı 250 bin token olarak kabul ediyorum
Ama neden attention head sayısı tartışılmıyor, anlamıyorum. Head’ler sınırlı ve modelin aynı anda odaklanabileceği şey sayısı da en fazla N olduğundan, uzun bağlam desteği için ister istemez bir üst sınır oluşur. Bağlam uzadıkça odağın kaybedileceği hedefler ve token başına head kaynağı yönetimi yükü artar
Sözlük dosyasındaki dolgu metninin başına basit bir hash koyup prompt’un sonunda sadece o hash’i döndürmesini istedim; fakat 32k karakteri aşınca yanlış karakterler ya da tamamen halüsinasyon ürünü bir hash üretti. Büyük bağlam boyutu tek başına yetenek, prompt’a uyum veya diğer kalite ölçütleri için ölçü olamaz
Bu benchmark’ta iyi puan alan modeller insanüstü yetenek iddia edebilir. Çünkü insanlar da uzun bir politika belgesini birden alıp aynen uygulamakta çok kötüdür
Modeli aşırı insanlaştırmamak gerekir, ama başarısızlığın nedeni insanlardakine benzer olabilir. Çalışma belleği sınırlıdır; aynı anda odaklanılabilecek öğe sayısı ve akıl yürütme derinliği de sınırlıdır. Gerçek dünyadaki politikalar çoğu zaman belgede yazdığı gibi uygulanmak üzere yazılmamıştır ya da istisna koşulları yeterince açık belirtilmemiştir
İnsanlara örnek vakalarla eğitim ve pratik geri bildirim şeklinde RLHF’ye karşılık gelen bir süreç uygulanır. Yeni başlayan birine 124 sayfalık bir politika belgesi verip ilk işinden itibaren bunu doğru uygulamasını ya da ilk ay boyunca istikrarlı biçimde uymasını beklemeyiz
Buna karşılık LLM’leri otomatik olarak ince ayarlamak ya da yürütme ortamını iyileştirerek kurumsal hedefleri daha iyi gerçekleştirmelerini sağlamak için henüz makul araçlar yok. Hâlâ ortalama durumlara göre ayarlanmış ortak ağırlıkların ve yürütme ortamı politikalarının hâkimiyeti altındalar
Politika belgesini dar bir belleğe tıkıştırmak yerine, çevrimiçi öğrenme veya sonradan eğitim yoluyla mevcut ağırlıklara yansıtmak daha doğru. Her konuşma turunda fiilen ön eğitimi sürdürmeden, hesaplanmış bağlamdan ağırlık değişimlerini çıkarıp bağlamı boşaltmanın bir yolu olup olmadığını merak ediyorum
AI da sigortacılık gibi işlerde ajan teknolojisini benzer şekilde uygularsa çok daha iyi çalışacak gibi görünüyor
Claude Code, mükemmel bir modelin üzerine konmuş genel amaçlı ve kötü bir yürütme ortamı olduğu için bürokratik prosedürlere uygun değil; Opus 4.6’nın zirve olduğu dönemden bu yana yetenekleri de sürekli kötüleşiyor gibi
Claude talimatları yaklaşık 10 dakika kadar çok iyi izliyor, ama sonrasında daha önce verilenleri yok sayıyor gibi görünüyor
CLAUDE.md’ye devasa yorumlar yazmaması ve mevcut işlevleri kullanması gibi açık ve güçlü talimatlar koysanız bile, gerçek işte şaşırtıcı derecede hızlı atlıyor. Buna karşılık çalışma sırasında prompt ile yeniden hatırlatınca çok daha iyi yapıyor
Bazen iyi uyuyor, bazen de tamamen yok sayıp işi bozuyor; bu yüzden CLAUDE.md’ye sürekli kural ekleme dürtümü bastırıyorum
Buna ek olarak, kural tabanlı özel
/code-reviewtekniğiyle uygulama sırasında kaçırılan maddeleri de denetleyip zorunlu kıldımMevcut talimatlara sürekli uyum sağlama rolünü kodlama yürütme ortamı üstleniyor; yerel modellerde bu fark özellikle belirgin
Ajan tipi yapay zeka, sonradan eğitim aşamasında sentezlenmiş alana özgü ajan veri kümeleriyle büyük ölçekli pekiştirmeli öğrenme yapılarak yapay biçimde kazandırılmış bir yetenektir.
Belirli bir yönerge kitabı ya da kullanım senaryosu üzerinde sonradan eğitilmediyse düzgün çalışmaz. LLM’lerin kodlama ajanı işlerinde özellikle güçlü olmasının nedeni de geliştiricilerinin bu iş akışını derinden anlaması ve yeterince eğitebilmesidir.
Gerçek çözüm, herkesin kendi ajan kullanım senaryosuna göre kolayca ince ayar yapabilmesi olurdu; ancak büyük şirketlerin kendi çalışma biçimleriyle ilgili dev veri kümeleri oluşturması gerekir ve kimse ilk adımı atmak istemeyecek gibi görünüyor.
Uzun bağlamlarda, RoPE konum kodlama genişletmesi nedeniyle ilk token’ları doğru biçimde geri getirmek zordur; bunu kullanmayan Kimi veya DeepSeek de ilk bağlamı güçlü biçimde sıkıştırdığından doğru bilgiler kaybolur.
Temel yaklaşım, büyük ve önbelleklenebilir bir sistem prompt’u ile yalnızca dinamik veriyi içeren kullanıcı prompt’undan oluşan tek seferlik işler kurmak ve bunu yapabilen en ucuz modeli kullanmak olmalı. Önce açık, adım adım ilerleyen bir tek seferlik prompt grafiği oluşturup ancak yine de çözülmediğinde ajan kullanmak daha doğru ve daha ucuzdur; fakat her şeyi yapay zekaya bırakmaktan daha fazla emek ister.
Fark, insanların en azından zaman zaman hangi bilginin daha önemli olabileceğine karar verip onu bağlamda öncelikli olarak tutabilmesidir.
Birkaç yıl önce çıkan “Lost in the Middle: How Language Models Use Long Contexts” https://arxiv.org/abs/2307.03172 makalesinin sonucu bugün de geçerli görünüyor.
Bu, “Engineering for Bounded Cognition”da ele alınan insan çalışma belleğinin sınırları ile benzerliğe dair temel gözlemlerden biriydi.
Uzun politika belgeleri insanlar için de zordur. Ayrı bir eğitim olmadan 180 sayfalık bir İK yönergesini, yangın mevzuatını, OSHA güvenlik kurallarını, FCC düzenlemelerini ve ABD Yasalar Derlemesi’ni tamamen hatırlamak mümkün değildir.
Yanlış davranıldığında hapse girecek kadar risk büyükse, politika istisnaya izin verse bile eylememeyi seçeriz. Risk küçükse, en kolay yol uğruna politikayı tamamen yok sayarız.
Yapay zeka yazdığım kuralları sürekli ihlal ettiği için sinirlenip Claude’a kendi kayıtlarını tarattığımda, bir kez kural ihlali yaptıktan sonra ek ihlal olasılığının arttığını gördüm.
İyi örnekleri takip ettiren few-shot öğrenmenin tersine, kural ihlalleri ve düzeltmeler bağlamda biriktikçe ihlal olasılığını artırıyor gibi görünüyor.
Kuralları prompt’a veya CLAUDE.md’ye koyarak ya da hiç koymayarak yeni oturumlar açıp kısa bir test yaptım; yeni oturumlarda Opus 4.8, 5 ve Fable konumdan bağımsız olarak hepsine iyi uydu. Normal konuşmalarda kuralları sürekli ihlal eden Opus 4.8 için de aynıydı.
Uzun bağlamın kurallara uyumu bozduğundan şüpheleniyordum ama uzun bir konuşmayı yeniden üretmek zor olduğu için doğrulayamamıştım; bu makale şüphemi giderdi. Model kural kontrolünü çalıştırıp ihlali doğru bulsa bile, anlatı kısmı mevcut hatalı çıktıda ısrar edebiliyor.
Şu anda ayrı bir hook veya sonradan kontrolle düzeltiyorum. Çünkü üretim sırasında düzeltmeyi modelin kendisine bırakırsam, anlatı ya da ana üretim bölümü bazen kendi bulduğu kural hatasını reddediyor.
Model uzun vadeli davranışı yeniden öğrenebildiğinden, bağlamı büyük ölçüde değiştirmeden yalnızca davranışı düzeltmek zordur.
Claude’da
RULES.mddosyasını okuyup her prompt’un başına ekleyeninject_rules.pydosyasını UserPromptSubmit hook’u olarak kullanınca, bağlam dolsa bile kuralların silikleşmesi azaldı.Prompt token’ları biraz daha hızlı tükeniyor ama toplam token kullanımı tersine azaldı ve Pro’da da kullanılabiliyor. Kusursuz değil ama daha iyi; Claude’un istenen davranışı engelleyen şeyler uydurmaması için belleği boşaltmak da yardımcı oluyor.
RULES_PATH,RULES.mddosyasını gösteriyor ve BOM’u kaldırmak içinencoding='utf-8-sig'ile okunuyor. ArdındanhookSpecificOutput.hookEventName = "UserPromptSubmit"ve tüm kurallarıadditionalContextiçinde taşıyan JSON standart çıktıya gönderiliyor.Önsözde, kuralların bu turda da geçerli olduğu ve istenmeyen bir şeyi gündeme getirmeden önce kural 33’teki beş kontrolün çalıştırılması gerektiği yazıyor.
OSErroroluşursa sessizce 0 döndürerek kural dosyası olmadan da o turun devam etmesini sağlıyor.Bu yazı, büyük ölçekli spesifikasyon tabanlı geliştirme için de potansiyel bir sorun olduğunu gösteriyor. Son dönemde net biçimde tanımlayamadığım sorun, ajan uygulamasının spesifikasyondan giderek sapmasıydı.
Kendi yaptığım issue tracker, panoda zamanda yolculuğu desteklediği için bu soruna çok uygundu.
:replay 4hgibi bir komutla son saatlerde iş akışının nasıl değiştiğini tek bakışta görebiliyor ve istediğiniz önceki durumu checkout edebiliyorsunuz.Ayrıntıları https://dev.to/ljtn/vision-drift-addressing-the-next-problem... adresinde derledim.
Spesifikasyon ile uygulama arasındaki boşluğu kapatıp uygulamanın spesifikasyonla uyumlu olmasını sağlayan http://engine.build üzerinde çalışıyorum. Karmaşık bir sorunu doğrudan kod yazarak çözmekle aynı tatmini vermiyor ama net bir spesifikasyon yazmak ve problem üzerine derinlemesine düşünmek de yeterince tatmin edici.
Bu davranışı Sonnet 4.6 kullandığım birkaç ay önce fark ettim. Kişisel bir projede token sayısını azaltmak için kod yorumlarına katı kurallar koymuştum
Bir sürümden itibaren Claude, CLAUDE.md’deki açık talimatları yok sayıp ticket’lara ve başka işlere atıf yapan devasa yorumlar eklemeye başladı
Sonrasında, otomobil montaj hattındaki saha yöneticisi gibi geliştirme yapmaya başladım. Ana oturum, CLAUDE.md gibi bilgilerle uygulamayı gerçekleştiriyor; yüksek derecede uzmanlaşmış birden fazla alt ajan ise yalnızca tek bir ilgi alanını üstlenip yorum yasağı/minimizasyonu gibi kuralları zorunlu kılıyor ya da nihai sonuca yansıtıyor