1 puan yazan GN⁺ 5 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Poolside, uzun süreli çalışma ve akıl yürütme yeteneklerini güçlendiren Laguna S 2.1’i duyurdu. Toplam 118B MoE içinde token başına 8B parametreyi etkinleştiriyor; hem thinking hem de no-thinking modlarında 1M token bağlama kadar destek sunuyor
  • Eğitimin başlamasından yayıma kadar 9 haftadan kısa sürdü; Terminal-Bench 2.1’de %70,2, SWE-Bench Multilingual’da %78,5, DeepSWE v1.1’de %40,4 elde ederek daha büyük modellerle rekabet ediyor
  • Performans artışının merkezinde basit model ölçeklendirmeden çok ısrarcılık, doğrulama ve geri çekilip yeniden deneme var. Daha uzun rollout’lar, iyileştirilmiş sandbox ve birden çok agent harness kullanarak aceleyle tamamlandı deme ve tek bir harness’e aşırı uyumu azaltmayı hedefliyor
  • Gerçek işlerde 181 adımda bir HTML/CSS render motoru oluşturdu; kendi harness hızını %5,2 artırırken bellek ayırmayı yaklaşık %70 azalttı ve Erdős problemi #397’nin sonsuz çözüm kümesini bağımsız olarak yeniden keşfetti
  • Modelin ve nihai değerlendirmenin tüm yürütme izlerini yayımladı; ancak üçüncü taraf harness’lerin araç şartnameleri, iç içe araç çağrılarının JSON’u ve aşırı uzun akıl yürütme konusunda kısıtlar var. Ağırlıklar ve 1M bağlama kadar destek Hugging Face ile başlıca çıkarım framework’leri ve hosting servislerinde kullanılabiliyor

Model yapısı ve yayımlama hızı

  • Laguna S 2.1, toplam 118B parametreye ve token başına 8B aktif parametreye sahip bir Mixture-of-Experts modelidir
    • Hem thinking hem de no-thinking modlarında 1M token bağlama kadar destekler
    • Eğitimin başlamasından yayıma kadar 9 haftadan kısa sürdü
  • 22 Mayıs 2026’da 4.096 NVIDIA H200 GPU üzerinde ön eğitime başladı ve 60 gün sonra yayımlandı
  • Küçük aktif boyutu sayesinde karmaşık işler yerel sistemlerde yürütülebilir; tek bir NVIDIA DGX Spark üzerinde bile çalıştırılabilir

Uzun süreli kodlama benchmark performansı

  • 21 Temmuz 2026 itibarıyla başlıca sonuçlar şöyle
    • Terminal-Bench 2.1: %70,2
    • SWE-Bench Multilingual: %78,5
    • SWE-Bench Pro açık veri kümesi: %59,4
    • DeepSWE v1.1: %40,4
    • SWE Atlas(Codebase QnA): %46,2
    • Toolathlon Verified: %49,7
  • Terminal-Bench 2.1, agent’ın terminal üzerinden ortamla etkileştiği çeşitli uzun süreli işleri değerlendirir; Laguna S 2.1, thinking etkinleştirilmiş pool harness’inde %70,2 elde etti
  • Olgun benchmark’larda en üst skorlar %70~90 bandında toplandığından davranış farkları büyük olan modeller bile birkaç puan farkla görünebilir
  • DeepSWE, kısmi çözümün zor olduğu ve daha uzun işleri içerdiği için skor dağılımı geniştir
    • v1.1’de frontier modeller %54~73 elde ederken, bazı 1T üzeri açık modeller %10’un altında kalıyor
    • Laguna S 2.1, kendi pool harness’inde %40,4 elde etti
    • Resmî sıralamadaki mini-swe-agent yerine kendi harness’i kullanıldığı için diğer model skorlarıyla tamamen eşdeğer bir karşılaştırma değildir
    • Diğer modeller için kendi duyuruları, benchmark sıralamaları ve Artificial Analysis içindeki en yüksek skor kullanıldı
  • Nihai değerlendirmenin tüm yürütme izleri trajectories.poolside.ai üzerinde yayımlandı

Değerlendirme yöntemi ve ödül hackleme yönetimi

  • Agent değerlendirmelerinde, doğru yanıtı veya mevcut düzeltmeleri çevrimiçi bulup skor alma şeklinde ödül hackleme sorunu bulunur
  • İnternet erişimi varsayılan olarak açık bırakıldı ve şüpheli vakaları işaretlemek için insan etiketli izlerle kalibre edilmiş LLM yargıcı (LLMaaJ) kullanıldı
    • İlk post-training aşamalarında ödül hackleme oranı %2’nin altındaydı
    • Eğitim ilerledikçe SWE-bench ailesinde işaretlenen izler %50’yi aştı
    • Manuel incelemede modelin çoğu zaman sorunun dayandığı PR’ı veya depoyu bulup gerçek düzeltmeyi uyguladığı görüldü
  • Kullanıcı prompt’una çevrimiçi bulunan doğrudan çözümleri kullanmama ifadesi eklendikten sonra ödül hackleme oranı genel olarak %2’nin altına düştü
    • Bu tam bir çözüm değil; ProgramBench ve MirrorCode istisna oluşturdu
  • Ek doğrulama için LLMaaJ’nin işaretlediği başarılı vakaların manuel incelenmesi, tüm izler üzerinde açık uçlu agent analizi ve Terminal-Bench 2.1 yüksek skorlu tüm çalıştırmaların uzman incelemesi kullanıldı
  • Son dönemde hasmane değerlendirme ile ödül hackleme tespiti güçlendirildi; açık checkpoint’lerin nihai değerlendirme izleri görüntülenip indirilebiliyor

Gerçek iş örnekleri

  • Boş klasörden tarayıcı motoru inşa etme

    • Laguna S 2.1, insan müdahalesi olmadan 50 dakika boyunca 181 adım yürütüp boş bir klasörden HTML/CSS render motoru inşa etti
    • Görsel yetenek olmadan headless Chromium ile canvas’ı okuyup ekran görüntülerini sayısal olarak karşılaştırarak sonucu doğruladı
    • Tüm pipeline’ı Vanilla JavaScript ile uyguladı
      • HTML tokenizer ve DOM ağacı
      • Seçici önceliğini işleyen CSS parser
      • Kalıtımı destekleyen cascade engine
      • Box model layout ve Canvas 2D renderer
    • Aynı markup’ın 9 örneğini kendi canvas’ı ve tarayıcı iframe’i içinde yan yana gösteren bir uygulamayla tamamladı
    • Tam yürütme izi yayımlandı
  • Kendi agent harness’ini optimize etme

    • Benchmark’ı ölçümleyen otomatik araştırma döngüsünde her değişiklikten sonra performansı ölçtü ve yalnızca iyileşme doğrulanan değişiklikleri koruyacak şekilde sınırlandı
    • Birkaç saat içinde harness’i %5,2 hızlandırdı ve bellek ayırmayı yaklaşık %70 azalttı
    • Başlıca optimizasyonlar şunlardı
      • Streaming token biriktirmede kullanılan O(n²) string birleştirmeyi buffer ile değiştirdi
      • İz somutlaştırma sürecindeki yinelenen kopyalamaları memoization ile kaldırdı
      • Slice’ları doğru boyutta önceden ayırarak aşırı ayırmayı azalttı
    • Hız farkını ölçmek zorlaşınca odağı daha doğru ölçülebilen bellek ayırma optimizasyonuna çevirdi
    • Kullanılan benchmark tam bir production testi olmasa da nihai sonucu Go race detector ve go vet gate’leriyle doğruladı, çıktının davranışını kontrol etti
    • Tam yürütme izi sağlandı
  • Erdős problemi #397’yi yeniden keşfetme

    • 1975’te Erdős, Graham, Ruzsa ve Straus’un önerdiği Erdős problemi #397 için sonsuz çözüm kümesi üreten bir yapıyı bağımsız olarak buldu
    • Bu problem 50 yıldan uzun süre çözümsüz kaldıktan sonra Ocak 2026’da GPT-5.2 Pro tarafından önce çözülmüş olduğundan bu ilk çözüm değil, yeniden keşiftir
    • Modelin bilgi kesim tarihi Kasım 2025; sandbox’ta Python olmayınca Perl’i bulup 68 dakika çalıştı
    • Çözüm süreci şöyleydi
      • Tam asal çarpanlara ayırmayı brute force ile aradı
      • Deseni analiz edip çözüm kümesini tahmin etti
      • 8 indeksten oluşan kapalı biçimli sonsuz çözüm kümesini kanıtladı
    • Bulduğu formül tüm n ≥ 0 için şöyledir
    B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n)
    = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)
    
    • Mevcut 6 indeksli çözüm kümelerinden farklı olarak doğrusal artan 8 indeksli yapı kullanır
    • Tam yürütme izi yayımlandı

Akıl yürütme modları ve performans farkı

  • Akıl yürütme modları off ve varsayılan olan max olmak üzere ikidir
    • max, probleme özel akıl yürütme ve test zamanı hesaplama bütçesini modelin belirlemesini sağlar
    • Saatler ve yüz binlerce token boyunca tutarlı akıl yürütmeyi sürdürdüğü örnekler gözlemlendi
  • max thinking kullanımı performansı ciddi ölçüde artırıyor
    • Terminal-Bench 2.1: %60,4 → %70,2
    • DeepSWE: %16,5 → %40,4
  • Yayım anında low·medium·high biçiminde kullanıcı tanımlı akıl yürütme yoğunluğu kontrolü sunulmuyor
  • pool içinde oturum bazında /thought-level komutuyla thinking kullanımını açıp kapatmak mümkün

Bilinen kısıtlar

  • Harness’e aşırı uyum nedeniyle Hermes Agent’ın terminal aracı gibi kendi harness’ine benzeyen ama ayrıntılı şartnamesi farklı araçlar ilk çağrıldığında önceki arayüz belleğine dayanabilir
    • Harness hatalı çağrıyı reddedip yeniden deneme istediğinde bağlam içi öğrenmeyle genellikle çözülür
  • XML’e benzer etiket tabanlı araç çağrı biçimi kullanır; argüman JSON dizisi gerektirdiğinde hatalı escape edilmiş veya geçersiz JSON üretebilir
  • Özellikle yarışma matematiği problemlerinde ilerleme olmadan aşırı uzun süre akıl yürütebilir
    • Sonraki modellere akıl yürütme yoğunluğu kontrolü ve akıl yürütme verimliliği iyileştirmeleri eklenmesi planlanıyor

Performans artışını sağlayan eğitim değişiklikleri

  • Model boyutundan çok çalışma biçimini iyileştirme

    • Amaç yalnızca zekâyı artırmak değil, daha çok doğrulayan, varsayımları sorgulayan ve başarıyı erken ilan etmeyen davranışı güçlendirmektir
    • Önceki Laguna modelleri testlerin bir kısmı geçince tamamlandı diyebiliyor veya başarıdan hemen önce yaklaşımı bırakabiliyordu; S 2.1 ise çalışmaya devam ediyor
    • Ham zekâdan bağımsız olarak ısrarcılık, doğrulama ve geri dönmeye istekliliği önemli performans eksenleri olarak görüyor ve ikisine de yatırım yapıyor
    • Bir sonraki büyük Laguna modelinin ön eğitimi şimdiden başladı
  • Ön eğitim ve post-training

    • Laguna XS 2.1 ile aynı ön eğitim verilerini kullanan ölçeklendirilmiş bir modeldir
    • XS 2.1’den farkları ölçek, eğitim kodu düzeltmeleri ve küçük eğitim reçetesi değişiklikleridir; yeni veri değildir
    • RL ilk kez FP8 hassasiyetinde yapılarak bu eğitim aşaması hızlandırıldı
    • Post-training iki aşamada yürütüldü
      • Bir miktar sentetik veri kullanan supervised fine-tuning (SFT) ile yetenekler başlatıldı
      • Henüz yüksek geçiş oranıyla çözülemeyen işlere RL uygulandı
    • Uzun süreli agent oturumları yüz binlerce token’lık çalışma bağlamı biriktirdiğinden 1M bağlam genişletmesi zor işlerin performansını artırıyor
  • Post-training iş bileşimi

    • Eğitim derlemi agent ve agent dışı ortamlardan oluşan 409.000 iş içeriyor
      • Terminal kullanım ortamı 83.000
      • Genel yazılım mühendisliği işi 168.000
    • İşler açık kaynak depolar, dahili sentetik veri, otomatik bağımlılık kurulum sistemi ve dış veri tedarikçisi satın alımlarıyla sağlandı
    • Yazılım mühendisliği işleri çoğunlukla gerçek kod geçmişine dayanıyor
      • Yaklaşık 17.000 depodaki gerçek commit’leri yeniden üretmeye dayalı yaklaşık 38.000 iş en büyük paya sahip
      • Birleştirilmiş PR’ları yeniden üretme, enjekte edilmiş bug düzeltme ve test suite’lerini esas alarak silinmiş dosyaları kurtarma işleri de içeriyor
    • S 2.1’e, bir deponun tüm bağımlılıklarını kurup test suite’ini çalıştıran agent depo kurulumu işleri eklendi
    • Terminal işleri, seed’de görülmeyen ortamlar ve görevler üreten veri kümelerini kullanıyor
  • Eğitim döngüsü iyileştirmeleri

    • Önceki modellere kıyasla zaman sınırı, tur başına token ve iş başına tur sayısı artırılmış daha büyük rollout bütçesi uygulandı
    • RL yeni bir sandbox servisine taşınarak şu özelliklerden yararlanıldı
      • Arka plan süreçlerini destekler
      • Seçmeli ağ engelleme ile ödül hackleme yüzeyini azaltır
      • Çıktı cache’leme ile dış servislerin aşırı yüklenmesini önler
    • Aynı prompt birden çok agent harness’inde çalıştırılarak tek bir scaffold’a değil, çeşitli harness’lerde işe yarayan davranışlar öğretildi

Poolside’ın odaklandığı iki yön

  • İlki agent kodlama yetkinliğidir
    • Kodlama ve yazılımın esnek arayüzünü zekâya giden bir yol olarak görüyor
    • Modelin bir agent olarak yazılım kullanıp saatler veya günler boyunca tutarlı çalıştığı örneklere odaklanıyor
  • İkincisi, web’de kayıtlı yanıtlardan o yanıtlara ulaşan düşünme sürecinin pekiştirmeli öğrenmeyle yeniden kurulabileceği yaklaşımıdır
    • Bu sürüm ilk yönün sonucudur; ikinci yön geliştirilmeye devam ediyor

Model Factory ve geliştirme döngüsü

  • Dahili araştırma ve mühendislik platformu Model Factory ile veri, mimari disiplin deneyleri ve değerlendirme altyapısı gibi model geliştirme süreçlerini otomatikleştiriyor
  • Laguna M.1 yayımlandıktan sonra 3 aydan kısa sürede, çalıştırma boyutu yarı yarıya daha küçük ama daha güçlü bir model geliştirdi
  • Araştırma iterasyonu ve entegrasyon hızını artırmaya, araştırmacıların defter tutma ve altyapıya ayırdığı dikkati azaltmaya yatırım yapıyor
  • Önümüzdeki 1 yıl boyunca aynı geliştirme yöntemini daha büyük modellere uygulamayı planlıyor

Dağıtım ve kullanım

  • Hugging Face üzerinde OpenMDW-1.1 lisansıyla yayımlandı
    • BF16, FP8, INT4, NVFP4 ağırlıkları sağlanıyor
    • Resmî GGUF·MLX dönüştürmeleri ve DFlash draft modeli sunuluyor
  • NVIDIA donanımı için TRT-LLM serving, Blackwell’de NVFP4 ve tek DGX Spark’a kadar çıkarım optimizasyonu destekleniyor
  • Yerel ve açık serving vLLM, SGLang, Ollama tarafından destekleniyor
  • Hosting erişim yolları şöyle
  • OpenRouter ücretsiz endpoint’i 256K bağlam sağlıyor
    • Özel ücretli endpoint 1M bağlamı destekliyor
    • 1 milyon token başına giriş $0.10, çıkış $0.20, cache okuma $0.01
  • Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline ve terminal kodlama agent’ı pool üzerinden de kullanılabiliyor
  • Post-training için NVIDIA NeMo AutoModel ve Prime Intellect Prime Lab destekleniyor; ZML LLMD ise çeşitli donanımlarda çalıştırmayı destekliyor
  • Geliştirici olmayan kullanıcılar giriş yapmadan chat.poolside.ai üzerinden web arama ve temel kod çalıştırma özelliklerini kullanabilir
  • Post-training öncesi temel model ağırlıkları e-posta talebiyle sağlanıyor

Benchmark çalıştırma koşulları

  • Dahili Harbor Framework fork’u ve pool agent harness, en fazla 500 adım ve dahili sandbox kullanıldı
  • SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1 için iş başına 4 çalıştırmanın ortalama pass@1 değeri kullanıldı
  • DeepSWE v1.1 ve SWE Atlas için iş başına 3 çalıştırma, Toolathlon Verified için 3 çalıştırma ortalaması uygulandı
  • SWE Atlas’ta açık metodoloji aynen uygulandı ve Opus 4.5 ile karar verildi
  • Toolathlon Verified, EC2 üzerinde çoğaltılmış harness ve özel agent kullandı; resmî sürümden farklı olarak her değerlendirme çalıştırmasından sonra ortam tamamen sıfırlanıp geri yüklendi
  • Sandbox kesintisini önlemek için CPU, bellek ve depolama sınırları benchmark’a göre ayarlandı; en az 2 CPU çekirdeği, 8GB bellek ve 25GB depolama garanti edildi
  • Tekil iş düzeltmeleri teknik raporda özetlenmiştir

1 yorum

 
GN⁺ 5 시간 전
Hacker News görüşleri
  • Şu anda test ediyorum; en azından DS4-Flash ile rekabet edecek seviyede görünüyor. Küçük ama anlam yoğunluğu çok yüksek bir C test kod tabanında daha önce yalnızca gpt-5.2'nin bulduğu bir sorunu yakaladı, ama memfd_create()/mmap'in IPC için kullanıldığı gibi saçma bir yanlış yargıya da vardı ve Sol da ben işaret edene kadar bunu kaçırdı
    DeepSeek V4 ile karşılaştırma, hem Flash hem de Pro yakında yeterli ek eğitimden geçip resmi olarak yayımlanacağı için şu anki gibi hızlı değişen bir ortamda çok kısa sürede değişebilir. Umarım bu tür modeller gelmeye devam eder
    • Hangi test harness'i ve quantization yönteminin kullanıldığını merak ediyorum
  • Müthiş; bugün çıkanlar arasında açık ara öne çıkıyor ve Google'ın yeni ürünlerini eziyor. Özellikle fiyat/performans açısından şaşırtıcı derecede rekabetçi ve DeepSeek V4 Flash ile boy ölçüşebilecek ilk ABD yapımı model olduğu için beklentim yüksek
  • Bu model şaka değil; şimdiden gerçek işte kullanılabilecek bir PR üretti
    https://github.com/mozilla-ai/otari/pull/348
  • Etkileyici ve bu boyutta olması, gerçekçi ev tipi donanımda da çalıştırılabileceğini düşündürüyor. Performans kaybını kabul etsem bile 64GB ortam için bir quantization sürümü çıkmasını isterim
    Qwen 3.5 122B'nin 2 bit sürümü için de fena olmadığı söylenmişti ve bu model daha yüksek bir başlangıç noktasına sahip, dolayısıyla denemeye değer. Zaten üzerinde çalışan biri var: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
  • 118B parametreli, yalnızca 8B'si etkin MoE, uzun bağlamda muhakeme ve açık ağırlıklar; sevindirici bir kombinasyon. Bu laboratuvarı ilk kez duyuyorum ama model boyutu ile performansın en iyi dengesine yakın görünüyor, o yüzden mutlaka denemek istiyorum
    • Açıklanan performans rakamları doğruysa, sonunda beklediğim model gelmiş demektir
  • Gerçekçi self-hosting, yeterli zeka ve sınırlı bellek bant genişliğinde bile hızlı MoE sunan orta sınıf bir model tam da ihtiyacım olan şeydi
    Şimdiye kadar Strix Halo üzerinde, çift 32GB GPU masaüstünde çalışan Gemma 4 veya Qwen 3.6 dense modellerinden belirgin biçimde daha iyi bir seçenek yoktu; bu model ise gerçekten performans artışı sağlayabilecek bir boyutta görünüyor
  • Modeli test ederken dikkatli olmak gerekiyor. Varsayılan ayarlarda muhakeme özelliği düzgün etkinleşmiyor, bu da sonuçlardan hayal kırıklığına uğramaya ya da benchmark'ların abartılı olduğunu düşünmeye yol açabilir
    vLLM çalıştırma ayarına --default-chat-template-kwargs '{"enable_thinking": true}' eklemekle de etkinleşmedi; ayrıca birlikte gelen generation_config.json içindeki varsayılan max_new_tokens değeri 32k olduğu için muhakemeyi kesiyor gibi görünüyor, bu yüzden artırılması gerekiyor. Muhakemeyi açınca kod kalitesi ciddi biçimde iyileşti; gerçek iş yüklerinde ek doğrulama yine de gerekli
    https://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
    • Bu gönderi yayımlandıktan hemen sonra, Hugging Face'teki varsayılan sohbet şablonunun muhakemeyi varsayılan olarak etkinleştirecek şekilde düzeltildiği anlaşılıyor
    • OpenRouter'ın resmi olarak sunduğu modelde de aynı sorun var gibi; umarım kolayca düzeltilir
    • Çalıştırma ayarlarını değiştirince sonuçlar ciddi biçimde farklılaştı
  • 128B modelin, 1.6T ölçekli DeepSeek V4'ü çoğu kodlama benchmark'ında geçmesi çok etkileyici bir sinyal
    Poolside'ın sadece benzer ölçekteki modellerle değil, 2.5T Kimi-K3 gibi çok daha büyük üst düzey açık ağırlıklı modellerle de karşılaştırma yapmasını beğeniyorum. Keşke Mistral ve diğerleri de böyle yapsa
  • Yaklaşık bir hafta önce yerel kodlama harness'i pool ve 33B MoE modelini keşfederken Poolside'ı ilk kez duydum. Eski bir 32GB Mac mini'de bile hızlı ve etkili çalıştı; büyük host edilen modellerini de değerlendirmeyi düşünüyorum
  • Sayfada yönlendirilen Poolside sohbeti burada kullanılabiliyor: https://chat.poolside.ai