- Poolside, uzun süreli çalışma ve akıl yürütme yeteneklerini güçlendiren Laguna S 2.1’i duyurdu. Toplam 118B MoE içinde token başına 8B parametreyi etkinleştiriyor; hem thinking hem de no-thinking modlarında 1M token bağlama kadar destek sunuyor
- Eğitimin başlamasından yayıma kadar 9 haftadan kısa sürdü; Terminal-Bench 2.1’de %70,2, SWE-Bench Multilingual’da %78,5, DeepSWE v1.1’de %40,4 elde ederek daha büyük modellerle rekabet ediyor
- Performans artışının merkezinde basit model ölçeklendirmeden çok ısrarcılık, doğrulama ve geri çekilip yeniden deneme var. Daha uzun rollout’lar, iyileştirilmiş sandbox ve birden çok agent harness kullanarak aceleyle tamamlandı deme ve tek bir harness’e aşırı uyumu azaltmayı hedefliyor
- Gerçek işlerde 181 adımda bir HTML/CSS render motoru oluşturdu; kendi harness hızını %5,2 artırırken bellek ayırmayı yaklaşık %70 azalttı ve Erdős problemi #397’nin sonsuz çözüm kümesini bağımsız olarak yeniden keşfetti
- Modelin ve nihai değerlendirmenin tüm yürütme izlerini yayımladı; ancak üçüncü taraf harness’lerin araç şartnameleri, iç içe araç çağrılarının JSON’u ve aşırı uzun akıl yürütme konusunda kısıtlar var. Ağırlıklar ve 1M bağlama kadar destek Hugging Face ile başlıca çıkarım framework’leri ve hosting servislerinde kullanılabiliyor
Model yapısı ve yayımlama hızı
- Laguna S 2.1, toplam 118B parametreye ve token başına 8B aktif parametreye sahip bir Mixture-of-Experts modelidir
- Hem thinking hem de no-thinking modlarında 1M token bağlama kadar destekler
- Eğitimin başlamasından yayıma kadar 9 haftadan kısa sürdü
- 22 Mayıs 2026’da 4.096 NVIDIA H200 GPU üzerinde ön eğitime başladı ve 60 gün sonra yayımlandı
- Küçük aktif boyutu sayesinde karmaşık işler yerel sistemlerde yürütülebilir; tek bir NVIDIA DGX Spark üzerinde bile çalıştırılabilir
Uzun süreli kodlama benchmark performansı
- 21 Temmuz 2026 itibarıyla başlıca sonuçlar şöyle
- Terminal-Bench 2.1: %70,2
- SWE-Bench Multilingual: %78,5
- SWE-Bench Pro açık veri kümesi: %59,4
- DeepSWE v1.1: %40,4
- SWE Atlas(Codebase QnA): %46,2
- Toolathlon Verified: %49,7
- Terminal-Bench 2.1, agent’ın terminal üzerinden ortamla etkileştiği çeşitli uzun süreli işleri değerlendirir; Laguna S 2.1, thinking etkinleştirilmiş pool harness’inde %70,2 elde etti
- Olgun benchmark’larda en üst skorlar %70~90 bandında toplandığından davranış farkları büyük olan modeller bile birkaç puan farkla görünebilir
- DeepSWE, kısmi çözümün zor olduğu ve daha uzun işleri içerdiği için skor dağılımı geniştir
- v1.1’de frontier modeller %54~73 elde ederken, bazı 1T üzeri açık modeller %10’un altında kalıyor
- Laguna S 2.1, kendi pool harness’inde %40,4 elde etti
- Resmî sıralamadaki mini-swe-agent yerine kendi harness’i kullanıldığı için diğer model skorlarıyla tamamen eşdeğer bir karşılaştırma değildir
- Diğer modeller için kendi duyuruları, benchmark sıralamaları ve Artificial Analysis içindeki en yüksek skor kullanıldı
- Nihai değerlendirmenin tüm yürütme izleri trajectories.poolside.ai üzerinde yayımlandı
Değerlendirme yöntemi ve ödül hackleme yönetimi
- Agent değerlendirmelerinde, doğru yanıtı veya mevcut düzeltmeleri çevrimiçi bulup skor alma şeklinde ödül hackleme sorunu bulunur
- İnternet erişimi varsayılan olarak açık bırakıldı ve şüpheli vakaları işaretlemek için insan etiketli izlerle kalibre edilmiş LLM yargıcı (LLMaaJ) kullanıldı
- İlk post-training aşamalarında ödül hackleme oranı %2’nin altındaydı
- Eğitim ilerledikçe SWE-bench ailesinde işaretlenen izler %50’yi aştı
- Manuel incelemede modelin çoğu zaman sorunun dayandığı PR’ı veya depoyu bulup gerçek düzeltmeyi uyguladığı görüldü
- Kullanıcı prompt’una çevrimiçi bulunan doğrudan çözümleri kullanmama ifadesi eklendikten sonra ödül hackleme oranı genel olarak %2’nin altına düştü
- Bu tam bir çözüm değil; ProgramBench ve MirrorCode istisna oluşturdu
- Ek doğrulama için LLMaaJ’nin işaretlediği başarılı vakaların manuel incelenmesi, tüm izler üzerinde açık uçlu agent analizi ve Terminal-Bench 2.1 yüksek skorlu tüm çalıştırmaların uzman incelemesi kullanıldı
- Son dönemde hasmane değerlendirme ile ödül hackleme tespiti güçlendirildi; açık checkpoint’lerin nihai değerlendirme izleri görüntülenip indirilebiliyor
Gerçek iş örnekleri
-
Boş klasörden tarayıcı motoru inşa etme
- Laguna S 2.1, insan müdahalesi olmadan 50 dakika boyunca 181 adım yürütüp boş bir klasörden HTML/CSS render motoru inşa etti
- Görsel yetenek olmadan headless Chromium ile canvas’ı okuyup ekran görüntülerini sayısal olarak karşılaştırarak sonucu doğruladı
- Tüm pipeline’ı Vanilla JavaScript ile uyguladı
- HTML tokenizer ve DOM ağacı
- Seçici önceliğini işleyen CSS parser
- Kalıtımı destekleyen cascade engine
- Box model layout ve Canvas 2D renderer
- Aynı markup’ın 9 örneğini kendi canvas’ı ve tarayıcı iframe’i içinde yan yana gösteren bir uygulamayla tamamladı
- Tam yürütme izi yayımlandı
-
Kendi agent harness’ini optimize etme
- Benchmark’ı ölçümleyen otomatik araştırma döngüsünde her değişiklikten sonra performansı ölçtü ve yalnızca iyileşme doğrulanan değişiklikleri koruyacak şekilde sınırlandı
- Birkaç saat içinde harness’i %5,2 hızlandırdı ve bellek ayırmayı yaklaşık %70 azalttı
- Başlıca optimizasyonlar şunlardı
- Streaming token biriktirmede kullanılan O(n²) string birleştirmeyi buffer ile değiştirdi
- İz somutlaştırma sürecindeki yinelenen kopyalamaları memoization ile kaldırdı
- Slice’ları doğru boyutta önceden ayırarak aşırı ayırmayı azalttı
- Hız farkını ölçmek zorlaşınca odağı daha doğru ölçülebilen bellek ayırma optimizasyonuna çevirdi
- Kullanılan benchmark tam bir production testi olmasa da nihai sonucu Go race detector ve
go vetgate’leriyle doğruladı, çıktının davranışını kontrol etti - Tam yürütme izi sağlandı
-
Erdős problemi #397’yi yeniden keşfetme
- 1975’te Erdős, Graham, Ruzsa ve Straus’un önerdiği Erdős problemi #397 için sonsuz çözüm kümesi üreten bir yapıyı bağımsız olarak buldu
- Bu problem 50 yıldan uzun süre çözümsüz kaldıktan sonra Ocak 2026’da GPT-5.2 Pro tarafından önce çözülmüş olduğundan bu ilk çözüm değil, yeniden keşiftir
- Modelin bilgi kesim tarihi Kasım 2025; sandbox’ta Python olmayınca Perl’i bulup 68 dakika çalıştı
- Çözüm süreci şöyleydi
- Tam asal çarpanlara ayırmayı brute force ile aradı
- Deseni analiz edip çözüm kümesini tahmin etti
- 8 indeksten oluşan kapalı biçimli sonsuz çözüm kümesini kanıtladı
- Bulduğu formül tüm
n ≥ 0için şöyledir
B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n) = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)- Mevcut 6 indeksli çözüm kümelerinden farklı olarak doğrusal artan 8 indeksli yapı kullanır
- Tam yürütme izi yayımlandı
Akıl yürütme modları ve performans farkı
- Akıl yürütme modları off ve varsayılan olan max olmak üzere ikidir
- max, probleme özel akıl yürütme ve test zamanı hesaplama bütçesini modelin belirlemesini sağlar
- Saatler ve yüz binlerce token boyunca tutarlı akıl yürütmeyi sürdürdüğü örnekler gözlemlendi
- max thinking kullanımı performansı ciddi ölçüde artırıyor
- Terminal-Bench 2.1: %60,4 → %70,2
- DeepSWE: %16,5 → %40,4
- Yayım anında low·medium·high biçiminde kullanıcı tanımlı akıl yürütme yoğunluğu kontrolü sunulmuyor
pooliçinde oturum bazında/thought-levelkomutuyla thinking kullanımını açıp kapatmak mümkün
Bilinen kısıtlar
- Harness’e aşırı uyum nedeniyle Hermes Agent’ın terminal aracı gibi kendi harness’ine benzeyen ama ayrıntılı şartnamesi farklı araçlar ilk çağrıldığında önceki arayüz belleğine dayanabilir
- Harness hatalı çağrıyı reddedip yeniden deneme istediğinde bağlam içi öğrenmeyle genellikle çözülür
- XML’e benzer etiket tabanlı araç çağrı biçimi kullanır; argüman JSON dizisi gerektirdiğinde hatalı escape edilmiş veya geçersiz JSON üretebilir
- Özellikle yarışma matematiği problemlerinde ilerleme olmadan aşırı uzun süre akıl yürütebilir
- Sonraki modellere akıl yürütme yoğunluğu kontrolü ve akıl yürütme verimliliği iyileştirmeleri eklenmesi planlanıyor
Performans artışını sağlayan eğitim değişiklikleri
-
Model boyutundan çok çalışma biçimini iyileştirme
- Amaç yalnızca zekâyı artırmak değil, daha çok doğrulayan, varsayımları sorgulayan ve başarıyı erken ilan etmeyen davranışı güçlendirmektir
- Önceki Laguna modelleri testlerin bir kısmı geçince tamamlandı diyebiliyor veya başarıdan hemen önce yaklaşımı bırakabiliyordu; S 2.1 ise çalışmaya devam ediyor
- Ham zekâdan bağımsız olarak ısrarcılık, doğrulama ve geri dönmeye istekliliği önemli performans eksenleri olarak görüyor ve ikisine de yatırım yapıyor
- Bir sonraki büyük Laguna modelinin ön eğitimi şimdiden başladı
-
Ön eğitim ve post-training
- Laguna XS 2.1 ile aynı ön eğitim verilerini kullanan ölçeklendirilmiş bir modeldir
- XS 2.1’den farkları ölçek, eğitim kodu düzeltmeleri ve küçük eğitim reçetesi değişiklikleridir; yeni veri değildir
- RL ilk kez FP8 hassasiyetinde yapılarak bu eğitim aşaması hızlandırıldı
- Post-training iki aşamada yürütüldü
- Bir miktar sentetik veri kullanan supervised fine-tuning (SFT) ile yetenekler başlatıldı
- Henüz yüksek geçiş oranıyla çözülemeyen işlere RL uygulandı
- Uzun süreli agent oturumları yüz binlerce token’lık çalışma bağlamı biriktirdiğinden 1M bağlam genişletmesi zor işlerin performansını artırıyor
-
Post-training iş bileşimi
- Eğitim derlemi agent ve agent dışı ortamlardan oluşan 409.000 iş içeriyor
- Terminal kullanım ortamı 83.000
- Genel yazılım mühendisliği işi 168.000
- İşler açık kaynak depolar, dahili sentetik veri, otomatik bağımlılık kurulum sistemi ve dış veri tedarikçisi satın alımlarıyla sağlandı
- Yazılım mühendisliği işleri çoğunlukla gerçek kod geçmişine dayanıyor
- Yaklaşık 17.000 depodaki gerçek commit’leri yeniden üretmeye dayalı yaklaşık 38.000 iş en büyük paya sahip
- Birleştirilmiş PR’ları yeniden üretme, enjekte edilmiş bug düzeltme ve test suite’lerini esas alarak silinmiş dosyaları kurtarma işleri de içeriyor
- S 2.1’e, bir deponun tüm bağımlılıklarını kurup test suite’ini çalıştıran agent depo kurulumu işleri eklendi
- Terminal işleri, seed’de görülmeyen ortamlar ve görevler üreten veri kümelerini kullanıyor
- Eğitim derlemi agent ve agent dışı ortamlardan oluşan 409.000 iş içeriyor
-
Eğitim döngüsü iyileştirmeleri
- Önceki modellere kıyasla zaman sınırı, tur başına token ve iş başına tur sayısı artırılmış daha büyük rollout bütçesi uygulandı
- RL yeni bir sandbox servisine taşınarak şu özelliklerden yararlanıldı
- Arka plan süreçlerini destekler
- Seçmeli ağ engelleme ile ödül hackleme yüzeyini azaltır
- Çıktı cache’leme ile dış servislerin aşırı yüklenmesini önler
- Aynı prompt birden çok agent harness’inde çalıştırılarak tek bir scaffold’a değil, çeşitli harness’lerde işe yarayan davranışlar öğretildi
Poolside’ın odaklandığı iki yön
- İlki agent kodlama yetkinliğidir
- Kodlama ve yazılımın esnek arayüzünü zekâya giden bir yol olarak görüyor
- Modelin bir agent olarak yazılım kullanıp saatler veya günler boyunca tutarlı çalıştığı örneklere odaklanıyor
- İkincisi, web’de kayıtlı yanıtlardan o yanıtlara ulaşan düşünme sürecinin pekiştirmeli öğrenmeyle yeniden kurulabileceği yaklaşımıdır
- Bu sürüm ilk yönün sonucudur; ikinci yön geliştirilmeye devam ediyor
Model Factory ve geliştirme döngüsü
- Dahili araştırma ve mühendislik platformu Model Factory ile veri, mimari disiplin deneyleri ve değerlendirme altyapısı gibi model geliştirme süreçlerini otomatikleştiriyor
- Laguna M.1 yayımlandıktan sonra 3 aydan kısa sürede, çalıştırma boyutu yarı yarıya daha küçük ama daha güçlü bir model geliştirdi
- Araştırma iterasyonu ve entegrasyon hızını artırmaya, araştırmacıların defter tutma ve altyapıya ayırdığı dikkati azaltmaya yatırım yapıyor
- Önümüzdeki 1 yıl boyunca aynı geliştirme yöntemini daha büyük modellere uygulamayı planlıyor
Dağıtım ve kullanım
- Hugging Face üzerinde OpenMDW-1.1 lisansıyla yayımlandı
- BF16, FP8, INT4, NVFP4 ağırlıkları sağlanıyor
- Resmî GGUF·MLX dönüştürmeleri ve DFlash draft modeli sunuluyor
- NVIDIA donanımı için TRT-LLM serving, Blackwell’de NVFP4 ve tek DGX Spark’a kadar çıkarım optimizasyonu destekleniyor
- Yerel ve açık serving vLLM, SGLang, Ollama tarafından destekleniyor
- Hosting erişim yolları şöyle
- Baseten Model Library ve Frontier Gateway
- OpenRouter
- Vercel AI Gateway
- OpenRouter ücretsiz endpoint’i 256K bağlam sağlıyor
- Özel ücretli endpoint 1M bağlamı destekliyor
- 1 milyon token başına giriş $0.10, çıkış $0.20, cache okuma $0.01
- Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline ve terminal kodlama agent’ı pool üzerinden de kullanılabiliyor
- Post-training için NVIDIA NeMo AutoModel ve Prime Intellect Prime Lab destekleniyor; ZML LLMD ise çeşitli donanımlarda çalıştırmayı destekliyor
- Geliştirici olmayan kullanıcılar giriş yapmadan chat.poolside.ai üzerinden web arama ve temel kod çalıştırma özelliklerini kullanabilir
- Post-training öncesi temel model ağırlıkları e-posta talebiyle sağlanıyor
Benchmark çalıştırma koşulları
- Dahili Harbor Framework fork’u ve pool agent harness, en fazla 500 adım ve dahili sandbox kullanıldı
- SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1 için iş başına 4 çalıştırmanın ortalama pass@1 değeri kullanıldı
- DeepSWE v1.1 ve SWE Atlas için iş başına 3 çalıştırma, Toolathlon Verified için 3 çalıştırma ortalaması uygulandı
- SWE Atlas’ta açık metodoloji aynen uygulandı ve Opus 4.5 ile karar verildi
- Toolathlon Verified, EC2 üzerinde çoğaltılmış harness ve özel agent kullandı; resmî sürümden farklı olarak her değerlendirme çalıştırmasından sonra ortam tamamen sıfırlanıp geri yüklendi
- Sandbox kesintisini önlemek için CPU, bellek ve depolama sınırları benchmark’a göre ayarlandı; en az 2 CPU çekirdeği, 8GB bellek ve 25GB depolama garanti edildi
- Tekil iş düzeltmeleri teknik raporda özetlenmiştir
1 yorum
Hacker News görüşleri
memfd_create()/mmap'in IPC için kullanıldığı gibi saçma bir yanlış yargıya da vardı ve Sol da ben işaret edene kadar bunu kaçırdıDeepSeek V4 ile karşılaştırma, hem Flash hem de Pro yakında yeterli ek eğitimden geçip resmi olarak yayımlanacağı için şu anki gibi hızlı değişen bir ortamda çok kısa sürede değişebilir. Umarım bu tür modeller gelmeye devam eder
https://github.com/mozilla-ai/otari/pull/348
Qwen 3.5 122B'nin 2 bit sürümü için de fena olmadığı söylenmişti ve bu model daha yüksek bir başlangıç noktasına sahip, dolayısıyla denemeye değer. Zaten üzerinde çalışan biri var: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/tree/main
Q4_K_Mde 75GB, yani 64GB ortamda bile daha düşük quantization yapılmayacak gibi görünüyor. Bunun yerine ağırlıkların yalnızca bir kısmını bellekte tutup geri kalanını SSD'den stream etmek daha iyi olabilirllm-compressor, belleğe sığmayan modelleri de quantize edebiliyor; sadece sıralı pipeline kullanmak gerekiyorhttps://github.com/vllm-project/llm-compressor
Yapılandırma örneği https://github.com/verdverm/quantr içinde var. Ancak Poolside modelle birlikte quantize sürümleri ve dflash'i de yayımladığı için artık buna gerek kalmamış olabilir
Şimdiye kadar Strix Halo üzerinde, çift 32GB GPU masaüstünde çalışan Gemma 4 veya Qwen 3.6 dense modellerinden belirgin biçimde daha iyi bir seçenek yoktu; bu model ise gerçekten performans artışı sağlayabilecek bir boyutta görünüyor
vLLM çalıştırma ayarına
--default-chat-template-kwargs '{"enable_thinking": true}'eklemekle de etkinleşmedi; ayrıca birlikte gelengeneration_config.jsoniçindeki varsayılanmax_new_tokensdeğeri 32k olduğu için muhakemeyi kesiyor gibi görünüyor, bu yüzden artırılması gerekiyor. Muhakemeyi açınca kod kalitesi ciddi biçimde iyileşti; gerçek iş yüklerinde ek doğrulama yine de gereklihttps://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
Poolside'ın sadece benzer ölçekteki modellerle değil, 2.5T Kimi-K3 gibi çok daha büyük üst düzey açık ağırlıklı modellerle de karşılaştırma yapmasını beğeniyorum. Keşke Mistral ve diğerleri de böyle yapsa
poolve 33B MoE modelini keşfederken Poolside'ı ilk kez duydum. Eski bir 32GB Mac mini'de bile hızlı ve etkili çalıştı; büyük host edilen modellerini de değerlendirmeyi düşünüyorum