- Echo, GLM-5.2, Kimi K2.7 gibi birden fazla açık ağırlıklı modeli istek bazında birleştirerek, tüm işleri tek bir modele yükleme yaklaşımının sınırlarını tamamlıyor
- Her istek için hesaplama miktarını ve katılacak modelleri belirleyip sonuçları birleştirme yöntemini de ayarlayarak, basit prompt’larda daha az çıkarım kaynağı kullanıyor
- İlk değerlendirme kurulumunda havuzdaki en iyi tekil modeli tutarlı biçimde geride bıraktı ve Fable’a benzer genel sonuçları yaklaşık üçte bir çıkarım maliyetiyle elde etti
- Genel olarak daha zayıf modeller bile belirli sorunlarda veya kombinasyonlarda işe yarayacak kadar birbirini tamamlayan yeteneklere sahip; ancak tahsis ve birleştirme kararlarının hatalı verildiği örnekler hâlâ var
- Sohbet arayüzü ve OpenAI uyumlu API yayımlandı; kalite ölçümünün daha zor olduğu kodlama ve ajan görevlerinde de aynı yaklaşımın geçerli olup olmadığı test ediliyor
Model seçimi ve sonuç birleştirme
- İlk deneylerde GLM-5.2, Kimi K2.7 vb. aynı değerlendirmeye sokuldu ve her problem için yararlı model ile uygun çıktı birleştirme yönteminin önceden bilindiği varsayılarak sonuçlar ölçüldü
- Bu varsayımsal sistem, havuza dahil edilen tüm tekil modellerden çok daha yüksek performans gösterdi
- İyi kararlar ancak sonuçlar görüldükten sonra belirlenebildiği için gerçek dağıtımda kullanılamıyor; Echo ise ön bilgi olmadan bu avantajın bir kısmını geri kazanma girişimi
- İsteğin özelliklerine göre gerekli hesaplama miktarını, katılacak modelleri ve sonuç birleştirme yöntemini seçiyor
- Basit prompt’lara görece daha az çıkarım ayırıyor
- Diğer problemlerde ise birden fazla modelin farklı bölümleri işleyeceği şekilde yapılandırıyor
- Modellerin yetenekleri birbirini tamamlayıcı nitelikte; bu nedenle genel performansı belirgin biçimde daha düşük olan bir model bile belirli problemlerde veya kombinasyonlarda çok yararlı olabiliyor
Değerlendirme sonuçları ve herkese açık test
- İlk değerlendirme kurulumunda en iyi tekil modelden tutarlı biçimde daha yüksek performans kaydetti ve karşılaştırma noktası olan Fable ile yaklaşık aynı genel sonuçları yaklaşık üçte bir maliyetle elde etti
- Bazı isteklerde hesaplama tahsisi veya model birleştirme kararını yanlış veriyor; şu anda bu başarısızlık örnekleri analiz ediliyor
- Kodlama ve ajan görevlerinde her kararın kalitesini ölçmek çok daha zor olduğundan, aynı yaklaşımın sürüp sürmediği ayrıca test ediliyor
- Dış testler için Echo sohbet arayüzü ve OpenAI uyumlu API sunuluyor
- Çalışma biçimini tanıtan video ile değerlendirme metodolojisi, tekil model sonuçları, maliyet ve mevcut sınırlamalar yayımlandı; olağandışı başarısızlıklar veya sezgisel görünmeyen kaynak tahsisi örnekleri için geri bildirim isteniyor
1 yorum
Hacker News görüşleri
Yanıt alınabilecekmiş gibi görünen bir Message Echo giriş kutusu gösterip sonra kayıt sayfasına gönderen tipik bir dark pattern
Sitenin yönlendirdiği ilk eylemde bile tökezleyince hemen çıktım ve bir daha ziyaret etmeyeceğim
Yapay zeka ürünü yapan biri açısından anlaşılabilir bir tercih de olabilir
Echo'yu kullanıp geri bildirim veren herkese teşekkürler; zaten tam da bu yüzden erken yayımladık
Daha zor kodlama ve ajan benchmark'ları da dahil olmak üzere, en güncel en üst düzey sistemlerle aradaki farkı daha doğru gösteren değerlendirmeleri yayımlamaya devam edeceğiz ve herkese açık değerlendirme panosunu da genişleteceğiz. Değerlendirme panosu arayüzünde ve kayıt sürecinde fark edilen sorunlar prod ortamında düzeltildi
Echo'yu denemek için kredi kartı gerekmiyor ve her hesap için API ve sohbette kullanılabilecek 10 dolarlık ücretsiz kredi veriliyor
Sadece basit model yönlendirmesinden daha geniş olarak, açık ağırlıklı modeller arasında çıkarım kaynaklarını verimli dağıtmanın yollarını araştırıyoruz. Bu, yalnızca hangi modelin kullanılacağını değil, bir isteğe ne kadar hesaplama ayrılacağını ve ara sonuçların nasıl birleştirileceğini de belirliyor
Ensemble yaklaşımının kendisi random forest'tan da önce biliniyordu, ancak Echo'nun özü bunu her istekte tüm ensemble maliyetini ödemeden modelleyip kullanmak. Fusion veya Fugu ile kavramsal olarak benzer yanları olsa da mimari ve optimizasyon hedefleri farklı
create passwordözel karakter istiyor ama Google Şifre Yöneticisi'nin varsayılan oluşturduğu parolada özel karakter yokİki haneli uzunlukta alfasayısal bir kombinasyon yeterli gibi görünüyor ama fikir gerçekten harika
too many authentication attemptshatası alıyorumŞeffaflık yoksa, açık ağırlıklı model kullanmanın son kullanıcıya ne fayda sağladığını bilmiyorum
Fable düzeyinde sonuçları maliyetin üçte birineaçıklaması, yoğun biçimde sübvanse edilen aylık 200 dolarlık plan kullanıcıları için çok cazip görünmüyorBu planın ne zamana kadar süreceğini bilmiyorum ama o zamana kadar bile herkese açık API fiyatının üçte biri pek çekici değil
Birden fazla alt ajan aynı anda çalışıyordu ve Claude, daha ucuz model kullanma talimatını unutup birden çok Fable örneği çalıştırdı; ama token başına ücretlendirme yine de taşınamaz düzeyde. Aylık 200 dolar da pahalı ama bir gecede 200 dolar saçmalık
Aylık 200 dolarlık kullanıcı 10 bin dolarlık API kredisi tüketirse, kullanıcı başına kâr marjı %-98 olur ve bu kârlılığa yardımcı olmaz
Kullanılmaya devam edebilecek ama kullandıkça ödenen kredi gerektirecek ve abonelik planının kullanım sınırlarına dahil olmayacak
Önümüzdeki birkaç yıl içinde en iyi model kavramının niş bir şeye dönüşmesine şaşırmam
Çoğu üretim sisteminde, ne zaman ucuz model kullanılacağını, ne zaman güçlü modele geçileceğini ve birden fazla çıktının ne zaman birleştirileceğini bilen bir orkestratör kazanan olabilir
Büyük yönelim cihaz içi modeller; modelin çip kalıbına yerleştiği ve birkaç yılda bir yonga setinin değiştirildiği bir düzen de mümkün. Böyle bir ortamda büyük bulut sağlayıcıları kaybeder
En ilginç sonuçlardan biri, model boyutundan çok model seçiminin daha önemli olabileceği
Sektör daha büyük modellere odaklandı ama istekleri uygun uzman model kombinasyonlarına akıllıca yönlendirmek, çok daha düşük maliyetle çok daha büyük iyileştirmeler sağlayabilir gibi görünüyor
Zayıf modeller de işe yaramaz hale gelmedi; farklı alanlarda güçlüler ve başka modellerle birleştirildiklerinde değerleri ciddi biçimde artabilir. Yine de bunun, doğru model seçiminin çok daha zor olduğu kodlama ve ajan görevleri için de geçerli olup olmayacağını merak ediyorum
Ajan ve kodlama görevleri, ayrıntı düzeyi nedeniyle daha karmaşık. Her modelin ne zaman, nasıl ve oturum, hedef, görev, konuşma sırası ya da araç çağrısı gibi hangi soyutlama katmanında kullanılacağına karar vermek gerekiyor ve bu şu anda aktif olarak araştırılıyor
Gerçekte birkaç kullanıcı deneyimi kusuru buldum
Thinkingsürekli görünüyor; sanki takılmış ya da ağ sorunu varmış gibi duruyor ve prompt girilen sol panel genişletilemiyor veya yeniden boyutlandırılamıyor. Kod üretmesini istediğimde çıktı sürekli kesiliyor, sonra en baştan yeniden başlıyor ve önceki konuşmayı sürdüremiyorSorunun karmaşıklığı önceden bilinmiyorsa ve sonraki konuşmanın aynı modele gideceğinin garantisi yoksa bu yaklaşım iyi çalışmaz
Aynı konuşmayı birden çok modele round-robin ile gönderirseniz cache bozulur; bu da cache'i hesaba katan bir sistemden daha maliyetli hale gelebilir
Anthropic Opus 4.8 ve Fable 5’i bir süredir kullandım, en yeni OpenAI modellerini de denedim; hepsi gereksiz çıktıyı fazlasıyla üretiyor.
Başka modelleri fiyat yüzünden değil kalite yüzünden denemeye başladım ve iş alanımda GLM 5.2, Fable 5’ten her açıdan çok daha üstündü. Hatta işi başarıyla tamamlayamadığı durumlar şaşırtıcı derecede nadir.
Kimi K2.7 biraz daha fazla yönlendirme istiyor ama Opus 4.8’den daha iyi bir kullanım deneyimi sunuyor; K3’ü ise henüz denemedim. En yeni OpenAI modellerinin yazılım tasarımı ve uygulama becerisi inanılmaz derecede kötü.
Bu değerlendirme, veri analizi, makine öğrenimi ve yazılım mühendisliğinin yoğun olduğu kendi iş alanımla sınırlı.
Ne benchmark var ne de kullanılan modeller hakkında bilgi, sadece yapay zeka üretimi video ve kayıt sayfası var.
“Monoliti mikroservislere çevirip her arızayı bir cinayet gizemine dönüştürdük” şeklindeki mimari şaka aklıma geliyor.
Şu anda 7 benchmark ailesinden kaydedilmiş 907 satırı açık olarak sunuyor; prompt, çıktı, değerlendirme ve maliyet kayıtları incelenebiliyor, daha fazlası da eklenecek.
İstek bazlı routing politikası ürünün kendisi olduğu için bunu açıklamıyoruz; ancak istek bazlı gizli yöntemi açığa çıkarmayacak ölçüde, kullanılan açık ağırlıklı modellerin bir kısmının listesi, sürüm tarihleri, toplam tahsis oranları ve değerlendirme ayarları paylaşılabilir. Yeni bir video da hazırlanıyor.
İyi benchmarklar değiller ama en azından varlar.
Gerçek bir sorunu çözmekten çok, “OpenRouter unicorn oldu, ben de vibe coding ile benzerini yapabilirim” diyerek yatırımcılara satış yapma girişimi gibi görünmesi hayal kırıklığı yaratıyor.
Buna
Fable seviyesidemek de entelektüel olarak tembelce ya da dürüst olmayan bir yaklaşım gibi geliyor.Ask Jeeves, AltaVista ve Lycos sonuçlarını bir araya getiren Dogpile.com’un yeniden yapılmış hali olup olmadığını merak ediyorum. Zaman sanki döngüsel.
Biz de aynı yaklaşımı uyguladık: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
OpenRouter, JusCode, Fireworks gibi diğer AI gateway ürünleri de son dönemde benzer bir yapıyı öneriyor; bu yüzden faydalı tarafları olması muhtemel.