1 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Echo, GLM-5.2, Kimi K2.7 gibi birden fazla açık ağırlıklı modeli istek bazında birleştirerek, tüm işleri tek bir modele yükleme yaklaşımının sınırlarını tamamlıyor
  • Her istek için hesaplama miktarını ve katılacak modelleri belirleyip sonuçları birleştirme yöntemini de ayarlayarak, basit prompt’larda daha az çıkarım kaynağı kullanıyor
  • İlk değerlendirme kurulumunda havuzdaki en iyi tekil modeli tutarlı biçimde geride bıraktı ve Fable’a benzer genel sonuçları yaklaşık üçte bir çıkarım maliyetiyle elde etti
  • Genel olarak daha zayıf modeller bile belirli sorunlarda veya kombinasyonlarda işe yarayacak kadar birbirini tamamlayan yeteneklere sahip; ancak tahsis ve birleştirme kararlarının hatalı verildiği örnekler hâlâ var
  • Sohbet arayüzü ve OpenAI uyumlu API yayımlandı; kalite ölçümünün daha zor olduğu kodlama ve ajan görevlerinde de aynı yaklaşımın geçerli olup olmadığı test ediliyor

Model seçimi ve sonuç birleştirme

  • İlk deneylerde GLM-5.2, Kimi K2.7 vb. aynı değerlendirmeye sokuldu ve her problem için yararlı model ile uygun çıktı birleştirme yönteminin önceden bilindiği varsayılarak sonuçlar ölçüldü
    • Bu varsayımsal sistem, havuza dahil edilen tüm tekil modellerden çok daha yüksek performans gösterdi
    • İyi kararlar ancak sonuçlar görüldükten sonra belirlenebildiği için gerçek dağıtımda kullanılamıyor; Echo ise ön bilgi olmadan bu avantajın bir kısmını geri kazanma girişimi
  • İsteğin özelliklerine göre gerekli hesaplama miktarını, katılacak modelleri ve sonuç birleştirme yöntemini seçiyor
    • Basit prompt’lara görece daha az çıkarım ayırıyor
    • Diğer problemlerde ise birden fazla modelin farklı bölümleri işleyeceği şekilde yapılandırıyor
  • Modellerin yetenekleri birbirini tamamlayıcı nitelikte; bu nedenle genel performansı belirgin biçimde daha düşük olan bir model bile belirli problemlerde veya kombinasyonlarda çok yararlı olabiliyor

Değerlendirme sonuçları ve herkese açık test

  • İlk değerlendirme kurulumunda en iyi tekil modelden tutarlı biçimde daha yüksek performans kaydetti ve karşılaştırma noktası olan Fable ile yaklaşık aynı genel sonuçları yaklaşık üçte bir maliyetle elde etti
  • Bazı isteklerde hesaplama tahsisi veya model birleştirme kararını yanlış veriyor; şu anda bu başarısızlık örnekleri analiz ediliyor
  • Kodlama ve ajan görevlerinde her kararın kalitesini ölçmek çok daha zor olduğundan, aynı yaklaşımın sürüp sürmediği ayrıca test ediliyor
  • Dış testler için Echo sohbet arayüzü ve OpenAI uyumlu API sunuluyor
  • Çalışma biçimini tanıtan video ile değerlendirme metodolojisi, tekil model sonuçları, maliyet ve mevcut sınırlamalar yayımlandı; olağandışı başarısızlıklar veya sezgisel görünmeyen kaynak tahsisi örnekleri için geri bildirim isteniyor

1 yorum

 
GN⁺ 3 시간 전
Hacker News görüşleri
  • Yanıt alınabilecekmiş gibi görünen bir Message Echo giriş kutusu gösterip sonra kayıt sayfasına gönderen tipik bir dark pattern
    Sitenin yönlendirdiği ilk eylemde bile tökezleyince hemen çıktım ve bir daha ziyaret etmeyeceğim

    • Ben de tamamen aynı hissettim; bu tür dark pattern'lerden o kadar nefret ediyorum ki artık bu ürüne hiç ilgim yok
    • Şu anda kaldırıyoruz
    • Öte yandan giriş yapmadan isteğe izin verilirse, ilk sorguların maliyetini üretici üstlenmek zorunda kalır ve kötüye kullanımla büyük faturalar çıkabilir
      Yapay zeka ürünü yapan biri açısından anlaşılabilir bir tercih de olabilir
  • Echo'yu kullanıp geri bildirim veren herkese teşekkürler; zaten tam da bu yüzden erken yayımladık
    Daha zor kodlama ve ajan benchmark'ları da dahil olmak üzere, en güncel en üst düzey sistemlerle aradaki farkı daha doğru gösteren değerlendirmeleri yayımlamaya devam edeceğiz ve herkese açık değerlendirme panosunu da genişleteceğiz. Değerlendirme panosu arayüzünde ve kayıt sürecinde fark edilen sorunlar prod ortamında düzeltildi
    Echo'yu denemek için kredi kartı gerekmiyor ve her hesap için API ve sohbette kullanılabilecek 10 dolarlık ücretsiz kredi veriliyor
    Sadece basit model yönlendirmesinden daha geniş olarak, açık ağırlıklı modeller arasında çıkarım kaynaklarını verimli dağıtmanın yollarını araştırıyoruz. Bu, yalnızca hangi modelin kullanılacağını değil, bir isteğe ne kadar hesaplama ayrılacağını ve ara sonuçların nasıl birleştirileceğini de belirliyor
    Ensemble yaklaşımının kendisi random forest'tan da önce biliniyordu, ancak Echo'nun özü bunu her istekte tüm ensemble maliyetini ödemeden modelleyip kullanmak. Fusion veya Fugu ile kavramsal olarak benzer yanları olsa da mimari ve optimizasyon hedefleri farklı

    • Küçük bir geri bildirim: create password özel karakter istiyor ama Google Şifre Yöneticisi'nin varsayılan oluşturduğu parolada özel karakter yok
      İki haneli uzunlukta alfasayısal bir kombinasyon yeterli gibi görünüyor ama fikir gerçekten harika
    • Neden dark pattern kullandığınızı merak ediyorum. İlgilenmiştim ama artık değilim
    • Yalnızca bir kez kayıt olmayı denememe rağmen too many authentication attempts hatası alıyorum
    • Dark pattern'i kaldırmalısınız
    • Sürekli açık ağırlık vurgusu yapıyorsunuz ama hangi modelleri kullandığınızı hiç açıklamıyorsunuz
      Şeffaflık yoksa, açık ağırlıklı model kullanmanın son kullanıcıya ne fayda sağladığını bilmiyorum
  • Fable düzeyinde sonuçları maliyetin üçte birine açıklaması, yoğun biçimde sübvanse edilen aylık 200 dolarlık plan kullanıcıları için çok cazip görünmüyor
    Bu planın ne zamana kadar süreceğini bilmiyorum ama o zamana kadar bile herkese açık API fiyatının üçte biri pek çekici değil

    • Aylık 200 dolarlık planda haftalık Fable kullanımımı bitirdikten sonra, promosyon amaçlı 200 dolarlık krediyle orta ölçekli bir kodlama planı çalıştırdım ve 1 saat 15 dakikada 120 dolar harcadım
      Birden fazla alt ajan aynı anda çalışıyordu ve Claude, daha ucuz model kullanma talimatını unutup birden çok Fable örneği çalıştırdı; ama token başına ücretlendirme yine de taşınamaz düzeyde. Aylık 200 dolar da pahalı ama bir gecede 200 dolar saçmalık
    • İş için kullanan kurumsal müşteriler bu sübvansiyonlu plandan yararlanamaz; dolayısıyla toplam kullanım içinde böyle bir planın payı muhtemelen küçüktür
    • Bu plan IPO'ya kadar sürer ama ondan sonra uzun ömürlü olmaz gibi görünüyor
      Aylık 200 dolarlık kullanıcı 10 bin dolarlık API kredisi tüketirse, kullanıcı başına kâr marjı %-98 olur ve bu kârlılığa yardımcı olmaz
    • Amaç kullanım sınırı ya da sınırı aşınca hesabın askıya alınmasını önlemekse, o zaman durum farklı
    • Anthropic'ten bugün aldığım e-postaya göre Fable 5, 20 Temmuz'dan itibaren kullanım kredisi modeline geçiyor
      Kullanılmaya devam edebilecek ama kullandıkça ödenen kredi gerektirecek ve abonelik planının kullanım sınırlarına dahil olmayacak
  • Önümüzdeki birkaç yıl içinde en iyi model kavramının niş bir şeye dönüşmesine şaşırmam
    Çoğu üretim sisteminde, ne zaman ucuz model kullanılacağını, ne zaman güçlü modele geçileceğini ve birden fazla çıktının ne zaman birleştirileceğini bilen bir orkestratör kazanan olabilir

    • Acaba Gemini CLI'ın fikri de bu değil mi
    • Evrimin çok fazla dalı var ama sonunda en iyi modelin niş bir kavrama dönüşeceği yöne yakınsayacak gibi görünüyor
      Büyük yönelim cihaz içi modeller; modelin çip kalıbına yerleştiği ve birkaç yılda bir yonga setinin değiştirildiği bir düzen de mümkün. Böyle bir ortamda büyük bulut sağlayıcıları kaybeder
  • En ilginç sonuçlardan biri, model boyutundan çok model seçiminin daha önemli olabileceği
    Sektör daha büyük modellere odaklandı ama istekleri uygun uzman model kombinasyonlarına akıllıca yönlendirmek, çok daha düşük maliyetle çok daha büyük iyileştirmeler sağlayabilir gibi görünüyor
    Zayıf modeller de işe yaramaz hale gelmedi; farklı alanlarda güçlüler ve başka modellerle birleştirildiklerinde değerleri ciddi biçimde artabilir. Yine de bunun, doğru model seçiminin çok daha zor olduğu kodlama ve ajan görevleri için de geçerli olup olmayacağını merak ediyorum

    • Her görevde uzmanlığı olan ve birbiriyle korelasyonu düşük küçük modelleri güçlü biçimde ensemble ederseniz çok ilginç sonuçlar alınabilir
      Ajan ve kodlama görevleri, ayrıntı düzeyi nedeniyle daha karmaşık. Her modelin ne zaman, nasıl ve oturum, hedef, görev, konuşma sırası ya da araç çağrısı gibi hangi soyutlama katmanında kullanılacağına karar vermek gerekiyor ve bu şu anda aktif olarak araştırılıyor
  • Gerçekte birkaç kullanıcı deneyimi kusuru buldum
    Thinking sürekli görünüyor; sanki takılmış ya da ağ sorunu varmış gibi duruyor ve prompt girilen sol panel genişletilemiyor veya yeniden boyutlandırılamıyor. Kod üretmesini istediğimde çıktı sürekli kesiliyor, sonra en baştan yeniden başlıyor ve önceki konuşmayı sürdüremiyor

  • Sorunun karmaşıklığı önceden bilinmiyorsa ve sonraki konuşmanın aynı modele gideceğinin garantisi yoksa bu yaklaşım iyi çalışmaz
    Aynı konuşmayı birden çok modele round-robin ile gönderirseniz cache bozulur; bu da cache'i hesaba katan bir sistemden daha maliyetli hale gelebilir

  • Anthropic Opus 4.8 ve Fable 5’i bir süredir kullandım, en yeni OpenAI modellerini de denedim; hepsi gereksiz çıktıyı fazlasıyla üretiyor.
    Başka modelleri fiyat yüzünden değil kalite yüzünden denemeye başladım ve iş alanımda GLM 5.2, Fable 5’ten her açıdan çok daha üstündü. Hatta işi başarıyla tamamlayamadığı durumlar şaşırtıcı derecede nadir.
    Kimi K2.7 biraz daha fazla yönlendirme istiyor ama Opus 4.8’den daha iyi bir kullanım deneyimi sunuyor; K3’ü ise henüz denemedim. En yeni OpenAI modellerinin yazılım tasarımı ve uygulama becerisi inanılmaz derecede kötü.
    Bu değerlendirme, veri analizi, makine öğrenimi ve yazılım mühendisliğinin yoğun olduğu kendi iş alanımla sınırlı.

  • Ne benchmark var ne de kullanılan modeller hakkında bilgi, sadece yapay zeka üretimi video ve kayıt sayfası var.
    “Monoliti mikroservislere çevirip her arızayı bir cinayet gizemine dönüştürdük” şeklindeki mimari şaka aklıma geliyor.

    • Açık değerlendirici https://echo.tracerml.ai/eval/ adresinde.
      Şu anda 7 benchmark ailesinden kaydedilmiş 907 satırı açık olarak sunuyor; prompt, çıktı, değerlendirme ve maliyet kayıtları incelenebiliyor, daha fazlası da eklenecek.
      İstek bazlı routing politikası ürünün kendisi olduğu için bunu açıklamıyoruz; ancak istek bazlı gizli yöntemi açığa çıkarmayacak ölçüde, kullanılan açık ağırlıklı modellerin bir kısmının listesi, sürüm tarihleri, toplam tahsis oranları ve değerlendirme ayarları paylaşılabilir. Yeni bir video da hazırlanıyor.
    • Benchmarklar https://echo.tracerml.ai/eval/ adresinde.
      İyi benchmarklar değiller ama en azından varlar.
    • Özünde OpenRouter’ı yeniden üretmeye çalışıyor gibi görünüyor. OpenRouter, failover, kullanım ölçümü, otomatik geçiş gibi özelliklerle belirli sağlayıcıları soyutlayan ve oldukça iyi çalışan akıllı bir altyapı soyutlaması.
      Gerçek bir sorunu çözmekten çok, “OpenRouter unicorn oldu, ben de vibe coding ile benzerini yapabilirim” diyerek yatırımcılara satış yapma girişimi gibi görünmesi hayal kırıklığı yaratıyor.
      Buna Fable seviyesi demek de entelektüel olarak tembelce ya da dürüst olmayan bir yaklaşım gibi geliyor.
    • tenderlove’un “mikroservisler, fonksiyon çağrılarını dağıtık hesaplama problemine dönüştürür” sözü aklıma geliyor.
    • Giriş yapmayı gerektiren uygulamaların Show HN’de kabul edilmediğini sanıyordum.
  • Ask Jeeves, AltaVista ve Lycos sonuçlarını bir araya getiren Dogpile.com’un yeniden yapılmış hali olup olmadığını merak ediyorum. Zaman sanki döngüsel.

    • İyi fikirler, dönem ve araçlar değişse bile çoğunlukla hâlâ iyidir.
    • Ensemble modeller, Kaggle’da da her zaman en iyi performansı verirdi.
      Biz de aynı yaklaşımı uyguladık: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
    • Hizmetteki her iş için aynı EC2 instance boyutunu kullanmama yaklaşımı.
    • Üçgen tekerlek de yapılabilir ama tekerleğin yuvarlak olmasının bir nedeni var.
    • Buna Model Karışımı (Mixture of Models) denebilir.
      OpenRouter, JusCode, Fireworks gibi diğer AI gateway ürünleri de son dönemde benzer bir yapıyı öneriyor; bu yüzden faydalı tarafları olması muhtemel.