1 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş

1 yorum

 
GN⁺ 3 시간 전
Hacker News görüşleri
  • Aylık çıkarım maliyeti için milyonlarca dolar harcayan büyük bir şirketse, yaklaşık 6 milyon dolarlık bir GB300 rack'ini doğrudan satın almaya değer olabilir
    20,7 TB belleğin tamamına MXFP4 modeli yüklemek için %10'u bile gerekmiyor ve toplam HBM bant genişliği 576 TB/s olduğundan, ortalama 100 bin token bağlamlı 6.000'den fazla ajan işini yaklaşık 30 token/s hızla paralel çalıştırabiliyor
    Yıllık amortisman ve elektrik giderini 1,5 milyon dolar, ortalama kullanım oranını da %50 varsayarsak, 1 milyon çıktı tokenı başına maliyet 0,6 doların altına iniyor; veriler de şirket içinde kalıyor ve bu, barındırılan hizmetlerden 10 kattan fazla daha ucuz oluyor
    Açık ağırlıklı modellerin gelişmeye devam edeceğine ve yapay zekanın kalıcı olacağına inanan şirketler için, rack'i doğrudan satın alma kararına yönelik ilk kez güçlü bir gerekçe oluşmuş sayılır

    • 107 bin dolarlık bir sunucuda Kimi 2.8 çalıştırıp çoğu işte saniyede yaklaşık 50 bin tokenın üzerinde işlem yapıyorlar
      Geçen yıl Claude ve Gemini için harcadıkları token maliyetinden daha fazlasını şimdiden tasarruf etmiş durumdalar
    • Operasyonu üstlenecek 2-3 DevOps çalışanı işe alınırsa 400 bin-700 bin dolar daha eklenir ve arıza ile bakımın tüm sorumluluğu da şirkete ait olur
      Buna rağmen gizli kalması gereken veriler için barındırılan LLM'lere güvenmiyorlar
    • Ayrıca sıvı soğutma ve ultra yüksek yoğunluklu güç altyapısı olan bir alan da gerekiyor; bu yüzden tipik bir colocation tesisi ya da şirket içi sunucu odası bunu kaldırmakta zorlanır
    • 6 milyon dolarlık rack ve altyapıyı satın alabilecek bir şirket için geçerli olacak ticari lisans koşulları da hesaba katılmalı, dolayısıyla hesap o kadar basit değil
  • Modelle birlikte çeşitli açık kaynak altyapılar da yayımlandı
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    Açık kaynak ve açık ağırlıklı modelleri yapay zeka gelişimini yavaşlatan bir şey olarak görmek ikna edici gelmiyor

    • Hatta bunun gelişimi yavaşlatan bir şey olduğunu düşünüyordum
      Çünkü diğer laboratuvarlar, en ileri laboratuvarın modelini damıtarak ona yetişebiliyor ve bu sırada o laboratuvarın bir sonraki nesle yeniden yatırabileceği gelirin bir kısmını elinden alıyor
      Tam hızlanma isteniyorsa iki büyük laboratuvarın kamulaştırılıp, özyineli kendini geliştirme (RSI) noktasına ulaşılana kadar Manhattan Project gibi kapalı tutulması gerektiğini düşünüyordum; ancak yanıttaki karşı argümanları görünce bakış açım ciddi biçimde değişti
  • Kimi-K3 lisansı https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE adresinde görülebilir
    Art arda gelen 12 ay boyunca iştirakler toplam geliri 20 milyon doları aşan Model as a Service sağlayıcıları, ticari kullanımdan önce Moonshot AI ile ayrı bir sözleşme imzalamak zorunda
    Önceki koşullarda ayrıca, aylık aktif kullanıcı sayısı 100 milyonu aşıyorsa veya ticari ürün geliri 20 milyon doları geçiyorsa Kimi adının gösterilmesi gerektiğine dair bir madde de var

    • Kimi 2.6 da aynı tür lisansı kullanıyordu ve bunun https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS... üzerinden K2'ye kadar gittiği görülüyor
      2025 açık modelleri temiz bir MIT lisansına sahipti, ancak 2026 Ocak'taki moonshotai/Kimi-K2-Thinking'den itibaren değiştirilmiş MIT lisansı kullanılmaya başlandı
    • En başta bu lisansın neye uygulandığı bile soru işareti
      Model ağırlıkları üzerinde telif hakkı oluşup oluşmadığı da belirsiz
    • ABD'de, makine öğrenimi modellerinin ağırlıkları olasılıksal gradyan inişi, beklenti maksimizasyonu, genetik algoritmalar gibi otomatik optimizasyon süreçlerinin ürünü olduğundan telif hakkı konusu olmadığı yönünde bir yorum mümkün
      Bu henüz mahkemede tamamen sınanmış değil ve dava maliyetleri de yüksek, bu yüzden işverenler genelde güvenli tarafta kalıp lisansa uymayı tercih edecektir
      Thaler v. Perlmutter kararı, telif hakkı için insan yazar gerektiğini teyit etti; ABD Telif Hakkı Ofisi rehberi de insanın yaratıcı müdahalesi olmadan makinenin otomatik ürettiği eserlerin tescil edilemeyeceğini açıkça belirtiyor
      Devamındaki hüküm, matematiksel ilkelerin, formüllerin, algoritmaların ve denklemlerin de telif hakkı kapsamı dışında olduğunu söylüyor; bu yüzden modeli bir algoritma olarak görürsek sonuç görece açık
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • İndirilebiliyor olması iyi, ama bu koşullarla buna gerçek anlamda açık ağırlıklı ya da açık kaynak demek zor
    • Lisans ihlali yapanların nasıl bulunup dava hedefi haline getirileceği de ayrı bir soru
  • Ajanların bilgi yoğun alanlar ve kodlama alanını web ölçeğinde tararken sürekli genişleyen kendini evrimleştiren hiyerarşik bilgi grafiği yaklaşımı ilginç

  • Aktivasyon fonksiyonunun yeniden tanh'a dönmüş olması, teknolojide trendlerin döngüsel olduğunu düşündürüyor

    • Makalenin 6. sayfasına göre doğrudan tanh kullanılmıyor; bunun yerine f_gate(b,x) = b * tanh(x / b) * sigmoid(x) ve f_up(b,x) = b * tanh(x / b) kullanılıyor
      Grafiğe bakılırsa bu tasarım, x yaklaşık 5'ten büyükken daha iyi ifade gücü veren GLU'nun avantajları ile 0'a çok yakın değerlerde sıçrayan SwiGLU'nun avantajlarını birlikte almaya çalışıyor gibi görünüyor
  • Bilgi grafiği tabanlı görev sentezi, çeşitli görevleri eksiksiz biçimde nasıl kapsayacağımız sorusuna yönelik eski bir probleme iyi uyan bir yaklaşım
    Yeni bilginin üretilme hızı ve bunun insanî ya da makinesel üretim biçimleriyle ilişkisi üzerine kuramsal araştırmalara da uzanabilir gibi görünüyor

  • Kendi ajan görevlerine göre ince ayar yapmak için şu anda LoRA+DPO, GRPO arasında hangisinin en iyi olduğu merak ediliyor

    • İlk etapta LoRA+SFT uygun görünüyor, ancak model büyük olduğu için maliyet yükü oldukça yüksek olacaktır
      Sağlayıcının ince ayar API'sini beklemek daha mantıklı olabilir; en baştan takviyeli öğrenme ya da DPO gibi off-policy benzeri takviyeli öğrenmeye gitmek gerekli görünmüyor
  • Çoklu öğretmenli on-policy damıtmada öğretmen modelin ne olduğu merak ediliyor
    Matematik ve kodlama gibi doğrulanabilir alanlar anlaşılır, ancak biyolojiyi de kapsadığına bakılırsa daha büyük modellerden damıtılan bir yapı olup olmadığı sorgulanıyor

    • https://thinkingmachines.ai/blog/on-policy-distillation/ alıntılanıyor
      Öğretmen modelin, problemi çözen öğrenci modelin her token'ını her adımın üretim olasılığıyla puanladığı ve bunun ödül ya da kayıp olarak uygulanıp takviyeli öğrenmeyle damıtma yapıldığı bir yöntem olarak anlaşılıyor
      Çoklu öğretmen, birden fazla modelden damıtma anlamına geliyor gibi görünüyor ve buna son teknoloji kapalı modeller de dahil olabilir
      Ancak log olasılığı gerekiyor; OpenAI API bunu mümkün kılarken Anthropic bunu sunmuyor, bu yüzden dışarıdan tahmin etme yöntemi de olabilir
      Bu yöntem, biyoloji dahil öğretmenin bildiği herhangi bir alana uygulanabilir
    • Öğretmen, diğer modeller anlamına geliyor
  • Birden fazla sağlayıcının çıkarım fiyatlarının neden aynı olduğunun Moonshot ile yapılan lisans anlaşmasından kaynaklanıp kaynaklanmadığı merak ediliyor

  • Kimi ile rekabet edecek bir ABD menşeli açık model yapmak için ne gerektiği merak ediliyor

    • ABD'deki büyük araştırma laboratuvarlarının yakın dönemdeki son büyük ölçekli açık modeli, görünüşe göre yaklaşık 1 yıl önce, 2025 yazındaki GPT-OSS-120b idi
      Gönüllü olarak çıkması zor görünüyor; bu yüzden bir şekilde kamuya açılması için baskı yapılması gerekecek gibi duruyor
      Son dönemde Gemma'nın en az 100B sınıfında çıkması bekleniyordu, ancak Google bu ölçekteki modelleri yalnızca içeride tutuyor gibi görünüyor
    • MSL ya da SpaceXAI'nin sıradaki büyük modellerden birini açık kaynak olarak yayımlama ihtimali yüksek görünüyor
      İkisi de açık kaynağa dost ve ABD'nin Kimi eşdeğeri pozisyonu için rekabet edecekler
    • Çin'in modeli sadece damıtıp 2 haftada kopyaladığı yönündeki yaygın kanı doğruysa, ABD'nin de 2 hafta içinde bir kopya model çıkarabilmesi gerekir
    • Inkling de aşağı yukarı rekabetçi sayılabilecek aralıkta