Aylık çıkarım maliyeti için milyonlarca dolar harcayan büyük bir şirketse, yaklaşık 6 milyon dolarlık bir GB300 rack'ini doğrudan satın almaya değer olabilir
20,7 TB belleğin tamamına MXFP4 modeli yüklemek için %10'u bile gerekmiyor ve toplam HBM bant genişliği 576 TB/s olduğundan, ortalama 100 bin token bağlamlı 6.000'den fazla ajan işini yaklaşık 30 token/s hızla paralel çalıştırabiliyor
Yıllık amortisman ve elektrik giderini 1,5 milyon dolar, ortalama kullanım oranını da %50 varsayarsak, 1 milyon çıktı tokenı başına maliyet 0,6 doların altına iniyor; veriler de şirket içinde kalıyor ve bu, barındırılan hizmetlerden 10 kattan fazla daha ucuz oluyor
Açık ağırlıklı modellerin gelişmeye devam edeceğine ve yapay zekanın kalıcı olacağına inanan şirketler için, rack'i doğrudan satın alma kararına yönelik ilk kez güçlü bir gerekçe oluşmuş sayılır
107 bin dolarlık bir sunucuda Kimi 2.8 çalıştırıp çoğu işte saniyede yaklaşık 50 bin tokenın üzerinde işlem yapıyorlar
Geçen yıl Claude ve Gemini için harcadıkları token maliyetinden daha fazlasını şimdiden tasarruf etmiş durumdalar
Operasyonu üstlenecek 2-3 DevOps çalışanı işe alınırsa 400 bin-700 bin dolar daha eklenir ve arıza ile bakımın tüm sorumluluğu da şirkete ait olur
Buna rağmen gizli kalması gereken veriler için barındırılan LLM'lere güvenmiyorlar
Ayrıca sıvı soğutma ve ultra yüksek yoğunluklu güç altyapısı olan bir alan da gerekiyor; bu yüzden tipik bir colocation tesisi ya da şirket içi sunucu odası bunu kaldırmakta zorlanır
6 milyon dolarlık rack ve altyapıyı satın alabilecek bir şirket için geçerli olacak ticari lisans koşulları da hesaba katılmalı, dolayısıyla hesap o kadar basit değil
Hatta bunun gelişimi yavaşlatan bir şey olduğunu düşünüyordum
Çünkü diğer laboratuvarlar, en ileri laboratuvarın modelini damıtarak ona yetişebiliyor ve bu sırada o laboratuvarın bir sonraki nesle yeniden yatırabileceği gelirin bir kısmını elinden alıyor
Tam hızlanma isteniyorsa iki büyük laboratuvarın kamulaştırılıp, özyineli kendini geliştirme (RSI) noktasına ulaşılana kadar Manhattan Project gibi kapalı tutulması gerektiğini düşünüyordum; ancak yanıttaki karşı argümanları görünce bakış açım ciddi biçimde değişti
Kimi-K3 lisansı https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE adresinde görülebilir
Art arda gelen 12 ay boyunca iştirakler toplam geliri 20 milyon doları aşan Model as a Service sağlayıcıları, ticari kullanımdan önce Moonshot AI ile ayrı bir sözleşme imzalamak zorunda
Önceki koşullarda ayrıca, aylık aktif kullanıcı sayısı 100 milyonu aşıyorsa veya ticari ürün geliri 20 milyon doları geçiyorsa Kimi adının gösterilmesi gerektiğine dair bir madde de var
En başta bu lisansın neye uygulandığı bile soru işareti Model ağırlıkları üzerinde telif hakkı oluşup oluşmadığı da belirsiz
ABD'de, makine öğrenimi modellerinin ağırlıkları olasılıksal gradyan inişi, beklenti maksimizasyonu, genetik algoritmalar gibi otomatik optimizasyon süreçlerinin ürünü olduğundan telif hakkı konusu olmadığı yönünde bir yorum mümkün
Bu henüz mahkemede tamamen sınanmış değil ve dava maliyetleri de yüksek, bu yüzden işverenler genelde güvenli tarafta kalıp lisansa uymayı tercih edecektir
Thaler v. Perlmutter kararı, telif hakkı için insan yazar gerektiğini teyit etti; ABD Telif Hakkı Ofisi rehberi de insanın yaratıcı müdahalesi olmadan makinenin otomatik ürettiği eserlerin tescil edilemeyeceğini açıkça belirtiyor
Devamındaki hüküm, matematiksel ilkelerin, formüllerin, algoritmaların ve denklemlerin de telif hakkı kapsamı dışında olduğunu söylüyor; bu yüzden modeli bir algoritma olarak görürsek sonuç görece açık
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
İndirilebiliyor olması iyi, ama bu koşullarla buna gerçek anlamda açık ağırlıklı ya da açık kaynak demek zor
Lisans ihlali yapanların nasıl bulunup dava hedefi haline getirileceği de ayrı bir soru
Ajanların bilgi yoğun alanlar ve kodlama alanını web ölçeğinde tararken sürekli genişleyen kendini evrimleştiren hiyerarşik bilgi grafiği yaklaşımı ilginç
Aktivasyon fonksiyonunun yeniden tanh'a dönmüş olması, teknolojide trendlerin döngüsel olduğunu düşündürüyor
Makalenin 6. sayfasına göre doğrudan tanh kullanılmıyor; bunun yerine f_gate(b,x) = b * tanh(x / b) * sigmoid(x) ve f_up(b,x) = b * tanh(x / b) kullanılıyor
Grafiğe bakılırsa bu tasarım, x yaklaşık 5'ten büyükken daha iyi ifade gücü veren GLU'nun avantajları ile 0'a çok yakın değerlerde sıçrayan SwiGLU'nun avantajlarını birlikte almaya çalışıyor gibi görünüyor
Bilgi grafiği tabanlı görev sentezi, çeşitli görevleri eksiksiz biçimde nasıl kapsayacağımız sorusuna yönelik eski bir probleme iyi uyan bir yaklaşım
Yeni bilginin üretilme hızı ve bunun insanî ya da makinesel üretim biçimleriyle ilişkisi üzerine kuramsal araştırmalara da uzanabilir gibi görünüyor
Kendi ajan görevlerine göre ince ayar yapmak için şu anda LoRA+DPO, GRPO arasında hangisinin en iyi olduğu merak ediliyor
İlk etapta LoRA+SFT uygun görünüyor, ancak model büyük olduğu için maliyet yükü oldukça yüksek olacaktır
Sağlayıcının ince ayar API'sini beklemek daha mantıklı olabilir; en baştan takviyeli öğrenme ya da DPO gibi off-policy benzeri takviyeli öğrenmeye gitmek gerekli görünmüyor
Çoklu öğretmenli on-policy damıtmada öğretmen modelin ne olduğu merak ediliyor
Matematik ve kodlama gibi doğrulanabilir alanlar anlaşılır, ancak biyolojiyi de kapsadığına bakılırsa daha büyük modellerden damıtılan bir yapı olup olmadığı sorgulanıyor
https://thinkingmachines.ai/blog/on-policy-distillation/ alıntılanıyor
Öğretmen modelin, problemi çözen öğrenci modelin her token'ını her adımın üretim olasılığıyla puanladığı ve bunun ödül ya da kayıp olarak uygulanıp takviyeli öğrenmeyle damıtma yapıldığı bir yöntem olarak anlaşılıyor
Çoklu öğretmen, birden fazla modelden damıtma anlamına geliyor gibi görünüyor ve buna son teknoloji kapalı modeller de dahil olabilir
Ancak log olasılığı gerekiyor; OpenAI API bunu mümkün kılarken Anthropic bunu sunmuyor, bu yüzden dışarıdan tahmin etme yöntemi de olabilir
Bu yöntem, biyoloji dahil öğretmenin bildiği herhangi bir alana uygulanabilir
Öğretmen, diğer modeller anlamına geliyor
Birden fazla sağlayıcının çıkarım fiyatlarının neden aynı olduğunun Moonshot ile yapılan lisans anlaşmasından kaynaklanıp kaynaklanmadığı merak ediliyor
Kimi ile rekabet edecek bir ABD menşeli açık model yapmak için ne gerektiği merak ediliyor
ABD'deki büyük araştırma laboratuvarlarının yakın dönemdeki son büyük ölçekli açık modeli, görünüşe göre yaklaşık 1 yıl önce, 2025 yazındaki GPT-OSS-120b idi
Gönüllü olarak çıkması zor görünüyor; bu yüzden bir şekilde kamuya açılması için baskı yapılması gerekecek gibi duruyor
Son dönemde Gemma'nın en az 100B sınıfında çıkması bekleniyordu, ancak Google bu ölçekteki modelleri yalnızca içeride tutuyor gibi görünüyor
MSL ya da SpaceXAI'nin sıradaki büyük modellerden birini açık kaynak olarak yayımlama ihtimali yüksek görünüyor
İkisi de açık kaynağa dost ve ABD'nin Kimi eşdeğeri pozisyonu için rekabet edecekler
Çin'in modeli sadece damıtıp 2 haftada kopyaladığı yönündeki yaygın kanı doğruysa, ABD'nin de 2 hafta içinde bir kopya model çıkarabilmesi gerekir
Inkling de aşağı yukarı rekabetçi sayılabilecek aralıkta
1 yorum
Hacker News görüşleri
Aylık çıkarım maliyeti için milyonlarca dolar harcayan büyük bir şirketse, yaklaşık 6 milyon dolarlık bir GB300 rack'ini doğrudan satın almaya değer olabilir
20,7 TB belleğin tamamına MXFP4 modeli yüklemek için %10'u bile gerekmiyor ve toplam HBM bant genişliği 576 TB/s olduğundan, ortalama 100 bin token bağlamlı 6.000'den fazla ajan işini yaklaşık 30 token/s hızla paralel çalıştırabiliyor
Yıllık amortisman ve elektrik giderini 1,5 milyon dolar, ortalama kullanım oranını da %50 varsayarsak, 1 milyon çıktı tokenı başına maliyet 0,6 doların altına iniyor; veriler de şirket içinde kalıyor ve bu, barındırılan hizmetlerden 10 kattan fazla daha ucuz oluyor
Açık ağırlıklı modellerin gelişmeye devam edeceğine ve yapay zekanın kalıcı olacağına inanan şirketler için, rack'i doğrudan satın alma kararına yönelik ilk kez güçlü bir gerekçe oluşmuş sayılır
Geçen yıl Claude ve Gemini için harcadıkları token maliyetinden daha fazlasını şimdiden tasarruf etmiş durumdalar
Buna rağmen gizli kalması gereken veriler için barındırılan LLM'lere güvenmiyorlar
Modelle birlikte çeşitli açık kaynak altyapılar da yayımlandı
https://github.com/MoonshotAI/MoonEP
https://github.com/kvcache-ai/AgentEnv
https://github.com/MoonshotAI/FlashKDA
Açık kaynak ve açık ağırlıklı modelleri yapay zeka gelişimini yavaşlatan bir şey olarak görmek ikna edici gelmiyor
Çünkü diğer laboratuvarlar, en ileri laboratuvarın modelini damıtarak ona yetişebiliyor ve bu sırada o laboratuvarın bir sonraki nesle yeniden yatırabileceği gelirin bir kısmını elinden alıyor
Tam hızlanma isteniyorsa iki büyük laboratuvarın kamulaştırılıp, özyineli kendini geliştirme (RSI) noktasına ulaşılana kadar Manhattan Project gibi kapalı tutulması gerektiğini düşünüyordum; ancak yanıttaki karşı argümanları görünce bakış açım ciddi biçimde değişti
Kimi-K3 lisansı https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE adresinde görülebilir
Art arda gelen 12 ay boyunca iştirakler toplam geliri 20 milyon doları aşan Model as a Service sağlayıcıları, ticari kullanımdan önce Moonshot AI ile ayrı bir sözleşme imzalamak zorunda
Önceki koşullarda ayrıca, aylık aktif kullanıcı sayısı 100 milyonu aşıyorsa veya ticari ürün geliri 20 milyon doları geçiyorsa Kimi adının gösterilmesi gerektiğine dair bir madde de var
2025 açık modelleri temiz bir MIT lisansına sahipti, ancak 2026 Ocak'taki moonshotai/Kimi-K2-Thinking'den itibaren değiştirilmiş MIT lisansı kullanılmaya başlandı
Model ağırlıkları üzerinde telif hakkı oluşup oluşmadığı da belirsiz
Bu henüz mahkemede tamamen sınanmış değil ve dava maliyetleri de yüksek, bu yüzden işverenler genelde güvenli tarafta kalıp lisansa uymayı tercih edecektir
Thaler v. Perlmutter kararı, telif hakkı için insan yazar gerektiğini teyit etti; ABD Telif Hakkı Ofisi rehberi de insanın yaratıcı müdahalesi olmadan makinenin otomatik ürettiği eserlerin tescil edilemeyeceğini açıkça belirtiyor
Devamındaki hüküm, matematiksel ilkelerin, formüllerin, algoritmaların ve denklemlerin de telif hakkı kapsamı dışında olduğunu söylüyor; bu yüzden modeli bir algoritma olarak görürsek sonuç görece açık
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Ajanların bilgi yoğun alanlar ve kodlama alanını web ölçeğinde tararken sürekli genişleyen kendini evrimleştiren hiyerarşik bilgi grafiği yaklaşımı ilginç
Aktivasyon fonksiyonunun yeniden tanh'a dönmüş olması, teknolojide trendlerin döngüsel olduğunu düşündürüyor
f_gate(b,x) = b * tanh(x / b) * sigmoid(x)vef_up(b,x) = b * tanh(x / b)kullanılıyorGrafiğe bakılırsa bu tasarım, x yaklaşık 5'ten büyükken daha iyi ifade gücü veren GLU'nun avantajları ile 0'a çok yakın değerlerde sıçrayan SwiGLU'nun avantajlarını birlikte almaya çalışıyor gibi görünüyor
Bilgi grafiği tabanlı görev sentezi, çeşitli görevleri eksiksiz biçimde nasıl kapsayacağımız sorusuna yönelik eski bir probleme iyi uyan bir yaklaşım
Yeni bilginin üretilme hızı ve bunun insanî ya da makinesel üretim biçimleriyle ilişkisi üzerine kuramsal araştırmalara da uzanabilir gibi görünüyor
Kendi ajan görevlerine göre ince ayar yapmak için şu anda LoRA+DPO, GRPO arasında hangisinin en iyi olduğu merak ediliyor
Sağlayıcının ince ayar API'sini beklemek daha mantıklı olabilir; en baştan takviyeli öğrenme ya da DPO gibi off-policy benzeri takviyeli öğrenmeye gitmek gerekli görünmüyor
Çoklu öğretmenli on-policy damıtmada öğretmen modelin ne olduğu merak ediliyor
Matematik ve kodlama gibi doğrulanabilir alanlar anlaşılır, ancak biyolojiyi de kapsadığına bakılırsa daha büyük modellerden damıtılan bir yapı olup olmadığı sorgulanıyor
Öğretmen modelin, problemi çözen öğrenci modelin her token'ını her adımın üretim olasılığıyla puanladığı ve bunun ödül ya da kayıp olarak uygulanıp takviyeli öğrenmeyle damıtma yapıldığı bir yöntem olarak anlaşılıyor
Çoklu öğretmen, birden fazla modelden damıtma anlamına geliyor gibi görünüyor ve buna son teknoloji kapalı modeller de dahil olabilir
Ancak log olasılığı gerekiyor; OpenAI API bunu mümkün kılarken Anthropic bunu sunmuyor, bu yüzden dışarıdan tahmin etme yöntemi de olabilir
Bu yöntem, biyoloji dahil öğretmenin bildiği herhangi bir alana uygulanabilir
Birden fazla sağlayıcının çıkarım fiyatlarının neden aynı olduğunun Moonshot ile yapılan lisans anlaşmasından kaynaklanıp kaynaklanmadığı merak ediliyor
Kimi ile rekabet edecek bir ABD menşeli açık model yapmak için ne gerektiği merak ediliyor
Gönüllü olarak çıkması zor görünüyor; bu yüzden bir şekilde kamuya açılması için baskı yapılması gerekecek gibi duruyor
Son dönemde Gemma'nın en az 100B sınıfında çıkması bekleniyordu, ancak Google bu ölçekteki modelleri yalnızca içeride tutuyor gibi görünüyor
İkisi de açık kaynağa dost ve ABD'nin Kimi eşdeğeri pozisyonu için rekabet edecekler