1 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Yeterli performans ve taşınabilirliğe sahip açık ağırlıklı modeller, geliştiricilerin, bulutların ve şirketlerin birlikte ölçeklendirdiği bir temel haline gelerek tek bir tedarikçinin yetişmekte zorlanacağı bir inovasyon ekosistemi yaratabilir
  • Kubernetes’in ortak bir arayüz üzerine ağ, depolama ve gözlemlenebilirlik araçlarını çekmesi gibi, AI tarafında da model sunumu, ince ayar, ajan çalışma zamanı ve değerlendirmeye uzanan bir prodüksiyon yığını büyüyor
  • Hugging Face’teki herkese açık model sayısı 2 milyonu aştı; GLM-5.2, kendi SWE-bench Pro değerlendirmesinde %62,1 ile GPT-5.5’in %58,6’sını geçti; Kimi K3 de bağımsız değerlendirmede Opus 4.8 ve GPT-5.5 ile benzer puan aldı
  • Çin yapımı açık ağırlıklı modellerin geniş çapta yasaklanması halinde dünyadaki geliştirme devam ederken yalnızca ABD’li araştırmacılar ve şirketler ekosistemin dışında kalabilir; son bir yılda Hugging Face indirmelerinin %41’ini oluşturan Çin modellerinin etrafında inovasyon birikebilir
  • ABD, yasaklar yerine ticari olarak kullanılabilir frontier modelleri yayımlayarak, taşınabilirlik ve birlikte çalışabilirliği öne çıkaran kamu alımlarıyla, tüm araç ve operasyon katmanını inşa ederek ve bağımsız güvenlik testleri ile standartlarla rekabet etmeli

Kubernetes’in gösterdiği açık platform gücü

  • Mesosphere, Apache Mesos üzerine açık kaynak bulut yerel yazılımlar geliştirdi ve bunun etrafında DC/OS’u inşa ederek destek ve tescilli özellikler içeren kurumsal bir dağıtım olarak ticarileştirdi
  • Daha sonra daha yeni ve tamamen açık kaynak bir proje olan Kubernetes, bulut yerel topluluğunu etrafında toplayarak Mesosphere’i sarstı
    • Dünya çapındaki dağıtık sistemler ve altyapı mühendisleri kariyerlerini Kubernetes’e bağladı; Mesosphere’in sadık topluluk üyelerinin bir kısmı da oraya geçti
    • İnovasyonun merkezi Kubernetes’e kayınca ağ, depolama, gözlemlenebilirlik, dağıtım araçları, politika motorları gibi eksik bileşenler hızla geliştirildi
  • Çok sayıda startup ve yerleşik tedarikçinin katılmasıyla Kubernetes’i prodüksiyonda çalıştırmak için gereken neredeyse tüm bileşenler açık kaynak olarak sunuldu
    • Bulut sağlayıcıları ile Mesosphere/D2iQ, Rancher, Red Hat ve Nutanix; entegrasyon, kurumsal özellikler, destek ve operasyon etrafında iş modelleri kurdu
  • Kubernetes’in başarısı yalnızca deponun açılmasının sonucu değildi
    • Mühendislerin, bulut sağlayıcılarının ve kurumsal tedarikçilerin müşteri ihtiyaçlarına göre genişletebildiği tarafsız bir temel haline geldi
    • Ortak arayüzler ve tedarikçiden bağımsız yönetişim, katılımcılara uzun vadede ürün inşa edebileceklerine dair güven verdi
  • Özelleştirilebilir açık bir platform sektörün merkezine yerleştiğinde, tek bir tedarikçinin tüm ekosistemin birleşik inovasyon hızına yetişmesi zorlaşır

Açık ağırlık ile açık kaynak AI arasındaki fark

  • Genellikle açık kaynak diye adlandırılan modellerin çoğu, daha doğru ifadeyle açık ağırlıklı modellerdir
  • Tam anlamıyla açık kaynak olmasa bile, kullanıcıların çalıştırıp değiştirebildiği çıktılar etrafında ekosistem oluşabilir
  • Kubernetes ile AI’ın yapıları arasında önemli farklar da var
    • Kubernetes katkıcıları gerçek kaynak kodunu inceleyip değiştirebiliyor ve iyileştirmeleri ortak upstream projeye yansıtıyordu
    • Model ince ayar sonuçları genelde aynı şekilde paylaşılmaz
    • Frontier bir modelin ağırlıkları indirilebilse bile çalıştırmak için pahalı donanım gerekebilir
    • AI’da tarafsız yönetişim ve ortak arayüzler sağlayan CNCF benzeri bir kuruluş yok
  • İki ekosistemin ortak noktası, yeterli performans ve taşınabilirliğe sahip bir temelin, orijinal üreticinin tek başına yapabileceği kapsamın ötesinde tamamlayıcı inovasyonu çekmesidir

Self-hosting’den model platformuna

  • Açık ağırlıklı modellerin benimsenmesinin ilk nedeni self-hosting idi
    • Şirketler, verileri doğrudan kontrol ederek modelleri kendi bulutlarında veya veri merkezlerinde çalıştırmak istedi
    • Kullanım ve çıkarım maliyetleri arttıkça maliyetleri de doğrudan kontrol etme isteği büyüdü
  • Bu talep üzerine vLLM, SGLang, llama.cpp, Ollama, MLX gibi açık kaynak model sunum yığınları oluştu
  • Açık ağırlıklar, self-hosting’in ötesine geçerek geliştiricilerin modelin kendisini değiştirmesini ve yeniden dağıtmasını mümkün kılar
  • Hugging Face’te 2 milyondan fazla herkese açık model kayıtlı
  • Qwen ve Gemma gibi popüler model ailelerinin etrafında çeşitli türev çıktılar üretiliyor
    • Farklı yarı iletken mimarileri ve ölçekler için kuantize edilmiş ve dönüştürülmüş ağırlıklar
    • Kodlama, tıp, hukuk, matematik ve ajan iş akışları için ince ayarlı modeller ve LoRA adaptörleri
    • Farklı ince ayar sonuçlarını birleştiren model birleştirmeleri
    • TensorRT-LLM, vLLM, MLX gibi çeşitli çalışma zamanlarına uyarlanmış model varyantları

Frontier ve daralan performans farkı

  • Geçmişte açık modellerin temel performansı en zor kodlama ve ajan görevleri için yetersiz olduğundan onları frontier rekabetinin dışında görmek kolaydı; ancak bu fark hızla kapanıyor
  • Z.ai, MIT lisansıyla açık ağırlıklar sağlayan GLM-5.2’yi yayımladı
    • Kendi değerlendirmesindeki SWE-bench Pro puanı %62,1 ile GPT-5.5’in %58,6’sından yüksek
    • Ancak sonuçlar benchmark’a ve ajan harness’ına göre değişebilir
  • Moonshot, Kimi K3’ün uzun süreli kodlama işlerinde kapalı frontier modellere yaklaştığını söyleyerek 27 Temmuz’da ağırlıkları yayımlama sözü verdi
  • Temel modelin performansı yeterli hale geldiğinde ajan çalışma zamanları, kodlama harness’ları, sandbox’lar, değerlendirme, gözlemlenebilirlik ve uzmanlaşmış ince ayar projeleri zincirleme şekilde büyüyebilir
  • Bu bileşenler, ekiplerin iş yüküne, donanımına ve maliyet yapısına göre ayarlanabilen prodüksiyon seviyesinde açık bir yığın oluşturur
    • Açık ağırlıklı modellerin açık kaynak yazılım üzerinde çalıştırıldığı bir yapıdır
    • Her benchmark’ta tüm kapalı modelleri yeneceği garanti edilemez
  • Frontier AI bir yetenek rekabetidir; açık ekosistemler, dünyanın dört bir yanındaki yeteneklerin aynı temel üzerinde geliştirme yapması için neden sunar

Çin modellerinin yasaklanmasının ABD’ye etkisi

  • Kimi K3 dahil güçlü Çin modellerinin ortaya çıkmasının ardından Trump yönetiminin Çin yapımı açık ağırlıklı modellere yönelik kısıtlamaları değerlendirdiği bildiriliyor
    • Olası bir yasağın nasıl bir biçim alacağı henüz belirsiz
  • Çin yapımı açık ağırlıklı modellerin kullanımını geniş çapta yasaklamak, ABD’li araştırmacı ve şirketleri küresel AI araştırmacıları ve mühendislerinin toplandığı ekosistemden kendi kendine ayırabilir
    • Bu ekosisteme çok sayıda Çinli araştırmacı da katılıyor
    • Dünyadaki geliştirme faaliyetleri devam ederken yalnızca ABD’li geliştiricilerin erişemediği bir sonuç doğar
  • Qwen etrafında aynı akış şimdiden görülüyor
    • Hugging Face verilerine göre son bir yılda Çin modelleri, toplam model indirmelerinin %41’ini oluşturdu
  • En iyi açık ağırlıklı temel modeller Çin’den gelmeye devam ederse, Kubernetes döneminde olduğu gibi bu modellerin etrafında araçlar ve inovasyon birikebilir

ABD’nin rekabet edebileceği dört yol

  • Frontier seviyesinde ABD modelleri yayımlamak

    • ABD laboratuvarları, startup’ların gerçek ürünler inşa edebileceği lisanslarla frontier seviyesinde açık ağırlıklı modeller yayımlamalı
    • Bazı ilerlemeler şimdiden görülüyor
    • NVIDIA Nemotron, NVIDIA’nın izin verici lisansı altında ticari olarak kullanılabiliyor
    • Thinking Machines’in Inkling, OpenAI’ın gpt-oss ve Google’ın Gemma 4 modelleri Apache 2.0 ile yayımlandı
    • Ancak OpenAI ve Google’ın en yüksek performanslı modelleri dahil ABD’deki frontier laboratuvarlarının en güçlü modellerinin çoğu hâlâ kapalı
  • Kamu alımlarıyla açık pazar oluşturmak

    • Kamu alımları, tek bir API tedarikçisine kalıcı olarak bağımlı sistemler yerine taşınabilirlik ve birlikte çalışabilirlik sunan sistemlere talep yaratmalı
    • ABD Savunma Bakanlığı zaten benzer bir yaklaşım kullanıyor
    • Platform One, birden fazla askeri programın temel alabileceği açık kaynak araçlar ve kurumsal ürünler sunuyor
    • Aynı alım yöntemi, açık ağırlıklı modeller etrafındaki inovasyonu hızlandırabilir
  • Model dışındaki tüm yığını inşa etmek

    • ABD şirketleri modellerin çevresindeki diğer katmanları da inşa etmeli
    • Startup’lar modelleri özelleştirip genişletebilir ve ürünlerine gömebilir
    • Sunum, araçlar, destek ve operasyon katmanları da iş fırsatıdır
    • ABD’nin büyük yarı iletken şirketleri donanımı geliştirmeyi sürdürebilir; hyperscaler’lar ve neo-cloud’lar modelleri ve ekosistemi servis olarak sunabilir
  • Yasak yerine test ve standartlar getirmek

    • Güvenlik, kısıtlamaları destekleyen en güçlü gerekçe olsa da toptan yasak fazla geniştir ve tüm ekosisteme erişimi de feda eder
    • Daha iyi yanıt, frontier modeller için bağımsız testler ve standartlar oluşturmaktır
    • Kubernetes uygunluk testi, güvenliği değil uyumluluğu doğruladığı için AI’a birebir karşılık gelen bir örnek değildir
    • Ancak bağımsız kriterler ve yönetişim modeli referans alınabilir
    • Demis Hassabis de buna benzer ABD öncülüğünde bağımsız bir standart kuruluşu önerdi

Açık AI ekosisteminde rekabet stratejisi

  • ABD, kendi geliştiricilerinin etrafına duvar örmek yerine Çin modellerini doğrudan çalıştırmalı, içlerini analiz etmeli, benchmark etmeli ve iyileştirmeli
  • Aynı zamanda daha iyi ABD yapımı alternatifler inşa ederek ABD’nin AI yığınını dünyada benimsemesi en kolay seçenek haline getirmeli
  • ABD, onlarca yıldır dünyanın en iyi teknoloji yeteneklerini çekti ve geliştirebilecekleri bir alan sundu
  • Diğer ülkeler daha açık yığınları standart olarak benimserken bu rekabet gücünü kapalı bir ekosisteme dönüştürmek, ABD’nin AI liderliği konumundan kendi eliyle vazgeçmesi olur

1 yorum

 
GN⁺ 3 시간 전
Hacker News yorumları
  • Çin modellerinin yasaklanması teknik olarak imkânsız görünüyor. Ağırlıklar nihayetinde sadece sayılardan ibaret; ABD yapımı ile Çin yapımını ayırt etmek mümkün değil ve kaynak temelli yasaklar kolayca aşılabilir
    Sonuçta tüm açık ağırlıklı modelleri düzenlemek gerekir; nitekim Axios’un haberine göre büyük yapay zeka laboratuvarları veya bu çevrelerle ilişkili kişiler her 3–5 ayda bir yönetime açık kaynak modellerin yasaklanmasını önermiş
    DRM’e benzer bir lisanslama sistemi dayatılarak yalnızca sertifikalı ABD modellerinin kendi sunucularında çalıştırılması sağlanabilir; ancak bu, büyük laboratuvarlara tekel hakkı verir ve türev modellerin dağıtımını da engeller. Yurt dışında uygulanması zor olacağından, sonunda muhtemelen sadece Amerikalılar kısıtlanmış olur

    • Açık kaynak modellerin yasaklanması, yazılımda olduğu gibi hızla Birinci Değişiklik ile çatışacaktır. Modern DeCSS bayrağı, “iyi ağırlıkların {...weights go here...} olduğunu düşünüyorum” biçiminde bir metin olabilir
      Bunun yerine Çinli şirketlere veya Çinli şirketlerin sahip olduğu işletmelere çıkarım/yapay zeka hizmeti bedeli ödenmesi yasaklanabilir
    • ABD hükümeti Çinli açık model şirketlerini Entity List’e alırsa, ABD ile iş yapan tüm şirketler bunlarla iş yapamaz hale gelir. Modelin kaynağını kusursuz biçimde tespit etmek zor olsa da cezalar ağır olacağı için ABD şirketleri açıkça Çin menşeli modelleri sunmak veya kullanmak bir yana, dolanmayı bile denemeyebilir
    • Bir devlet kurumu Hugging Face’in model listesini oluşturup erişim sağlanmasını yasaklarsa bu yeterli olur. Korkutucu yasal ifadeler olmasa bile, yalnızca bir yasak listesi ABD şirketlerinin ve barındırma sağlayıcılarının bu modelleri sunucularında çalıştırmamasını sağlar
    • ABD şirketlerine uyum zorunlu kılınıp modellerin Hugging Face’ten indirilmesi sağlanabilir; ancak yurt dışında alternatif servisler ortaya çıkarsa herkes oraya taşınır. Sonuçta bu ABD’nin zararına bir sonuç olur
    • Modeller de yazılım olduğundan, FedRAMP sertifikası gerektiren yüksek güvence ortamlarında kullanımları yasaklanabilir. Ancak ABD’de Great Firewall olmadığı için internet üzerinden içeri alınmasını bizzat engellemek imkânsızdır
  • Yapay zeka sektörünün en tuhaf yanlarından biri token fiyatlandırma sistemi. 2023 başında GPT-4 çok pahalıyken 6 ay sonra 20 dolara hatırı sayılır miktarda çıkarım kullanılabilir hale gelmesinin nedeni belirsiz; çeşitli laboratuvarların ve sağlayıcıların fiyatları da yıllar boyunca belirgin bir gerekçe olmadan inip çıktı
    Açık ağırlıklı modeller en azından çıkarım maliyeti için bir taban ölçüt sunarak fiyatları daha rasyonel ve öngörülebilir hale getiriyor. Kimi K3 çıksa bile istenirse K2 kullanılmaya devam edilebildiğinden, açık modellerin rekabet baskısı ve sürekliliği kullanıcılar için faydalı

    • Fiyatlar, mevcut hesaplama kaynakları ve rekabet ortamında piyasanın kaldırabileceği seviyede belirlenir; bunu bulmak için farklı fiyat noktalarını denemek gerekir. Sağlayıcılar çeşitli tarifeleri ve indirimleri denerken talep de değişiyor
      İstikrarlı, olgun pazarlara alışkınsanız bu kafa karıştırıcı gelebilir; ama yeni pazarların fiyat oynaklığı sık görülen bir özelliktir
    • GPT-5’in çıkışından sonra GPT-4o’nun kaldırılmasına büyük tepki gelmesinde olduğu gibi, her modelin kendine özgü özellikleri var ve bazı kullanım alanlarında eski bir model en yenisinden daha iyi olabilir. Laboratuvarların LTS sürümleri sunmaya istekli görünmemesi nedeniyle eski modelleri çalıştırmaya devam edebilme becerisi özellikle önemli
    • FlashAttention’ın etkisi çok büyüktü
    • Reçeteli ilaçların pahalı, jenerik ilaçların ucuz olması gibi, bu da Ar-Ge maliyetlerini geri kazanmak için yapay bir fiyat şişirmesi olabilir
    • GPT-4’ün kendi fiyatını gerçekten düşürüp düşürmedikleri şüpheli. API’nin eski sürümleri hâlâ çok pahalı; fiyatlar ancak Turbo gibi yeni modeller çıkınca düştü
      Hepsinin adında gpt-4 geçmesi, iç modelin aynı olduğu anlamına gelmez; hizmet maliyetini düşürmek için önemli ölçüde değiştirilmiş olabilir
  • Kubernetes’in konumuna ulaşmak için birden fazla şirketin eğitim verileri açık olan yapay zeka modellerini birlikte geliştirmesi gerekecek. Şirketlerin Linux’a birlikte katkıda bulunması gibi, yapay zeka modelleri iş için gerekli ama sıfırdan geliştirmek çok pahalı olduğundan açık modelleri kullanıp ihtiyaç duyulan özelliklere katkı sağlamak mantıklı olabilir

  • OpenAI de dönemin ölçütlerine göre iyi iki açık kaynak model yayımladı. 20B model evde metin inceleme veya Bash betiği taslağı hazırlama için harika; ancak 120B’yi tüketici donanımında gerçekçi saniye başına token hızlarında çalıştırmak zor
    Yine de OpenAI bu modelleri daha sık güncellese iyi olur

    • gpt-oss-120b, Strix Halo’da saniyede 30’dan fazla token, 128GB MacBook Pro M5 Max’te saniyede 75’ten fazla token hızında çalışıyor
      Manevi halefi Nemotron 3 ailesi gibi görünüyor, ancak o da biraz eskimiş durumda: https://research.nvidia.com/labs/nemotron/Nemotron-3/
      Daha yeni Gemma 4 de var: https://huggingface.co/collections/google/gemma-4
      Ya da Qwen3.6 seçilebilir: https://huggingface.co/collections/Qwen/qwen36
    • Sam Altman, GPT-3’ün çıkışından iki buçuk yıl sonra yönetim kuruluna gönderdiği e-postada, yerelde çalışan GPT-3 düzeyinde bir model yapmanın başkalarının aynı düzeyde model yayımlamasını caydırabileceğini ve yeni girişimlerin finansman bulmasını zorlaştırabileceğini yazmıştı
      Çin teknoloji seviyesini yukarı çekmek için açık modeller yayımlıyor; OpenAI ve Sam’in bunları rakipleri bastırmak amacıyla yayımlaması ise aradaki fark
    • OpenAI’nin modeli fena değil, ancak çıktığı dönemde Qwen3 Coder A3B gibi alternatiflerden daha rekabetçi değildi. Bir startup için, bir süre devamı gelmeyen OpenAI’nin ilk modeli yerine birden fazla açık ağırlık güncellemesi sunan Qwen3’ü seçmek için güçlü nedenler var
      ABD laboratuvarlarından sınır seviye model isteyen startup’lar açısından mevcut yayın döngüsü sürdürülebilir değil. ABD bu pazarı tamamen kaptırmak istemiyorsa OpenAI ve benzerlerinin hızla tempo artırması gerekiyor
  • Çin donanım üretimini artırana kadar kendi başına çalıştırmak ekonomik değil, ancak açık modellerin laboratuvarlar üzerinde baskı oluşturması olumlu. Sonunda telefonlar çoğu iş için yeterli modelleri çalıştırabilir hale geldiğinde Apple’ın kazanması muhtemel

    • Model-on-Chip yaklaşıyor. GPU genel amaçlı bir hesaplama birimi olduğu için model çıkarımında büyük darboğazlar var; ancak çipe işlenmiş bir model büyük ölçüde güncellenemese bile performans kazancı muazzam olur
      En ileri yarı iletken süreçleri de gerekmediğinden maliyet ciddi ölçüde düşürülebilir
    • Böyle olursa hyperscaler’lar ve Oracle için neredeyse son demek; o günü sabırsızlıkla bekliyorum
    • Balon öncesi fiyatlara göre 128GB Strix Halo yaklaşık 1.400 dolara 200W civarında güç kullanıyordu; dört tanesi bir araya getirildiğinde 1 trilyon parametreli frontier modeli çalıştırabiliyor: https://www.amd.com/en/developer/resources/technical-article...
      Düğüm başına Claude Code aboneliğinin 7 aylık bedeliyle hesaplandığında yatırım 28 ayda geri dönüyor; 5 yıllık amortisman bazında ise neredeyse başa baş maliyetle iki küme kurup iki eşzamanlı istek akışını işleyebilirsiniz
      Yeni nesil donanım zaten duyuruldu ve Moore yasasının yaklaşık iki döngüsü sonrasında piyasaya çıkması bekleniyor; oturmuş fiyatının 2024 değeriyle 1.400 doların altında ve daha hızlı olması muhtemel
      Finans balonu söndüğünde ve laboratuvarların veri merkezi donanımı alımları durduğunda yerel çıkarım abonelikten daha ucuz ve oldukça pratik hale gelecek. O zaman UNIX Surplus’ın dot-com çöküşünden sonra yaptığı gibi çıkarım sunucularını kelepir fiyata satıp satmayacağını, yoksa güç gereksinimlerinin ev kullanımı için fazla özel mi kalacağını merak ediyorum
    • Kodlama dışı işler için kuantize modelleri gece boyunca çalıştırmak çoğu ihtiyacı karşılayabilir
    • Evdeki masaüstünde modeli çalıştırıp telefon uygulamasıyla kullanıyorum; modele ve kullanım amacına göre saniyede 60–140 token alıyorum. Sesli konuşmayı sürdürmek için de yeterince hızlı
  • Hükümetin belirli bir API sağlayıcısına kalıcı olarak bağımlı olmak yerine taşınabilir ve birlikte çalışabilir sistemler tedarik ederek talep yaratması fikrinin değeri var. Bunu yalnızca federal hükümet değil, California, Colorado, Illinois, New York gibi eyalet yönetimleri de uygulayabilir

  • Açık ağırlıklı modellerle ajan tabanlı kodlama yapan gerçek kurulumları merak ediyorum. Hangi çalıştırma araçları ve modeller kullanılıyor, aylık maliyet ne; Claude Code ve Pro gibi sübvansiyonlu tarifelerle karşılaştırınca nasıl duruyor bilmek isterim
    Açık modellerin ucuz ve verimli olduğu sözü pratikte de doğru mu görmek istiyorum

    • Eskiden özel bir çalıştırma aracı kullanıyordum, ancak araçlar iyileştiği için kurulumu epey basitleştirdim. Temel model de kodun zor kısımlarında başarısız oluyor, bu yüzden yalnızca fırsat uygun olduğunda yararlanıyorum
      Zed’de üç yerel model kullanıyorum: tek bir RTX 3090 üzerindeki llama.cpp ile 128K bağlamlı Qwen 3.6 27B saniyede yaklaşık 50 token, bir Titan V ve iki GTX 1080 Ti üzerindeki llama.cpp ile tam bağlamlı Qwen 3.6 35B-A3B yaklaşık 30 token; GPT-OSS 120B ise CPU’da yavaş çalışıyor
      Zed’in paralel ajanlarını kullanarak işler arasında geçiş yapıyor, model takılırsa durdurup kodu düzeltiyorum. Bu yöntemle odağımı koruyup bakımı yapılabilir kod üretirken hedefin yaklaşık %80’ine ulaşıyorum
      30 yıllık deneyimim var ve kodun nasıl çalıştığını mutlaka anlamaya çalışıyorum; bu nedenle kodun ilerleyişini üçüncü taraflara bağımlı kılmadan kısa vadeli avantajların çoğunu elde ediyorum. İki adet GTX 5060 Ti 16GB ile, yaygın bulunabilen kartlarla Qwen 3.6 35B-A3B’de saniyede yaklaşık 100 token mümkün olur
      En yeni bulut modelleri taslak token’lar vb. kullanarak genel kodlama için çok iyi, ancak alan odaklı işlerde performans düşüyor. Taslak modelin boyutu temel modelin yalnızca %10–20’si kadar ve en üst seviye Blackwell GPU bile saniyede yaklaşık 250 token ile sınırlı olduğundan, temel seviye performansı ölçeklemek için MoE veya taslak model gerekiyor
      Ancak benim kullanımım dağılım dışı (OOD) sorunlar ya da eğitim derleminde az örneği bulunan problemler olduğu için bu optimizasyonlar dezavantajlı. Lamborghini’den çok minibüse ihtiyaç duyulan bir duruma benziyor
    • Ryzen 5950X, 128GB bellek ve RTX 3060 12GB üzerinde kendi çalıştırma aracım ve qwen 3.6 35B unsloth 4 bit kullanıyorum
      10K bağlamda üretim saniyede yaklaşık 40 token, prefill yaklaşık 500 token; 100K bağlamda üretim yaklaşık 25 token, prefill yaklaşık 400 token veriyor
      Çoğu zaman önce GPT veya Claude ile ayrıntılı, adım adım bir plan oluşturup Qwen’in bunu izlemesini sağlıyorum. Ekonomik mi emin değilim, ama donanım zaten var ve çatıdaki güneş panelleri sayesinde elektrik büyük sorun değil
      En büyük avantaj, tüm işlemlerin tamamen yerel gerçekleşmesi ve çalıştırma aracının yükleme ya da telemetri yapmadığından emin olabilmem
    • Kimi K3 ve OpenCode kullanıyorum; API kullandıkça öde modeliyle sürekli kullanımda 1–2 oturum saatte yaklaşık 10 milyon token ve yaklaşık 5 dolar tüketiyor
      Paketlerin sınırlarından ve çalışma biçiminden hoşlanmadığım için aboneliklerle karşılaştırmadım. Fable, Opus, Gemini’den belirgin şekilde daha yavaş, ancak bunların API ücretlerinden çok daha ucuz
    • Aylık 20 dolarlık Ollama Cloud paketiyle GLM-5.2 kullanıyorum. Aynı paketten birden çok API anahtarı alıp OpenWebUI sunucusu, OpenCode ve Pi geliştirme oturumlarında kullanıyorum; genelde aynı anda 2–4 oturum çalıştırınca bile sınıra takılmıyorum
      İş yerinde Claude sağlanıyor; Opus kullanımının çalışma saati başına 75 dolar olduğuna dair rapor aldım
    • OpenCode’da GLM 5.2 awq4 kullandım; şirketin tercih ettiği Sonnet 4.8’den daha iyiydi, Opus 4.8’den biraz gerideydi ve geliştirme ekibinin ihtiyaç duyduğu işlerin çoğu için yeterliydi. Sonnet 5’ten kötü ama token’lar tükenmiyor
      Buna karşılık çalıştırmak için dört H200 gerekiyor ve bu yapılandırmayla bağlamı önbelleğe alabilecek kullanıcı sayısı yalnızca yaklaşık üç
      Blackwell makinelerinin gelmesini ve Kimi 3 ağırlıklarının gerçekten yayımlanmasını bekliyorum. Geliştiricilerin maaşlarının ciddi bir kısmını token’lara harcadığı noktada, saçma derecede pahalı bir DGX sunucusunu doğrudan satın alıp rafa takmak ve işletmek aslında daha ucuza geliyor
  • Çin hükümetinin en iyi modellerin eğitilmesini ve yayımlanmasını destekleyerek OpenAI ve Anthropic üzerinde açık rekabet baskısı oluşturduğu yorumu inandırıcı gelmiyor. Aksine, en ileri modelleri Çin hükümetinin onayladığı bilgi dağıtım biçimine uyacak şekilde pekiştirmeli öğrenmeyle ayarlamanın bir yolu gibi görünüyor
    Sorulara yanıt veren opak bir sisteme güvenmem gerekiyorsa, Çin hükümetinin onayladığı ve büyük ölçekli sübvansiyon verdiği bir model yerine piyasa baskısı altındaki ABD’li kâr amaçlı halka açık bir şirketin modelini seçerim

    • Bu, Çin’in başka pazarlarda yaptığı gibi ürünleri damping yaparak rakipleri piyasadan silme stratejisiyle uyumlu. Token başına büyük zarar ediyorlarsa, bir hasım tüketimi kötü niyetle artırıp maliyetleri şişirebilir
      Fiziksel ürünlerde dampingde talep sınırlıdır ve çevresel maliyet yüksektir; yazılım talebi ise fiilen sınırsızdır ve üretim maliyetine kıyasla çevresel maliyeti de düşük olduğundan AI dampingini tersine çevirerek kullanmak mümkün olabilir
    • Çin modellerindeki devlet destekli önyargıya karşı koyacak araçların ne olduğunu merak ediyorum. Bireyler önyargıyı kolayca düzeltebiliyorsa bu pek akıllıca bir strateji gibi görünmüyor
  • Çin’in gelecekte de sınırdaki model ağırlıklarını Hugging Face’e yüklemeye devam edeceği varsayımı, sanki bir doğa yasasıymış gibi kabul ediliyor. Oysa Çin’in Mythos anı birkaç ay içinde geliyor ve çeşitli haberlere bakılırsa Çin’in de benzer şekilde karşılık verme olasılığı yüksek
    Çin’in Mythos’un devam modelini Hugging Face’e koyup herkesin güvenlik önlemlerini kaldırmasına izin vereceğine inanmak zor. Durum ne OpenAI ve Anthropic’in beklediği gibi, ne de Çin’in beklediği gibi ilerledi