- Yeterli performans ve taşınabilirliğe sahip açık ağırlıklı modeller, geliştiricilerin, bulutların ve şirketlerin birlikte ölçeklendirdiği bir temel haline gelerek tek bir tedarikçinin yetişmekte zorlanacağı bir inovasyon ekosistemi yaratabilir
- Kubernetes’in ortak bir arayüz üzerine ağ, depolama ve gözlemlenebilirlik araçlarını çekmesi gibi, AI tarafında da model sunumu, ince ayar, ajan çalışma zamanı ve değerlendirmeye uzanan bir prodüksiyon yığını büyüyor
- Hugging Face’teki herkese açık model sayısı 2 milyonu aştı; GLM-5.2, kendi SWE-bench Pro değerlendirmesinde %62,1 ile GPT-5.5’in %58,6’sını geçti; Kimi K3 de bağımsız değerlendirmede Opus 4.8 ve GPT-5.5 ile benzer puan aldı
- Çin yapımı açık ağırlıklı modellerin geniş çapta yasaklanması halinde dünyadaki geliştirme devam ederken yalnızca ABD’li araştırmacılar ve şirketler ekosistemin dışında kalabilir; son bir yılda Hugging Face indirmelerinin %41’ini oluşturan Çin modellerinin etrafında inovasyon birikebilir
- ABD, yasaklar yerine ticari olarak kullanılabilir frontier modelleri yayımlayarak, taşınabilirlik ve birlikte çalışabilirliği öne çıkaran kamu alımlarıyla, tüm araç ve operasyon katmanını inşa ederek ve bağımsız güvenlik testleri ile standartlarla rekabet etmeli
Kubernetes’in gösterdiği açık platform gücü
- Mesosphere, Apache Mesos üzerine açık kaynak bulut yerel yazılımlar geliştirdi ve bunun etrafında DC/OS’u inşa ederek destek ve tescilli özellikler içeren kurumsal bir dağıtım olarak ticarileştirdi
- Daha sonra daha yeni ve tamamen açık kaynak bir proje olan Kubernetes, bulut yerel topluluğunu etrafında toplayarak Mesosphere’i sarstı
- Dünya çapındaki dağıtık sistemler ve altyapı mühendisleri kariyerlerini Kubernetes’e bağladı; Mesosphere’in sadık topluluk üyelerinin bir kısmı da oraya geçti
- İnovasyonun merkezi Kubernetes’e kayınca ağ, depolama, gözlemlenebilirlik, dağıtım araçları, politika motorları gibi eksik bileşenler hızla geliştirildi
- Çok sayıda startup ve yerleşik tedarikçinin katılmasıyla Kubernetes’i prodüksiyonda çalıştırmak için gereken neredeyse tüm bileşenler açık kaynak olarak sunuldu
- Bulut sağlayıcıları ile Mesosphere/D2iQ, Rancher, Red Hat ve Nutanix; entegrasyon, kurumsal özellikler, destek ve operasyon etrafında iş modelleri kurdu
- Kubernetes’in başarısı yalnızca deponun açılmasının sonucu değildi
- Mühendislerin, bulut sağlayıcılarının ve kurumsal tedarikçilerin müşteri ihtiyaçlarına göre genişletebildiği tarafsız bir temel haline geldi
- Ortak arayüzler ve tedarikçiden bağımsız yönetişim, katılımcılara uzun vadede ürün inşa edebileceklerine dair güven verdi
- Özelleştirilebilir açık bir platform sektörün merkezine yerleştiğinde, tek bir tedarikçinin tüm ekosistemin birleşik inovasyon hızına yetişmesi zorlaşır
Açık ağırlık ile açık kaynak AI arasındaki fark
- Genellikle açık kaynak diye adlandırılan modellerin çoğu, daha doğru ifadeyle açık ağırlıklı modellerdir
- Eğitilmiş parametreler indirilebilir ve değiştirilebilir, ancak eğitim verileri ve tüm eğitim süreci çoğu zaman公开 değildir
- Bu nedenle Open Source Initiative’in açık kaynak AI tanımını karşılamazlar
- Tam anlamıyla açık kaynak olmasa bile, kullanıcıların çalıştırıp değiştirebildiği çıktılar etrafında ekosistem oluşabilir
- Kubernetes ile AI’ın yapıları arasında önemli farklar da var
- Kubernetes katkıcıları gerçek kaynak kodunu inceleyip değiştirebiliyor ve iyileştirmeleri ortak upstream projeye yansıtıyordu
- Model ince ayar sonuçları genelde aynı şekilde paylaşılmaz
- Frontier bir modelin ağırlıkları indirilebilse bile çalıştırmak için pahalı donanım gerekebilir
- AI’da tarafsız yönetişim ve ortak arayüzler sağlayan CNCF benzeri bir kuruluş yok
- İki ekosistemin ortak noktası, yeterli performans ve taşınabilirliğe sahip bir temelin, orijinal üreticinin tek başına yapabileceği kapsamın ötesinde tamamlayıcı inovasyonu çekmesidir
Self-hosting’den model platformuna
- Açık ağırlıklı modellerin benimsenmesinin ilk nedeni self-hosting idi
- Şirketler, verileri doğrudan kontrol ederek modelleri kendi bulutlarında veya veri merkezlerinde çalıştırmak istedi
- Kullanım ve çıkarım maliyetleri arttıkça maliyetleri de doğrudan kontrol etme isteği büyüdü
- Bu talep üzerine vLLM, SGLang, llama.cpp, Ollama, MLX gibi açık kaynak model sunum yığınları oluştu
- Açık ağırlıklar, self-hosting’in ötesine geçerek geliştiricilerin modelin kendisini değiştirmesini ve yeniden dağıtmasını mümkün kılar
- Hugging Face’te 2 milyondan fazla herkese açık model kayıtlı
- Qwen ve Gemma gibi popüler model ailelerinin etrafında çeşitli türev çıktılar üretiliyor
- Farklı yarı iletken mimarileri ve ölçekler için kuantize edilmiş ve dönüştürülmüş ağırlıklar
- Kodlama, tıp, hukuk, matematik ve ajan iş akışları için ince ayarlı modeller ve LoRA adaptörleri
- Farklı ince ayar sonuçlarını birleştiren model birleştirmeleri
- TensorRT-LLM, vLLM, MLX gibi çeşitli çalışma zamanlarına uyarlanmış model varyantları
Frontier ve daralan performans farkı
- Geçmişte açık modellerin temel performansı en zor kodlama ve ajan görevleri için yetersiz olduğundan onları frontier rekabetinin dışında görmek kolaydı; ancak bu fark hızla kapanıyor
- Z.ai, MIT lisansıyla açık ağırlıklar sağlayan GLM-5.2’yi yayımladı
- Kendi değerlendirmesindeki SWE-bench Pro puanı %62,1 ile GPT-5.5’in %58,6’sından yüksek
- Ancak sonuçlar benchmark’a ve ajan harness’ına göre değişebilir
- Moonshot, Kimi K3’ün uzun süreli kodlama işlerinde kapalı frontier modellere yaklaştığını söyleyerek 27 Temmuz’da ağırlıkları yayımlama sözü verdi
- Artificial Analysis’in bağımsız değerlendirmesinde de Kimi K3, Opus 4.8 ve GPT-5.5 ile benzer puan aldı
- Temel modelin performansı yeterli hale geldiğinde ajan çalışma zamanları, kodlama harness’ları, sandbox’lar, değerlendirme, gözlemlenebilirlik ve uzmanlaşmış ince ayar projeleri zincirleme şekilde büyüyebilir
- Bu bileşenler, ekiplerin iş yüküne, donanımına ve maliyet yapısına göre ayarlanabilen prodüksiyon seviyesinde açık bir yığın oluşturur
- Açık ağırlıklı modellerin açık kaynak yazılım üzerinde çalıştırıldığı bir yapıdır
- Her benchmark’ta tüm kapalı modelleri yeneceği garanti edilemez
- Frontier AI bir yetenek rekabetidir; açık ekosistemler, dünyanın dört bir yanındaki yeteneklerin aynı temel üzerinde geliştirme yapması için neden sunar
Çin modellerinin yasaklanmasının ABD’ye etkisi
- Kimi K3 dahil güçlü Çin modellerinin ortaya çıkmasının ardından Trump yönetiminin Çin yapımı açık ağırlıklı modellere yönelik kısıtlamaları değerlendirdiği bildiriliyor
- Olası bir yasağın nasıl bir biçim alacağı henüz belirsiz
- Çin yapımı açık ağırlıklı modellerin kullanımını geniş çapta yasaklamak, ABD’li araştırmacı ve şirketleri küresel AI araştırmacıları ve mühendislerinin toplandığı ekosistemden kendi kendine ayırabilir
- Bu ekosisteme çok sayıda Çinli araştırmacı da katılıyor
- Dünyadaki geliştirme faaliyetleri devam ederken yalnızca ABD’li geliştiricilerin erişemediği bir sonuç doğar
- Qwen etrafında aynı akış şimdiden görülüyor
- Hugging Face verilerine göre son bir yılda Çin modelleri, toplam model indirmelerinin %41’ini oluşturdu
- En iyi açık ağırlıklı temel modeller Çin’den gelmeye devam ederse, Kubernetes döneminde olduğu gibi bu modellerin etrafında araçlar ve inovasyon birikebilir
ABD’nin rekabet edebileceği dört yol
-
Frontier seviyesinde ABD modelleri yayımlamak
- ABD laboratuvarları, startup’ların gerçek ürünler inşa edebileceği lisanslarla frontier seviyesinde açık ağırlıklı modeller yayımlamalı
- Bazı ilerlemeler şimdiden görülüyor
- NVIDIA Nemotron, NVIDIA’nın izin verici lisansı altında ticari olarak kullanılabiliyor
- Thinking Machines’in Inkling, OpenAI’ın gpt-oss ve Google’ın Gemma 4 modelleri Apache 2.0 ile yayımlandı
- Ancak OpenAI ve Google’ın en yüksek performanslı modelleri dahil ABD’deki frontier laboratuvarlarının en güçlü modellerinin çoğu hâlâ kapalı
-
Kamu alımlarıyla açık pazar oluşturmak
- Kamu alımları, tek bir API tedarikçisine kalıcı olarak bağımlı sistemler yerine taşınabilirlik ve birlikte çalışabilirlik sunan sistemlere talep yaratmalı
- ABD Savunma Bakanlığı zaten benzer bir yaklaşım kullanıyor
- Platform One, birden fazla askeri programın temel alabileceği açık kaynak araçlar ve kurumsal ürünler sunuyor
- Aynı alım yöntemi, açık ağırlıklı modeller etrafındaki inovasyonu hızlandırabilir
-
Model dışındaki tüm yığını inşa etmek
- ABD şirketleri modellerin çevresindeki diğer katmanları da inşa etmeli
- Startup’lar modelleri özelleştirip genişletebilir ve ürünlerine gömebilir
- Sunum, araçlar, destek ve operasyon katmanları da iş fırsatıdır
- ABD’nin büyük yarı iletken şirketleri donanımı geliştirmeyi sürdürebilir; hyperscaler’lar ve neo-cloud’lar modelleri ve ekosistemi servis olarak sunabilir
-
Yasak yerine test ve standartlar getirmek
- Güvenlik, kısıtlamaları destekleyen en güçlü gerekçe olsa da toptan yasak fazla geniştir ve tüm ekosisteme erişimi de feda eder
- Daha iyi yanıt, frontier modeller için bağımsız testler ve standartlar oluşturmaktır
- Kubernetes uygunluk testi, güvenliği değil uyumluluğu doğruladığı için AI’a birebir karşılık gelen bir örnek değildir
- Ancak bağımsız kriterler ve yönetişim modeli referans alınabilir
- Demis Hassabis de buna benzer ABD öncülüğünde bağımsız bir standart kuruluşu önerdi
Açık AI ekosisteminde rekabet stratejisi
- ABD, kendi geliştiricilerinin etrafına duvar örmek yerine Çin modellerini doğrudan çalıştırmalı, içlerini analiz etmeli, benchmark etmeli ve iyileştirmeli
- Aynı zamanda daha iyi ABD yapımı alternatifler inşa ederek ABD’nin AI yığınını dünyada benimsemesi en kolay seçenek haline getirmeli
- ABD, onlarca yıldır dünyanın en iyi teknoloji yeteneklerini çekti ve geliştirebilecekleri bir alan sundu
- Diğer ülkeler daha açık yığınları standart olarak benimserken bu rekabet gücünü kapalı bir ekosisteme dönüştürmek, ABD’nin AI liderliği konumundan kendi eliyle vazgeçmesi olur
1 yorum
Hacker News yorumları
Çin modellerinin yasaklanması teknik olarak imkânsız görünüyor. Ağırlıklar nihayetinde sadece sayılardan ibaret; ABD yapımı ile Çin yapımını ayırt etmek mümkün değil ve kaynak temelli yasaklar kolayca aşılabilir
Sonuçta tüm açık ağırlıklı modelleri düzenlemek gerekir; nitekim Axios’un haberine göre büyük yapay zeka laboratuvarları veya bu çevrelerle ilişkili kişiler her 3–5 ayda bir yönetime açık kaynak modellerin yasaklanmasını önermiş
DRM’e benzer bir lisanslama sistemi dayatılarak yalnızca sertifikalı ABD modellerinin kendi sunucularında çalıştırılması sağlanabilir; ancak bu, büyük laboratuvarlara tekel hakkı verir ve türev modellerin dağıtımını da engeller. Yurt dışında uygulanması zor olacağından, sonunda muhtemelen sadece Amerikalılar kısıtlanmış olur
Bunun yerine Çinli şirketlere veya Çinli şirketlerin sahip olduğu işletmelere çıkarım/yapay zeka hizmeti bedeli ödenmesi yasaklanabilir
Yapay zeka sektörünün en tuhaf yanlarından biri token fiyatlandırma sistemi. 2023 başında GPT-4 çok pahalıyken 6 ay sonra 20 dolara hatırı sayılır miktarda çıkarım kullanılabilir hale gelmesinin nedeni belirsiz; çeşitli laboratuvarların ve sağlayıcıların fiyatları da yıllar boyunca belirgin bir gerekçe olmadan inip çıktı
Açık ağırlıklı modeller en azından çıkarım maliyeti için bir taban ölçüt sunarak fiyatları daha rasyonel ve öngörülebilir hale getiriyor. Kimi K3 çıksa bile istenirse K2 kullanılmaya devam edilebildiğinden, açık modellerin rekabet baskısı ve sürekliliği kullanıcılar için faydalı
İstikrarlı, olgun pazarlara alışkınsanız bu kafa karıştırıcı gelebilir; ama yeni pazarların fiyat oynaklığı sık görülen bir özelliktir
Hepsinin adında
gpt-4geçmesi, iç modelin aynı olduğu anlamına gelmez; hizmet maliyetini düşürmek için önemli ölçüde değiştirilmiş olabilirKubernetes’in konumuna ulaşmak için birden fazla şirketin eğitim verileri açık olan yapay zeka modellerini birlikte geliştirmesi gerekecek. Şirketlerin Linux’a birlikte katkıda bulunması gibi, yapay zeka modelleri iş için gerekli ama sıfırdan geliştirmek çok pahalı olduğundan açık modelleri kullanıp ihtiyaç duyulan özelliklere katkı sağlamak mantıklı olabilir
OpenAI de dönemin ölçütlerine göre iyi iki açık kaynak model yayımladı. 20B model evde metin inceleme veya Bash betiği taslağı hazırlama için harika; ancak 120B’yi tüketici donanımında gerçekçi saniye başına token hızlarında çalıştırmak zor
Yine de OpenAI bu modelleri daha sık güncellese iyi olur
gpt-oss-120b, Strix Halo’da saniyede 30’dan fazla token, 128GB MacBook Pro M5 Max’te saniyede 75’ten fazla token hızında çalışıyorManevi halefi Nemotron 3 ailesi gibi görünüyor, ancak o da biraz eskimiş durumda: https://research.nvidia.com/labs/nemotron/Nemotron-3/
Daha yeni Gemma 4 de var: https://huggingface.co/collections/google/gemma-4
Ya da Qwen3.6 seçilebilir: https://huggingface.co/collections/Qwen/qwen36
Çin teknoloji seviyesini yukarı çekmek için açık modeller yayımlıyor; OpenAI ve Sam’in bunları rakipleri bastırmak amacıyla yayımlaması ise aradaki fark
ABD laboratuvarlarından sınır seviye model isteyen startup’lar açısından mevcut yayın döngüsü sürdürülebilir değil. ABD bu pazarı tamamen kaptırmak istemiyorsa OpenAI ve benzerlerinin hızla tempo artırması gerekiyor
Çin donanım üretimini artırana kadar kendi başına çalıştırmak ekonomik değil, ancak açık modellerin laboratuvarlar üzerinde baskı oluşturması olumlu. Sonunda telefonlar çoğu iş için yeterli modelleri çalıştırabilir hale geldiğinde Apple’ın kazanması muhtemel
En ileri yarı iletken süreçleri de gerekmediğinden maliyet ciddi ölçüde düşürülebilir
Düğüm başına Claude Code aboneliğinin 7 aylık bedeliyle hesaplandığında yatırım 28 ayda geri dönüyor; 5 yıllık amortisman bazında ise neredeyse başa baş maliyetle iki küme kurup iki eşzamanlı istek akışını işleyebilirsiniz
Yeni nesil donanım zaten duyuruldu ve Moore yasasının yaklaşık iki döngüsü sonrasında piyasaya çıkması bekleniyor; oturmuş fiyatının 2024 değeriyle 1.400 doların altında ve daha hızlı olması muhtemel
Finans balonu söndüğünde ve laboratuvarların veri merkezi donanımı alımları durduğunda yerel çıkarım abonelikten daha ucuz ve oldukça pratik hale gelecek. O zaman UNIX Surplus’ın dot-com çöküşünden sonra yaptığı gibi çıkarım sunucularını kelepir fiyata satıp satmayacağını, yoksa güç gereksinimlerinin ev kullanımı için fazla özel mi kalacağını merak ediyorum
Hükümetin belirli bir API sağlayıcısına kalıcı olarak bağımlı olmak yerine taşınabilir ve birlikte çalışabilir sistemler tedarik ederek talep yaratması fikrinin değeri var. Bunu yalnızca federal hükümet değil, California, Colorado, Illinois, New York gibi eyalet yönetimleri de uygulayabilir
Açık ağırlıklı modellerle ajan tabanlı kodlama yapan gerçek kurulumları merak ediyorum. Hangi çalıştırma araçları ve modeller kullanılıyor, aylık maliyet ne; Claude Code ve Pro gibi sübvansiyonlu tarifelerle karşılaştırınca nasıl duruyor bilmek isterim
Açık modellerin ucuz ve verimli olduğu sözü pratikte de doğru mu görmek istiyorum
Zed’de üç yerel model kullanıyorum: tek bir RTX 3090 üzerindeki
llama.cppile 128K bağlamlı Qwen 3.6 27B saniyede yaklaşık 50 token, bir Titan V ve iki GTX 1080 Ti üzerindekillama.cppile tam bağlamlı Qwen 3.6 35B-A3B yaklaşık 30 token; GPT-OSS 120B ise CPU’da yavaş çalışıyorZed’in paralel ajanlarını kullanarak işler arasında geçiş yapıyor, model takılırsa durdurup kodu düzeltiyorum. Bu yöntemle odağımı koruyup bakımı yapılabilir kod üretirken hedefin yaklaşık %80’ine ulaşıyorum
30 yıllık deneyimim var ve kodun nasıl çalıştığını mutlaka anlamaya çalışıyorum; bu nedenle kodun ilerleyişini üçüncü taraflara bağımlı kılmadan kısa vadeli avantajların çoğunu elde ediyorum. İki adet GTX 5060 Ti 16GB ile, yaygın bulunabilen kartlarla Qwen 3.6 35B-A3B’de saniyede yaklaşık 100 token mümkün olur
En yeni bulut modelleri taslak token’lar vb. kullanarak genel kodlama için çok iyi, ancak alan odaklı işlerde performans düşüyor. Taslak modelin boyutu temel modelin yalnızca %10–20’si kadar ve en üst seviye Blackwell GPU bile saniyede yaklaşık 250 token ile sınırlı olduğundan, temel seviye performansı ölçeklemek için MoE veya taslak model gerekiyor
Ancak benim kullanımım dağılım dışı (OOD) sorunlar ya da eğitim derleminde az örneği bulunan problemler olduğu için bu optimizasyonlar dezavantajlı. Lamborghini’den çok minibüse ihtiyaç duyulan bir duruma benziyor
qwen 3.6 35B unsloth 4 bitkullanıyorum10K bağlamda üretim saniyede yaklaşık 40 token, prefill yaklaşık 500 token; 100K bağlamda üretim yaklaşık 25 token, prefill yaklaşık 400 token veriyor
Çoğu zaman önce GPT veya Claude ile ayrıntılı, adım adım bir plan oluşturup Qwen’in bunu izlemesini sağlıyorum. Ekonomik mi emin değilim, ama donanım zaten var ve çatıdaki güneş panelleri sayesinde elektrik büyük sorun değil
En büyük avantaj, tüm işlemlerin tamamen yerel gerçekleşmesi ve çalıştırma aracının yükleme ya da telemetri yapmadığından emin olabilmem
Paketlerin sınırlarından ve çalışma biçiminden hoşlanmadığım için aboneliklerle karşılaştırmadım. Fable, Opus, Gemini’den belirgin şekilde daha yavaş, ancak bunların API ücretlerinden çok daha ucuz
İş yerinde Claude sağlanıyor; Opus kullanımının çalışma saati başına 75 dolar olduğuna dair rapor aldım
GLM 5.2 awq4kullandım; şirketin tercih ettiği Sonnet 4.8’den daha iyiydi, Opus 4.8’den biraz gerideydi ve geliştirme ekibinin ihtiyaç duyduğu işlerin çoğu için yeterliydi. Sonnet 5’ten kötü ama token’lar tükenmiyorBuna karşılık çalıştırmak için dört H200 gerekiyor ve bu yapılandırmayla bağlamı önbelleğe alabilecek kullanıcı sayısı yalnızca yaklaşık üç
Blackwell makinelerinin gelmesini ve Kimi 3 ağırlıklarının gerçekten yayımlanmasını bekliyorum. Geliştiricilerin maaşlarının ciddi bir kısmını token’lara harcadığı noktada, saçma derecede pahalı bir DGX sunucusunu doğrudan satın alıp rafa takmak ve işletmek aslında daha ucuza geliyor
Çin hükümetinin en iyi modellerin eğitilmesini ve yayımlanmasını destekleyerek OpenAI ve Anthropic üzerinde açık rekabet baskısı oluşturduğu yorumu inandırıcı gelmiyor. Aksine, en ileri modelleri Çin hükümetinin onayladığı bilgi dağıtım biçimine uyacak şekilde pekiştirmeli öğrenmeyle ayarlamanın bir yolu gibi görünüyor
Sorulara yanıt veren opak bir sisteme güvenmem gerekiyorsa, Çin hükümetinin onayladığı ve büyük ölçekli sübvansiyon verdiği bir model yerine piyasa baskısı altındaki ABD’li kâr amaçlı halka açık bir şirketin modelini seçerim
Fiziksel ürünlerde dampingde talep sınırlıdır ve çevresel maliyet yüksektir; yazılım talebi ise fiilen sınırsızdır ve üretim maliyetine kıyasla çevresel maliyeti de düşük olduğundan AI dampingini tersine çevirerek kullanmak mümkün olabilir
Çin’in gelecekte de sınırdaki model ağırlıklarını Hugging Face’e yüklemeye devam edeceği varsayımı, sanki bir doğa yasasıymış gibi kabul ediliyor. Oysa Çin’in Mythos anı birkaç ay içinde geliyor ve çeşitli haberlere bakılırsa Çin’in de benzer şekilde karşılık verme olasılığı yüksek
Çin’in Mythos’un devam modelini Hugging Face’e koyup herkesin güvenlik önlemlerini kaldırmasına izin vereceğine inanmak zor. Durum ne OpenAI ve Anthropic’in beklediği gibi, ne de Çin’in beklediği gibi ilerledi