- OpenAI, model, çıkarım sistemi ve ajan altyapısındaki verimlilik artışlarını fiyata ve işlem hızına yansıtarak kurumsal yapay zekada dolar başına performansı artırıyor
- 30 Temmuz’dan itibaren Luna fiyatı %80, Terra fiyatı ise %20 düşürülüyor; API’de 1 milyon token başına Luna için giriş $0.20·çıkış $1.20, Terra için giriş $2·çıkış $12 uygulanacak
- Luna, bir yıl önceki en ileri seviye modellerle benzer performansı görev başına yaklaşık %6 maliyetle ve neredeyse 9 kat hızla sunuyor; Agents’ Last Exam’de Fable 5’ten daha yüksek performans ve yaklaşık %99 daha düşük tahmini görev maliyeti kaydetti
- GPT‑5.6 Sol’un Fast mode’u mevcut Priority Processing’in yerini alıyor ve zeka düzeyini korurken Standard’a kıyasla 2 kata varan fiyatla 2,5 kata kadar daha yüksek hız sunuyor
- Şirketler, planlama ve belirsizliği giderme için Sol’u, net uygulama ve test için Luna’yı konumlandırmak gibi aşamalı değerlendirmelerle zeka·hız·maliyet dengesini ayarlayabilir
Luna·Terra fiyat indirimleri ve Sol hız iyileştirmesi
- GPT‑5.6’daki çalışma verimliliği artışları, Luna·Terra fiyat indirimlerine ve Sol’un API işlem hızındaki iyileştirmelere yansıyor
- En hızlı ve en ucuz model olan Luna %80, günlük işler için dengeli model olan Terra ise %20 daha ucuz hale geliyor
- Codex ve ChatGPT Work ücretli aboneliklerinde de iki modelin kullanımı daha az kredi olarak hesaplanacak
- Abonelik fiyatları ve kota bütçeleri değişmiyor
- Luna, araçlar kullanarak çok adımlı iş akışlarını tamamlayabildiği için yüksek kalite gerektiren büyük hacimli işlerin operasyon maliyetini düşürüyor
- Sol fiyatı değişmiyor
İş sonucuna göre model seçimi
- Verimli yapay zeka kullanımı için görevin önemi·hata maliyeti·aciliyeti·ölçeğine göre zeka, hız, güvenilirlik ve maliyet dengesini belirlemek gerekir
- Aynı iş akışında bile en uygun nokta aşamadan aşamaya değişebilir
- Luna, bir yıl önce en ileri seviye kabul edilen modellerle benzer performansı görev başına yaklaşık %6 maliyetle ve neredeyse 9 kat hızla sunuyor
- Uzmanlık gerektiren işleri ölçen Agents’ Last Exam’de Fable 5’ten daha yüksek performans gösterirken tahmini görev başına maliyeti yaklaşık %99 azalttı
- Şirketler önce gerekli sonuçları ve kalite ölçütlerini belirleyip değerlendirme yoluyla ek zekanın sonucu gerçekten iyileştirdiği bölümleri ve düşük maliyetli işlemenin aynı kaliteyi sağladığı bölümleri ayırt edebilir
- Kodlama iş akışlarında Sol belirsizliği giderir ve plan oluşturur
- Açıkça tanımlanmış değişikliklerin uygulanması, test yazma·çalıştırma ve sonuç değerlendirme Luna tarafından üstlenilebilir
- GPT‑5.6 ürün ailesi, aşama aşama gereken zekayı uygulama ve yaratılan değere göre ödeme yapma seçeneklerini genişletiyor
Modelden ajana uzanan verimlilik iyileştirmeleri
- Verimlilik artışı modelde, modeli çalıştıran çıkarım sistemlerinde ve araçlarla bağlamı birbirine bağlayan ajan altyapısında birlikte gerçekleşiyor
- GPT‑5.6 modelleri görevleri daha doğrudan yollarla işliyor
- İyileştirilmiş yönlendirme donanım kullanımını artırıyor
- Optimize edilmiş üretim yazılımı token’ları daha verimli üretiyor
- Geliştirilmiş bağlam yönetimi, ajanların tamamlanmış işleri tekrarlamamasına yardımcı oluyor
- Aynı bilgi işlem kaynaklarıyla daha fazla yararlı iş tamamlanarak sonuç başına süre·token·maliyet azaltılıyor
Sol’un desteklediği ek optimizasyonlar
- İnsanların yönettiği süreçte GPT‑5.6 Sol, üretim kernel’larını otonom olarak yeniden yazıp optimize etti
- Token üretimini iyileştirmek için yüzlerce deney tasarlayıp yürüttü; eğitimi izledi ve sorun çıktığında müdahale etti
- Kernel çalışması, model sunmanın uçtan uca maliyetini %20 azalttı; deneyler sayesinde token üretim verimliliği de %15’ten fazla arttı
- Modelin performansı ve otonomisi yükseldikçe bir sonraki verimlilik iyileştirmesini bulma hızının da arttığı bir geri bildirim döngüsü oluşuyor
- İlgili mühendislik süreci GPT‑5.6 verimlilik iyileştirmesi tanıtımında görülebilir
Ölçeklenebilirliği destekleyen bilgi işlem stratejisi
- Bol zeka talebini karşılamak için yalnızca daha fazla bilgi işlem kaynağı değil, yüksek üretkenlik sağlayan bilgi işlem de gerekir
- OpenAI dayanıklı bir altyapı portföyü oluşturuyor ve her iş yükünü çalıştırmaya en uygun sisteme yerleştiriyor
- Luna ve Terra fiyat indirimleriyle büyük hacimli işler daha büyük ölçekte ekonomik şekilde yürütülebiliyor
- Fast mode, yanıt süresinin önemli olduğu Sol işleri için daha hızlı API erişimi sağlıyor
- Büyük ölçekli belge analizi, müşteri etkileşimlerini sınıflandırma ve tekrarlı uygulama işleri gibi görevleri geniş çapta yürütmenin ekonomisi iyileşiyor
- Karmaşık Sol iş yükleri, ek maliyeti haklı çıkaracak kadar hızın önemli olduğu durumlarda daha hızlı işlenebiliyor
- Daha güçlü modeller teknik ekiplerin sonraki iyileştirmelerini destekleyerek performans artışı ve maliyet düşüşü için gereken süreyi kısaltıyor
Fast mode’un işleyişi ve uyumluluğu
- API’deki Fast mode, Priority Processing’in yerini alıyor ve Codex’teki
/fastile eşleşiyor - GPT‑5.6 Sol’da zeka düzeyini değiştirmeden Standard işleme kıyasla 2,5 kata kadar daha yüksek hızı 2 kat fiyatla sunuyor
- Geriye dönük uyumluluğu koruyarak mevcut
priorityetiketi belirtilmiş API istekleri de çalışmaya devam ediyor
Sunulma kapsamı ve API ücretleri
- GPT‑5.6 Terra ve Luna, ChatGPT Work, Codex, OpenAI API üzerinde sunulmaya devam ediyor
- ChatGPT Work ve Codex’in Free·Go kullanıcıları Terra’ya erişebilir
- Plus·Pro·Business·Enterprise kullanıcıları Terra ve Luna’yı seçebilir
- 30 Temmuz’dan itibaren API’de 1 milyon token başına fiyatlar şöyle olacak
- Terra: giriş $2, çıkış $12
- Luna: giriş $0.20, çıkış $1.20
- ChatGPT ve Codex’in abonelik fiyatları ile kota bütçeleri korunuyor; ancak Terra ve Luna kullanıldığında harcanan kredi miktarı azalıyor
- AWS’de fiyat değişikliği 30 Temmuz’un ilerleyen saatlerinden itibaren kademeli olarak uygulanacak
- Tüm ücretler API fiyat bilgileri sayfasında görülebilir
1 yorum
Hacker News yorumları
John Wanamaker’ın “Reklam harcamalarının yarısı boşa gider, ama hangi yarısı olduğunu bilmeyiz” sözü model seçimine daha iyi uyuyor. Çoğu iş için güçlü bir modele ihtiyaç olmadığını biliyoruz, ama basit işlerle zor işleri ayırmanın kendisi çözmesi zor, hatta belki de karar verilemez bir problem
HN, 1970’lerin donanımıyla da BBS gibi işletilebilir, ama gerçekte yaklaşık 10 bin transistörlü değil yaklaşık 10 milyar transistörlü bir CPU ile fiilen aynı işi yapıyor ve bunu pek dert etmiyoruz
“Bugünden itibaren en hızlı ve ucuz modelimiz GPT‑5.6 Luna’nın maliyetini %80 düşürüyoruz” denmesi insanı söyleyecek söz bulamaz hale getiriyor. Aylar içinde %5–10 iyileşmelerin olduğu bir durgunluk dönemine girdiğimizi sanıyordum; böyle ani bir değişim olunca fiyat tabanının neresi olduğu merak konusu
Dinamik GPU kümeleri kalan %5 ve en ileri alanların genişletilmesi için kullanılacak; ayrıca bugün çoğu bilgi çalışanı için fazla zor olduğu için yapılmayan işler de yeni yeni ele alınmaya başlayacak
Gerçek bir verimlilik iyileşmesiyse agresif kuantalama veya KV cache sıkıştırması nedeniyle kalite düşüşü gibi bedelleri olabilir
Token’lar her yıl daha hızlı ve ucuz hale geldikçe, uzman ekipleri taklit eden yapay zeka fabrikaları ve çok daha yüksek paralellik gerçekçi olacak
Zaten ucuz ve performansı da iyi olan Luna’yı 5 kat daha ucuz hale getirmeleri şaşırtıcı. İşte Sol, evde Luna kullanıyorum; fark açık ama ezici değil. Bir yıl boyunca fiyatlar sürekli yükseldikten sonra Luna, Kimi K3 ve GLM 5.2 ile yeniden düşüşe geçmiş gibi hissettiriyor
OpenAI ve Anthropic de aylarca fiyat artırdıktan sonra bir ABD laboratuvarı fiyatı büyük ölçüde düşürdü; bu daha çok ters yönde bir hareket gibi görünüyor
“Çekirdek çalışmalarıyla model sunumunun uçtan uca maliyetini %20 azalttık ve deneylerle token üretim verimliliğini %15’ten fazla artırdık” deniyor. GPT-5.6 sunum maliyeti %20 azaldıysa, bu ayda onlarca milyar dolar tasarruf anlamına mı geliyor merak ediyorum
SpaceX IPO belgelerine göre Anthropic, iki Colossus veri merkezinin çıkarım kapasitesini kiralamak için 1,25 milyar dolar harcamış, ancak mevcut AWS vb. kapasite hesaba katıldığında bunun toplamın ne kadarı olduğu bilinmiyor. OpenAI’ın aylık çıkarım maliyetinin de onlarca milyar dolar ölçeğinde olması çok muhtemel; bu yüzden %20 tasarruf muazzam bir değişim
Bu değişim çevirmeli bağlantıdan geniş banda geçiş gibi hissettiriyor. Derin araştırma için Luna’yı zaten güçlü biçimde öneriyordum; aynı maliyetle 5 kat daha fazla çalıştırabilmek inanılmaz
Şu anda bile hipotez üretimi için paralel 10 ajan çalıştırıyorum; 50 tanesini hayal etmek zor. Aynı prompt’u ve modeli onlarca kez çalıştırmanın maliyet yükü düşükse istatistikler çok daha ilginç ve güçlü hale gelir
Luna’nın yeni fiyatı beklenmedik; bu fiyat/performansla rekabet edecek bir ürün piyasada yok gibi görünüyor
Prodüksiyon uygulamalarında artık OpenAI açık ara en iyi sağlayıcı. API istikrarlı ve özellik açısından zengin; modeller genelinde fiyat/performansı da mükemmel. Uzun süre Fireworks üzerinde Kimi K2.5 gibi açık ağırlıklı modeller kullandım, ama aralıklı sorunlar yaşadım; Anthropic ve Google’da da benzerdi. OpenAI hızlı ve neredeyse her zekâ seviyesinde daha iyi fiyat/performans sunuyor
Genelde OpenRouter’ın fiyat/performans grafiğine bakıp sağdaki
"Show Pareto"seçeneğini etkinleştiriyorum. Kişisel projelerde hâlâ GLM-5.2 kullanıyordum, ama artık Luna zahmetsiz tercih haline geldiLuna’daki %80 fiyat indirimi çok agresif. En ileri zekânın gerekmediği çoğu iş için ezici derecede iyi bir tercih; Luna’nın Opus 5 ile yarıştığı durumlar bile var
xhighseviyesi ile Luna’nınmaxseviyesi arasında göze çarpan bir fark vardı. Sol prompt’u daha iyi anlıyor; Luna’ya daha somut ve net talimat vermek gerekiyorÇok miktarda DeepSeek v4 flash token’ını peşin ödedim; bitince bir süre Luna token’ı satın almayı denemek istiyorum. Ucuz ve hızlı modelleri tercih ediyorum, emekliyim; arada daha güçlü modele elle geçmek zaman alsa da sorun değil
Luna’nın %80 ucuzlaması şaşırtıcı. Hesaplama maliyetleri düşmeye devam ettiği için gelecek yıl güçlü modellerin API kullanım ücretleri abonelik ücretlerinden daha ucuz hale gelebilir