1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • OpenAI, model, çıkarım sistemi ve ajan altyapısındaki verimlilik artışlarını fiyata ve işlem hızına yansıtarak kurumsal yapay zekada dolar başına performansı artırıyor
  • 30 Temmuz’dan itibaren Luna fiyatı %80, Terra fiyatı ise %20 düşürülüyor; API’de 1 milyon token başına Luna için giriş $0.20·çıkış $1.20, Terra için giriş $2·çıkış $12 uygulanacak
  • Luna, bir yıl önceki en ileri seviye modellerle benzer performansı görev başına yaklaşık %6 maliyetle ve neredeyse 9 kat hızla sunuyor; Agents’ Last Exam’de Fable 5’ten daha yüksek performans ve yaklaşık %99 daha düşük tahmini görev maliyeti kaydetti
  • GPT‑5.6 Sol’un Fast mode’u mevcut Priority Processing’in yerini alıyor ve zeka düzeyini korurken Standard’a kıyasla 2 kata varan fiyatla 2,5 kata kadar daha yüksek hız sunuyor
  • Şirketler, planlama ve belirsizliği giderme için Sol’u, net uygulama ve test için Luna’yı konumlandırmak gibi aşamalı değerlendirmelerle zeka·hız·maliyet dengesini ayarlayabilir

Luna·Terra fiyat indirimleri ve Sol hız iyileştirmesi

  • GPT‑5.6’daki çalışma verimliliği artışları, Luna·Terra fiyat indirimlerine ve Sol’un API işlem hızındaki iyileştirmelere yansıyor
  • En hızlı ve en ucuz model olan Luna %80, günlük işler için dengeli model olan Terra ise %20 daha ucuz hale geliyor
    • Codex ve ChatGPT Work ücretli aboneliklerinde de iki modelin kullanımı daha az kredi olarak hesaplanacak
    • Abonelik fiyatları ve kota bütçeleri değişmiyor
  • Luna, araçlar kullanarak çok adımlı iş akışlarını tamamlayabildiği için yüksek kalite gerektiren büyük hacimli işlerin operasyon maliyetini düşürüyor
  • Sol fiyatı değişmiyor

İş sonucuna göre model seçimi

  • Verimli yapay zeka kullanımı için görevin önemi·hata maliyeti·aciliyeti·ölçeğine göre zeka, hız, güvenilirlik ve maliyet dengesini belirlemek gerekir
    • Aynı iş akışında bile en uygun nokta aşamadan aşamaya değişebilir
  • Luna, bir yıl önce en ileri seviye kabul edilen modellerle benzer performansı görev başına yaklaşık %6 maliyetle ve neredeyse 9 kat hızla sunuyor
  • Uzmanlık gerektiren işleri ölçen Agents’ Last Exam’de Fable 5’ten daha yüksek performans gösterirken tahmini görev başına maliyeti yaklaşık %99 azalttı
  • Şirketler önce gerekli sonuçları ve kalite ölçütlerini belirleyip değerlendirme yoluyla ek zekanın sonucu gerçekten iyileştirdiği bölümleri ve düşük maliyetli işlemenin aynı kaliteyi sağladığı bölümleri ayırt edebilir
    • Kodlama iş akışlarında Sol belirsizliği giderir ve plan oluşturur
    • Açıkça tanımlanmış değişikliklerin uygulanması, test yazma·çalıştırma ve sonuç değerlendirme Luna tarafından üstlenilebilir
  • GPT‑5.6 ürün ailesi, aşama aşama gereken zekayı uygulama ve yaratılan değere göre ödeme yapma seçeneklerini genişletiyor

Modelden ajana uzanan verimlilik iyileştirmeleri

  • Verimlilik artışı modelde, modeli çalıştıran çıkarım sistemlerinde ve araçlarla bağlamı birbirine bağlayan ajan altyapısında birlikte gerçekleşiyor
    • GPT‑5.6 modelleri görevleri daha doğrudan yollarla işliyor
    • İyileştirilmiş yönlendirme donanım kullanımını artırıyor
    • Optimize edilmiş üretim yazılımı token’ları daha verimli üretiyor
    • Geliştirilmiş bağlam yönetimi, ajanların tamamlanmış işleri tekrarlamamasına yardımcı oluyor
  • Aynı bilgi işlem kaynaklarıyla daha fazla yararlı iş tamamlanarak sonuç başına süre·token·maliyet azaltılıyor

Sol’un desteklediği ek optimizasyonlar

  • İnsanların yönettiği süreçte GPT‑5.6 Sol, üretim kernel’larını otonom olarak yeniden yazıp optimize etti
  • Token üretimini iyileştirmek için yüzlerce deney tasarlayıp yürüttü; eğitimi izledi ve sorun çıktığında müdahale etti
  • Kernel çalışması, model sunmanın uçtan uca maliyetini %20 azalttı; deneyler sayesinde token üretim verimliliği de %15’ten fazla arttı
  • Modelin performansı ve otonomisi yükseldikçe bir sonraki verimlilik iyileştirmesini bulma hızının da arttığı bir geri bildirim döngüsü oluşuyor
  • İlgili mühendislik süreci GPT‑5.6 verimlilik iyileştirmesi tanıtımında görülebilir

Ölçeklenebilirliği destekleyen bilgi işlem stratejisi

  • Bol zeka talebini karşılamak için yalnızca daha fazla bilgi işlem kaynağı değil, yüksek üretkenlik sağlayan bilgi işlem de gerekir
  • OpenAI dayanıklı bir altyapı portföyü oluşturuyor ve her iş yükünü çalıştırmaya en uygun sisteme yerleştiriyor
    • Luna ve Terra fiyat indirimleriyle büyük hacimli işler daha büyük ölçekte ekonomik şekilde yürütülebiliyor
    • Fast mode, yanıt süresinin önemli olduğu Sol işleri için daha hızlı API erişimi sağlıyor
  • Büyük ölçekli belge analizi, müşteri etkileşimlerini sınıflandırma ve tekrarlı uygulama işleri gibi görevleri geniş çapta yürütmenin ekonomisi iyileşiyor
  • Karmaşık Sol iş yükleri, ek maliyeti haklı çıkaracak kadar hızın önemli olduğu durumlarda daha hızlı işlenebiliyor
  • Daha güçlü modeller teknik ekiplerin sonraki iyileştirmelerini destekleyerek performans artışı ve maliyet düşüşü için gereken süreyi kısaltıyor

Fast mode’un işleyişi ve uyumluluğu

  • API’deki Fast mode, Priority Processing’in yerini alıyor ve Codex’teki /fast ile eşleşiyor
  • GPT‑5.6 Sol’da zeka düzeyini değiştirmeden Standard işleme kıyasla 2,5 kata kadar daha yüksek hızı 2 kat fiyatla sunuyor
  • Geriye dönük uyumluluğu koruyarak mevcut priority etiketi belirtilmiş API istekleri de çalışmaya devam ediyor

Sunulma kapsamı ve API ücretleri

  • GPT‑5.6 Terra ve Luna, ChatGPT Work, Codex, OpenAI API üzerinde sunulmaya devam ediyor
    • ChatGPT Work ve Codex’in Free·Go kullanıcıları Terra’ya erişebilir
    • Plus·Pro·Business·Enterprise kullanıcıları Terra ve Luna’yı seçebilir
  • 30 Temmuz’dan itibaren API’de 1 milyon token başına fiyatlar şöyle olacak
    • Terra: giriş $2, çıkış $12
    • Luna: giriş $0.20, çıkış $1.20
  • ChatGPT ve Codex’in abonelik fiyatları ile kota bütçeleri korunuyor; ancak Terra ve Luna kullanıldığında harcanan kredi miktarı azalıyor
  • AWS’de fiyat değişikliği 30 Temmuz’un ilerleyen saatlerinden itibaren kademeli olarak uygulanacak
  • Tüm ücretler API fiyat bilgileri sayfasında görülebilir

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • John Wanamaker’ın “Reklam harcamalarının yarısı boşa gider, ama hangi yarısı olduğunu bilmeyiz” sözü model seçimine daha iyi uyuyor. Çoğu iş için güçlü bir modele ihtiyaç olmadığını biliyoruz, ama basit işlerle zor işleri ayırmanın kendisi çözmesi zor, hatta belki de karar verilemez bir problem

    • Pek zor değil. Önce durma problemini makul şekilde çözen bir kütüphane bulursan hemen başlayabilirsin
    • Henüz aynı anda 1.000 ajan çalıştırma aşamasına gelmedik. Şimdilik ajanın yaptığı önemli işleri bizzat dikkatle yönettiğimiz için, en ileri seviye olmayan bir modeli seçmek için pek neden yok. Kodlama dışı işlerde bu değişebilir
    • Bir ajan ve kullanıcı varsa, değerlendirme çalıştırıp modelin sınırlarını görebilirsin. Luna araç çağırma konusunda en iyisi değil, ama problemi ve araçları net tanımlarsan çok daha düşük maliyetle Gemini 4 Flash ile yarışabilir
    • https://news.ycombinator.com/item?id=49113236 bakış açısı yerinde
      HN, 1970’lerin donanımıyla da BBS gibi işletilebilir, ama gerçekte yaklaşık 10 bin transistörlü değil yaklaşık 10 milyar transistörlü bir CPU ile fiilen aynı işi yapıyor ve bunu pek dert etmiyoruz
  • “Bugünden itibaren en hızlı ve ucuz modelimiz GPT‑5.6 Luna’nın maliyetini %80 düşürüyoruz” denmesi insanı söyleyecek söz bulamaz hale getiriyor. Aylar içinde %5–10 iyileşmelerin olduğu bir durgunluk dönemine girdiğimizi sanıyordum; böyle ani bir değişim olunca fiyat tabanının neresi olduğu merak konusu

    • Model zekâsı mevcut bilgi işlerinin %90–95’ini istikrarlı şekilde halledebilir hale geldiğinde ağırlıklar silikona işlenecek ve fiyat/performans tekrar 10 kat iyileşecek
      Dinamik GPU kümeleri kalan %5 ve en ileri alanların genişletilmesi için kullanılacak; ayrıca bugün çoğu bilgi çalışanı için fazla zor olduğu için yapılmayan işler de yeni yeni ele alınmaya başlayacak
    • Mevcut fiyatın ne kadarının gerçek maliyet, ne kadarının yatırımcı sübvansiyonuyla pazar ele geçirme stratejisi olduğunu bilemeyiz. OpenAI finansal gücüne güveniyorsa, amiral ürününe sahip Anthropic’i sıkıştırma girişimi de olabilir
    • İnanması güç derecede etkileyici rakamlar. Performansı birkaç puan düşük olsa bile rakiplerinden %80’den fazla ucuz ve bir ABD şirketi tarafından ABD’li hiper ölçekli bulutta sunuluyorsa, çoğu şirket için başka bir seçimi gerekçelendirmek zor olur
    • Maliyetin %80 azaldığı anlamına gelir; verimliliğin %80 arttığı anlamına gelmez. Luna baştan beri pahalı olabilir ve modelin kendisi hakkında da yeterli bilgi yok
      Gerçek bir verimlilik iyileşmesiyse agresif kuantalama veya KV cache sıkıştırması nedeniyle kalite düşüşü gibi bedelleri olabilir
    • Birkaç ayda bir %5–10 iyileşme bile oldukça şaşırtıcı. Kimi 3’ün Anthropic, OpenAI ve Google içinde nasıl bir baskı yarattığını merak ediyorum
      Token’lar her yıl daha hızlı ve ucuz hale geldikçe, uzman ekipleri taklit eden yapay zeka fabrikaları ve çok daha yüksek paralellik gerçekçi olacak
  • Zaten ucuz ve performansı da iyi olan Luna’yı 5 kat daha ucuz hale getirmeleri şaşırtıcı. İşte Sol, evde Luna kullanıyorum; fark açık ama ezici değil. Bir yıl boyunca fiyatlar sürekli yükseldikten sonra Luna, Kimi K3 ve GLM 5.2 ile yeniden düşüşe geçmiş gibi hissettiriyor

    • Bunu Kimi veya GLM ile aynı akımda görmek zor. GLM 5.2, Çin modelleri açısından büyük bir fiyat artışıydı; Kimi K3 bunun da üstüne çıktı ve OpenAI fiyatlarına yaklaştı
      OpenAI ve Anthropic de aylarca fiyat artırdıktan sonra bir ABD laboratuvarı fiyatı büyük ölçüde düşürdü; bu daha çok ters yönde bir hareket gibi görünüyor
    • Şirketler pazarı kapmak için gece gündüz rekabet ediyor, yani sonunda bu sadece zaman meselesi
    • Kimi’nin gerçekten ucuz olup olmadığı şüpheli; aksine oldukça pahalı bir model
    • Hata düzeltme gibi sonucu doğrulanabilen işlerde uygun bir doğrulama süreci yazarsan herhangi bir modeli kullanabilirsin
  • “Çekirdek çalışmalarıyla model sunumunun uçtan uca maliyetini %20 azalttık ve deneylerle token üretim verimliliğini %15’ten fazla artırdık” deniyor. GPT-5.6 sunum maliyeti %20 azaldıysa, bu ayda onlarca milyar dolar tasarruf anlamına mı geliyor merak ediyorum
    SpaceX IPO belgelerine göre Anthropic, iki Colossus veri merkezinin çıkarım kapasitesini kiralamak için 1,25 milyar dolar harcamış, ancak mevcut AWS vb. kapasite hesaba katıldığında bunun toplamın ne kadarı olduğu bilinmiyor. OpenAI’ın aylık çıkarım maliyetinin de onlarca milyar dolar ölçeğinde olması çok muhtemel; bu yüzden %20 tasarruf muazzam bir değişim

    • Yaklaşık 2 yıl önce Gemini 2.5, kendi çekirdek iyileştirmelerine yardım ederek ancak %1 verimlilik artışına ulaşmıştı; şimdi %20’ye kadar gelinmiş
    • Özgeçmişe “çıkarım maliyetini %20 düşürerek şirketin ayda onlarca milyar dolar tasarruf etmesini sağladı” yazabildiğini hayal ediyorum
  • Bu değişim çevirmeli bağlantıdan geniş banda geçiş gibi hissettiriyor. Derin araştırma için Luna’yı zaten güçlü biçimde öneriyordum; aynı maliyetle 5 kat daha fazla çalıştırabilmek inanılmaz
    Şu anda bile hipotez üretimi için paralel 10 ajan çalıştırıyorum; 50 tanesini hayal etmek zor. Aynı prompt’u ve modeli onlarca kez çalıştırmanın maliyet yükü düşükse istatistikler çok daha ilginç ve güçlü hale gelir

    • ‘Derin araştırma’yı tam olarak nasıl yürüttüğünü merak ediyorum
    • Hipotez üretimi ve araştırma süreci hakkında daha fazlasını bilmek isterim. İyi fikirlerin daha fazla akıl yürütme gücü gerektirdiğini düşünüp Sol kullanıyordum, ama bir noktadan sonra nicelik kaliteden daha iyi olabilir gibi görünüyor
    • Hangi işlerin ajan sayısını artırmaktan fayda gördüğünü, hangilerinin görmediğini merak ediyorum
  • Luna’nın yeni fiyatı beklenmedik; bu fiyat/performansla rekabet edecek bir ürün piyasada yok gibi görünüyor
    Prodüksiyon uygulamalarında artık OpenAI açık ara en iyi sağlayıcı. API istikrarlı ve özellik açısından zengin; modeller genelinde fiyat/performansı da mükemmel. Uzun süre Fireworks üzerinde Kimi K2.5 gibi açık ağırlıklı modeller kullandım, ama aralıklı sorunlar yaşadım; Anthropic ve Google’da da benzerdi. OpenAI hızlı ve neredeyse her zekâ seviyesinde daha iyi fiyat/performans sunuyor

    • OpenAI API’si çok istikrarlı; son arıza veya kesintinin ne zaman olduğunu hatırlamayacak kadar
  • Genelde OpenRouter’ın fiyat/performans grafiğine bakıp sağdaki "Show Pareto" seçeneğini etkinleştiriyorum. Kişisel projelerde hâlâ GLM-5.2 kullanıyordum, ama artık Luna zahmetsiz tercih haline geldi

    • OpenRouter’ın çıkıştan beri Luna ve Terra’da %50 indirim yapıp yapmadığını merak ediyorum. Bu indirimden sonra o indirime ne olacağını bilmiyorum
    • Resmî belgelere göre Luna önceki Nano model ailesine daha yakın; kodlama performansı da gerçekten iyi mi merak ediyorum
  • Luna’daki %80 fiyat indirimi çok agresif. En ileri zekânın gerekmediği çoğu iş için ezici derecede iyi bir tercih; Luna’nın Opus 5 ile yarıştığı durumlar bile var

    • Luna, Haiku ile rekabet etmesi için yapılmış bir model; hangi işlerde Opus ile aynı seviyede olduğunu merak ediyorum
    • Sol’un xhigh seviyesi ile Luna’nın max seviyesi arasında göze çarpan bir fark vardı. Sol prompt’u daha iyi anlıyor; Luna’ya daha somut ve net talimat vermek gerekiyor
  • Çok miktarda DeepSeek v4 flash token’ını peşin ödedim; bitince bir süre Luna token’ı satın almayı denemek istiyorum. Ucuz ve hızlı modelleri tercih ediyorum, emekliyim; arada daha güçlü modele elle geçmek zaman alsa da sorun değil

  • Luna’nın %80 ucuzlaması şaşırtıcı. Hesaplama maliyetleri düşmeye devam ettiği için gelecek yıl güçlü modellerin API kullanım ücretleri abonelik ücretlerinden daha ucuz hale gelebilir

    • Abonelik kullanıcıyı bağlı tutar ve şirketler için büyük değer taşır; bu yüzden API abonelikten daha ucuz hale gelmeyecektir