1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • DeepSeek-V4-Flash API kararlı sürümü, 31 Temmuz 2026'da herkese açık beta olarak yayımlandı; mevcut çağrı yönteminde yalnızca model adını deepseek-v4-flash olarak belirterek kullanılabiliyor
  • Ajan performansı V4-Pro-Preview'i belirgin şekilde geride bıraktı ve Terminal Bench 2.1'de 82,7 puan dahil olmak üzere Cybergym 76,7, Toolathlon verified 70,3, DSBench-FullStack 68,7 sonuçlarını kaydetti
  • Kod ajanı benchmark'ları, yakında yayımlanacak DeepSeek Harness minimal modunda max effort, top_p=0.95, temperature=1.0 koşullarıyla ölçüldü
  • Kararlı V4-Flash, Responses API biçimini yerel olarak destekliyor ve Codex'e göre ayarlandı; Preview ile aynı model yapısı ve boyutunda yalnızca sonradan ek eğitim uygulandı
  • Değişiklik kapsamı V4-Flash API ile sınırlı; V4-Pro API ve APP/WEB modelleri korunuyor, V4-Pro kararlı sürümünün yakında yayımlanması planlanıyor

Herkese açık beta çıkışı ve API kullanımı

  • DeepSeek-V4-Flash API kararlı sürümü, 31 Temmuz 2026'da herkese açık beta olarak yayımlandı
  • Mevcut çağrı yöntemi aynen korunuyor; model parametresi deepseek-v4-flash olarak ayarlandığında en güncel sürüm kullanılabiliyor
  • V4 serisi, öncekiyle aynı base_url üzerinden OpenAI ChatCompletions ve Anthropic arayüzleriyle sunuluyor
    • V4-Pro için deepseek-v4-pro, V4-Flash için deepseek-v4-flash kullanılıyor
    • Önceki model adları olan deepseek-chat ve deepseek-reasonerın 24 Temmuz 2026'da kullanımdan kaldırılması planlanmıştı
    • Geçiş döneminde bu iki ad sırasıyla V4-Flash'in düşünmesiz modu ve düşünme moduna işaret ediyordu

Ajan benchmark sonuçları

  • V4-Flash kararlı sürümü, ajan performansında V4-Pro-Preview'in belirgin şekilde üzerinde sonuçlar kaydetti
    • Terminal Bench 2.1: 82,7
    • NL2Repo: 54,2
    • Cybergym: 76,7
    • DeepSWE: 54,4
    • Toolathlon verified: 70,3
    • Agent Last Exam: 25,2
    • Automation Bench Public: 25,1
    • DSBench-FullStack: 68,7
    • DSBench-Hard: 59,6
  • Açık benchmark'lardaki kod ajanı görevleri, yakında yayımlanacak DeepSeek Harness minimal modunda ölçüldü
    • effort seviyesi max olup top_p=0.95, temperature=1.0 olarak ayarlandı
  • DSBench-FullStack şirket içi full-stack geliştirme test seti, DSBench-Hard ise şirket içi kodlama ajanı zor problem setidir

Responses API ve Codex entegrasyonu

  • Kararlı V4-Flash, Responses API biçimini yerel olarak destekliyor ve Codex'e göre ayarlandı
  • Codex entegrasyonu için gerekli ayarlar resmî belgelerde bulunabilir

Model değişiklik kapsamı

  • DeepSeek-V4-Flash-0731, V4-Flash-Preview ile aynı model yapısını ve boyutunu koruyor
  • Modelin kendi yapısında değişiklik yapılmadan yalnızca sonradan ek eğitim uygulandı
  • Güncelleme yalnızca DeepSeek-V4-Flash API'ye uygulanıyor
    • DeepSeek-V4-Pro API değişmedi
    • APP/WEB'de sunulan modeller de aynen korunuyor
  • DeepSeek-V4-Pro kararlı sürümünün yakında yayımlanması planlanıyor

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • Kişisel olarak K3’ten daha çok heyecan veriyor. DSV4 modelinin sunum maliyeti çok düşük; performansı arttıkça daha fazla işte “yeterince iyi” bir model hâline gelebilir.
    DeepSeek uzun süredir Pro sürümünü çok ucuza sunuyor ve OpenCode gibi araçlarla entegre olduğu için, gerçek geliştirme işi verisini de epey toplamış olması muhtemel. Bunları sonradan eğitmede kullanırsa ek iyileştirmeler de mümkün.
    K3’ü DSV4’e damıttıklarında ne kadar daha iyi olacağını da merak ediyorum. Ucuz ve hızlı modeller, sağlayıcının keyfine göre ortadan kalkmadan performanslarından yararlanmaya devam edilebildiği için topluluk açısından özellikle faydalı. En azından Flash, 10 bin doların altındaki ekipmanla evde bile çalıştırılabilir; GLM ya da K3 büyük modelleri ise pratikte zor.

    • Eğitim verisi sağlamayı kabul edebileceğim sağlayıcılar yalnızca DeepSeek ve Moonshot.
    • DwarfStar ile birleştirilirse kullanılabilir bir yerel yapay zeka mümkün olur diye umuyorum.
  • İşlerimin %90’ını Flash ile hallediyorum. Nedenini bilmiyorum ama Pro’dan daha iyi; çok ucuz ve hızlı.
    Değişiklik miktarını 1.000 satırın altında tutup mimari kararları kendim verirsem, en ileri modellerle aradaki farkı neredeyse hissetmiyorum. Kalan %10’u hataları ve güvenlik sorunlarını bulmak ya da daha iyi yapıları değerlendirmek için kullanıyorum; Flash da bunda oldukça iyi ama çapraz doğrulama yapıyorum.
    Küçük değişiklikler için 5–10 dakika beklemektense hızlı yineleme çok daha iyi. Son dönemde Kimi ve GLM gereksiz yere uzun akıl yürütüp yavaş kaldı. Bağımlılıklar, loglar, performans dökümleri gibi çok fazla veriyi limit endişesi olmadan koyabiliyorum; binary reverse engineering işlerinde de güvenlik kısıtlarına takılmıyor.

    • Prompt ifadelerim zayıf olduğundan mı bilmiyorum ama Codex üzerinden kullandığım OpenAI modelleri binary reverse engineering’i hiç reddetmedi. Şu anda da Codex ile üçüncü taraf firmware analiz ediyorum ve hiç limite takılmadım.
      Buna karşılık güvenlikle ilgisi olmayan promptların bile reddedildiğini söyleyenler var; platformdan platforma, kullanıcıdan kullanıcıya fark gerçekten bu kadar büyük mü merak ediyorum.
    • DeepSeek V4 Flash çoğu iş için yeterli ve yanıtları hızlı. Tokenları çoğunlukla ABD’deki FireWorks.ai’den satın alıyorum ama DeepSeek’e de toplu ön ödeme yaptım.
      Claude Code’dan daha az token kullanan OpenCode’u ağırlıklı olarak kullanıyorum; DeepSeek’in kendi kodlama harness’ini çıkarmasını da bekliyorum.
    • Genel olarak iyi ama OpenRouter’da çıktı token sınırı aşırı sıkı. Akıl yürütme tuzağına düşerse limit içinde kendi kendine çıkamıyor; yine de Kimi modellerinin yerini aldı.
  • Kişisel günlük ajan işlerimin çoğunda DeepSeek kullandığım son 30 günlük kayıt: maliyet 4,55 dolar, 3.467 API isteği, 323.183.886 token.
    Küçük bir ekibi yöneten bir mühendis olarak kalite çıtam yüksek ve aynı standardı kişisel projelerime de uyguluyorum; buna rağmen kodlama ve inceleme işlerinde hiç hayal kırıklığı yaşamadım. Diğer işler için başka modeller kullanıyorum.

    • LLM ile kod incelemesi yaparken nasıl bir yöntem ve prompt kullandığını merak ediyorum. Yanıt kalitesi oldukça düşüktü; sorunun benim kullanım şeklimden kaynaklanıp kaynaklanmadığını bilmek istiyorum.
    • Bu düzeyde token caching elde etmek için hangi harness’i kullandığını merak ediyorum.
    • Halüsinasyonlar çok olmuyor mu; oluyorsa iş akışını nasıl etkiliyor merak ediyorum.
    • Kalitesi olağanüstü değil; çoğu LLM için de durum aynı.
  • Artık pi içindeki neredeyse tüm işleri Flash ile çalıştırıyorum. Uygun MCP sunucuları, bağlam küçültme araçları ve skill’lerle her türlü iş uygulanabilir.
    Bazı oturumlar 30 turdan fazla sürüyor ama hızlı ve ucuz; bir saat çalışsa bile yaklaşık 0,5 dolar yetiyor. Ancak çoklu alt ajan iş akışlarında planlama, inceleme ve oracle rolleri için daha pahalı modeller de kullanıyorum.
    Yavaş Opus aboneliğini haftalardır kullanmadım. Telefonda da çalışan, MCP ve skill desteği olan kendi barındırdığım OpenWebUI sohbetini de kurdum; Perplexity’nin yerini tamamen aldı ve barındırma ile abonelik maliyeti ayda yaklaşık 18 dolar.

    • Ben de pi + DeepSeek kombinasyonuna yapılacak iş takibi ve token tasarrufu için çok sayıda özel araç ekledim; yalnızca çok zor işlerde en ileri modelleri kullanıyorum. Bu kurulum ihtiyacım olan tüm özellikleri karşılıyor.
    • pi için kullanılabilecek eklenti önerileri almak isterim.
    • Bu güncellemede hissedilir bir iyileşme olup olmadığını merak ediyorum.
    • pi’de top_p ve temperature ayarlarının nasıl yapılacağını merak ediyorum.
  • Benchmark’lar gerçek kullanım performansını doğru yansıtıyorsa şaşırtıcı bir model. 300B model önceki DS4 Pro önizleme modelinin 1.8T parametreli performansını aşıyor ve GPT 5.6 Luna’dan da daha iyi görünüyor.
    Fiyat indirimi sonrası Luna’dan hâlâ daha ucuz.

    • DeepSWE’de DeepSeek %54,4, Luna %67.
  • 200B modelin GLM-5.2 ile rekabet edip Opus 4.8’e yaklaşması oldukça etkileyici.
    Bu rakamlar genel amaçlı performansa da yansır ve DeepSeek’in mükemmel caching’i de eklenirse kullanımın çok artacağına benziyor.

    • Sadece 200B model olması değil, boyutu da yalnızca 160GiB.
  • Daha net ayrıştırmak için neden v4.1-Flash denemediğini merak ediyorum.

  • Hızını ve düşük fiyatını korurken zaten yeterince kullanışlı olan deepseek-v4-pro’nun performansını aşarsa çok umut verici.
    deepseek-v4-flash zaten fiyat/performans açısından en iyi modeldi; zeka/maliyet metriğinde fark daha da açılacak gibi. Ancak DeepSeek API’nin ucuz maliyeti, codebase bilgilerinin Çin’e aktarılması karşılığında geliyor.

    • En azından bir benchmark’ta GLM 5.2’den daha iyi olduğu söyleniyor.
  • Pahalı işler için Opus yerine Kimi K3, genel işler için Sonnet yerine DSV4 Flash kullanmak mantıklı bir kurulum mu merak ediyorum.

    • deepseek-v4-pro’nun güncellenmiş sürümü yakında çıkacak gibi; DSV4 Flash’taki büyük iyileşmeye bakılırsa hem zeka hem maliyet açısından Kimi K3’ü geçme ihtimali yüksek.
    • Gayet mantıklı. DSV4 Flash ile bir saat kodlama ya da sunucu denetimi yaptığımda saf API maliyetinin yaklaşık 0,30 dolar olmasına her seferinde şaşırıyorum.
    • Arka planda iki model arasında geçiş yapmak için benim model router’ımı kullanabilirsin.
  • Kodlama dışı amaçlı ajanlarda DSv4 kullanım örneklerini merak ediyorum. Özellikle GPT-5.4 mini ile sınıflandırma veya kategorilendirme gibi işleri yapan kullanıcıların DSv4’ü nasıl kullandığını bilmek isterim.