1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Maksimum akıl yürütme ayarı AAII’de 50 puan alarak Kimi K3 (max) ve GLM-5.2 (max)’in ardından 3. sıraya yerleşti
  • Toplam 284 milyar parametrenin içinden her token için yalnızca 13 milyarı etkinleştiren bir MoE modelidir; metin girdi/çıktısı ve 1 milyon token bağlamı destekler
  • API fiyatı 1 milyon token başına girdi için $0.14, çıktı için $0.28, cache isabeti için $0.003; Intelligence Index tam değerlendirme maliyeti ise $72.02 oldu
  • Değerlendirme sürecinde 210 milyon çıktı tokenı kullanarak aynı sınıftaki modellerin 100 milyonluk medyanının çok üstünde, oldukça uzun yanıtlar üretti; çıktı hızı ise henüz açıklanmadı
  • Model ağırlıkları açıklandı ve MIT lisansı uygulandı; böylece self-hosting ve ticari kullanım mümkün, şu anda API sağlayıcısı ise 1 adet

Model yapısı ve yayınlama biçimi

  • DeepSeek V4 Flash 0731, 31 Temmuz 2026’da yayımlanan akıl yürütme odaklı açık ağırlıklı bir modeldir
  • Toplam parametre sayısı 284 milyardır ve çıkarım sırasında token başına 13 milyar parametrenin etkinleştiği Mixture of Experts(MoE) yapısını kullanır
  • Model ağırlıkları indirilerek self-hosting yapılabilir
  • MIT lisansı ile ticari kullanıma izin verilir
  • Maksimum akıl yürütme çabası (Max Effort) kullanan akıl yürütme sürümüdür; ayrıca akıl yürütmeyen ayrı bir sürüm de olabilir

Zeka değerlendirmesi

  • Artificial Analysis Intelligence Index v4.1’de 50 puan aldı
    • Kimi K3 (max) ve GLM-5.2 (max)’in ardından 3. sırada. Ardından Kimi K3 (low) ve MiniMax-M3 4. ve 5. sırada geliyor
    • Aynı sınıftaki büyük açık ağırlıklı modellerin medyanı 25 puandır
    • Artificial Analysis bunu zeka açısından öncü model grubunda sınıflandırıyor
  • Intelligence Index v4.1 şu 9 değerlendirmeyi birleştiriyor
    • GDPval-AA v2: ajan tipi gerçek iş görevleri
    • 𝜏³-Banking: ajan tipi araç kullanımı
    • Terminal-Bench v2.1: ajan tipi kodlama/terminal kullanımı
    • SciCode: kodlama
    • Humanity's Last Exam: akıl yürütme/bilgi
    • GPQA Diamond: bilimsel akıl yürütme
    • CritPt: fizik akıl yürütmesi
    • AA-Omniscience: bilgi doğruluğu ve halüsinasyon baskılama
    • AA-LCR: uzun bağlam akıl yürütmesi

Ek benchmark kapsamı

  • Modellerin ayrıntılı kullanım alanlarını karşılaştırabilmek için şu değerlendirme sonuçları da sunuluyor
    • AA-Briefcase: ajan tipi bilgi işi
    • AutomationBench-AA: SaaS iş otomasyonu
    • Harvey LAB-AA: hukuk ajanı işleri
    • EnterpriseOps-Gym-AA: kurumsal operasyon işleri
    • IFBench: komutlara uyum
    • APEX-Agents-AA: uzun süreli ajan görevleri
    • ITBench-AA: Kubernetes arıza kök nedeni analizi
    • MMMU-Pro: görsel akıl yürütme
  • DeepSeek V4 Flash 0731 görüntü girdisini desteklemediği için yalnızca metin modelidir ve multimodal bir model değildir

Bilgi güvenilirliği ve halüsinasyon değerlendirmesi

  • AA-Omniscience Index, doğru yanıtlara puan verir ve halüsinasyonları cezalandırır; yanıt vermeyi reddetmeye ise ceza vermez
  • Puan aralığı -100 ile 100 arasındadır
    • 0 puan, doğru ve yanlış yanıt sayısının eşit olduğu anlamına gelir
    • Negatif değer, doğru yanıtlardan daha fazla yanlış yanıt olduğu anlamına gelir

Token kullanımı ve yanıt özellikleri

  • Intelligence Index tam değerlendirmesinde 210 milyon çıktı tokenı üretti
    • Aynı sınıftaki açık ağırlıklı modellerin medyanı 100 milyon tokendır
    • Artificial Analysis bunu çok uzun yanıt seviyesi olarak sınıflandırıyor
  • Görev başına çıktı token sayısı, her benchmark’ın çıktı miktarına Intelligence Index ağırlığı uygulanıp tekrar çalıştırmalar hariç görev sayısına bölünerek hesaplanır
  • Çıktı hızı henüz ölçülmediği için saniye başına çıktı tokenı açıklanmadı

API fiyatı ve değerlendirme maliyeti

  • DeepSeek API bazında fiyatlar şöyle
    • Girdi: 1 milyon token başına $0.14
    • Çıktı: 1 milyon token başına $0.28
    • Cache isabeti: 1 milyon token başına $0.003
  • Cache isabeti/girdi/çıktı 7:2:1 oranında karıştırıldığında 1 milyon token başına fiyat $0.06 oluyor
  • Intelligence Index tam değerlendirme maliyeti $72.02 oldu
  • Özet alanı, karşılaştırma modellerinin medyanını girdi $0.43/çıktı $1.20 olarak; SSS alanı ise girdi $0.58/çıktı $2.20 olarak gösterir
  • Görev başına maliyet; girdi, cache isabeti, cache yazma, akıl yürütme ve nihai yanıt token maliyetlerinin görev sayısına bölünmesinin ardından her benchmark’ın Index ağırlığı uygulanarak hesaplanır
  • Cache yazma ve depolama maliyetleri API sağlayıcısına göre ayrıca ücretlendirilebilir

Bağlam ve sunum kapsamı

  • Bağlam penceresi 1 milyon token olup 12 punto Arial’e göre yaklaşık 1.500 A4 sayfasına karşılık gelir
  • Büyük ölçekli belge arama ve akıl yürütme gerektiren RAG iş akışlarında kullanılabilir
  • Yalnızca metin girdi ve metin çıktısını destekler
  • Şu anda API sunan sağlayıcı sayısı 1’dir ve sağlayıcıya göre fiyatlar değişebilir

1 yorum

 
GN⁺ 2 시간 전
Hacker News görüşleri
  • Model ağırlıkları az önce yayımlandı: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • DwarfStar kuantize sürümü bekleniyor. 128GB MacBook Pro'da DeepSeek V4 Flash önizlemesini birkaç aydır ana kodlama ajanım olarak kullanıyorum; neredeyse tüm ölçütlerde GLM 5.2'den daha iyi görünüyor
    • 128×128 matris çarpımı primitiflerine sahip donanım hızlandırıcıları hedefliyor; bunun H100'deki Warp Group Matrix Multiply Accumulate anlamına gelip gelmediğini merak ediyorum
    • 165GB altı Unsloth GGUF ise 256GB RAM'e sahip CPU-only sistemlerin çoğunda çalıştırılabilir. llama-server ile olabildiğince 32GB·48GB·96GB GPU'lara yükleyip kalanını sistem DRAM'ine yerleştiren hibrit kurulum da mümkün
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Yeni DeepSeek modeli Noel hediyesi gibi. Düşük maliyetli API modellerini en iyi DeepSeek yapıyor ve VRAM fiyatları yerelde çalıştırmayı mümkün kılacak kadar düşene kadar en iyi yaklaşım bu gibi görünüyor
    Sübvansiyona dayalı abonelik modellerinin uzun ömürlü olması zor; API ücretlendirmesi ise sürdürülebilir bir iş modeline daha yakın duruyor

    • Bir projede DeepSeek kullanıyorum; on milyonlarca tokenı birkaç sente kullanabiliyor olmak şaşırtıcı. Her iş için uygun değil ama bazı işleri neredeyse bedava sayılabilecek bir maliyetle mükemmel yapıyor
    • Çin'in bellek ve hesaplama donanımında yetişip ABD şirketlerini hem fiyat hem performansta geçtiği günü görmeyi sabırsızlıkla bekliyorum
    • Geliştirici arkadaşlarım Claude tokenlarını bir saatte bitirdiklerinden şikayet ediyor, ben ise DS Flash'ı tüm gün kullanıyorum. Bazen hata yaparsa o zaman zor işler için Claude gibi bir modeli açmak yeterli oluyor
    • Token başına hesaplandığında da DeepSeek API büyük olasılıkla aboneliklerden daha maliyet verimli. Bizzat denediğimde Flash'ın yönerge takibi ciddi biçimde iyileşmişti ve daha proaktif hale gelmişti; şu anda maliyet verimliliği açısından ona yaklaşan çok az model var
    • Fiyatlara doğrudan bakınca, GPT 5.6 Luna ile aynı sonucu almak için 5 kat daha fazla token gerekiyor ve saniye başına token sayısı da çok daha düşük. Yine de DeepSeek'in yarattığı baskı sayesinde mevcut sağlayıcıların optimizasyona devam etmesi gibi net bir etkisi var
  • Eski adres 404 veriyor; doğru URL şu gibi görünüyor: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Dün yayımlanan OpenAI grafiğine DeepSeek V4 Flash 0731 veri noktasını ekledim; fiyat-performans sınırında yer alıyor
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Orijinal: https://openai.com/index/advancing-the-price-performance-fro...

  • Açık benchmark'taki kod ajanı görevlerinde henüz yayımlanmamış DeepSeek Harness minimum modu kullanılmış; optimize edilmiş bir kodlama ajanı harness'ı da duyurmayı planlayıp planlamadıklarını merak ediyorum
    DSv4 Flash'ı reasonix ya da pi ile birlikte kullanırsanız token derdi olmadan bütün gün birkaç sente kod yazabilirsiniz. Buna karşılık aynı modeli Fireworks veya OpenRouter'da ZDR ile kullanınca maliyet sebepsiz yere sürekli artıyor. Kullanım verisi toplamak için fiyatları sübvanse ediyor gibiler; yerelde çalıştırmanın mümkün olacağı günü bekliyorum

    • OpenRouter üzerinden değilse hangi sağlayıcıdan satın aldığını merak ediyorum. OpenRouter'da listelenen sağlayıcılardan biriyse doğrudan alınca fiyatın aynı olduğunu sanıyordum
    • Teknik raporda DeepSeek Harness zaten önceden duyurulmuştu. Kod ajanı görevleri minimum mod, maksimum akıl yürütme çabası, temperature = 1.0, top_p = 0.95 ile değerlendirildi ve harness daha sonra yayımlanacak
  • Tek bir RTX PRO 6000 96GB ya da DGX Spark 128GB kullananlar için daha az bilinen vllm-moet çok iyi bir motor. Çıkarım için simetrik 2-bit plane'leri otomatik oluşturuyor, doğruluk geri kazanımı için 4-bit delta cache de üretiyor ve RAM'den büyük ağırlıklar için SSD streaming destekliyor
    Her bölgeye ayrılacak VRAM miktarını belirleyerek hız ve doğruluk dengesini ayarlayabiliyorsunuz; DS V4 Flash üzerinde saniyede 170 token gösterildi. Ayrı bir dönüştürülmüş model olmadan doğrudan orijinal modeli kullanıyor
    DGX Spark'ta sm120 ile sm121 farkını görmezden gelen küçük bir geçici çözüm gerekiyor ama sm121 üzerinde de çalışabildiği için birkaç saat ayırmaya değer

  • 1 milyon çıktı tokenı başına 0,28 dolar karşılığında GLM 5.2·Gemini 3.6 düzeyinde zeka sunuyor ve güncellenmiş Pro modelinin de yakında gelmesi bekleniyor
    Unsloth kayıpsız Q8'in 162GB olması, evde gerçekten çalıştırılabilecek bir boyutta olduğu anlamına geliyor

    • O seviyede bir şeyi evde çalıştırmak nasıl bir ev gerektiriyor, görmek isterim
    • Q8 boyutu yaklaşık 151GB
  • DeepSeek V4 Flash, V4 Pro'yu geçiyorsa birkaç hafta içinde Opus 5 seviyesinde bir V4 Pro da bekleyebilir miyiz diye merak ediyorum. Opus'tan da iyi olursa daha da güzel olur

    • Geliştirdiğim bir uygulamada V4 Flash kullanıyorum; sadece GPT·Opus·Sonnet kullandıktan sonra buna geçince maliyet verimliliği ve performansı gerçekten şaşırtıcı geldi. Maliyet o kadar düşük ki kâr amacı gütmeyen bir uygulamaya bile cömert bir ücretsiz katman sunabiliyorum
      https://trysojourn.app
    • V4 Pro fiyatına Opus 5 performansı inanılmaz derecede iyi olurdu ama muhtemelen hayale daha yakın
    • Güncellenmiş V4 Pro final sürümünün yakında yayımlanacağı söylenmişti
  • Gerçekten ilginç olan kısım, mimariyi değiştirmeden yalnızca ek ince ayar ile büyük bir performans artışı elde etmiş olmaları. Sonuç, daha fazla veri, hesaplama ve zaman yatırımı
    DS V4 Flash rakip model ailesine kıyasla nispeten küçük olduğundan, yüksek kaliteli veri ve eğitim hattı başka küçük modellere de uygulanırsa benzer iyileşmeler elde etme olasılığı yüksek görünüyor

  • Görev başına fiyat açısından Luna'nın önüne zaten yaklaşık 2 kat farkla geçiyor: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Luna ile belirli görev türlerinde nasıl karşılaştırıldığını da görmek isterim
    • Maliyet X ekseni olduğundan teknik olarak DeepSeek V4 Flash 0731 maksimum akıl yürütmede görev başına yaklaşık 0,03 dolar ve endeks 50 seviyesinde. OpenAI Luna ise yüksek akıl yürütmede 0,03 dolar·endeks 46, çok yüksek akıl yürütmede 0,04 dolar·endeks 49 ve maksimum akıl yürütmede 0,07 dolar·endeks 51 seviyesinde
      Bu yüzden Luna'nın DeepSeek Flash'tan 2-3 kat daha pahalı ama akıl yürütmede 2-5 kat daha hızlı olduğunu söylemek daha adil olur. DeepSeek'i aşan en ucuz OpenAI modeli Luna maksimum akıl yürütme; benzer performansta, yuvarlamadan önce yaklaşık 3 kat daha pahalı ama hızı da neredeyse 3 kat fazla
      Artificial Analysis'ın hem DeepSeek hem OpenAI için koyu mavi kullanması, özellikle bugün gibi bir günde, renk seçimi açısından oldukça talihsiz