- Maksimum akıl yürütme ayarı AAII’de 50 puan alarak Kimi K3 (max) ve GLM-5.2 (max)’in ardından 3. sıraya yerleşti
- Toplam 284 milyar parametrenin içinden her token için yalnızca 13 milyarı etkinleştiren bir MoE modelidir; metin girdi/çıktısı ve 1 milyon token bağlamı destekler
- API fiyatı 1 milyon token başına girdi için $0.14, çıktı için $0.28, cache isabeti için $0.003; Intelligence Index tam değerlendirme maliyeti ise $72.02 oldu
- Değerlendirme sürecinde 210 milyon çıktı tokenı kullanarak aynı sınıftaki modellerin 100 milyonluk medyanının çok üstünde, oldukça uzun yanıtlar üretti; çıktı hızı ise henüz açıklanmadı
- Model ağırlıkları açıklandı ve MIT lisansı uygulandı; böylece self-hosting ve ticari kullanım mümkün, şu anda API sağlayıcısı ise 1 adet
Model yapısı ve yayınlama biçimi
- DeepSeek V4 Flash 0731, 31 Temmuz 2026’da yayımlanan akıl yürütme odaklı açık ağırlıklı bir modeldir
- Toplam parametre sayısı 284 milyardır ve çıkarım sırasında token başına 13 milyar parametrenin etkinleştiği Mixture of Experts(MoE) yapısını kullanır
- Model ağırlıkları indirilerek self-hosting yapılabilir
- MIT lisansı ile ticari kullanıma izin verilir
- Maksimum akıl yürütme çabası (Max Effort) kullanan akıl yürütme sürümüdür; ayrıca akıl yürütmeyen ayrı bir sürüm de olabilir
Zeka değerlendirmesi
- Artificial Analysis Intelligence Index v4.1’de 50 puan aldı
- Kimi K3 (max) ve GLM-5.2 (max)’in ardından 3. sırada. Ardından Kimi K3 (low) ve MiniMax-M3 4. ve 5. sırada geliyor
- Aynı sınıftaki büyük açık ağırlıklı modellerin medyanı 25 puandır
- Artificial Analysis bunu zeka açısından öncü model grubunda sınıflandırıyor
- Intelligence Index v4.1 şu 9 değerlendirmeyi birleştiriyor
- GDPval-AA v2: ajan tipi gerçek iş görevleri
- 𝜏³-Banking: ajan tipi araç kullanımı
- Terminal-Bench v2.1: ajan tipi kodlama/terminal kullanımı
- SciCode: kodlama
- Humanity's Last Exam: akıl yürütme/bilgi
- GPQA Diamond: bilimsel akıl yürütme
- CritPt: fizik akıl yürütmesi
- AA-Omniscience: bilgi doğruluğu ve halüsinasyon baskılama
- AA-LCR: uzun bağlam akıl yürütmesi
Ek benchmark kapsamı
- Modellerin ayrıntılı kullanım alanlarını karşılaştırabilmek için şu değerlendirme sonuçları da sunuluyor
- AA-Briefcase: ajan tipi bilgi işi
- AutomationBench-AA: SaaS iş otomasyonu
- Harvey LAB-AA: hukuk ajanı işleri
- EnterpriseOps-Gym-AA: kurumsal operasyon işleri
- IFBench: komutlara uyum
- APEX-Agents-AA: uzun süreli ajan görevleri
- ITBench-AA: Kubernetes arıza kök nedeni analizi
- MMMU-Pro: görsel akıl yürütme
- DeepSeek V4 Flash 0731 görüntü girdisini desteklemediği için yalnızca metin modelidir ve multimodal bir model değildir
Bilgi güvenilirliği ve halüsinasyon değerlendirmesi
- AA-Omniscience Index, doğru yanıtlara puan verir ve halüsinasyonları cezalandırır; yanıt vermeyi reddetmeye ise ceza vermez
- Puan aralığı -100 ile 100 arasındadır
- 0 puan, doğru ve yanlış yanıt sayısının eşit olduğu anlamına gelir
- Negatif değer, doğru yanıtlardan daha fazla yanlış yanıt olduğu anlamına gelir
Token kullanımı ve yanıt özellikleri
- Intelligence Index tam değerlendirmesinde 210 milyon çıktı tokenı üretti
- Aynı sınıftaki açık ağırlıklı modellerin medyanı 100 milyon tokendır
- Artificial Analysis bunu çok uzun yanıt seviyesi olarak sınıflandırıyor
- Görev başına çıktı token sayısı, her benchmark’ın çıktı miktarına Intelligence Index ağırlığı uygulanıp tekrar çalıştırmalar hariç görev sayısına bölünerek hesaplanır
- Çıktı hızı henüz ölçülmediği için saniye başına çıktı tokenı açıklanmadı
API fiyatı ve değerlendirme maliyeti
- DeepSeek API bazında fiyatlar şöyle
- Girdi: 1 milyon token başına $0.14
- Çıktı: 1 milyon token başına $0.28
- Cache isabeti: 1 milyon token başına $0.003
- Cache isabeti/girdi/çıktı 7:2:1 oranında karıştırıldığında 1 milyon token başına fiyat $0.06 oluyor
- Intelligence Index tam değerlendirme maliyeti $72.02 oldu
- Özet alanı, karşılaştırma modellerinin medyanını girdi $0.43/çıktı $1.20 olarak; SSS alanı ise girdi $0.58/çıktı $2.20 olarak gösterir
- Görev başına maliyet; girdi, cache isabeti, cache yazma, akıl yürütme ve nihai yanıt token maliyetlerinin görev sayısına bölünmesinin ardından her benchmark’ın Index ağırlığı uygulanarak hesaplanır
- Cache yazma ve depolama maliyetleri API sağlayıcısına göre ayrıca ücretlendirilebilir
Bağlam ve sunum kapsamı
- Bağlam penceresi 1 milyon token olup 12 punto Arial’e göre yaklaşık 1.500 A4 sayfasına karşılık gelir
- Büyük ölçekli belge arama ve akıl yürütme gerektiren RAG iş akışlarında kullanılabilir
- Yalnızca metin girdi ve metin çıktısını destekler
- Şu anda API sunan sağlayıcı sayısı 1’dir ve sağlayıcıya göre fiyatlar değişebilir
1 yorum
Hacker News görüşleri
Model ağırlıkları az önce yayımlandı: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-serverile olabildiğince 32GB·48GB·96GB GPU'lara yükleyip kalanını sistem DRAM'ine yerleştiren hibrit kurulum da mümkünhttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Yeni DeepSeek modeli Noel hediyesi gibi. Düşük maliyetli API modellerini en iyi DeepSeek yapıyor ve VRAM fiyatları yerelde çalıştırmayı mümkün kılacak kadar düşene kadar en iyi yaklaşım bu gibi görünüyor
Sübvansiyona dayalı abonelik modellerinin uzun ömürlü olması zor; API ücretlendirmesi ise sürdürülebilir bir iş modeline daha yakın duruyor
Eski adres 404 veriyor; doğru URL şu gibi görünüyor: https://artificialanalysis.ai/models/deepseek-v4-flash
Dün yayımlanan OpenAI grafiğine DeepSeek V4 Flash 0731 veri noktasını ekledim; fiyat-performans sınırında yer alıyor
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
Orijinal: https://openai.com/index/advancing-the-price-performance-fro...
Açık benchmark'taki kod ajanı görevlerinde henüz yayımlanmamış DeepSeek Harness minimum modu kullanılmış; optimize edilmiş bir kodlama ajanı harness'ı da duyurmayı planlayıp planlamadıklarını merak ediyorum
DSv4 Flash'ı reasonix ya da pi ile birlikte kullanırsanız token derdi olmadan bütün gün birkaç sente kod yazabilirsiniz. Buna karşılık aynı modeli Fireworks veya OpenRouter'da ZDR ile kullanınca maliyet sebepsiz yere sürekli artıyor. Kullanım verisi toplamak için fiyatları sübvanse ediyor gibiler; yerelde çalıştırmanın mümkün olacağı günü bekliyorum
temperature = 1.0,top_p = 0.95ile değerlendirildi ve harness daha sonra yayımlanacakTek bir RTX PRO 6000 96GB ya da DGX Spark 128GB kullananlar için daha az bilinen vllm-moet çok iyi bir motor. Çıkarım için simetrik 2-bit plane'leri otomatik oluşturuyor, doğruluk geri kazanımı için 4-bit delta cache de üretiyor ve RAM'den büyük ağırlıklar için SSD streaming destekliyor
Her bölgeye ayrılacak VRAM miktarını belirleyerek hız ve doğruluk dengesini ayarlayabiliyorsunuz; DS V4 Flash üzerinde saniyede 170 token gösterildi. Ayrı bir dönüştürülmüş model olmadan doğrudan orijinal modeli kullanıyor
DGX Spark'ta
sm120ilesm121farkını görmezden gelen küçük bir geçici çözüm gerekiyor amasm121üzerinde de çalışabildiği için birkaç saat ayırmaya değer1 milyon çıktı tokenı başına 0,28 dolar karşılığında GLM 5.2·Gemini 3.6 düzeyinde zeka sunuyor ve güncellenmiş Pro modelinin de yakında gelmesi bekleniyor
Unsloth kayıpsız Q8'in 162GB olması, evde gerçekten çalıştırılabilecek bir boyutta olduğu anlamına geliyor
DeepSeek V4 Flash, V4 Pro'yu geçiyorsa birkaç hafta içinde Opus 5 seviyesinde bir V4 Pro da bekleyebilir miyiz diye merak ediyorum. Opus'tan da iyi olursa daha da güzel olur
https://trysojourn.app
Gerçekten ilginç olan kısım, mimariyi değiştirmeden yalnızca ek ince ayar ile büyük bir performans artışı elde etmiş olmaları. Sonuç, daha fazla veri, hesaplama ve zaman yatırımı
DS V4 Flash rakip model ailesine kıyasla nispeten küçük olduğundan, yüksek kaliteli veri ve eğitim hattı başka küçük modellere de uygulanırsa benzer iyileşmeler elde etme olasılığı yüksek görünüyor
Görev başına fiyat açısından Luna'nın önüne zaten yaklaşık 2 kat farkla geçiyor: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
Bu yüzden Luna'nın DeepSeek Flash'tan 2-3 kat daha pahalı ama akıl yürütmede 2-5 kat daha hızlı olduğunu söylemek daha adil olur. DeepSeek'i aşan en ucuz OpenAI modeli Luna maksimum akıl yürütme; benzer performansta, yuvarlamadan önce yaklaşık 3 kat daha pahalı ama hızı da neredeyse 3 kat fazla
Artificial Analysis'ın hem DeepSeek hem OpenAI için koyu mavi kullanması, özellikle bugün gibi bir günde, renk seçimi açısından oldukça talihsiz