- Pengaturan penalaran maksimum mencatat 50 poin di AAII, menempatkannya di peringkat ke-3 setelah Kimi K3 (max) dan GLM-5.2 (max)
- Ini adalah model MoE yang hanya mengaktifkan 13 miliar parameter per token dari total 284 miliar parameter, serta mendukung input/output teks dan konteks 1 juta token
- Harga API adalah $0.14 untuk input, $0.28 untuk output, dan cache hit $0.003 per 1 juta token; total biaya evaluasi Intelligence Index adalah $72.02
- Selama evaluasi, model ini menggunakan 210 juta token output, jauh lebih panjang dibanding median 100 juta token pada model sekelasnya, dan kecepatan outputnya belum dipublikasikan
- Bobot model dibuka dan menggunakan lisensi MIT, sehingga memungkinkan self-hosting dan penggunaan komersial; saat ini baru ada 1 penyedia API
Konfigurasi model dan cara perilisannya
- DeepSeek V4 Flash 0731 adalah model open-weight berbasis penalaran yang dirilis pada 31 Juli 2026
- Total parameternya 284 miliar, dan menggunakan arsitektur Mixture of Experts (MoE) yang mengaktifkan 13 miliar parameter per token saat inferensi
- Bobot model dapat diunduh untuk self-hosting
- Menggunakan lisensi MIT, sehingga penggunaan komersial diizinkan
- Ini adalah versi penalaran yang menggunakan upaya penalaran maksimum (Max Effort), dan mungkin ada versi non-penalaran yang terpisah
Evaluasi kecerdasan
- Mencatat 50 poin pada Artificial Analysis Intelligence Index v4.1
- Peringkat ke-3 setelah Kimi K3 (max) dan GLM-5.2 (max). Di belakangnya ada Kimi K3 (low) dan MiniMax-M3 di posisi 4/5
- Median model open-weight besar sekelasnya adalah 25 poin
- Artificial Analysis mengelompokkannya sebagai model dalam kelompok terdepan dari sisi kecerdasan
- Intelligence Index v4.1 menggabungkan 9 evaluasi berikut
- GDPval-AA v2: pekerjaan nyata berbasis agen
- 𝜏³-Banking: penggunaan alat berbasis agen
- Terminal-Bench v2.1: coding/penggunaan terminal berbasis agen
- SciCode: coding
- Humanity's Last Exam: penalaran/pengetahuan
- GPQA Diamond: penalaran ilmiah
- CritPt: penalaran fisika
- AA-Omniscience: akurasi pengetahuan dan penekanan halusinasi
- AA-LCR: penalaran konteks panjang
Cakupan benchmark tambahan
- Hasil evaluasi berikut juga disediakan agar penggunaan detail tiap model dapat dibandingkan
- AA-Briefcase: pekerjaan pengetahuan berbasis agen
- AutomationBench-AA: otomatisasi pekerjaan SaaS
- Harvey LAB-AA: pekerjaan agen hukum
- EnterpriseOps-Gym-AA: pekerjaan operasional perusahaan
- IFBench: kepatuhan terhadap instruksi
- APEX-Agents-AA: pekerjaan agen berdurasi panjang
- ITBench-AA: analisis akar penyebab gangguan Kubernetes
- MMMU-Pro: penalaran visual
- DeepSeek V4 Flash 0731 tidak mendukung input gambar, sehingga merupakan model khusus teks dan bukan model multimodal
Evaluasi keandalan pengetahuan dan halusinasi
- AA-Omniscience Index memberi poin untuk jawaban yang benar dan penalti untuk halusinasi, tetapi tidak memberi penalti untuk penolakan menjawab
- Rentang skor adalah dari -100 hingga 100
- Skor 0 berarti jumlah jawaban benar dan salah sama
- Nilai negatif berarti jumlah jawaban salah lebih banyak daripada jawaban benar
Penggunaan token dan karakteristik respons
- Pada evaluasi penuh Intelligence Index, model ini menghasilkan 210 juta token output
- Median model open-weight sekelasnya adalah 100 juta token
- Artificial Analysis mengklasifikasikannya sebagai sangat bertele-tele
- Jumlah token output per tugas dihitung dengan menerapkan bobot Intelligence Index pada jumlah output tiap benchmark, lalu dibagi dengan jumlah tugas tanpa eksekusi berulang
- Kecepatan output belum diukur, sehingga jumlah token output per detik belum dipublikasikan
Harga API dan biaya evaluasi
- Berdasarkan harga DeepSeek API, rinciannya adalah sebagai berikut
- Input: $0.14 per 1 juta token
- Output: $0.28 per 1 juta token
- Cache hit: $0.003 per 1 juta token
- Jika cache hit/input/output dicampur dengan rasio 7:2:1, maka harganya menjadi $0.06 per 1 juta token
- Total biaya evaluasi penuh Intelligence Index adalah $72.02
- Area ringkasan menampilkan median model pembanding sebagai input $0.43/output $1.20, dan area FAQ menampilkan input $0.58/output $2.20
- Biaya per tugas dihitung dengan membagi biaya token input, cache hit, penulisan cache, penalaran, dan jawaban akhir dengan jumlah tugas, lalu menerapkan bobot Index tiap benchmark
- Biaya penulisan dan penyimpanan cache dapat dikenakan terpisah tergantung penyedia API
Konteks dan cakupan penyediaan
- Jendela konteks adalah 1 juta token, setara sekitar 1.500 halaman A4 dengan Arial 12 poin
- Dapat digunakan untuk workflow RAG yang memerlukan pencarian dan penalaran dokumen skala besar
- Hanya mendukung input teks dan output teks
- Saat ini ada 1 penyedia yang menawarkan API, dan harga dapat berbeda tergantung penyedia
1 komentar
Komentar Hacker News
Bobot model baru saja dirilis: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-server, memuat sebanyak mungkin ke GPU 32GB·48GB·96GB dan menaruh sisanya di DRAM sistemhttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Model DeepSeek baru terasa seperti hadiah Natal. Untuk model API berbiaya rendah, DeepSeek adalah yang terbaik, dan sampai harga VRAM turun cukup jauh agar inferensi lokal jadi layak, pendekatan ini tampaknya paling masuk akal
Model langganan yang bergantung pada subsidi sulit bertahan lama, dan penagihan API tampak lebih dekat ke model bisnis yang berkelanjutan
Alamat lama menghasilkan 404, dan URL yang benar tampaknya ini: https://artificialanalysis.ai/models/deepseek-v4-flash
Saya menambahkan titik data DeepSeek V4 Flash 0731 ke grafik OpenAI yang dirilis kemarin, dan model ini berada di frontier harga-performa
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
Sumber asli: https://openai.com/index/advancing-the-price-performance-fro...
Untuk tugas agen kode di benchmark publik, mereka katanya memakai mode minimal DeepSeek Harness yang belum dirilis, jadi saya penasaran apakah ada rencana mengumumkan harness agen coding yang dioptimalkan juga
Jika memakai DSv4 Flash bersama reasonix atau pi, Anda bisa coding seharian hanya dengan beberapa sen tanpa khawatir soal token. Sebaliknya, kalau memakai model yang sama lewat Fireworks atau OpenRouter dengan ZDR, biayanya terus naik tanpa alasan yang jelas. Tampaknya harga disubsidi demi mengumpulkan data penggunaan, dan saya sedang menunggu hari ketika ini bisa dijalankan secara lokal
temperature = 1.0,top_p = 0.95, dan harness-nya akan dirilis nantiBagi pengguna RTX PRO 6000 96GB tunggal atau DGX Spark 128GB, vllm-moet yang kurang dikenal adalah engine yang sangat bagus. Ia otomatis membuat plane 2-bit simetris untuk inferensi, sekaligus membuat delta cache 4-bit untuk memulihkan presisi, dan mendukung streaming SSD untuk bobot yang lebih besar daripada RAM
Anda bisa menentukan berapa VRAM yang dialokasikan ke tiap area untuk menyeimbangkan kecepatan dan presisi, dan 170 token per detik sudah didemonstrasikan pada DS V4 Flash. Model asli dipakai apa adanya tanpa model konversi terpisah
Di DGX Spark diperlukan sedikit workaround untuk mengabaikan perbedaan
sm120dansm121, tetapi karena tetap bisa berjalan dism121, rasanya layak menghabiskan beberapa jam untuk mencobanyaDengan $0,28 per 1 juta token output, model ini memberi kecerdasan setara GLM 5.2·Gemini 3.6, dan model Pro yang diperbarui juga akan segera hadir
Unsloth Q8 lossless berukuran 162GB, jadi secara realistis ukurannya sudah cukup masuk akal untuk dijalankan di rumah
Jika DeepSeek V4 Flash melampaui V4 Pro, saya penasaran apakah dalam beberapa minggu kita juga bisa berharap pada V4 Pro setingkat Opus 5. Akan lebih bagus lagi kalau bahkan melampaui Opus
https://trysojourn.app
Bagian yang benar-benar menarik adalah bahwa peningkatan performa besar dicapai hanya lewat fine-tuning tambahan tanpa perubahan arsitektur. Ini hasil dari memasukkan lebih banyak data, komputasi, dan waktu
DS V4 Flash relatif kecil dibanding kelompok model pesaingnya, jadi tampaknya besar kemungkinan peningkatan serupa juga bisa diperoleh pada model kecil lain jika diberi data berkualitas tinggi dan pipeline pelatihan yang baik
Dari sisi harga per tugas, model ini sudah mengungguli Luna dengan selisih sekitar 2×: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
Jadi, cara yang lebih adil untuk melihatnya adalah bahwa Luna 2~3× lebih mahal, tetapi kecepatan inferensinya 2~5× lebih cepat daripada DeepSeek Flash. Model OpenAI termurah yang melampaui DeepSeek adalah Luna dengan penalaran maksimum, yang pada performa serupa sekitar 3× lebih mahal sebelum pembulatan, tetapi juga hampir 3× lebih cepat
Fakta bahwa Artificial Analysis memakai warna biru tua untuk DeepSeek dan OpenAI terasa sebagai pilihan warna yang sangat tidak tepat, terutama pada hari seperti ini