- Versi resmi DeepSeek-V4-Flash API diluncurkan sebagai beta publik pada 31 Juli 2026, dan dapat digunakan dengan cara pemanggilan yang sama seperti sebelumnya cukup dengan menetapkan nama model ke
deepseek-v4-flash - Performa agen jauh melampaui V4-Pro-Preview, mencatat 82,7 poin di Terminal Bench 2.1, serta Cybergym 76,7, Toolathlon verified 70,3, dan DSBench-FullStack 68,7
- Benchmark agen kode diukur dalam mode minimal DeepSeek Harness yang akan dirilis, dengan kondisi max effort,
top_p=0.95, dantemperature=1.0 - V4-Flash resmi mendukung format Responses API secara bawaan dan disesuaikan untuk Codex; hanya pelatihan pascapemrosesan ulang yang diterapkan pada struktur dan ukuran model yang sama dengan Preview
- Cakupan perubahan terbatas pada V4-Flash API; V4-Pro API serta model APP/WEB tetap dipertahankan, dan versi resmi V4-Pro akan segera dirilis
Peluncuran beta publik dan cara penggunaan API
- Versi resmi DeepSeek-V4-Flash API diluncurkan sebagai beta publik pada 31 Juli 2026
- Cara pemanggilan yang ada tetap dipertahankan; versi terbaru dapat digunakan dengan mengatur parameter model ke
deepseek-v4-flash - Seri V4 disediakan melalui OpenAI ChatCompletions dan antarmuka Anthropic pada
base_urlyang sama seperti sebelumnya- V4-Pro menggunakan
deepseek-v4-pro, dan V4-Flash menggunakandeepseek-v4-flash - Nama model lama,
deepseek-chatdandeepseek-reasoner, sebelumnya dijadwalkan dihentikan pada 24 Juli 2026 - Selama periode transisi, kedua nama tersebut masing-masing merujuk pada mode non-reasoning dan mode reasoning V4-Flash
- V4-Pro menggunakan
Hasil benchmark agen
- Versi resmi V4-Flash mencatat hasil yang jauh melampaui V4-Pro-Preview dalam performa agen
- Terminal Bench 2.1: 82,7
- NL2Repo: 54,2
- Cybergym: 76,7
- DeepSWE: 54,4
- Toolathlon verified: 70,3
- Agent Last Exam: 25,2
- Automation Bench Public: 25,1
- DSBench-FullStack: 68,7
- DSBench-Hard: 59,6
- Tugas agen kode pada benchmark publik diukur dengan mode minimal DeepSeek Harness yang akan dirilis
- Level effort adalah max, dengan pengaturan
top_p=0.95dantemperature=1.0
- Level effort adalah max, dengan pengaturan
- DSBench-FullStack adalah set pengujian pengembangan full-stack internal, dan DSBench-Hard adalah set soal sulit internal untuk agen coding
Responses API dan integrasi Codex
- V4-Flash resmi mendukung format Responses API secara bawaan dan disesuaikan untuk Codex
- Pengaturan yang diperlukan untuk integrasi Codex dapat dilihat di dokumentasi resmi
Cakupan perubahan model
DeepSeek-V4-Flash-0731mempertahankan struktur dan ukuran model yang sama dengan V4-Flash-Preview- Hanya pelatihan pascapemrosesan ulang yang diterapkan, tanpa perubahan struktur pada model itu sendiri
- Pembaruan hanya diterapkan pada DeepSeek-V4-Flash API
- DeepSeek-V4-Pro API tidak berubah
- Model yang disediakan di APP/WEB juga tetap dipertahankan
- Versi resmi DeepSeek-V4-Pro akan segera dirilis
1 komentar
Pendapat di Hacker News
Secara pribadi, saya lebih menantikannya daripada K3. Model DSV4 memiliki biaya serving yang sangat rendah, sehingga seiring performanya meningkat, ia bisa menjadi model yang “cukup baik” untuk lebih banyak pekerjaan
DeepSeek sudah lama menyediakan versi Pro dengan harga sangat murah dan terintegrasi dengan OpenCode dan lainnya, jadi kemungkinan besar mereka juga telah mengumpulkan banyak data pekerjaan pengembangan nyata. Jika ini dimanfaatkan untuk post-training, peningkatan tambahan juga memungkinkan
Saya juga penasaran seberapa jauh K3 akan menjadi lebih baik jika didistilasi ke DSV4. Model yang murah dan cepat sangat bermanfaat bagi komunitas karena performanya bisa terus dimanfaatkan tanpa menghilang begitu saja sesuai kemauan penyedia. Setidaknya Flash bisa dijalankan di rumah dengan perangkat di bawah 10 ribu dolar, tetapi model besar seperti GLM atau K3 secara realistis sulit
Saya memproses 90% pekerjaan dengan Flash. Entah kenapa, ini lebih baik daripada Pro, sangat murah, sekaligus cepat
Jika perubahan dijaga di bawah 1.000 baris dan keputusan arsitektur diambil sendiri, hampir tidak terasa berbeda dari model mutakhir. Sisa 10% dipakai untuk mencari bug/masalah keamanan atau meninjau struktur yang lebih baik; Flash juga cukup bagus, tetapi saya melakukan verifikasi silang
Iterasi cepat jauh lebih baik daripada menunggu 5–10 menit untuk perubahan kecil. Belakangan Kimi dan GLM melambat karena melakukan inferensi terlalu lama tanpa perlu. Banyak data seperti dependensi, log, dan dump performa bisa dimasukkan tanpa khawatir batas, dan dalam reverse engineering biner pun tidak tersandung pembatasan keamanan
Sebaliknya, ada juga kasus prompt yang tidak terkait keamanan pun ditolak, jadi saya penasaran apakah perbedaan per platform dan per pengguna memang sebesar ini
Saya lebih sering memakai OpenCode yang menggunakan token lebih sedikit daripada Claude Code, dan juga menantikan peluncuran harness coding milik DeepSeek sendiri
Catatan 30 hari terakhir menggunakan DeepSeek untuk sebagian besar pekerjaan agen harian pribadi saya adalah biaya 4,55 dolar, 3.467 permintaan API, dan 323.183.886 token
Sebagai engineer yang memimpin tim kecil, standar kualitas saya tinggi dan saya menerapkan standar yang sama pada proyek pribadi, tetapi untuk pekerjaan coding dan review saya sama sekali tidak kecewa. Untuk pekerjaan lain, saya memakai model lain
Sekarang hampir semua pekerjaan di pi saya jalankan dengan Flash. Dengan server MCP yang tepat, alat pemangkasan konteks, dan skill, pekerjaan apa pun bisa diimplementasikan
Beberapa sesi memakan lebih dari 30 giliran, tetapi karena cepat dan murah, bekerja selama satu jam pun cukup sekitar 0,5 dolar. Namun dalam alur kerja multi-subagen, saya juga memakai model yang lebih mahal untuk peran perencanaan, review, dan oracle
Langganan Opus yang lambat sudah tidak saya pakai selama beberapa minggu. Saya juga membangun chat OpenWebUI self-hosted yang berjalan di ponsel serta mendukung MCP dan skill, sehingga sepenuhnya menggantikan Perplexity; biaya hosting dan langganannya sekitar 18 dolar per bulan
top_pdantemperaturedi piJika benchmark benar-benar mencerminkan performa penggunaan nyata, ini model yang menakjubkan. Model 300B melampaui performa 1,8T parameter dari model pratinjau DS4 Pro sebelumnya dan tampaknya juga lebih baik daripada GPT 5.6 Luna
Masih lebih murah daripada Luna setelah penurunan harga
Cukup mengesankan bahwa model 200B bisa bersaing dengan GLM-5.2 dan mendekati Opus 4.8
Jika angka ini juga berlanjut ke performa umum, ditambah caching DeepSeek yang sangat baik, penggunaannya tampaknya akan sangat besar
Saya penasaran mengapa tidak dinamai
v4.1-Flashagar perbedaannya lebih jelasJika tetap mempertahankan kecepatan dan harga rendah sambil melampaui performa deepseek-v4-pro yang sudah cukup layak pakai, ini sangat menjanjikan
deepseek-v4-flash sudah menjadi model dengan performa per harga terbaik, jadi kesenjangan pada metrik kecerdasan/biaya tampaknya akan makin melebar. Namun biaya murah DeepSeek API juga dibayar dengan menyerahkan informasi codebase ke Tiongkok
Saya penasaran apakah konfigurasi memakai Kimi K3 untuk pekerjaan mahal sebagai pengganti Opus, dan DSV4 Flash untuk pekerjaan umum sebagai pengganti Sonnet, masuk akal
Saya penasaran dengan contoh penggunaan DSv4 untuk agen di luar coding. Terutama ingin tahu bagaimana pengguna yang sebelumnya memakai GPT-5.4 mini untuk klasifikasi atau kategorisasi memanfaatkan DSv4