1 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Versi resmi DeepSeek-V4-Flash API diluncurkan sebagai beta publik pada 31 Juli 2026, dan dapat digunakan dengan cara pemanggilan yang sama seperti sebelumnya cukup dengan menetapkan nama model ke deepseek-v4-flash
  • Performa agen jauh melampaui V4-Pro-Preview, mencatat 82,7 poin di Terminal Bench 2.1, serta Cybergym 76,7, Toolathlon verified 70,3, dan DSBench-FullStack 68,7
  • Benchmark agen kode diukur dalam mode minimal DeepSeek Harness yang akan dirilis, dengan kondisi max effort, top_p=0.95, dan temperature=1.0
  • V4-Flash resmi mendukung format Responses API secara bawaan dan disesuaikan untuk Codex; hanya pelatihan pascapemrosesan ulang yang diterapkan pada struktur dan ukuran model yang sama dengan Preview
  • Cakupan perubahan terbatas pada V4-Flash API; V4-Pro API serta model APP/WEB tetap dipertahankan, dan versi resmi V4-Pro akan segera dirilis

Peluncuran beta publik dan cara penggunaan API

  • Versi resmi DeepSeek-V4-Flash API diluncurkan sebagai beta publik pada 31 Juli 2026
  • Cara pemanggilan yang ada tetap dipertahankan; versi terbaru dapat digunakan dengan mengatur parameter model ke deepseek-v4-flash
  • Seri V4 disediakan melalui OpenAI ChatCompletions dan antarmuka Anthropic pada base_url yang sama seperti sebelumnya
    • V4-Pro menggunakan deepseek-v4-pro, dan V4-Flash menggunakan deepseek-v4-flash
    • Nama model lama, deepseek-chat dan deepseek-reasoner, sebelumnya dijadwalkan dihentikan pada 24 Juli 2026
    • Selama periode transisi, kedua nama tersebut masing-masing merujuk pada mode non-reasoning dan mode reasoning V4-Flash

Hasil benchmark agen

  • Versi resmi V4-Flash mencatat hasil yang jauh melampaui V4-Pro-Preview dalam performa agen
    • Terminal Bench 2.1: 82,7
    • NL2Repo: 54,2
    • Cybergym: 76,7
    • DeepSWE: 54,4
    • Toolathlon verified: 70,3
    • Agent Last Exam: 25,2
    • Automation Bench Public: 25,1
    • DSBench-FullStack: 68,7
    • DSBench-Hard: 59,6
  • Tugas agen kode pada benchmark publik diukur dengan mode minimal DeepSeek Harness yang akan dirilis
    • Level effort adalah max, dengan pengaturan top_p=0.95 dan temperature=1.0
  • DSBench-FullStack adalah set pengujian pengembangan full-stack internal, dan DSBench-Hard adalah set soal sulit internal untuk agen coding

Responses API dan integrasi Codex

  • V4-Flash resmi mendukung format Responses API secara bawaan dan disesuaikan untuk Codex
  • Pengaturan yang diperlukan untuk integrasi Codex dapat dilihat di dokumentasi resmi

Cakupan perubahan model

  • DeepSeek-V4-Flash-0731 mempertahankan struktur dan ukuran model yang sama dengan V4-Flash-Preview
  • Hanya pelatihan pascapemrosesan ulang yang diterapkan, tanpa perubahan struktur pada model itu sendiri
  • Pembaruan hanya diterapkan pada DeepSeek-V4-Flash API
    • DeepSeek-V4-Pro API tidak berubah
    • Model yang disediakan di APP/WEB juga tetap dipertahankan
  • Versi resmi DeepSeek-V4-Pro akan segera dirilis

1 komentar

 
GN⁺ 2 jam lalu
Pendapat di Hacker News
  • Secara pribadi, saya lebih menantikannya daripada K3. Model DSV4 memiliki biaya serving yang sangat rendah, sehingga seiring performanya meningkat, ia bisa menjadi model yang “cukup baik” untuk lebih banyak pekerjaan
    DeepSeek sudah lama menyediakan versi Pro dengan harga sangat murah dan terintegrasi dengan OpenCode dan lainnya, jadi kemungkinan besar mereka juga telah mengumpulkan banyak data pekerjaan pengembangan nyata. Jika ini dimanfaatkan untuk post-training, peningkatan tambahan juga memungkinkan
    Saya juga penasaran seberapa jauh K3 akan menjadi lebih baik jika didistilasi ke DSV4. Model yang murah dan cepat sangat bermanfaat bagi komunitas karena performanya bisa terus dimanfaatkan tanpa menghilang begitu saja sesuai kemauan penyedia. Setidaknya Flash bisa dijalankan di rumah dengan perangkat di bawah 10 ribu dolar, tetapi model besar seperti GLM atau K3 secara realistis sulit

    • Penyedia yang bisa saya setujui untuk memberikan data pelatihan hanya DeepSeek dan Moonshot
    • Saya berharap jika digabungkan dengan DwarfStar, AI lokal yang layak pakai akan memungkinkan
  • Saya memproses 90% pekerjaan dengan Flash. Entah kenapa, ini lebih baik daripada Pro, sangat murah, sekaligus cepat
    Jika perubahan dijaga di bawah 1.000 baris dan keputusan arsitektur diambil sendiri, hampir tidak terasa berbeda dari model mutakhir. Sisa 10% dipakai untuk mencari bug/masalah keamanan atau meninjau struktur yang lebih baik; Flash juga cukup bagus, tetapi saya melakukan verifikasi silang
    Iterasi cepat jauh lebih baik daripada menunggu 5–10 menit untuk perubahan kecil. Belakangan Kimi dan GLM melambat karena melakukan inferensi terlalu lama tanpa perlu. Banyak data seperti dependensi, log, dan dump performa bisa dimasukkan tanpa khawatir batas, dan dalam reverse engineering biner pun tidak tersandung pembatasan keamanan

    • Mungkin karena cara saya menulis prompt lemah, model OpenAI yang saya pakai lewat Codex tidak pernah menolak reverse engineering biner. Saat ini saya juga sedang menganalisis firmware pihak ketiga dengan Codex dan belum pernah terkena batasan
      Sebaliknya, ada juga kasus prompt yang tidak terkait keamanan pun ditolak, jadi saya penasaran apakah perbedaan per platform dan per pengguna memang sebesar ini
    • DeepSeek V4 Flash cukup untuk sebagian besar pekerjaan dan responsnya juga cepat. Token terutama saya beli dari FireWorks.ai di AS, tetapi saya juga sudah prabayar dalam jumlah besar ke DeepSeek
      Saya lebih sering memakai OpenCode yang menggunakan token lebih sedikit daripada Claude Code, dan juga menantikan peluncuran harness coding milik DeepSeek sendiri
    • Secara keseluruhan bagus, tetapi di OpenRouter batas token keluaran terlalu ketat. Jika terjebak dalam perangkap reasoning, ia tidak bisa keluar sendiri dalam batas itu, tetapi tetap saja sudah menggantikan model Kimi
  • Catatan 30 hari terakhir menggunakan DeepSeek untuk sebagian besar pekerjaan agen harian pribadi saya adalah biaya 4,55 dolar, 3.467 permintaan API, dan 323.183.886 token
    Sebagai engineer yang memimpin tim kecil, standar kualitas saya tinggi dan saya menerapkan standar yang sama pada proyek pribadi, tetapi untuk pekerjaan coding dan review saya sama sekali tidak kecewa. Untuk pekerjaan lain, saya memakai model lain

    • Saya penasaran metode dan prompt seperti apa yang digunakan saat melakukan code review dengan LLM. Kualitas jawabannya cukup rendah, jadi saya ingin tahu apakah penyebabnya ada pada cara saya memakainya
    • Saya penasaran harness apa yang digunakan untuk mencapai token caching sebesar ini
    • Saya penasaran apakah halusinasinya tidak banyak, dan jika ada, bagaimana pengaruhnya terhadap alur kerja
    • Kualitasnya tidak luar biasa, dan sebagian besar LLM juga demikian
  • Sekarang hampir semua pekerjaan di pi saya jalankan dengan Flash. Dengan server MCP yang tepat, alat pemangkasan konteks, dan skill, pekerjaan apa pun bisa diimplementasikan
    Beberapa sesi memakan lebih dari 30 giliran, tetapi karena cepat dan murah, bekerja selama satu jam pun cukup sekitar 0,5 dolar. Namun dalam alur kerja multi-subagen, saya juga memakai model yang lebih mahal untuk peran perencanaan, review, dan oracle
    Langganan Opus yang lambat sudah tidak saya pakai selama beberapa minggu. Saya juga membangun chat OpenWebUI self-hosted yang berjalan di ponsel serta mendukung MCP dan skill, sehingga sepenuhnya menggantikan Perplexity; biaya hosting dan langganannya sekitar 18 dolar per bulan

    • Saya juga memasang banyak alat kustom untuk pelacakan tugas dan penghematan token pada kombinasi pi + DeepSeek, dan hanya memakai model mutakhir untuk pekerjaan yang sangat sulit. Konfigurasi ini memenuhi semua fungsi yang saya butuhkan
    • Saya ingin mendapat rekomendasi ekstensi yang layak dipakai untuk pi
    • Saya penasaran apakah ada peningkatan yang terasa pada pembaruan ini
    • Saya penasaran bagaimana mengatur top_p dan temperature di pi
  • Jika benchmark benar-benar mencerminkan performa penggunaan nyata, ini model yang menakjubkan. Model 300B melampaui performa 1,8T parameter dari model pratinjau DS4 Pro sebelumnya dan tampaknya juga lebih baik daripada GPT 5.6 Luna
    Masih lebih murah daripada Luna setelah penurunan harga

    • Di DeepSWE, DeepSeek 54,4%, Luna 67%
  • Cukup mengesankan bahwa model 200B bisa bersaing dengan GLM-5.2 dan mendekati Opus 4.8
    Jika angka ini juga berlanjut ke performa umum, ditambah caching DeepSeek yang sangat baik, penggunaannya tampaknya akan sangat besar

    • Bukan sekadar model 200B, kapasitasnya juga hanya 160GiB
  • Saya penasaran mengapa tidak dinamai v4.1-Flash agar perbedaannya lebih jelas

  • Jika tetap mempertahankan kecepatan dan harga rendah sambil melampaui performa deepseek-v4-pro yang sudah cukup layak pakai, ini sangat menjanjikan
    deepseek-v4-flash sudah menjadi model dengan performa per harga terbaik, jadi kesenjangan pada metrik kecerdasan/biaya tampaknya akan makin melebar. Namun biaya murah DeepSeek API juga dibayar dengan menyerahkan informasi codebase ke Tiongkok

    • Setidaknya di satu benchmark disebut lebih unggul daripada GLM 5.2
  • Saya penasaran apakah konfigurasi memakai Kimi K3 untuk pekerjaan mahal sebagai pengganti Opus, dan DSV4 Flash untuk pekerjaan umum sebagai pengganti Sonnet, masuk akal

    • Versi pembaruan deepseek-v4-pro tampaknya akan segera keluar, dan melihat besarnya peningkatan DSV4 Flash, kemungkinan besar ia bisa mengungguli Kimi K3 baik dari sisi kecerdasan maupun biaya
    • Cukup masuk akal. Setiap kali menjalankan coding atau pemeriksaan server selama satu jam dengan DSV4 Flash, biaya API murninya sekitar 0,30 dolar, dan itu selalu membuat saya terkejut
    • Anda bisa memakai model router saya agar beralih di antara dua model itu di latar belakang
  • Saya penasaran dengan contoh penggunaan DSv4 untuk agen di luar coding. Terutama ingin tahu bagaimana pengguna yang sebelumnya memakai GPT-5.4 mini untuk klasifikasi atau kategorisasi memanfaatkan DSv4