1 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Pengaturan penalaran maksimum mencatat 50 poin di AAII, menempatkannya di peringkat ke-3 setelah Kimi K3 (max) dan GLM-5.2 (max)
  • Ini adalah model MoE yang hanya mengaktifkan 13 miliar parameter per token dari total 284 miliar parameter, serta mendukung input/output teks dan konteks 1 juta token
  • Harga API adalah $0.14 untuk input, $0.28 untuk output, dan cache hit $0.003 per 1 juta token; total biaya evaluasi Intelligence Index adalah $72.02
  • Selama evaluasi, model ini menggunakan 210 juta token output, jauh lebih panjang dibanding median 100 juta token pada model sekelasnya, dan kecepatan outputnya belum dipublikasikan
  • Bobot model dibuka dan menggunakan lisensi MIT, sehingga memungkinkan self-hosting dan penggunaan komersial; saat ini baru ada 1 penyedia API

Konfigurasi model dan cara perilisannya

  • DeepSeek V4 Flash 0731 adalah model open-weight berbasis penalaran yang dirilis pada 31 Juli 2026
  • Total parameternya 284 miliar, dan menggunakan arsitektur Mixture of Experts (MoE) yang mengaktifkan 13 miliar parameter per token saat inferensi
  • Bobot model dapat diunduh untuk self-hosting
  • Menggunakan lisensi MIT, sehingga penggunaan komersial diizinkan
  • Ini adalah versi penalaran yang menggunakan upaya penalaran maksimum (Max Effort), dan mungkin ada versi non-penalaran yang terpisah

Evaluasi kecerdasan

  • Mencatat 50 poin pada Artificial Analysis Intelligence Index v4.1
    • Peringkat ke-3 setelah Kimi K3 (max) dan GLM-5.2 (max). Di belakangnya ada Kimi K3 (low) dan MiniMax-M3 di posisi 4/5
    • Median model open-weight besar sekelasnya adalah 25 poin
    • Artificial Analysis mengelompokkannya sebagai model dalam kelompok terdepan dari sisi kecerdasan
  • Intelligence Index v4.1 menggabungkan 9 evaluasi berikut
    • GDPval-AA v2: pekerjaan nyata berbasis agen
    • 𝜏³-Banking: penggunaan alat berbasis agen
    • Terminal-Bench v2.1: coding/penggunaan terminal berbasis agen
    • SciCode: coding
    • Humanity's Last Exam: penalaran/pengetahuan
    • GPQA Diamond: penalaran ilmiah
    • CritPt: penalaran fisika
    • AA-Omniscience: akurasi pengetahuan dan penekanan halusinasi
    • AA-LCR: penalaran konteks panjang

Cakupan benchmark tambahan

  • Hasil evaluasi berikut juga disediakan agar penggunaan detail tiap model dapat dibandingkan
    • AA-Briefcase: pekerjaan pengetahuan berbasis agen
    • AutomationBench-AA: otomatisasi pekerjaan SaaS
    • Harvey LAB-AA: pekerjaan agen hukum
    • EnterpriseOps-Gym-AA: pekerjaan operasional perusahaan
    • IFBench: kepatuhan terhadap instruksi
    • APEX-Agents-AA: pekerjaan agen berdurasi panjang
    • ITBench-AA: analisis akar penyebab gangguan Kubernetes
    • MMMU-Pro: penalaran visual
  • DeepSeek V4 Flash 0731 tidak mendukung input gambar, sehingga merupakan model khusus teks dan bukan model multimodal

Evaluasi keandalan pengetahuan dan halusinasi

  • AA-Omniscience Index memberi poin untuk jawaban yang benar dan penalti untuk halusinasi, tetapi tidak memberi penalti untuk penolakan menjawab
  • Rentang skor adalah dari -100 hingga 100
    • Skor 0 berarti jumlah jawaban benar dan salah sama
    • Nilai negatif berarti jumlah jawaban salah lebih banyak daripada jawaban benar

Penggunaan token dan karakteristik respons

  • Pada evaluasi penuh Intelligence Index, model ini menghasilkan 210 juta token output
    • Median model open-weight sekelasnya adalah 100 juta token
    • Artificial Analysis mengklasifikasikannya sebagai sangat bertele-tele
  • Jumlah token output per tugas dihitung dengan menerapkan bobot Intelligence Index pada jumlah output tiap benchmark, lalu dibagi dengan jumlah tugas tanpa eksekusi berulang
  • Kecepatan output belum diukur, sehingga jumlah token output per detik belum dipublikasikan

Harga API dan biaya evaluasi

  • Berdasarkan harga DeepSeek API, rinciannya adalah sebagai berikut
    • Input: $0.14 per 1 juta token
    • Output: $0.28 per 1 juta token
    • Cache hit: $0.003 per 1 juta token
  • Jika cache hit/input/output dicampur dengan rasio 7:2:1, maka harganya menjadi $0.06 per 1 juta token
  • Total biaya evaluasi penuh Intelligence Index adalah $72.02
  • Area ringkasan menampilkan median model pembanding sebagai input $0.43/output $1.20, dan area FAQ menampilkan input $0.58/output $2.20
  • Biaya per tugas dihitung dengan membagi biaya token input, cache hit, penulisan cache, penalaran, dan jawaban akhir dengan jumlah tugas, lalu menerapkan bobot Index tiap benchmark
  • Biaya penulisan dan penyimpanan cache dapat dikenakan terpisah tergantung penyedia API

Konteks dan cakupan penyediaan

  • Jendela konteks adalah 1 juta token, setara sekitar 1.500 halaman A4 dengan Arial 12 poin
  • Dapat digunakan untuk workflow RAG yang memerlukan pencarian dan penalaran dokumen skala besar
  • Hanya mendukung input teks dan output teks
  • Saat ini ada 1 penyedia yang menawarkan API, dan harga dapat berbeda tergantung penyedia

1 komentar

 
GN⁺ 2 jam lalu
Komentar Hacker News
  • Bobot model baru saja dirilis: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • Versi kuantisasi DwarfStar sangat dinantikan. Saya sudah memakai pratinjau DeepSeek V4 Flash selama beberapa bulan sebagai agen coding utama di MacBook Pro 128GB, dan tampaknya lebih unggul daripada GLM 5.2 di hampir semua metrik
    • Model ini menargetkan akselerator perangkat keras dengan primitive perkalian matriks 128×128, dan saya penasaran apakah itu merujuk pada Warp Group Matrix Multiply Accumulate milik H100
    • Jika Unsloth GGUF-nya di bawah 165GB, maka ini bisa dijalankan di sebagian besar sistem khusus CPU dengan RAM 256GB. Konfigurasi campuran juga memungkinkan dengan llama-server, memuat sebanyak mungkin ke GPU 32GB·48GB·96GB dan menaruh sisanya di DRAM sistem
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Model DeepSeek baru terasa seperti hadiah Natal. Untuk model API berbiaya rendah, DeepSeek adalah yang terbaik, dan sampai harga VRAM turun cukup jauh agar inferensi lokal jadi layak, pendekatan ini tampaknya paling masuk akal
    Model langganan yang bergantung pada subsidi sulit bertahan lama, dan penagihan API tampak lebih dekat ke model bisnis yang berkelanjutan

    • Saya memakai DeepSeek untuk sebuah proyek, dan kemampuan memakai puluhan juta token hanya dengan beberapa sen terasa luar biasa. Memang tidak cocok untuk semua tugas, tetapi untuk tugas tertentu hasilnya sangat baik dengan biaya yang nyaris gratis
    • Saya menantikan hari ketika Tiongkok menyamai perangkat keras memori dan komputasi lalu mengalahkan perusahaan AS baik dari sisi harga maupun performa
    • Rekan-rekan developer mengeluh token Claude habis dalam satu jam, sementara saya memakai DS Flash seharian. Kalau sesekali salah, tinggal pakai model seperti Claude hanya untuk tugas yang sulit
    • Bahkan dihitung per token, DeepSeek API kemungkinan besar lebih hemat biaya daripada langganan. Dari pengujian saya sendiri, Flash jauh lebih baik dalam mengikuti instruksi dan menjadi lebih proaktif, sehingga saat ini hampir tidak ada tandingan dari sisi efisiensi biaya
    • Kalau melihat harganya langsung, untuk menghasilkan hasil setara GPT 5.6 Luna dibutuhkan lebih banyak token dan kecepatan token per detiknya juga jauh lebih rendah. Meski begitu, tekanan dari DeepSeek jelas mendorong pemain lama untuk terus beroptimasi
  • Alamat lama menghasilkan 404, dan URL yang benar tampaknya ini: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Saya menambahkan titik data DeepSeek V4 Flash 0731 ke grafik OpenAI yang dirilis kemarin, dan model ini berada di frontier harga-performa
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Sumber asli: https://openai.com/index/advancing-the-price-performance-fro...

  • Untuk tugas agen kode di benchmark publik, mereka katanya memakai mode minimal DeepSeek Harness yang belum dirilis, jadi saya penasaran apakah ada rencana mengumumkan harness agen coding yang dioptimalkan juga
    Jika memakai DSv4 Flash bersama reasonix atau pi, Anda bisa coding seharian hanya dengan beberapa sen tanpa khawatir soal token. Sebaliknya, kalau memakai model yang sama lewat Fireworks atau OpenRouter dengan ZDR, biayanya terus naik tanpa alasan yang jelas. Tampaknya harga disubsidi demi mengumpulkan data penggunaan, dan saya sedang menunggu hari ketika ini bisa dijalankan secara lokal

    • Kalau bukan lewat OpenRouter, saya penasaran beli dari penyedia mana. Saya kira kalau penyedianya terdaftar di OpenRouter, harga beli langsung sama saja
    • Di laporan teknis mereka sebenarnya sudah mengisyaratkan DeepSeek Harness. Tugas agen kode dievaluasi dengan mode minimal, upaya penalaran maksimum, temperature = 1.0, top_p = 0.95, dan harness-nya akan dirilis nanti
  • Bagi pengguna RTX PRO 6000 96GB tunggal atau DGX Spark 128GB, vllm-moet yang kurang dikenal adalah engine yang sangat bagus. Ia otomatis membuat plane 2-bit simetris untuk inferensi, sekaligus membuat delta cache 4-bit untuk memulihkan presisi, dan mendukung streaming SSD untuk bobot yang lebih besar daripada RAM
    Anda bisa menentukan berapa VRAM yang dialokasikan ke tiap area untuk menyeimbangkan kecepatan dan presisi, dan 170 token per detik sudah didemonstrasikan pada DS V4 Flash. Model asli dipakai apa adanya tanpa model konversi terpisah
    Di DGX Spark diperlukan sedikit workaround untuk mengabaikan perbedaan sm120 dan sm121, tetapi karena tetap bisa berjalan di sm121, rasanya layak menghabiskan beberapa jam untuk mencobanya

  • Dengan $0,28 per 1 juta token output, model ini memberi kecerdasan setara GLM 5.2·Gemini 3.6, dan model Pro yang diperbarui juga akan segera hadir
    Unsloth Q8 lossless berukuran 162GB, jadi secara realistis ukurannya sudah cukup masuk akal untuk dijalankan di rumah

    • Saya ingin tahu seperti apa rumah yang bisa menjalankan sesuatu sebesar itu
    • Ukuran Q8 sekitar 151GB
  • Jika DeepSeek V4 Flash melampaui V4 Pro, saya penasaran apakah dalam beberapa minggu kita juga bisa berharap pada V4 Pro setingkat Opus 5. Akan lebih bagus lagi kalau bahkan melampaui Opus

    • Saya sedang memakai V4 Flash untuk aplikasi yang saya buat, dan setelah sebelumnya hanya memakai GPT·Opus·Sonnet, efisiensi biaya dan performanya benar-benar mengejutkan. Biayanya sangat rendah sehingga saya bisa menyediakan tier gratis yang cukup longgar untuk aplikasi yang bukan bertujuan mencari keuntungan
      https://trysojourn.app
    • Performa Opus 5 dengan harga V4 Pro akan terdengar luar biasa sampai sulit dipercaya, tetapi mungkin itu lebih dekat ke mimpi
    • Mereka pernah menyatakan bahwa versi final V4 Pro yang diperbarui akan segera dirilis
  • Bagian yang benar-benar menarik adalah bahwa peningkatan performa besar dicapai hanya lewat fine-tuning tambahan tanpa perubahan arsitektur. Ini hasil dari memasukkan lebih banyak data, komputasi, dan waktu
    DS V4 Flash relatif kecil dibanding kelompok model pesaingnya, jadi tampaknya besar kemungkinan peningkatan serupa juga bisa diperoleh pada model kecil lain jika diberi data berkualitas tinggi dan pipeline pelatihan yang baik

  • Dari sisi harga per tugas, model ini sudah mengungguli Luna dengan selisih sekitar : https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Saya juga ingin melihat bagaimana perbandingannya dengan Luna untuk tipe tugas tertentu
    • Karena biaya ada di sumbu X, secara teknis DeepSeek V4 Flash 0731 dengan penalaran maksimum berada di sekitar $0,03 per tugas dengan indeks 50. OpenAI Luna memiliki penalaran tinggi di $0,03·indeks 46, penalaran sangat tinggi di $0,04·indeks 49, dan penalaran maksimum di $0,07·indeks 51
      Jadi, cara yang lebih adil untuk melihatnya adalah bahwa Luna 2~3× lebih mahal, tetapi kecepatan inferensinya 2~5× lebih cepat daripada DeepSeek Flash. Model OpenAI termurah yang melampaui DeepSeek adalah Luna dengan penalaran maksimum, yang pada performa serupa sekitar 3× lebih mahal sebelum pembulatan, tetapi juga hampir 3× lebih cepat
      Fakta bahwa Artificial Analysis memakai warna biru tua untuk DeepSeek dan OpenAI terasa sebagai pilihan warna yang sangat tidak tepat, terutama pada hari seperti ini