- Kimi K3 adalah model agen multimodal native berbobot terbuka dengan 2,8 triliun parameter dan konteks 1.048.576 token, mendukung coding jangka panjang, pekerjaan pengetahuan, dan penalaran
- Menggabungkan Kimi Delta Attention (KDA), Attention Residuals, dan Stable LatentMoE untuk mengaktifkan 16 dari 896 expert per token, dengan efisiensi penskalaan keseluruhan sekitar 2,5 kali lebih tinggi dibanding Kimi K2
- Dalam evaluasi publik, model ini mencatat GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, dan OmniDocBench 91.1, tetapi perbedaan harness, pengaturan inferensi, dan hardware antar model tetap perlu dipertimbangkan
- Model ini dilatih dengan kesadaran kuantisasi menggunakan bobot MXFP4 dan aktivasi MXFP8 dan dapat dijalankan lewat Transformers, vLLM, SGLang, Docker, serta API kompatibel OpenAI dan Anthropic
- Dalam multi-turn dan pemanggilan tool, seluruh pesan assistant yang dikembalikan API, termasuk
reasoning_contentdantool_calls, harus dikirim ulang apa adanya, dan kode serta bobotnya dirilis di bawah Kimi K3 License
Arsitektur dan skala model
- Kimi K3 adalah model agen multimodal native berbobot terbuka yang dirancang untuk coding jangka panjang, pekerjaan pengetahuan, dan penalaran
- Total parameternya 2.8T, dengan 104B parameter aktif dan terdiri dari 93 layer
- Menggunakan 1 dense layer, 69 layer KDA, dan 24 layer Gated MLA
- Attention hidden dimension adalah 7.168, dengan 96 attention head
- Stable LatentMoE memilih 16 dari 896 expert per token dan menggunakan 2 shared expert
- Dimensi Latent MoE adalah 3.584, dan MoE hidden dimension per expert adalah 3.072
- Dibanding Kimi K2, efisiensi penskalaan keseluruhan meningkat sekitar 2,5 kali
- Ukuran kosakatanya 160K, panjang konteks 1.048.576 token, dan fungsi aktivasi yang digunakan adalah SiTU-GLU
- Untuk vision encoder, model ini memakai MoonViT-V2 dengan 401M parameter
- Fitur utamanya mencakup pemahaman teks, gambar, dan video, tetapi pada kolom modality di tabel ringkasan model hanya tercantum Text dan Image
Coding jangka panjang dan pekerjaan pengetahuan
- Menjelajahi repositori besar dan mengoordinasikan tool terminal sambil mempertahankan sesi engineering yang panjang dengan pengawasan manusia yang minimal
- Mendukung optimasi kernel GPU dan pengembangan compiler
- Mencakup pengembangan game berbasis vision, CAD, dan desain chip
- Dalam pekerjaan pengetahuan berbasis agen, model ini membuat visualisasi interaktif, widget, dan dashboard bersama riset mendalam
- Motion design dan penyuntingan video juga termasuk dalam cakupan dukungannya
- Sebagai framework agen coding, direkomendasikan memakai Kimi Code CLI, dan Kimi K3 dapat dipilih lewat perintah
/modeldi terminal
Hasil evaluasi
- Semua hasil Kimi K3 diukur dengan
reasoning_effort="max"dan temperature 1.0- Untuk tugas satu langkah seperti GPQA Diamond, HLE-Full, dan evaluasi vision tanpa tool, digunakan top-p 0.95
- Untuk tugas agen, diterapkan top-p 1.0
- Dalam evaluasi penalaran dan pengetahuan, model ini mencatat GPQA Diamond 93.5, CritPt 23.4, dan AA-LCR 74.7
- HLE-Full memperoleh 43.5 tanpa tool dan 56.0 saat menggunakan tool
- Dalam evaluasi coding, model ini mencatat ProgramBench 77.8, Terminal-Bench 2.1 88.3, dan FrontierSWE 81.2
- DeepSWE mencatat 67.5 pada harness Kimi Code dan 67.3 pada harness mini-SWE-agent
- SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, dan Kimi Code Bench 2.0 72.9
- Dalam evaluasi agen, model ini mencatat BrowseComp 91.2, DeepSearchQA F1 95.0, dan ResearchRubrics 76.2
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, dan OSWorld-Verified 84.8
- Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, dan Legal Research Bench 44.2
- Dalam evaluasi vision, model ini mencatat OmniDocBench 91.1, Video-MME 90.0, dan MMVU 82.1
- MMMU-Pro memperoleh 81.6 tanpa tool dan 83.4 saat menggunakan tool
- MathVision naik dari 94.3 menjadi 97.8 saat memakai Python
- ZeroBench pass@5 meningkat dari 23.0 menjadi 41.0 saat menggunakan tool
Kondisi evaluasi dan keterbatasan perbandingan
- Model pembanding mencakup Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, dan GLM-5.2, tetapi harness evaluasi bisa berbeda untuk tiap model
- Kimi K3 terutama menggunakan Kimi Code atau Claude Code
- Keluarga GPT terutama menggunakan Codex, sedangkan model Claude dan GLM lain memakai Claude Code atau Terminus 2, dan sebagainya
- SWE-Marathon dievaluasi pada branch yang disesuaikan untuk H20 berdasarkan tugas per 9 Juli 2026, sebelum rilis final v1.1
- Image Docker, standar performa GPU, dan oracle referensi dikalibrasi ulang untuk H20, tetapi validator akurasi dan pencegahan kecurangan tidak diubah
- Claude Fable 5 mengalami fallback pada 35% tugas, yang mungkin berdampak negatif pada performa terukurnya
- PostTrainBench adalah rata-rata dari 3 kali eksekusi dengan upaya inferensi maksimum pada GPU H20, bukan H100 seperti di lingkungan resmi
- Kimi Code Bench 2.0 mencakup tugas keamanan siber dan keselamatan
- Claude Fable 5 mengalami 13 fallback dan 1 penolakan dari 80 tugas
- GPT-5.6 Sol menolak 10 tugas, dan GPT-5.5 menolak 3 tugas
- BrowseComp 91.2 adalah hasil dengan strategi kompresi konteks yang berjalan pada 300K token
- Saat memakai penuh jendela 1M token tanpa manajemen konteks terpisah, hasilnya 90.4
- Evaluasi multimodal menggunakan rata-rata 3 kali, kecuali ZeroBench
- ZeroBench dijalankan 5 kali sesuai pengaturan resmi
- PerceptionBench adalah benchmark internal untuk mengukur kemampuan persepsi visual atomik
Kuantisasi native
- Sejak tahap SFT, telah diterapkan pelatihan sadar kuantisasi
- Bobot menggunakan MXFP4 dan aktivasi menggunakan MXFP8 untuk menargetkan kompatibilitas hardware yang luas
Deployment dan cara menjalankan
- Dengan memilih
kimi-k3, pengguna dapat mengakses Kimi API yang menyediakan API kompatibel OpenAI dan Anthropic - Di Hugging Face Transformers, model bisa dimuat dengan
pipeline("image-text-to-text", ...)atauAutoModel.from_pretrained(...)- Untuk memakai kode model kustom, diperlukan
trust_remote_code=True
- Untuk memakai kode model kustom, diperlukan
- Local serving didukung lewat vLLM dan SGLang
- Kedua engine dapat menangani permintaan teks dan gambar pada endpoint kompatibel OpenAI
/v1/chat/completions
- Kedua engine dapat menangani permintaan teks dan gambar pada endpoint kompatibel OpenAI
- Di Docker Model Runner, jalankan dengan
docker model run hf.co/moonshotai/Kimi-K3 - Model ini juga dapat digunakan di HuggingChat, Google Colab, dan Kaggle
Cara memakai API sambil mempertahankan status penalaran
- Kimi K3 memiliki mode berpikir yang selalu aktif dan mengembalikan
reasoning_content - Field permintaan tingkat atas
reasoning_effortmendukung"low","high", dan"max", dengan nilai bawaan"max" - Percakapan multi-turn dan pemanggilan tool harus mengikuti cara kerja riwayat pemikiran yang dipertahankan
- Pesan assistant yang dikembalikan API harus dikirim ulang ke
messagesapa adanya - Bukan hanya
content, tetapi jugareasoning_contentdantool_callsharus disertakan
- Pesan assistant yang dikembalikan API harus dikirim ulang ke
- Input vision, structured output, partial mode, pemilihan tool, pemuatan tool dinamis, dan context caching dapat dilihat di Kimi K3 Quickstart dan Thinking Effort
Lisensi
- Repositori kode dan bobot model keduanya dirilis di bawah Kimi K3 License
2 komentar
Semoga ada penyedia layanan di dalam negeri yang menawarkannya.
Komentar Hacker News
Jika harga perantara pihak ketiga untuk model 3 triliun parameter ini sudah ditetapkan, kita bisa memperkirakan biaya serving sebenarnya dan apakah lab tersebut mensubsidi token API
Karena native MXFP4, dibutuhkan sekitar 1,5TB VRAM sehingga berada di batas 8×B200, dan jika mempertimbangkan panjang konteks serta optimisasi throughput, secara realistis tampaknya butuh 16 kartu
Pada benchmark AISI keamanan siber, model ini lebih tinggi daripada GLM 5.2, tetapi masih tertinggal jauh dari model tertutup terdepan sehingga mungkin perlu fine-tuning. Juga menarik apakah Cursor akan melatih ulang agar bisa dibandingkan langsung dengan lini Composer yang merupakan varian fine-tuning Kimi 2.6/2.7 serta Grok 4.5
Ada juga harapan untuk membuat model kecil lewat distilasi pengetahuan yang benar-benar mempelajari distribusi probabilitas penuh. Terutama DSV4-Kimi dengan biaya serving rendah tampak menjanjikan
Jika membangun 3TB RAM dengan server 4U bekas dan 32 DIMM ECC 64GB, biayanya di bawah 30 ribu dolar sehingga selisih harga dengan perangkat GPU nyata cukup besar. Memang belum ada bobot presisi penuh atau versi kuantisasi Q8/Q8-XL dari Unsloth, tetapi untuk memakai konteks yang longgar tampaknya perlu lebih dari 1.536GB, yakni 2TB, idealnya 2,5~3TB
Q4 dan Q6 kemungkinan menjadi kompromi terburuk karena kehilangan pengetahuan dan presisi, tetap lambat, dan sulit dipercaya, jadi jika ingin menjalankan model yang pintar tetapi lambat di perangkat murah, saya rasa Q8 diperlukan
Mereka membuat proof of concept di https://github.com/woct0rdho/transformers5-qwen3.5-recipe, dan tanpa CPU offloading, Qwen3.5-35B-A3B bisa di-fine-tune dengan 16GiB VRAM, sedangkan DeepSeek-V4-Flash 284B-A13B dengan 90GiB VRAM. Ini juga berjalan baik pada sistem memori terpadu seperti Strix Halo
Meski begitu, model sekelas Kimi-K3 tetap membutuhkan banyak GPU dan node, jadi ada jauh lebih banyak hal yang harus diselesaikan dibanding pelatihan GPU tunggal
Dalam rilis kali ini, bagian yang jauh lebih menarik daripada harga adalah kustomisasi. Startup pun bisa mengunduh bobot, memodifikasinya, dan melakukan fine-tuning, dan keunggulan sebenarnya bukan pada biaya melainkan pada performa di data internal serta kedaulatan hak kekayaan intelektual. Ini pencapaian besar bagi tim Kimi
Saya merasa hardware untuk individu yang ingin menjalankan LLM disusun dengan cara yang tidak cocok untuk kebutuhannya. Pilihannya hanya bertahan di memori terpadu dengan 5~10 token per detik, atau beralih ke kartu data center yang menghabiskan ratusan GB VRAM dan lebih dari 1kW
Tidak ada GPU semi-profesional dengan TDP 180~250W dan VRAM 128GB atau 256GB, padahal dua kartu seperti itu dengan koneksi setara NVLink yang umum saja akan sangat berguna. Menjalankan Kimi K3 secara lokal akan butuh homelab dan biaya yang sangat besar, tetapi akan menyenangkan jika GLM 5.2 bisa dijalankan sekitar 100 token per detik dalam satu sesi, atau sekitar 60 token saat memakai banyak sub-agent
Pengukuran dengan
llama-serverterbaru yang dijalankan memakai--no-mmapdiperkirakan menunjukkan DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, dan Qwen3.5-122B-A10B Q8_K_XL 170,038MiBIni kontras dengan pekerjaan desktop yang juga intermiten, tetapi performa komputasi yang dibutuhkan sudah menjadi cukup murah sehingga kita bisa menaruh perangkat yang sebenarnya berlebihan untuk kondisi idle di atas meja
gpt-osssebagai pengecualian, sambil membuat model terbuka makin sulit dijalankan namun tetap berbicara soal demokratisasi, yang terasa sangat tidak adilJika mampu membeli GPU seharga beberapa ribu dolar, saya mungkin tetap akan membelinya sebagai penggemar teknologi yang berkecukupan, tetapi harus diakui itu kemewahan yang sangat tidak efisien seperti mobil sport. Kemalangan yang sesungguhnya adalah tidak adanya teknologi komputasi atau institusi politik-sosial untuk mengoperasikan hardware bersama dengan cara yang dapat dipercaya
Berdasarkan lisensi, jika pemegang lisensi atau afiliasinya menjalankan bisnis model-as-a-service dan total pendapatan gabungan selama 12 bulan berturut-turut melebihi 20 juta dolar, mereka harus menandatangani kontrak terpisah dengan Moonshot AI sebelum menggunakan perangkat lunak atau turunannya secara komersial
Tersedia di https://app.fireworks.ai/models/fireworks/kimi-k3, dengan harga 3 dolar per 1 juta token input non-cache, 0,30 dolar untuk input cache, dan 15 dolar untuk output
Saat ini latensinya jauh lebih rendah daripada Moonshot, tetapi volumenya juga jauh lebih kecil, jadi masih harus dilihat apakah ini akan bertahan. Meski begitu, peluncuran di hari yang sama tetap mengesankan
Karena persaingan, harga GLM 5.2 telah turun sekitar 45% hanya dalam sekitar 1,5 bulan sejak dirilis pada 16 Juni, dan penyedia baru masih terus bersaing harga: https://openrouter.ai/z-ai/glm-5.2#providers
Secara ekonomi, harga tidak harus lebih rendah dari total biaya, melainkan tidak boleh lebih rendah dari biaya marjinal, dan untuk pusat data dengan utilisasi GPU rendah, ini kira-kira setara dengan biaya listrik. Karena kelebihan kapasitas dan persaingan di pusat data skala kecil, saya menduga segera akan ada tempat yang menjual token di bawah gabungan biaya listrik dan depresiasi GPU
Saat ditanya “Tell me about yourself” di Hugging Face, menariknya Kimi K3 menjawab bahwa dirinya adalah Claude buatan Anthropic
Saya menyarankan model frontier diunduh untuk arsip. Meski 1,5TB, simpan saja di disk murah dan akan lebih berguna lagi jika ikut seeding torrent
Seperti dulu ada upaya untuk mengendalikan algoritme kriptografi, model juga bisa diblokir lewat regulasi, dan perangkat lunak terbuka hanya bisa bertahan jika didistribusikan luas. Seiring waktu, eksekusi yang realistis akan menjadi mungkin berkat teknik dan investasi besar pada manufaktur perangkat keras, dan akan disayangkan jika pada saat itu distribusinya justru menjadi ilegal sehingga harus membayar biaya regulatory capture
Alamat magnetnya adalah
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2FannounceSetelah meninjau lisensi dan mengujinya pada perangkat keras nyata, tampaknya akan sulit bagi penyedia untuk menawarkan harga 60~70% lebih murah daripada harga Moonshot. Mungkin bisa sedikit lebih murah, tetapi tanpa mengorbankan kecepatan pemrosesan secara besar, diskon setingkat GLM tampaknya sulit
Margin Kimi diperkirakan sekitar 40~50% bahkan jika diasumsikan GPU diperoleh lewat sewa mahal, dan bisa lebih tinggi jika memakai peralatan sendiri. Namun ini masih di bawah margin lebih dari 90% milik Anthropic yang diperkirakan sebagian orang, dan bahkan margin API Anthropic 80% pun terasa meragukan
Jika biaya listrik adalah satu-satunya biaya pokok, maka 80~90% mungkin saja, tetapi melihat jumlah token per detik yang saat ini ditawarkan, itu tampaknya tidak mudah. Saya hanya menguji di B200 dan tidak bisa mendapatkan B300; model ini juga sudah terkuantisasi dan saya tidak memakai konteks 1 juta token, jadi ruang untuk optimasi memori langsung juga tampak kecil. Akan bagus jika ada seseorang yang punya akses ke R100 dan bisa memverifikasi biayanya
Penyedia besar harus membuat kontrak dengan Kimi, jadi selama Kimi masih menjadi model terbuka papan atas, sulit mengharapkan diskon besar
Saya penasaran karena tautan sumber asli mengembalikan 404, apakah diblokir atau disensor sendiri
Tampaknya akan ada permintaan untuk menyimpannya sebagai cadangan, untuk berjaga-jaga jika tiba-tiba hilang karena kontrol pemerintah. Tiongkok juga baru-baru ini mulai membahas kontrol ekspor model, dan sekarang situasinya berbeda karena yang mulai dirilis bukan model tertinggal, melainkan model paling mutakhir