- Kimi K3 dari Moonshot AI adalah model open weight dengan total 2,8T parameter, 104B parameter aktif, native vision, dan konteks 1 juta token; Unsloth menyediakan kuantisasi GGUF untuk menjalankannya secara lokal
- Inferensi presisi penuh membutuhkan 1,56TB, tetapi Dynamic 1-bit
UD-IQ1_S mencatat akurasi Top-1 sekitar 78,9% pada 594GB, sementara 2-bit UD-Q2_K_XL berukuran 861,3GB mencatat sekitar 90%
- Kimi K3 adalah model thinking-only yang mempertahankan jejak penalaran, tidak mendukung mode Instant, memungkinkan pilihan
"low", "high", "max" lewat reasoning_effort, dan memproses hingga 1.048.576 token
- Unsloth Studio mengotomatiskan offloading RAM dan deteksi multi-GPU; untuk menjalankan
llama.cpp dengan fitur vision diperlukan fork Unsloth untuk Kimi K3
- Menjalankan
UD-IQ1_S yang direkomendasikan membutuhkan minimal 610GB RAM, dan secara umum RAM+VRAM harus sebesar ukuran file kuantisasi; jika kurang, proses akan jauh melambat karena offloading ke disk
Karakteristik Model dan Kebutuhan Menjalankan secara Lokal
- Kimi K3 dari Moonshot AI adalah model open weight 2,8T parameter yang ditujukan untuk coding, agent, konteks panjang, dan chat; saat inferensi, model mengaktifkan 104B parameter
- Mendukung native vision dan jendela konteks 1 juta token, serta menggunakan MXFP4 untuk bobot MoE
- Inferensi presisi penuh membutuhkan ruang penyimpanan 1,56TB
- Kimi-K3-GGUF dapat dijalankan di Unsloth Studio atau
llama.cpp
- Dapat dijalankan juga di NVIDIA DGX Station atau Mac Studio yang terhubung ke perangkat dengan RAM 128GB
- Kebutuhan hardware dihitung sebagai gabungan RAM dan VRAM atau unified memory, dengan rentang konfigurasi 610GB~1,6TB
Cara Implementasi GGUF
- Diimplementasikan berdasarkan PR llama.cpp, dengan fork Unsloth yang menambahkan dukungan vision dan perbaikan bug
- Vision tower mirip dengan Kimi K2.5, tetapi memiliki perbedaan berikut
- Menggunakan RMSNorm dan tidak memiliki bias
- QKV gabungan berbentuk non-persegi dan
qkv width != n_embd
- Normalisasi diterapkan setelah projector
- Pada batch besar, anggaran
n_tokens * 40 gagal sehingga dinaikkan menjadi n_tokens * 160
- Template chat Kimi dikonversi ke format Jinja
- Karena pengaturan pelatihan default mengaktifkan
preserved thinking, jejak penalaran dipertahankan tanpa dihapus
Metode Kuantisasi dan Kualitas
UD-Q8_K_XL mengikuti apa adanya konfigurasi MXFP4 untuk bobot MoE dan BF16 untuk bobot lainnya, sehingga merupakan kuantisasi lossless
UD-Q4_K_XL menyimpan sebagian tensor residual, kecuali tensor normalisasi dan beberapa lainnya, sebagai Q8_0; kualitasnya mendekati presisi penuh dan ukurannya 1,51TB
- Versi lossless
UD-Q8_K_XL berukuran 1,56TB, 50GB lebih besar daripada UD-Q4_K_XL
- Hasil kuantisasi utama adalah sebagai berikut
UD-IQ1_S: 594,0GB, perplexity 2,5789, akurasi Top-1 78,875±0,107%
UD-IQ1_M: 648,9GB, perplexity 2,3639, akurasi Top-1 81,219±0,103%
UD-IQ2_XXS: 711,1GB, perplexity 2,1266, akurasi Top-1 84,127±0,096%
UD-Q2_K_XL: 861,3GB, perplexity 1,7359, akurasi Top-1 90,390±0,077%
UD-Q4_K_XL: 1.510GB, perplexity 1,4579
UD-Q8_K_XL: 1.560GB, perplexity 1,4581
- Untuk pembuatan imatrix dan koreksi kuantisasi digunakan
UD-Q8_K_XL lossless berukuran 1,56TB
- Dynamic 1-bit 62% lebih kecil daripada versi lossless sekaligus mencapai akurasi Top-1 sekitar 79%
- 2-bit
UD-Q2_K_XL 45% lebih kecil dan mencatat akurasi sekitar 90%
- Ukuran 1-bit adalah 553,2GiB, dan masih diselidiki apakah dapat diperkecil menjadi di bawah 512GiB tanpa merusak model
-
Perbandingan dengan Kuantisasi Komunitas
IQ1_M komunitas berukuran 618,9GB lebih besar daripada UD-IQ1_S 594GB, tetapi perplexity naik menjadi 54,56 sehingga 21 kali lebih buruk
IQ2_XXS komunitas mencatat perplexity 96 pada 725GB, sedangkan versi Unsloth mencatat 2,12 pada 711GB, selisih sekitar 45 kali
- Kuantisasi dinamis dan koreksi yang tepat sama-sama menentukan ukuran file dan kualitas
Pengaturan Inferensi dan Performa
- Kimi K3 adalah model thinking-only,
preserve_thinking selalu aktif, dan level penalaran default adalah max
- Mode Instant tidak didukung, dan field permintaan
reasoning_effort dapat diisi dengan "low", "high", "max"
- Panjang konteks maksimum adalah 1.048.576 token, dan di Unsloth tiga level penalaran dapat diganti
- Pengaturan inferensi mencakup
temperature=1.0, top_p=0.95 atau top_p=1.0
- Jika model muat di memori, di B200 dapat diperoleh sekitar 20 token/detik untuk generasi dan throughput lebih dari 120 token/detik
- Dengan mempertimbangkan keseimbangan ukuran dan kualitas, direkomendasikan
UD-IQ1_S berukuran 594GB
- Gabungan RAM dan VRAM harus kira-kira setara dengan ukuran file kuantisasi; meski tetap bisa dijalankan jika kurang, proses akan jauh melambat karena offloading ke disk
Menjalankan di Unsloth Studio
- Unsloth Studio adalah UI web open source untuk AI lokal yang mendukung macOS, Windows, dan Linux
- Dapat mencari, mengunduh, dan menjalankan model GGUF serta safetensors, dan menyediakan inferensi CPU+GPU berbasis
llama.cpp
- Secara otomatis mendeteksi offloading RAM dan konfigurasi multi-GPU
- Perintah instalasi dan menjalankannya adalah sebagai berikut
# macOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh
# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex
unsloth studio
- Setelah dijalankan, buka
http://127.0.0.1:8888 atau alamat yang ditampilkan di browser; saat pertama kali berjalan, buat kata sandi untuk perlindungan akun
- Menjalankan melalui HTTPS dengan tunnel Cloudflare gratis juga didukung
unsloth studio --secure
- Cari Kimi K3 di Model hub, lalu unduh dan jalankan kuantisasi yang diinginkan
- Parameter inferensi diatur otomatis, tetapi level penalaran, panjang konteks, template chat, dan lainnya dapat diubah secara manual
- Pengaturan detail dapat dilihat di panduan inferensi Unsloth Studio
Menjalankan di llama.cpp
- Untuk inferensi lokal cepat termasuk CPU, gunakan llama.cpp
- Untuk mengaktifkan vision Kimi K3, Anda harus membangun fork khusus Unsloth, bukan versi umum
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
--target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
- Jika tidak memiliki GPU atau hanya menggunakan inferensi CPU, ubah menjadi
-DGGML_CUDA=OFF
- Perangkat Apple Mac dan Metal juga menggunakan
-DGGML_CUDA=OFF, dan dukungan Metal aktif secara default
llama.cpp dapat dibuat untuk langsung mengunduh dan menjalankan model, tetapi unduhannya bisa sangat lambat
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
--temp 1.0 \
--top-p 0.95
hf download unsloth/Kimi-K3-GGUF \
--local-dir unsloth/Kimi-K3-GGUF \
--include "*mmproj-BF16*" \
--include "*UD-IQ1_S*"
- Jika membutuhkan versi lossless, ubah pola unduhan menjadi
*UD-Q8_K_XL*
- Dapat dijalankan dalam mode percakapan dengan menentukan file lokal dan vision projector
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
--temp 1.0 \
--top-p 0.95
- Selain kueri teks, input gambar menggunakan
mmproj-BF16.gguf juga didukung
Cakupan Benchmark
- Evaluasi mencakup penalaran·pengetahuan, coding, agent, dan vision
- Benchmark yang digunakan adalah GPQA Diamond, HLE-Full, DeepSWE, Terminal-Bench 2.1, BrowseComp, GDPval-AA v2, OSWorld 2.0, MMMU-Pro, MathVision
- Dari hasil DeepSWE, Kimi K3 menunjukkan performa yang efisien
1 komentar
Setelah saya coba jalankan, hasilnya bagu~s banget~ Sekarang tinggal ada tang jjajjamyeon & takkang saja sudah cukup