1 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Kimi K3 dari Moonshot AI adalah model open weight dengan total 2,8T parameter, 104B parameter aktif, native vision, dan konteks 1 juta token; Unsloth menyediakan kuantisasi GGUF untuk menjalankannya secara lokal
  • Inferensi presisi penuh membutuhkan 1,56TB, tetapi Dynamic 1-bit UD-IQ1_S mencatat akurasi Top-1 sekitar 78,9% pada 594GB, sementara 2-bit UD-Q2_K_XL berukuran 861,3GB mencatat sekitar 90%
  • Kimi K3 adalah model thinking-only yang mempertahankan jejak penalaran, tidak mendukung mode Instant, memungkinkan pilihan "low", "high", "max" lewat reasoning_effort, dan memproses hingga 1.048.576 token
  • Unsloth Studio mengotomatiskan offloading RAM dan deteksi multi-GPU; untuk menjalankan llama.cpp dengan fitur vision diperlukan fork Unsloth untuk Kimi K3
  • Menjalankan UD-IQ1_S yang direkomendasikan membutuhkan minimal 610GB RAM, dan secara umum RAM+VRAM harus sebesar ukuran file kuantisasi; jika kurang, proses akan jauh melambat karena offloading ke disk

Karakteristik Model dan Kebutuhan Menjalankan secara Lokal

  • Kimi K3 dari Moonshot AI adalah model open weight 2,8T parameter yang ditujukan untuk coding, agent, konteks panjang, dan chat; saat inferensi, model mengaktifkan 104B parameter
  • Mendukung native vision dan jendela konteks 1 juta token, serta menggunakan MXFP4 untuk bobot MoE
  • Inferensi presisi penuh membutuhkan ruang penyimpanan 1,56TB
  • Kimi-K3-GGUF dapat dijalankan di Unsloth Studio atau llama.cpp
  • Dapat dijalankan juga di NVIDIA DGX Station atau Mac Studio yang terhubung ke perangkat dengan RAM 128GB
  • Kebutuhan hardware dihitung sebagai gabungan RAM dan VRAM atau unified memory, dengan rentang konfigurasi 610GB~1,6TB

Cara Implementasi GGUF

  • Diimplementasikan berdasarkan PR llama.cpp, dengan fork Unsloth yang menambahkan dukungan vision dan perbaikan bug
  • Vision tower mirip dengan Kimi K2.5, tetapi memiliki perbedaan berikut
    • Menggunakan RMSNorm dan tidak memiliki bias
    • QKV gabungan berbentuk non-persegi dan qkv width != n_embd
    • Normalisasi diterapkan setelah projector
  • Pada batch besar, anggaran n_tokens * 40 gagal sehingga dinaikkan menjadi n_tokens * 160
  • Template chat Kimi dikonversi ke format Jinja
  • Karena pengaturan pelatihan default mengaktifkan preserved thinking, jejak penalaran dipertahankan tanpa dihapus

Metode Kuantisasi dan Kualitas

  • UD-Q8_K_XL mengikuti apa adanya konfigurasi MXFP4 untuk bobot MoE dan BF16 untuk bobot lainnya, sehingga merupakan kuantisasi lossless
  • UD-Q4_K_XL menyimpan sebagian tensor residual, kecuali tensor normalisasi dan beberapa lainnya, sebagai Q8_0; kualitasnya mendekati presisi penuh dan ukurannya 1,51TB
  • Versi lossless UD-Q8_K_XL berukuran 1,56TB, 50GB lebih besar daripada UD-Q4_K_XL
  • Hasil kuantisasi utama adalah sebagai berikut
    • UD-IQ1_S: 594,0GB, perplexity 2,5789, akurasi Top-1 78,875±0,107%
    • UD-IQ1_M: 648,9GB, perplexity 2,3639, akurasi Top-1 81,219±0,103%
    • UD-IQ2_XXS: 711,1GB, perplexity 2,1266, akurasi Top-1 84,127±0,096%
    • UD-Q2_K_XL: 861,3GB, perplexity 1,7359, akurasi Top-1 90,390±0,077%
    • UD-Q4_K_XL: 1.510GB, perplexity 1,4579
    • UD-Q8_K_XL: 1.560GB, perplexity 1,4581
  • Untuk pembuatan imatrix dan koreksi kuantisasi digunakan UD-Q8_K_XL lossless berukuran 1,56TB
  • Dynamic 1-bit 62% lebih kecil daripada versi lossless sekaligus mencapai akurasi Top-1 sekitar 79%
  • 2-bit UD-Q2_K_XL 45% lebih kecil dan mencatat akurasi sekitar 90%
  • Ukuran 1-bit adalah 553,2GiB, dan masih diselidiki apakah dapat diperkecil menjadi di bawah 512GiB tanpa merusak model
  • Perbandingan dengan Kuantisasi Komunitas

    • IQ1_M komunitas berukuran 618,9GB lebih besar daripada UD-IQ1_S 594GB, tetapi perplexity naik menjadi 54,56 sehingga 21 kali lebih buruk
    • IQ2_XXS komunitas mencatat perplexity 96 pada 725GB, sedangkan versi Unsloth mencatat 2,12 pada 711GB, selisih sekitar 45 kali
    • Kuantisasi dinamis dan koreksi yang tepat sama-sama menentukan ukuran file dan kualitas

Pengaturan Inferensi dan Performa

  • Kimi K3 adalah model thinking-only, preserve_thinking selalu aktif, dan level penalaran default adalah max
  • Mode Instant tidak didukung, dan field permintaan reasoning_effort dapat diisi dengan "low", "high", "max"
  • Panjang konteks maksimum adalah 1.048.576 token, dan di Unsloth tiga level penalaran dapat diganti
  • Pengaturan inferensi mencakup temperature=1.0, top_p=0.95 atau top_p=1.0
  • Jika model muat di memori, di B200 dapat diperoleh sekitar 20 token/detik untuk generasi dan throughput lebih dari 120 token/detik
  • Dengan mempertimbangkan keseimbangan ukuran dan kualitas, direkomendasikan UD-IQ1_S berukuran 594GB
  • Gabungan RAM dan VRAM harus kira-kira setara dengan ukuran file kuantisasi; meski tetap bisa dijalankan jika kurang, proses akan jauh melambat karena offloading ke disk

Menjalankan di Unsloth Studio

  • Unsloth Studio adalah UI web open source untuk AI lokal yang mendukung macOS, Windows, dan Linux
  • Dapat mencari, mengunduh, dan menjalankan model GGUF serta safetensors, dan menyediakan inferensi CPU+GPU berbasis llama.cpp
  • Secara otomatis mendeteksi offloading RAM dan konfigurasi multi-GPU
  • Perintah instalasi dan menjalankannya adalah sebagai berikut
# macOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh


# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex

unsloth studio
  • Setelah dijalankan, buka http://127.0.0.1:8888 atau alamat yang ditampilkan di browser; saat pertama kali berjalan, buat kata sandi untuk perlindungan akun
  • Menjalankan melalui HTTPS dengan tunnel Cloudflare gratis juga didukung
unsloth studio --secure
  • Cari Kimi K3 di Model hub, lalu unduh dan jalankan kuantisasi yang diinginkan
  • Parameter inferensi diatur otomatis, tetapi level penalaran, panjang konteks, template chat, dan lainnya dapat diubah secara manual
  • Pengaturan detail dapat dilihat di panduan inferensi Unsloth Studio

Menjalankan di llama.cpp

  • Untuk inferensi lokal cepat termasuk CPU, gunakan llama.cpp
  • Untuk mengaktifkan vision Kimi K3, Anda harus membangun fork khusus Unsloth, bukan versi umum
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
    --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
  • Jika tidak memiliki GPU atau hanya menggunakan inferensi CPU, ubah menjadi -DGGML_CUDA=OFF
  • Perangkat Apple Mac dan Metal juga menggunakan -DGGML_CUDA=OFF, dan dukungan Metal aktif secara default
  • llama.cpp dapat dibuat untuk langsung mengunduh dan menjalankan model, tetapi unduhannya bisa sangat lambat
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
    --temp 1.0 \
    --top-p 0.95
hf download unsloth/Kimi-K3-GGUF \
    --local-dir unsloth/Kimi-K3-GGUF \
    --include "*mmproj-BF16*" \
    --include "*UD-IQ1_S*"
  • Jika membutuhkan versi lossless, ubah pola unduhan menjadi *UD-Q8_K_XL*
  • Dapat dijalankan dalam mode percakapan dengan menentukan file lokal dan vision projector
./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
    --temp 1.0 \
    --top-p 0.95
  • Selain kueri teks, input gambar menggunakan mmproj-BF16.gguf juga didukung

Cakupan Benchmark

  • Evaluasi mencakup penalaran·pengetahuan, coding, agent, dan vision
  • Benchmark yang digunakan adalah GPQA Diamond, HLE-Full, DeepSWE, Terminal-Bench 2.1, BrowseComp, GDPval-AA v2, OSWorld 2.0, MMMU-Pro, MathVision
  • Dari hasil DeepSWE, Kimi K3 menunjukkan performa yang efisien

1 komentar

 
plumpmath 23 menit lalu

Setelah saya coba jalankan, hasilnya bagu~s banget~ Sekarang tinggal ada tang jjajjamyeon & takkang saja sudah cukup