- Kimi K3-256k adalah model untuk coding sehari-hari yang mempertahankan kualitas hasil K3 pada konteks 256k, sambil menggunakan kuota sekitar setengahnya dibanding
k3dengan konteks 1M - Kimi Code menyediakan K3 dan K2.7 Code melalui 4 model ID;
k3mendukung 2.8T parameter dan konteks hingga 1M, sedangkankimi-for-coding-highspeedmemberikan output sekitar 5~6 kali lebih cepat tetapi memakai kuota 3 kali lebih banyak - Saat beralih dari
k3kek3-256k, jika konteks yang ada melebihi 256k atau menyertakan video, Anda harus menjalankan compact terlebih dahulu agar kompatibilitas tetap terjaga sambil mempertahankan informasi penting - Jika model atau
reasoning_effortdiubah, cache konteks yang ada akan dibatalkan sehingga perlu prefill ulang dan penggunaan bisa meningkat; karena itu, disarankan beralih melalui sesi baru - Model dan konteks yang tersedia berbeda menurut paket langganan, dan jika melampaui izin akses akan dikembalikan
401. Di alat pihak ketiga, Anda harus mengatur sendiri model ID yang tepat serta ukuran konteks dan tingkat penalaran
Konfigurasi model Kimi Code
- Kimi Code menyediakan Kimi K3 dan Kimi K2.7 Code melalui 4 model ID
k3: model coding flagship dengan 2.8T parameter, mendukung konteks hingga 1M pada paket tingkat atask3-256k: versi konteks 256k dari Kimi K3, berfokus pada pengurangan konsumsi kuotakimi-for-coding: Kimi K2.7 Code yang cocok untuk pelengkapan kode dan pekerjaan pengembangan sehari-harikimi-for-coding-highspeed: K2.7 Code HighSpeed yang memberikan output sekitar 5~6 kali lebih cepat dengan kemampuan coding yang sama
- Spesifikasi dan syarat penggunaan tiap model adalah sebagai berikut
k3- Berjalan pada kecepatan normal, dan menyediakan konteks hingga 1M untuk anggota tingkat atas
reasoning_effortmendukunglow,high,maxdan nilai default-nya adalahhigh- Tersedia mulai paket Moderato, dan konteks 1M tersedia mulai Allegretto
- Dapat menerima input gambar dan video
k3-256k- Berjalan pada kecepatan normal dan konteksnya tetap di 256k
reasoning_effortmendukunglow,high,maxdan nilai default-nya adalahhigh- Dapat digunakan oleh anggota paket Moderato ke atas
- Hanya dapat menerima input gambar dan tidak mendukung video
kimi-for-coding- Menyediakan kecepatan normal dan konteks 256k, serta dapat digunakan oleh semua anggota
- Berjalan dengan
Thinking:ONdan mendukung gambar serta video
kimi-for-coding-highspeed- Menghasilkan output sekitar 6 kali lebih cepat pada konteks 256k tetapi menggunakan kuota 3 kali lebih banyak
- Tersedia mulai Allegretto, serta mendukung
Thinking:ONdan input gambar/video
Kegunaan K3-256k dan perpindahan model
k3-256kmemberikan hasil yang sama sepertik3dalam rentang konteks 256k, sambil hanya memakai sekitar setengah kuota dibanding versi 1M- Cocok untuk tanya jawab harian, pelengkapan kode, pengembangan fitur umum, serta penyuntingan satu file atau file skala kecil, tetapi tidak mendukung input video
-
Beralih dari K3 ke K3-256k
- Jika konteks sesi saat ini melebihi 256k, beberapa alat seperti Kimi Code CLI dan Claude Code akan menjalankan compact secara otomatis
- Karena tiap alat agen menangani ini dengan cara berbeda, disarankan menjalankan compact secara manual sekali sebelum beralih agar konteks dikompresi ke dalam 256k
- Dengan begitu, sesi dapat dipertahankan sambil menjaga inti pekerjaan tetap utuh
- Setelah beralih, kuota dapat dipakai lebih lama
- Jika riwayat percakapan berisi file video, Anda tidak bisa langsung beralih ke
k3-256k, jadi harus menjalankan compact terlebih dahulu
-
Beralih dari K3-256k ke K3
- Jika
k3-256kmendekati batas 256k dan Anda ingin menghindari kehilangan informasi akibat compact, Anda bisa langsung beralih kek31M - Pada versi saat ini, beralih dari 256k ke 1M tidak memengaruhi cache
- Jika
Cache dan pengelolaan penggunaan
- Saat model diubah, cache konteks yang dibangun pada model sebelumnya tidak akan terkena hit sehingga konteks tersebut harus diprefill ulang
- Karena itu, penggunaan bisa tampak meningkat segera setelah beralih. Saat memakai model baru, memulai sesi baru lebih menguntungkan untuk hasil yang lebih baik dan konsumsi yang lebih rendah
-
Biaya perpindahan tingkat penalaran
- Mengubah
reasoning_effortjuga membatalkan cache konteks yang ada sehingga perlu diprefill ulang - Disarankan memilih tingkat penalaran yang sesuai dengan pekerjaan lalu menjaganya tetap konsisten dalam satu sesi
- Jika benar-benar membutuhkan tingkat penalaran lain, lebih baik memulai sesi baru daripada berulang kali berpindah dalam sesi panjang
- Mengubah
Izin paket dan error 401
- Bahkan jika model ID yang digunakan benar, server akan mengembalikan
401bila fitur yang diminta melampaui izin paket- Tidak ada akses K3: pada paket di bawah Moderato,
k3dank3-256ktidak dapat dipanggil - Tidak ada akses 1M: pada Moderato,
k3hanya mendukung hingga 256k, sedangkan hingga 1M hanya tersedia mulai Allegretto - Batas konteks
k3-256ktetap 256k terlepas dari paket - Tidak ada akses HighSpeed:
kimi-for-coding-highspeedmemerlukan Allegretto atau lebih tinggi
- Tidak ada akses K3: pada paket di bawah Moderato,
- Pesan error lengkap dan cara menanganinya dapat dilihat di Error Reference
Alasan HighSpeed tidak terasa lebih cepat
- Model ID HighSpeed harus tepat
kimi-for-coding-highspeed- Jika salah memasukkannya, tanpa error akan diganti ke
kimi-for-codingstandar sehingga peningkatan kecepatan tidak terlihat
- Jika salah memasukkannya, tanpa error akan diganti ke
- HighSpeed hanya mempercepat output model
- Pembacaan/penulisan file, pemanggilan perintah, dan eksekusi skrip tidak menjadi lebih cepat
- Jika dalam satu pekerjaan porsi eksekusi alat atau skrip tinggi, peningkatan kecepatan keseluruhan bisa terasa kecil
Beralih model di klien
- Mengubah model ID akan membatalkan cache konteks. Untuk menghindari konsumsi token tambahan dan mendapatkan pengalaman penggunaan yang optimal, disarankan memulai sesi baru
- Saat melakukan pemanggilan, yang harus dimasukkan bukan nama versi model, melainkan salah satu model ID berikut
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
- Jika memasukkan nama versi seperti
Kimi K3atauK2.7 Code, pemanggilan akan gagal - Jika Thinking dimatikan pada K3 atau K2.7, permintaan akan dirutekan ke K2.6, jadi untuk memakai K3 atau K2.7 Code, Thinking harus diaktifkan
-
Klien resmi
- Di Kimi Code CLI, Anda dapat memasukkan
/modeluntuk mengganti model tanpa mengubah pengaturan - Jika model terbaru tidak ada dalam daftar, Anda harus login ulang dengan
/logoutlalu/login - Di Kimi Code for VS Code, model dipilih dari menu dropdown pada kotak input
- Jika model tidak ditampilkan, Anda harus me-restart VS Code atau memasang ulang ekstensi
- Di Kimi Code CLI, Anda dapat memasukkan
Pengaturan alat pihak ketiga
- Buat API Key di Kimi Code Console, lalu masukkan Base URL dan model ID ke alat
- Kimi Code API mendukung protokol kompatibel OpenAI dan protokol kompatibel Anthropic
- Base URL kompatibel OpenAI:
https://api.kimi.com/coding/v1 - Base URL kompatibel Anthropic:
https://api.kimi.com/coding/
- Base URL kompatibel OpenAI:
- Cara konfigurasi tiap alat dapat dilihat di dokumen berikut
- Claude Code: asisten coding command-line dari Anthropic
- OpenCode: agen coding berbasis terminal
- Codex: agen coding dari OpenAI
-
Pengaturan konteks K3
- Konteks default di beberapa alat pihak ketiga lebih kecil daripada maksimum K3 yaitu 1M
- Untuk menggunakan konteks hingga 1M, Anda harus mengatur field
context-windowsecara manual menjadi1048576
-
Pemetaan tingkat penalaran K3
- K3 mendukung
low,high,max, dan nilai yang dikirim alat dipetakan sebagai berikut nullatauundefined: defaulthigh- Nilai lain yang tidak dikenal: error HTTP
400 ultra,max,xhigh:maxhigh,medium: tingkat yang direkomendasikan,highlow,minimum,light:lownone:thinking.typedinonaktifkan
- K3 mendukung
1 komentar
Komentar Hacker News
Codex memanfaatkan konteks 256k dengan sangat baik. 1M memang lapang, tetapi masih mahal dan tampaknya tidak diperlukan sebagai default
LLM dengan cepat menjadi komoditas serbaguna, dan moat lab riset AI AS seperti OpenAI makin melemah. Pada akhirnya, hyperscaler dan pemilik pusat data yang bisa menjual token murah kemungkinan besar akan menang
k3-256ktelah dirilis dan memberikan hasil yang sama dalam konteks 256k.k3 (1M)menghabiskan kuota kira-kira dua kali lebih banyak dibandingk3-256kIni perubahan yang bagus. Biasanya saya berusaha menjaga konteks di bawah 200k
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
Kalau begitu, saya penasaran apakah semua pengguna tiba-tiba bisa memakai Kimi dengan harga setengahnya sampai konteks mencapai 256k. Kalau benar, ini perubahan besar
k3-256klalu beralih ke model 1M pada 256k, cache akan menjadi tidak valid, sehingga 256k token yang sudah ada harus dibayar ulang dengan harga model 1MNamun ternyata itu salah; saat mendekati batas konteks, kita bisa beralih ke model 1M tanpa membuat cache tidak valid. Pada versi saat ini, mengganti dari
k3-256kkek3 (1M)tidak memengaruhi cacheSudah 38 menit sejak tulisan ini diposting, dan sejak 20 menit lalu beberapa layanan Anthropic ditandai mengalami gangguan besar. Mungkin tidak terkait, tapi agak lucu
Sepertinya modelnya sendiri sama dan ini hanya perubahan di level API
Secara fungsional mirip dengan cara OpenAI mengubah tingkat harga setelah melewati panjang konteks tertentu. Ambangnya juga sekitar 272k, yaitu
2^18atau sekitar 256kSemakin besar konteks aktif, semakin banyak komputasi dan byte yang harus dibaca untuk tiap token output, jadi masuk akal jika biayanya diteruskan ke pengguna. Namun agak mengejutkan mereka tidak memakai kurva harga yang halus, melainkan ambang bertingkat
Konfigurasi konteks pendek membutuhkan lebih sedikit node khusus prefill per instance, dan karena tidak perlu mendukung KV cache besar, jumlah node keseluruhan juga bisa dikurangi. Jika memakai inferensi terpisah, rasio komputasi yang dialokasikan untuk prefill dan decoding juga bisa disesuaikan masing-masing
Semoga perubahan ini mengurangi beban infrastruktur. Belakangan semua model terasa jauh lebih lamban, sementara tim dukungan tidak merespons. Saya curiga sebagian besar permintaan diproses dengan model terkuantisasi
Saya penasaran apakah ini bukan model yang dikuantisasi, melainkan hanya jendela konteks yang diperkecil menjadi 256k