1 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Kimi K3-256k adalah model untuk coding sehari-hari yang mempertahankan kualitas hasil K3 pada konteks 256k, sambil menggunakan kuota sekitar setengahnya dibanding k3 dengan konteks 1M
  • Kimi Code menyediakan K3 dan K2.7 Code melalui 4 model ID; k3 mendukung 2.8T parameter dan konteks hingga 1M, sedangkan kimi-for-coding-highspeed memberikan output sekitar 5~6 kali lebih cepat tetapi memakai kuota 3 kali lebih banyak
  • Saat beralih dari k3 ke k3-256k, jika konteks yang ada melebihi 256k atau menyertakan video, Anda harus menjalankan compact terlebih dahulu agar kompatibilitas tetap terjaga sambil mempertahankan informasi penting
  • Jika model atau reasoning_effort diubah, cache konteks yang ada akan dibatalkan sehingga perlu prefill ulang dan penggunaan bisa meningkat; karena itu, disarankan beralih melalui sesi baru
  • Model dan konteks yang tersedia berbeda menurut paket langganan, dan jika melampaui izin akses akan dikembalikan 401. Di alat pihak ketiga, Anda harus mengatur sendiri model ID yang tepat serta ukuran konteks dan tingkat penalaran

Konfigurasi model Kimi Code

  • Kimi Code menyediakan Kimi K3 dan Kimi K2.7 Code melalui 4 model ID
    • k3: model coding flagship dengan 2.8T parameter, mendukung konteks hingga 1M pada paket tingkat atas
    • k3-256k: versi konteks 256k dari Kimi K3, berfokus pada pengurangan konsumsi kuota
    • kimi-for-coding: Kimi K2.7 Code yang cocok untuk pelengkapan kode dan pekerjaan pengembangan sehari-hari
    • kimi-for-coding-highspeed: K2.7 Code HighSpeed yang memberikan output sekitar 5~6 kali lebih cepat dengan kemampuan coding yang sama
  • Spesifikasi dan syarat penggunaan tiap model adalah sebagai berikut
    • k3
      • Berjalan pada kecepatan normal, dan menyediakan konteks hingga 1M untuk anggota tingkat atas
      • reasoning_effort mendukung low, high, max dan nilai default-nya adalah high
      • Tersedia mulai paket Moderato, dan konteks 1M tersedia mulai Allegretto
      • Dapat menerima input gambar dan video
    • k3-256k
      • Berjalan pada kecepatan normal dan konteksnya tetap di 256k
      • reasoning_effort mendukung low, high, max dan nilai default-nya adalah high
      • Dapat digunakan oleh anggota paket Moderato ke atas
      • Hanya dapat menerima input gambar dan tidak mendukung video
    • kimi-for-coding
      • Menyediakan kecepatan normal dan konteks 256k, serta dapat digunakan oleh semua anggota
      • Berjalan dengan Thinking:ON dan mendukung gambar serta video
    • kimi-for-coding-highspeed
      • Menghasilkan output sekitar 6 kali lebih cepat pada konteks 256k tetapi menggunakan kuota 3 kali lebih banyak
      • Tersedia mulai Allegretto, serta mendukung Thinking:ON dan input gambar/video

Kegunaan K3-256k dan perpindahan model

  • k3-256k memberikan hasil yang sama seperti k3 dalam rentang konteks 256k, sambil hanya memakai sekitar setengah kuota dibanding versi 1M
  • Cocok untuk tanya jawab harian, pelengkapan kode, pengembangan fitur umum, serta penyuntingan satu file atau file skala kecil, tetapi tidak mendukung input video
  • Beralih dari K3 ke K3-256k

    • Jika konteks sesi saat ini melebihi 256k, beberapa alat seperti Kimi Code CLI dan Claude Code akan menjalankan compact secara otomatis
    • Karena tiap alat agen menangani ini dengan cara berbeda, disarankan menjalankan compact secara manual sekali sebelum beralih agar konteks dikompresi ke dalam 256k
    • Dengan begitu, sesi dapat dipertahankan sambil menjaga inti pekerjaan tetap utuh
    • Setelah beralih, kuota dapat dipakai lebih lama
    • Jika riwayat percakapan berisi file video, Anda tidak bisa langsung beralih ke k3-256k, jadi harus menjalankan compact terlebih dahulu
  • Beralih dari K3-256k ke K3

    • Jika k3-256k mendekati batas 256k dan Anda ingin menghindari kehilangan informasi akibat compact, Anda bisa langsung beralih ke k3 1M
    • Pada versi saat ini, beralih dari 256k ke 1M tidak memengaruhi cache

Cache dan pengelolaan penggunaan

  • Saat model diubah, cache konteks yang dibangun pada model sebelumnya tidak akan terkena hit sehingga konteks tersebut harus diprefill ulang
  • Karena itu, penggunaan bisa tampak meningkat segera setelah beralih. Saat memakai model baru, memulai sesi baru lebih menguntungkan untuk hasil yang lebih baik dan konsumsi yang lebih rendah
  • Biaya perpindahan tingkat penalaran

    • Mengubah reasoning_effort juga membatalkan cache konteks yang ada sehingga perlu diprefill ulang
    • Disarankan memilih tingkat penalaran yang sesuai dengan pekerjaan lalu menjaganya tetap konsisten dalam satu sesi
    • Jika benar-benar membutuhkan tingkat penalaran lain, lebih baik memulai sesi baru daripada berulang kali berpindah dalam sesi panjang

Izin paket dan error 401

  • Bahkan jika model ID yang digunakan benar, server akan mengembalikan 401 bila fitur yang diminta melampaui izin paket
    • Tidak ada akses K3: pada paket di bawah Moderato, k3 dan k3-256k tidak dapat dipanggil
    • Tidak ada akses 1M: pada Moderato, k3 hanya mendukung hingga 256k, sedangkan hingga 1M hanya tersedia mulai Allegretto
    • Batas konteks k3-256k tetap 256k terlepas dari paket
    • Tidak ada akses HighSpeed: kimi-for-coding-highspeed memerlukan Allegretto atau lebih tinggi
  • Pesan error lengkap dan cara menanganinya dapat dilihat di Error Reference

Alasan HighSpeed tidak terasa lebih cepat

  • Model ID HighSpeed harus tepat kimi-for-coding-highspeed
    • Jika salah memasukkannya, tanpa error akan diganti ke kimi-for-coding standar sehingga peningkatan kecepatan tidak terlihat
  • HighSpeed hanya mempercepat output model
    • Pembacaan/penulisan file, pemanggilan perintah, dan eksekusi skrip tidak menjadi lebih cepat
    • Jika dalam satu pekerjaan porsi eksekusi alat atau skrip tinggi, peningkatan kecepatan keseluruhan bisa terasa kecil

Beralih model di klien

  • Mengubah model ID akan membatalkan cache konteks. Untuk menghindari konsumsi token tambahan dan mendapatkan pengalaman penggunaan yang optimal, disarankan memulai sesi baru
  • Saat melakukan pemanggilan, yang harus dimasukkan bukan nama versi model, melainkan salah satu model ID berikut
    • k3
    • k3-256k
    • kimi-for-coding
    • kimi-for-coding-highspeed
  • Jika memasukkan nama versi seperti Kimi K3 atau K2.7 Code, pemanggilan akan gagal
  • Jika Thinking dimatikan pada K3 atau K2.7, permintaan akan dirutekan ke K2.6, jadi untuk memakai K3 atau K2.7 Code, Thinking harus diaktifkan
  • Klien resmi

    • Di Kimi Code CLI, Anda dapat memasukkan /model untuk mengganti model tanpa mengubah pengaturan
    • Jika model terbaru tidak ada dalam daftar, Anda harus login ulang dengan /logout lalu /login
    • Di Kimi Code for VS Code, model dipilih dari menu dropdown pada kotak input
    • Jika model tidak ditampilkan, Anda harus me-restart VS Code atau memasang ulang ekstensi

Pengaturan alat pihak ketiga

  • Buat API Key di Kimi Code Console, lalu masukkan Base URL dan model ID ke alat
  • Kimi Code API mendukung protokol kompatibel OpenAI dan protokol kompatibel Anthropic
  • Cara konfigurasi tiap alat dapat dilihat di dokumen berikut
    • Claude Code: asisten coding command-line dari Anthropic
    • OpenCode: agen coding berbasis terminal
    • Codex: agen coding dari OpenAI
  • Pengaturan konteks K3

    • Konteks default di beberapa alat pihak ketiga lebih kecil daripada maksimum K3 yaitu 1M
    • Untuk menggunakan konteks hingga 1M, Anda harus mengatur field context-window secara manual menjadi 1048576
  • Pemetaan tingkat penalaran K3

    • K3 mendukung low, high, max, dan nilai yang dikirim alat dipetakan sebagai berikut
    • null atau undefined: default high
    • Nilai lain yang tidak dikenal: error HTTP 400
    • ultra, max, xhigh: max
    • high, medium: tingkat yang direkomendasikan, high
    • low, minimum, light: low
    • none: thinking.type dinonaktifkan

1 komentar

 
GN⁺ 2 jam lalu
Komentar Hacker News
  • Codex memanfaatkan konteks 256k dengan sangat baik. 1M memang lapang, tetapi masih mahal dan tampaknya tidak diperlukan sebagai default

  • LLM dengan cepat menjadi komoditas serbaguna, dan moat lab riset AI AS seperti OpenAI makin melemah. Pada akhirnya, hyperscaler dan pemilik pusat data yang bisa menjual token murah kemungkinan besar akan menang

    • Saya belum banyak mencoba produk lain, tetapi harness Codex begitu menarik sampai sulit beralih. Penasaran apakah ada pihak lain yang menyediakan harness dengan kualitas seperti ini
    • Saya sangat berterima kasih kepada perusahaan AI frontier yang telah menggelontorkan modal besar dan R&D kompleks untuk tiap model. Mudah sekali melupakan betapa mahalnya biaya untuk sampai ke titik ini
  • k3-256k telah dirilis dan memberikan hasil yang sama dalam konteks 256k. k3 (1M) menghabiskan kuota kira-kira dua kali lebih banyak dibanding k3-256k

  • Ini perubahan yang bagus. Biasanya saya berusaha menjaga konteks di bawah 200k

    • Di thread Reddit tentang berita ini, kalimat yang sama juga menjadi komentar teratas
      https://www.reddit.com/r/kimi/s/BFa1TR9vNg
    • Tergantung cakupan pekerjaan, tetapi menurut saya titik yang pas adalah di bawah 500k. Di Claude, 500 ribu token sudah cukup untuk membangun proyek yang cukup besar sambil tetap mempertahankan seluruh konteks dari awal hingga saat ini
    • 256k seharusnya cukup untuk siapa pun
  • Kalau begitu, saya penasaran apakah semua pengguna tiba-tiba bisa memakai Kimi dengan harga setengahnya sampai konteks mencapai 256k. Kalau benar, ini perubahan besar

    • Karena ini model terpisah, saya kira jika memakai k3-256k lalu beralih ke model 1M pada 256k, cache akan menjadi tidak valid, sehingga 256k token yang sudah ada harus dibayar ulang dengan harga model 1M
      Namun ternyata itu salah; saat mendekati batas konteks, kita bisa beralih ke model 1M tanpa membuat cache tidak valid. Pada versi saat ini, mengganti dari k3-256k ke k3 (1M) tidak memengaruhi cache
    • Saya memahaminya tidak demikian. Tampaknya maksudnya, jika jendela konteks lebih kecil, token input yang terakumulasi seiring waktu lebih sedikit sehingga umumnya lebih murah
  • Sudah 38 menit sejak tulisan ini diposting, dan sejak 20 menit lalu beberapa layanan Anthropic ditandai mengalami gangguan besar. Mungkin tidak terkait, tapi agak lucu

  • Sepertinya modelnya sendiri sama dan ini hanya perubahan di level API

  • Secara fungsional mirip dengan cara OpenAI mengubah tingkat harga setelah melewati panjang konteks tertentu. Ambangnya juga sekitar 272k, yaitu 2^18 atau sekitar 256k
    Semakin besar konteks aktif, semakin banyak komputasi dan byte yang harus dibaca untuk tiap token output, jadi masuk akal jika biayanya diteruskan ke pengguna. Namun agak mengejutkan mereka tidak memakai kurva harga yang halus, melainkan ambang bertingkat

    • Kemungkinan besar mereka menjalankan dua konfigurasi infrastruktur berdasarkan panjang sequence maksimum, jadi ambang bertingkat tidak mengherankan
      Konfigurasi konteks pendek membutuhkan lebih sedikit node khusus prefill per instance, dan karena tidak perlu mendukung KV cache besar, jumlah node keseluruhan juga bisa dikurangi. Jika memakai inferensi terpisah, rasio komputasi yang dialokasikan untuk prefill dan decoding juga bisa disesuaikan masing-masing
  • Semoga perubahan ini mengurangi beban infrastruktur. Belakangan semua model terasa jauh lebih lamban, sementara tim dukungan tidak merespons. Saya curiga sebagian besar permintaan diproses dengan model terkuantisasi

    • Teori konspirasi tanpa dasar mungkin cocok di Reddit, tapi tidak di HN
  • Saya penasaran apakah ini bukan model yang dikuantisasi, melainkan hanya jendela konteks yang diperkecil menjadi 256k

    • Jendela konteks 256k dan apakah model dikuantisasi atau tidak adalah hal terpisah. Karena sulit memastikannya langsung dari luar, kemungkinan modelnya memang dikuantisasi juga tidak bisa dikesampingkan