- Kimi Linear adalah arsitektur hibrida yang menempatkan KDA dan MLA dengan rasio 3:1; dalam kondisi pelatihan yang sama, ia mencatat performa lebih tinggi daripada MLA penuh di seluruh evaluasi konteks jangka pendek, konteks jangka panjang, dan reinforcement learning
- Modul intinya, Kimi Delta Attention(KDA), memecah gate pelupaan per-head milik Gated DeltaNet menjadi per-channel, sehingga setiap dimensi fitur dalam memori RNN terbatas memiliki tingkat pelupaan independen
- Dengan matriks transisi khusus Diagonal-Plus-Low-Rank(DPLR) dan algoritme paralel per-chunk, KDA mengurangi jumlah komputasi dibanding DPLR umum, dan efisiensi operator meningkat sekitar 100%
- Model dengan 3B parameter aktif dan 48B parameter total dilatih dengan 1,4T token, mencapai skor 51,0 di MMLU-Pro 4K, skor 84,3 dan akselerasi 3,98× di RULER 128K; pada 1M token, waktu per token keluaran menjadi 6,3× lebih cepat daripada MLA
- Saat generasi teks panjang, KV cache dapat dikurangi hingga 75% dan dapat diterapkan tanpa mengubah antarmuka cache maupun scheduling pada pipeline full-attention yang sudah ada; kernel KDA, implementasi vLLM, dan checkpoint model juga telah dirilis
Bottleneck yang Dibuat Full Attention dalam Penalaran Jangka Panjang
- LLM berbasis agen dan penskalaan test-time berbasis reinforcement learning harus memproses lintasan panjang, interaksi penggunaan tool, dan ruang pengambilan keputusan yang kompleks saat inferensi
- Attention softmax standar memiliki kompleksitas waktu yang meningkat secara kuadratik dan KV cache membesar sebanding dengan panjang konteks, sehingga membatasi throughput, perluasan konteks, dan interaksi real-time
- Linear attention dapat menurunkan kompleksitas komputasi, tetapi ekspresivitasnya terbatas sehingga performanya lebih rendah daripada softmax attention bahkan pada language modeling untuk sekuens pendek
- Mekanisme gating dan decay terbaru serta delta rule memperkecil selisih kualitas pada sekuens panjang menengah, tetapi struktur linear murni memiliki keterbatasan dalam pemodelan sekuens jangka panjang dan pencarian dalam konteks karena kapasitas finite-state
- Arsitektur hibrida yang menggabungkan sebagian layer global attention dengan banyak layer linear muncul sebagai kompromi antara kualitas dan efisiensi, tetapi model yang ada sebelumnya memiliki skala terbatas atau kurang dievaluasi pada benchmark yang beragam
Dari Linear Attention hingga Gated DeltaNet
- Linear attention dasar terus mengakumulasi asosiasi key-value ke dalam state rekuren berbentuk matriks, lalu menggunakannya sebagai fast weight, yaitu memori asosiatif sementara
- Karena tidak ada kriteria untuk menentukan memori mana yang harus dihapus, state terakumulasi tanpa batas dan menimbulkan interferensi pada konteks panjang
- DeltaNet melakukan online gradient descent terhadap reconstruction loss agar state dapat memulihkan key menjadi value
- Ia menggunakan delta rule klasik yang terus mengoreksi state yang sudah ada
- Pembaruan rank-1 setara dengan transformasi Householder tergeneralisasi dan dapat diparalelkan per chunk
- Gated DeltaNet(GDN) menambahkan gate pelupaan skalar
αtuntuk meredam asosiasi lama- Gate bekerja seperti weight decay terhadap fast weight, dan mengimplementasikan mekanisme pelupaan yang mirip dengan regularisasi L2 berbasis data
- Ia mengontrol masa hidup memori dan mengurangi interferensi sambil mempertahankan struktur paralelisasi DeltaNet
- GDN dapat ditafsirkan sebagai positional encoding multiplikatif yang melonggarkan batasan ortogonalitas RoPE, karena matriks transisinya bergantung pada data dan dapat dipelajari
Kontrol Memori Halus pada Kimi Delta Attention
- KDA mengganti decay skalar tunggal pada GDN dengan gate per-channel yang didiagonalkan, sehingga decay memori dan informasi posisi pada setiap dimensi fitur dapat dikontrol secara independen
- Tingkat pelupaan per-channel mengatur memori RNN finite-state yang terbatas dengan lebih presisi, dan menyediakan granularitas yang mirip dengan Gated Linear Attention(GLA)
- Dinamika transisi diparameterisasi dengan matriks DPLR khusus dan tetap konsisten dengan delta rule klasik
- Serangkaian transformasi matriks rank-1 dikompresi menjadi representasi padat, mendukung pemrosesan paralel per-chunk yang stabil bahkan di bawah gating diagonal
Algoritme Paralel Per-Chunk
- Sekuens dibagi menjadi chunk dengan panjang tetap, dan state terakhir dari chunk sebelumnya digunakan sebagai state awal untuk tiap chunk
- Dengan representasi WY, beberapa pembaruan rank-1 digabungkan menjadi satu representasi terkompresi; mengikuti ekspansi Comba, komputasi berikutnya tidak lagi membutuhkan inversi matriks tambahan
- Transformasi UT mengurangi FLOP untuk operasi selain perkalian matriks, sehingga meningkatkan utilisasi hardware selama pelatihan
- Invers matriks segitiga bawah dihitung per baris menggunakan forward substitution dari eliminasi Gaussian
- Pembaruan state dilakukan dalam bentuk matriks per-chunk, sementara tahap output menggabungkan pemrosesan rekuren antar-chunk dan pemrosesan paralel di dalam chunk
- Komputasi intra-chunk disusun berpusat pada perkalian matriks agar dapat memanfaatkan throughput Tensor Core
Komputasi yang Lebih Rendah daripada DPLR Umum
- KDA dan DPLR tergeneralisasi sama-sama mendukung decay halus, sehingga sepadan dari sisi kapasitas ekspresif
- Decay halus dapat menimbulkan masalah presisi numerik pada pembagian intra-chunk
- GLA menggunakan komputasi domain log dan chunking sekunder dengan presisi penuh, tetapi pemanfaatan perkalian matriks half-precision terbatas sehingga kecepatan operatornya rendah
- KDA mengikat kedua variabel transisi DPLR ke key
k- Mengurangi komputasi matriks chunk sekunder dari 4 menjadi 2
- Menghilangkan 3 perkalian matriks tambahan
- Dalam pengukuran kernel menurut panjang input, efisiensi operator KDA meningkat sekitar 100% dibanding DPLR umum
Konfigurasi Model Kimi Linear
- Backbone model mengikuti Moonlight, dengan layer MoE channel mixing ditempatkan setelah layer token mixing
- Query, key, dan value pada setiap head KDA dihitung melalui ShortConv dan Swish
- Normalisasi L2 ditambahkan pada query dan key untuk stabilitas nilai eigen
- Dimensi head untuk key dan value ditetapkan 128 pada semua eksperimen
- Gate decay per-channel diparameterisasi dengan proyeksi low-rank yang rank-nya sama dengan dimensi head, dan menggunakan fungsi decay yang mirip dengan GDN dan Mamba
- Sebelum proyeksi output, diterapkan RMSNorm per-head dan gate output berbasis data
- Gate output juga dibuat low-rank untuk mendukung perbandingan parameter yang adil sambil mempertahankan performa yang mirip dengan gate full-rank
- Gate ini meredakan Attention Sink
Hibrida KDA dan MLA 3:1
- Untuk menutupi keterbatasan linear attention murni dalam pencarian konteks jangka panjang, layer Full MLA berupa full global attention ditempatkan di antara layer KDA
- Alih-alih mencampur head di dalam satu layer, seluruh layer disusun bergantian
- Konfigurasi per-layer membuat infrastruktur lebih sederhana dan stabilitas pelatihan lebih tinggi
- Dalam eksperimen, rasio 3:1 yang mengulang 3 KDA lalu 1 MLA memberikan keseimbangan terbaik antara kualitas dan throughput
- Pada generasi teks panjang, hanya layer full attention yang mempertahankan KV cache, sehingga penggunaan memori dan KV cache dapat dikurangi hingga 75% sambil mempertahankan aliran informasi global
Penerapan NoPE dan Hasil Evaluasi
- Semua layer MLA menerapkan NoPE, yaitu tanpa positional encoding, sementara informasi posisi dan bias kebaruan ditangani oleh KDA
- KDA menjalankan peran yang serupa atau lebih kuat daripada komponen sadar posisi tambahan seperti konvolusi pendek atau sliding-window attention
- Dengan NoPE, MLA dapat dikonversi menjadi Multi-Query Attention(MQA) murni yang efisien saat inferensi
- Pelatihan konteks panjang menjadi lebih sederhana karena tidak membutuhkan penyesuaian berbasis frekuensi RoPE atau teknik seperti YaRN
- Dalam perbandingan dengan pelatihan 1,4T token menggunakan metode yang sama, Kimi Linear mencatat hasil berikut
- 51,0 poin di MMLU-Pro 4K, mengungguli MLA 47,2 dan GDN-H 47,9
- Skor 84,3 dan akselerasi 3,98× di RULER 128K, melampaui MLA 81,3 dan GDN-H 80,5
- Pada 1M token, time per output token(TPOT) adalah 1,84 ms, 6,3× lebih cepat daripada MLA yang 11,48 ms
- TPOT tetap rendah bahkan pada sekuens panjang, sehingga batch yang lebih besar dapat digunakan
- Model pra-pelatihan memiliki 3B parameter aktif dan 48B parameter total, serta secara konsisten mengungguli MLA penuh pada konteks jangka pendek, konteks jangka panjang, dan tugas post-training bergaya reinforcement learning
- Kernel KDA, integrasi vLLM, dan checkpoint Kimi-Linear-48B-A3B-Instruct telah dirilis
- Dapat menggantikan pipeline full-attention yang ada tanpa memodifikasi antarmuka cache atau scheduling
1 komentar
Pendapat di Hacker News
Jika melihat makalah Kimi K3 yang baru-baru ini dirilis, arsitekturnya memperluas Kimi Linear yang dibahas di sini ke skala besar, serta menambahkan visi native dan peningkatan reinforcement learning
https://arxiv.org/abs/2607.24653
Saya penasaran apakah kecerdasan yang terlihat pada model mutakhir benar-benar merupakan fenomena emergen yang hanya muncul saat arsitektur diperbesar
Rasanya berlawanan dengan intuisi bahwa model 1 juta parameter dengan struktur yang sama tidak bisa menyelesaikan teka-teki dasar, sementara model 1 triliun parameter bahkan bisa membuat kontra-contoh untuk konjektur Jacobian. Memberi lebih banyak komputasi pada algoritma pengurutan sederhana tidak akan membuatnya mengalahkan quicksort, tetapi riset LLM modern terasa seperti perlombaan yang terus membesarkan algoritma dan struktur yang sama sambil berharap jawaban akan muncul
Tulisan aslinya yang singkat juga layak dibaca: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
Model besar lebih mudah membangun pijakan di ruang representasi internal itu, dan setelah optimisasi berjalan, sebagian besar bobot mungkin tidak melakukan sesuatu yang berarti. Daya ekspresif yang dibutuhkan untuk mempelajari ruang ini masih belum jelas, tetapi sejauh ini tampaknya diperlukan miliaran parameter
Pertanyaan yang lebih menarik adalah seberapa invarian model harus terhadap data. Menurut saya, alasan penalaran matematis dan pemrograman sangat meningkatkan performa secara keseluruhan adalah karena keduanya merupakan keterampilan yang dapat diulang di banyak kelompok tugas. Melatih secara intensif logika pemrograman yang tidak bergantung pada bahasa atau tugas mungkin merupakan jalan menuju model yang lebih kecil
Sebagai analogi, model kecil, karena keterbatasan kapasitas dan sinyal pelatihan, secara internal tertahan di level bubble sort, sedangkan model besar dapat menelusuri lebih dalam dan menemukan cara yang lebih mendekati quicksort
Kecerdasan bukan sesuatu yang biner; baik model 1 miliar parameter maupun 10 triliun parameter sama-sama memiliki tingkat kecerdasan tertentu. Yang pertama terlalu mudah diabaikan karena terlalu bergantung pada regularitas statistik, sedangkan yang kedua hanya sudah berkembang cukup jauh untuk menemukan kontra-contoh baru bagi konjektur yang belum terpecahkan. Perbedaan di antara keduanya pun lebih mirip penumpukan peningkatan kecil yang menjadi longsoran salju, bukan lompatan mendadak
Capaian spesifik seperti kemampuan matematika bisa tampak melonjak drastis, tetapi di bawahnya ada akumulasi bertahap kemampuan umum untuk mengurangi kesalahan dan pulih dari kesalahan. Ketika kemampuan seperti ini sudah cukup baik, model mulai bisa memecahkan jenis masalah logika yang sama sekali baru
Lab Marcus Hutter mengekspresikan ini melalui induksi Solomonoff dan menunjukkan bahwa bias ini efektif secara universal. Bias yang efektif dapat memanfaatkan kutukan dimensionalitas secara terbalik, sehingga performa pada model besar bisa terus meningkat, mirip seperti mendapatkan jawaban yang lebih baik ketika data semakin banyak
Namun kelas model yang menunjukkan sifat seperti ini sangat sempit, dan kita kurang lebih beruntung bisa mencapai titik tersebut. Itulah sebabnya prinsip statistik umum masih mengajarkan agar kita pada umumnya tidak mengharapkan perilaku seperti ini
Peningkatan dari 1 juta ke 1 triliun parameter adalah penskalaan 1 juta kali. Ini mirip dengan mengecilkan otak manusia hingga 1% di setiap arah, yakni ke skala beberapa mm
Saya mulai membuat model internal dengan Kimi Linear, tetapi Gated Deltanet 2 yang muncul setelahnya terlihat seperti versi yang lebih maju dari sisi daya ekspresif, dan dalam pengujian kami sendiri memang lebih baik
https://arxiv.org/abs/2605.22791
Sangat bagus bahwa mereka merilis kernel KDA dan implementasi vLLM sebagai open source untuk riset, serta membagikan checkpoint model pre-training dan instruction tuning
Jika ingin percaya bahwa kesuksesan Kimi hanya karena serangan distilasi, abaikan saja riset ini
Saya penasaran bagaimana performanya dibandingkan model full-attention berukuran sama dalam pencarian konteks panjang, terutama needle-in-a-haystack atau RULER. Peningkatan efisiensi memang bagus, tetapi model campuran linear attention biasanya runtuh di bagian ini
Saya penasaran apakah Transformer nonstandar seperti ini akan menyulitkan perusahaan seperti Etched jika mulai digunakan secara luas
Makalah ini adalah materi tahun 2025 dan sudah 9 bulan berlalu, sementara beberapa model utama baru telah dirilis dalam periode itu
Kontribusi utama makalah K3 adalah Stable LatentMoE. Karena, seperti beberapa model lain, ia mengompresi data yang diteruskan antar-layer, router memerlukan kondisi tertentu, dan K3 meningkatkan performa dengan strategi pemilihan expert yang lebih seimbang