2 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Model produksi yang memperluas Kimi Linear yang dirilis tahun lalu dari 48B menjadi 2.8T, dan saat ini merupakan yang terbesar di antara model berbobot terbuka
  • LatentMoE yang baru diperkenalkan mengompresi lapisan linear besar dengan down-projection, sementara keseluruhan strukturnya mengganti MoE umum dan attention dengan komponen yang berfokus pada efisiensi inferensi
  • Attention residuals menghubungkan residual antarlapisan dengan bobot berbasis skor attention, sehingga secara konsisten memberikan sedikit peningkatan pada validation loss dan performa downstream
  • Dengan attention residuals, biaya pelatihan naik sekitar 4% dan biaya inferensi sekitar 2%; semua lapisan RoPE dihapus dan NoPE diterapkan di seluruh model
  • Menambahkan dukungan multimodal native, sekaligus mengejar penskalaan besar Kimi Linear, efisiensi inferensi, dan perbaikan jalur residual

Penskalaan dari Kimi Linear ke 2.8T

  • Kimi K3 adalah versi produksi dari Kimi Linear yang diskalakan dari 48B menjadi 2.8T, dan saat ini merupakan model terbesar di antara model berbobot terbuka
  • LatentMoE yang baru ditambahkan dibandingkan Kimi Linear pada dasarnya sama dengan pendekatan Nemotron 3 Ultra
  • Berfokus pada peningkatan efisiensi inferensi, sebagaimana tren yang terlihat pada Nemotron 3 dan DeepSeek V4
    • MoE umum diganti dengan LatentMoE
    • Alih-alih attention umum, digunakan multi-head latent attention dan Kimi Delta Attention

Jalur residual dan informasi posisi

  • Attention residuals adalah komponen untuk memperbaiki jalur residual, bukan untuk optimisasi efisiensi, dan sudah diterapkan pada Kimi Linear
    • Berbeda dari mHC (manifold-constrained Hyper-Connections) milik DeepSeek V4 yang memperlebar jalur residual, attention residuals menghubungkan residual di antara lapisan
    • Skor attention yang menunjukkan pentingnya atau kontribusi tiap residual digunakan sebagai bobot koneksi
    • Menurut laporan teknis, validation loss dan performa downstream meningkat sedikit namun konsisten, tetapi biaya pelatihan naik sekitar 4% dan biaya inferensi sekitar 2%
  • Semua lapisan RoPE dihapus dan NoPE, yaitu tanpa embedding posisi, diterapkan ke seluruh lapisan
    • Arsitektur lain belakangan ini cenderung menggunakan RoPE pada attention lokal seperti sliding window attention dan NoPE pada lapisan global
    • Ada juga arsitektur sebelumnya yang hanya menggunakan NoPE, tetapi sejauh yang telah dikonfirmasi, Kimi K3 adalah model kelas frontier pertama yang menerapkannya secara penuh

Dukungan multimodal native

  • Kimi K3 juga menambahkan dukungan multimodal native

1 komentar

 
GN⁺ 2 jam lalu
Komentar Hacker News
  • Berbeda dengan para pimpinan lab riset Barat yang menganggap Kimi sekadar hasil serangan distilasi, kenyataannya model ini memperkenalkan pendekatan yang baru dan orisinal

  • Sebastian Raschka adalah peneliti model bahasa skala besar dan penulis yang luar biasa, dan Substack miliknya sangat direkomendasikan

    • Sebelumnya saya tidak tahu, tetapi saya terkesan karena ia langsung menyorot inti persoalan namun tetap mudah dipahami
    • Di bidang yang dipenuhi ringkasan AI asal jadi, ini terasa seperti permata langka sehingga saya menambahkannya ke feed RSS saya
  • Disebutkan bahwa “menariknya, Kimi K3 menghapus semua lapisan RoPE dan sebagai gantinya menggunakan NoPE (No Positional Embeddings) di seluruh bagian”
    Fakta bahwa ini bisa bekerja sendiri sudah mengejutkan. Tanpa informasi posisi, apakah ini tidak akan menjadi sup token, dan apakah attention cukup presisi sehingga hanya dengan mempelajari cara token kedua mengakumulasi sesuatu di ruang embedding, model bisa tahu bahwa dirinya adalah token kedua?

    • Melalui masking kausal, model dapat mempelajari embedding posisi implisit. Anggapan umum bahwa blok Transformer invarian terhadap permutasi sebenarnya tidak benar
    • Pada Transformer kausal khusus decoder, embedding posisi tidak wajib, tetapi pada model non-kausal seperti encoder dalam makalah Transformer asli, itu jelas diperlukan
      Intuisi tentang akumulasi juga tepat. Jika sebagian head attention terus menulis nilai ke area yang sama di residual stream, maka seiring bertambahnya token input, nilai akan terakumulasi melalui penjumlahan attention dan dapat berfungsi sebagai semacam indeks bahkan tanpa encoding posisi terpisah
    • Lapisan linear menyediakan posisi relatif secara alami menggunakan peredaman seperti filter FIR. Dengan begitu, lapisan full attention bisa fokus menghubungkan konsep tanpa memandang jarak
    • Dalam model attention hibrida seperti ini, setidaknya lapisan state space model (SSM) kemungkinan sudah mengandung embedding posisi relatif melalui struktur rekursifnya
  • Menarik bahwa NoPE dipakai di semua tempat. Model lain biasanya tetap menyisakan RoPE di lapisan lokal, tetapi di sini tampaknya lapisan linear attention seperti Kimi Delta diam-diam menangani posisi sehingga itu bisa dihilangkan. Saya penasaran apakah ini akan tetap bertahan pada skala paling mutakhir

    • Terlepas dari namanya, Kimi Delta Attention (KDA) lebih dekat ke RNN yang bisa diparalelkan secara efisien saat training daripada attention dalam arti umum. Ini adalah struktur yang sedikit dimodifikasi dari Gated DeltaNet, yaitu RNN dengan hidden state yang bekerja seperti memori attention kecil yang bisa diedit
      Karena mirip RNN, model ini pada dasarnya mengenali urutan X, Y, Z dalam XYZ. Transformer dasar memproses himpunan tanpa urutan, jadi posisi antar item harus diberitahukan secara terpisah
      Ada 3 lapisan KDA untuk setiap lapisan attention, dan juga 3 lapisan sebelum lapisan attention pertama, sehingga semua token bisa mempelajari informasi posisinya sebelum mencapai lapisan attention nyata pertama
      RoPE sedikit merusak sebagian informasi, jadi menghilangkannya seperti ini menguntungkan bila memungkinkan. Gemma-4 juga punya struktur 5:1 yang mirip, dengan lima lapisan sliding window attention (SWA) untuk setiap satu lapisan global attention. SWA murah dan kurang kuat tetapi menangani informasi lokal serta mengisi sela di antara lapisan global yang kuat, dan dalam model ini KDA menjalankan peran yang sama
      Pada Gemma, RoPE hanya diperlukan pada SWA yang benar-benar attention, dan dihilangkan pada global attention. KDA bukan attention, jadi tidak memerlukan embedding posisi
      Saya tidak tahu seberapa jauh lagi skala yang harus dicapai untuk disebut paling mutakhir dari ini, tetapi tidak ada alasan mengapa ini tidak akan bekerja juga pada skala yang lebih besar. Semakin banyak parameter, justru semakin mudah bagi lapisan KDA untuk meneruskan informasi posisi
    • Dalam benchmark, Kimi K3 ada di kisaran yang mirip dengan Opus dan Fable, jadi saya ragu apa yang lebih besar dari ini masih perlu disebut skala paling mutakhir. Semuanya berada di kisaran 2–4 triliun parameter, dan saya menduga perbedaan utamanya ada pada kualitas training dan arsitektur
    • Ada efek samping yang agak aneh. Penyedia yang saya coba tidak menyimpan cache KV hanya sampai prompt input terbaru, melainkan mengimplementasikannya sebagai blok inkremental tetap 1.024 token. Akibatnya, pada setiap inferensi bisa ada tambahan hingga 1.023 token input cache miss