- Permintaan Kimi K3 meningkat jauh lebih besar dari perkiraan, sehingga dalam 48 jam terakhir penggunaan GPU mendekati batas kapasitas saat ini
- Untuk melindungi pengalaman penggunaan pelanggan yang sudah ada, langganan baru ditangguhkan sementara dan sumber daya komputasi diprioritaskan untuk anggota saat ini
- Pelanggan berbayar yang sudah ada tidak terdampak, dan Moonshot AI sedang mempercepat peningkatan kapasitas infrastruktur
- Begitu kapasitas tambahan tersedia, langganan baru akan dibuka kembali secara bertahap per batch
- Selain itu, sesuai tujuan penggunaan, keanggotaan akan dibagi menjadi dua paket khusus
- Kimi Membership: untuk Kimi Web, App, Work
- Kimi Code Membership: untuk alur kerja coding
- Langkah ini bertujuan mengalokasikan sumber daya komputasi secara lebih tepat sesuai permintaan tiap layanan dan menjaga pengalaman penggunaan yang stabil
1 komentar
Komentar Hacker News
Kalimat yang mengatakan bahwa selama 48 jam terakhir permintaan mendekati batas kapasitas saat ini, sehingga demi menjaga pengalaman pengguna pelanggan lama mereka menghentikan sementara langganan baru dan memprioritaskan sumber daya komputasi untuk anggota yang sudah ada, benar-benar enak dilihat
Ini perusahaan yang memprioritaskan kepuasan pelanggan yang sudah ada daripada pertumbuhan cepat
Kemarin saya menghabiskan jatah Claude lalu membayar paket 20 dolar untuk mencoba Kimi. Di Kimi Code saya memilih K3 dan memintanya mencari semua pengaturan input terkait perangkat keras, I/O, kontrol thread, dan jaringan di dalam repositori lalu membuat laporan; setelah berpikir selama 12 menit, ia menjawab bahwa jatah hariannya sudah habis
Keesokan harinya Fable menyelesaikan tugas yang sama dalam 3 menit, jadi kalau mau pakai K3 sebaiknya jangan beli paket 20 dolar
Di antarmuka web pun pemakaian mingguan saya terpakai 23%, sedangkan di Cursor 20 dolar per bulan saya tidak pernah mendapat peringatan meski mengerjakan jauh lebih banyak. Awalnya saya kira masalahnya di OpenCode, tetapi kalau di Kimi Code juga sama, sepertinya bukan itu
Yang paling menarik dari Kimi adalah jumlah lapisan RNN/linear attention 3 kali lebih banyak daripada lapisan full attention. Saya belum mencobanya, tetapi ini tampak seperti struktur yang sangat masuk akal untuk pekerjaan konteks panjang
Alasan parameternya banyak tampaknya sama seperti alasan xLSTM yang dioptimalkan secara komputasi punya banyak parameter, dan melihat keberhasilan model ini membuat saya menyayangkan bahwa Eropa tidak berhasil mengembangkan model keluarga xLSTM berskala besar. Karena ini tim pragmatis yang memilih hal-hal yang bekerja baik dalam evaluasi internal, mereka juga mempertahankan lapisan attention biasa, jadi tidak bisa dijamin implementasinya ideal, tetapi Kimi menunjukkan apa yang mungkin terjadi jika superkomputer untuk melatih LLM skala besar diberikan kepada peneliti yang tepat. Pada akhirnya, sebagian besar ini tetap ranah Hochreiter, yaitu RNN
Saya sudah memakai Kimi untuk pekerjaan coding sekitar 6 bulan dan puas, jadi tidak merasa perlu beralih ke model lain. Paling hanya sesekali mencoba tugas yang sama di Claude untuk memastikan saya tidak ketinggalan sesuatu
Saya memakai OpenRouter, dan karena cakupan penggunaan LLM saya sempit, perbedaan biaya di sisi mana pun nyaris bisa diabaikan
Menyegarkan melihat mereka menghentikan langganan baru alih-alih diam-diam menurunkan batas sambil berharap pengguna tidak sadar bahwa nilai langganannya berkurang, seperti yang dilakukan Google
Gemini Apps memang menyatakan bahwa batas bisa diubah tanpa pemberitahuan demi menjaga kualitas saat ada kendala kapasitas atau lonjakan aktivitas: https://support.google.com/gemini/answer/16275805
Dalam evaluasi coding game multi-agent, model-model Tiongkok biasanya lemah dalam penalaran sekali jalan, tetapi menutupinya lewat penggunaan alat dan perbaikan berulang. Kimi K3 juga berada di peringkat 19 untuk coding sekali jalan, tetapi dalam agentic coding dengan lingkungan eksekusi, alat, dan pemanggilan berulang, ia berada di peringkat 3, dengan hanya Sol dan Fable yang unggul berdasarkan rata-rata submit
Bagi software engineer, agentic coding paling relevan, tetapi kecepatan juga penting, dan saat ini itu menjadi masalah kegunaan nyata pada Kimi. Penyedia inferensi eksternal seperti Fireworks pernah mengurangi kesenjangan ini pada model sebelumnya. Tren model frontier dengan bobot terbuka yang menjadi standar menarik untuk dilihat, dan akan makin sulit bersaing hanya dengan memiliki model frontier itu sendiri
Data: https://gertlabs.com/rankings?mode=agentic_coding
Kualitas model ini di atas ekspektasi, dan khususnya bagus dalam code review dan review PR. Namun, karena permintaan berlebihan dan ukuran model yang besar, sekarang terlalu lambat sehingga bahkan code review yang relatif sederhana pun memakan waktu sangat lama
Saya penasaran apakah demam Kimi kali ini merupakan kenaikan bersih akibat paradoks Jevons, di mana pasokan melimpah memicu konsumsi lebih besar, atau sekadar perpindahan ke model yang lebih murah
Saya juga penasaran apakah ada data yang bagus untuk melihat total konsumsi token di berbagai lab dan OpenRouter
Saya penasaran apakah Anthropic dan OpenAI akan tetap kompetitif hanya karena untuk sementara mereka satu-satunya pihak yang bisa menangani permintaan sebesar ini. Dalam kondisi biaya yang sudah tinggi, pelanggan perusahaan tidak akan senang jika gangguan membuang waktu kerja karyawan
Tampaknya mereka menghentikan langganan karena menilai tidak bisa menjamin kualitas layanan minimum kepada pelanggan