1 poin oleh GN⁺ 19 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Permintaan Kimi K3 meningkat jauh lebih besar dari perkiraan, sehingga dalam 48 jam terakhir penggunaan GPU mendekati batas kapasitas saat ini
  • Untuk melindungi pengalaman penggunaan pelanggan yang sudah ada, langganan baru ditangguhkan sementara dan sumber daya komputasi diprioritaskan untuk anggota saat ini
  • Pelanggan berbayar yang sudah ada tidak terdampak, dan Moonshot AI sedang mempercepat peningkatan kapasitas infrastruktur
  • Begitu kapasitas tambahan tersedia, langganan baru akan dibuka kembali secara bertahap per batch
  • Selain itu, sesuai tujuan penggunaan, keanggotaan akan dibagi menjadi dua paket khusus
    • Kimi Membership: untuk Kimi Web, App, Work
    • Kimi Code Membership: untuk alur kerja coding
  • Langkah ini bertujuan mengalokasikan sumber daya komputasi secara lebih tepat sesuai permintaan tiap layanan dan menjaga pengalaman penggunaan yang stabil

1 komentar

 
GN⁺ 19 jam lalu
Komentar Hacker News
  • Kalimat yang mengatakan bahwa selama 48 jam terakhir permintaan mendekati batas kapasitas saat ini, sehingga demi menjaga pengalaman pengguna pelanggan lama mereka menghentikan sementara langganan baru dan memprioritaskan sumber daya komputasi untuk anggota yang sudah ada, benar-benar enak dilihat
    Ini perusahaan yang memprioritaskan kepuasan pelanggan yang sudah ada daripada pertumbuhan cepat

    • Saat GitHub dulu melakukan hal yang sama, banyak orang marah, tetapi baik saat itu maupun sekarang itu adalah keputusan yang benar
    • Saya selalu tidak suka kalau di situs mana pun tombol “Login” dibuat lebih kecil daripada “Sign Up”
    • Kalau begitu, apakah Hetzner juga seharusnya menghentikan pendaftaran baru alih-alih menaikkan harga untuk menyeimbangkan permintaan dan penawaran?
    • Tidak perlu terlalu bersemangat. VC sedang membanjiri AI dengan uang dalam jumlah besar, jadi ini juga bisa saja pendanaan untuk alat penghabis token agar OpenAI atau Anthropic bisa menyuling dataset
  • Kemarin saya menghabiskan jatah Claude lalu membayar paket 20 dolar untuk mencoba Kimi. Di Kimi Code saya memilih K3 dan memintanya mencari semua pengaturan input terkait perangkat keras, I/O, kontrol thread, dan jaringan di dalam repositori lalu membuat laporan; setelah berpikir selama 12 menit, ia menjawab bahwa jatah hariannya sudah habis
    Keesokan harinya Fable menyelesaikan tugas yang sama dalam 3 menit, jadi kalau mau pakai K3 sebaiknya jangan beli paket 20 dolar

    • Codex tetap menalar sampai selesai lalu menjawab permintaan meski sudah mencapai batas
    • Mungkin lingkungannya berbeda karena saya hanya memakai model yang sepenuhnya self-hosted, tetapi saya penasaran apakah menunggu 12 menit tanpa umpan balik apa pun itu hal yang umum dalam alur kerja nyata. Saya biasanya terus mengamati jalur yang ditempuh model, lalu menghentikan atau mengarahkannya ulang kalau terlihat menuju jalan buntu
    • Saya mengalami hal yang persis sama. Saya membayar tahunan untuk paket 20 dolar per bulan Kimi.com dan mengirim permintaan sederhana ke Kimi K2.7 lewat API di OpenCode, tetapi itu menghabiskan seluruh jatah 5 jam, sedangkan Cursor menyelesaikan permintaan yang sama dalam beberapa menit
      Di antarmuka web pun pemakaian mingguan saya terpakai 23%, sedangkan di Cursor 20 dolar per bulan saya tidak pernah mendapat peringatan meski mengerjakan jauh lebih banyak. Awalnya saya kira masalahnya di OpenCode, tetapi kalau di Kimi Code juga sama, sepertinya bukan itu
    • Beberapa hari lalu di Claude juga ada satu tugas yang relatif sederhana yang gagal menghasilkan jawaban dan malah menghabiskan seluruh jatah 5 jam, jadi rasanya benar-benar buang waktu
    • Saya penasaran seberapa besar aplikasi targetnya. Hasilnya tentu berbeda jika itu aplikasi to-do Node.js yang memakai file teks seperti database, atau kode spaghetti COBOL sejuta baris yang dibuat pada 1971
  • Yang paling menarik dari Kimi adalah jumlah lapisan RNN/linear attention 3 kali lebih banyak daripada lapisan full attention. Saya belum mencobanya, tetapi ini tampak seperti struktur yang sangat masuk akal untuk pekerjaan konteks panjang
    Alasan parameternya banyak tampaknya sama seperti alasan xLSTM yang dioptimalkan secara komputasi punya banyak parameter, dan melihat keberhasilan model ini membuat saya menyayangkan bahwa Eropa tidak berhasil mengembangkan model keluarga xLSTM berskala besar. Karena ini tim pragmatis yang memilih hal-hal yang bekerja baik dalam evaluasi internal, mereka juga mempertahankan lapisan attention biasa, jadi tidak bisa dijamin implementasinya ideal, tetapi Kimi menunjukkan apa yang mungkin terjadi jika superkomputer untuk melatih LLM skala besar diberikan kepada peneliti yang tepat. Pada akhirnya, sebagian besar ini tetap ranah Hochreiter, yaitu RNN

    • Bukankah salah satu tujuan awal arsitektur Transformer adalah menghilangkan RNN yang tidak bisa diparalelkan? Saya bukan ahli, cuma pernah membaca beberapa paper beberapa tahun lalu
    • Sekitar satu setengah tahun lalu saya sudah mengatakan kepada Hochreiter bahwa ia tidak boleh berhenti di eksperimen berparameter miliaran dan harus menskalakan xLSTM ke ukuran LLM, tetapi tampaknya ia merasa sudah terlambat untuk mendapat investasi dan perhatian. Sayang sekali kalau ambisi Eropa hanya sebatas ini
    • Saya penasaran apakah ini RNN, model state-space seperti Qwen atau Mamba, atau lebih dekat ke RWKV; setelah dicek ternyata mirip Linear DeltaNet yang digunakan Qwen
  • Saya sudah memakai Kimi untuk pekerjaan coding sekitar 6 bulan dan puas, jadi tidak merasa perlu beralih ke model lain. Paling hanya sesekali mencoba tugas yang sama di Claude untuk memastikan saya tidak ketinggalan sesuatu
    Saya memakai OpenRouter, dan karena cakupan penggunaan LLM saya sempit, perbedaan biaya di sisi mana pun nyaris bisa diabaikan

    • Saya penasaran pakai paket yang mana. Dalam pengalaman saya, baik paket 20 dolar per bulan Kimi maupun paket 30 dolar per bulan Qwen sama-sama jauh dari cukup untuk dipakai sebagai alat utama, tetapi karena K3 saya jadi ingin mencoba paket 49 atau 99 dolar per bulan
  • Menyegarkan melihat mereka menghentikan langganan baru alih-alih diam-diam menurunkan batas sambil berharap pengguna tidak sadar bahwa nilai langganannya berkurang, seperti yang dilakukan Google
    Gemini Apps memang menyatakan bahwa batas bisa diubah tanpa pemberitahuan demi menjaga kualitas saat ada kendala kapasitas atau lonjakan aktivitas: https://support.google.com/gemini/answer/16275805

  • Dalam evaluasi coding game multi-agent, model-model Tiongkok biasanya lemah dalam penalaran sekali jalan, tetapi menutupinya lewat penggunaan alat dan perbaikan berulang. Kimi K3 juga berada di peringkat 19 untuk coding sekali jalan, tetapi dalam agentic coding dengan lingkungan eksekusi, alat, dan pemanggilan berulang, ia berada di peringkat 3, dengan hanya Sol dan Fable yang unggul berdasarkan rata-rata submit
    Bagi software engineer, agentic coding paling relevan, tetapi kecepatan juga penting, dan saat ini itu menjadi masalah kegunaan nyata pada Kimi. Penyedia inferensi eksternal seperti Fireworks pernah mengurangi kesenjangan ini pada model sebelumnya. Tren model frontier dengan bobot terbuka yang menjadi standar menarik untuk dilihat, dan akan makin sulit bersaing hanya dengan memiliki model frontier itu sendiri
    Data: https://gertlabs.com/rankings?mode=agentic_coding

  • Kualitas model ini di atas ekspektasi, dan khususnya bagus dalam code review dan review PR. Namun, karena permintaan berlebihan dan ukuran model yang besar, sekarang terlalu lambat sehingga bahkan code review yang relatif sederhana pun memakan waktu sangat lama

    • Karena Kimi K3 sekarang sudah muncul di daftar harga opencode-go, sepertinya itu berarti sudah bisa dipakai, meski saya belum sempat memastikan. Di Zen belum ada
    • Jalur OpenRouter mungkin layak dicoba: https://openrouter.ai/moonshotai/kimi-k3
  • Saya penasaran apakah demam Kimi kali ini merupakan kenaikan bersih akibat paradoks Jevons, di mana pasokan melimpah memicu konsumsi lebih besar, atau sekadar perpindahan ke model yang lebih murah
    Saya juga penasaran apakah ada data yang bagus untuk melihat total konsumsi token di berbagai lab dan OpenRouter

    • Kalau ini hanya perpindahan ke model murah, orang pasti akan pergi ke DeepSeek v4 Flash. Kimi terbaru justru lebih mahal daripada kebanyakan model Tiongkok lain, jadi ini tampaknya lebih seperti efek ikut tren: “model baru ini benar-benar bagus, ayo coba.” Pertanyaannya adalah seberapa kuat ia bertahan di bawah verifikasi ketat, dan lab AS mungkin cukup tegang melihatnya
  • Saya penasaran apakah Anthropic dan OpenAI akan tetap kompetitif hanya karena untuk sementara mereka satu-satunya pihak yang bisa menangani permintaan sebesar ini. Dalam kondisi biaya yang sudah tinggi, pelanggan perusahaan tidak akan senang jika gangguan membuang waktu kerja karyawan

    • Di tempat kerja pun polanya sama. Perangkat lunaknya sendiri murah, tetapi deployment nyata tetap terkonsentrasi pada beberapa vendor karena keahlian hosting dan tanggung jawab uptime. Meski begitu, juga banyak alat produktivitas vibe coding yang berjalan di laptop pribadi
    • Anthropic pun baru beberapa bulan lalu mengalami masalah permintaan, sampai membedakan penggunaan jam sibuk dan non-sibuk sehingga membuat pengguna kesal, dan outage juga sering terjadi. Setelah berkontrak dengan xAI, kondisinya umumnya stabil, dan Moonshot saat ini juga sedang mengupayakan kontrak sumber daya komputasi
    • Sebagian besar sumber daya komputasi OpenAI dan Anthropic sebenarnya dimiliki hyperscaler. Mereka mungkin bisa mengambil margin dari hak akses atas sumber daya yang diamankan lewat kontrak jangka panjang, tetapi itu tampaknya tidak akan bertahan lama karena hyperscaler sendiri bisa menawarkan harga lebih rendah
    • Karena Kimi adalah model berbobot terbuka, penyedia hosting selain Moonshot akan segera bermunculan, dan masalah kali ini tampaknya bukan hambatan besar bagi adopsi bobot terbuka
    • Saya memakai Synthetic dan setahu saya mereka berencana meng-host Kimi3. Model terbuka memungkinkan inferensi didistribusikan
  • Tampaknya mereka menghentikan langganan karena menilai tidak bisa menjamin kualitas layanan minimum kepada pelanggan

    • Tepatnya, mereka hanya menghentikan sementara langganan baru dan memprioritaskan sumber daya komputasi untuk anggota yang sudah ada