- Dalam pekerjaan coding sehari-hari, penggunaan Kimi K3 dan Claude secara berdampingan menunjukkan bahwa perbedaan nyata dalam kualitas output dan jumlah token yang dibutuhkan untuk jawaban sulit dibedakan
- API Kimi K3 jauh lebih murah, dengan input $3 dan output $15 per 1 juta token, dibandingkan model teratas Claude yang masing-masing $10 dan $50
- Kimi mulai dari $19 per bulan, dan tier coding $39 per bulan juga cukup longgar, sementara batas penggunaan Claude cepat habis selama pekerjaan agen dan akses Fable pun tidak bisa dipertahankan pada paket $20 per bulan
- Dalam benchmark keamanan siber Semgrep, ketika Claude yang dibatasi menolak sebagian tugas, GLM 5.2 menjalankannya dan unggul; model ini dirilis dengan lisensi MIT dan lebih murah daripada Opus terbaru
- Pembatasan yang hanya berlaku pada model AS hanya mengurangi pilihan pelanggan AS, tetapi tidak menghentikan persaingan dari model terbuka luar negeri; dengan Kimi K3 yang kualitasnya mirip dan harganya lebih rendah, alasan untuk terus membayar Claude makin berkurang
Perbandingan kualitas dan harga Kimi K3 dan Claude
- Saat Kimi K3 digunakan bersama Claude untuk pekerjaan coding umum, hasilnya menunjukkan tugas dan kualitas output yang sama, dengan penggunaan token yang hampir sama
- Ini berbeda dari dugaan bahwa model terbuka akan menghasilkan keluaran yang lebih berantakan atau memakai lebih banyak token untuk mendapatkan jawaban yang sama
- Harga API Kimi K3 adalah $3 per 1 juta token input dan $15 per 1 juta token output
- Model teratas Claude masing-masing $10 dan $50 untuk satuan yang sama
- Paket berbayar Kimi mulai dari $19 per bulan, dan tier coding $39 per bulan menawarkan kuota penggunaan yang lebih longgar dibandingkan produk Claude pada kisaran harga serupa
- Paket Claude memiliki batas penggunaan yang ketat, sehingga pada hari kerja agen biasa pun kuota bisa habis sebelum makan siang
- Claude tidak bisa mempertahankan akses Fable pada paket $20 per bulan sehingga akses itu dimatikan dan beralih ke Opus, tetapi tier Kimi tidak memiliki kondisi yang sama
Kebijakan AI AS dan persaingan model terbuka
- Pemerintah AS memperlambat peluncuran Fable, dan model final juga menerapkan pembatasan yang menolak berbagai kategori tugas; sementara itu, model terbuka kelas frontier dari laboratorium Tiongkok dapat diunduh sehingga berada di luar jangkauan regulasi pemerintah AS
- Dalam benchmark keamanan siber Semgrep, GLM 5.2 mengungguli Claude
- Model yang dibatasi menolak tugas, tetapi model terbuka menjalankannya, dan perbedaan ini memengaruhi hasil
- GLM 5.2 dirilis dengan lisensi MIT, dan meski tidak memosisikan dirinya sebagai model frontier, dalam pekerjaan nyata model ini memberikan hasil yang lebih baik daripada Opus terbaru dengan biaya yang jauh lebih rendah
- GPT-5.6 dari OpenAI juga melalui prosedur pembatasan pemerintah, tetapi OpenAI memiliki lebih banyak ruang dibandingkan Anthropic karena dapat menyediakan model utamanya dalam paket $20 per bulan
- Ke depannya, pemerintah AS dapat menerapkan pendekatan subsidi, bailout, dan tarif protektif yang pernah digunakan pada industri otomotif ke AI dan open source
- Melalui kerja sama publik-swasta, mereka dapat mendukung model domestik yang hanya digunakan di dalam AS dan tidak mampu bersaing secara internasional
- Akibatnya, pengguna AS mungkin harus membeli model domestik alih-alih mendapatkan kualitas terbaik atau harga terendah, dan bisa tidak dapat menggunakan model terbaik dengan harga terbaik
1 komentar
Opini Hacker News
Entah performa setara dicapai lewat distilasi atau dikembangkan secara independen dari awal, akhir bagi laboratorium frontier AS memang sudah ditentukan sejak awal. Distilasi bukan serangan, dan laboratorium frontier sendiri juga mendistilasi pengetahuan yang ditulis manusia ke dalam model, jadi wajar bila laboratorium yang datang belakangan memampatkannya menjadi model yang lebih murah
Karena secara realistis tidak ada cara untuk mencegah percakapan disimpan dan dipakai melatih model mereka sendiri, tampaknya lebih baik berinvestasi pada perusahaan hardware daripada perusahaan model
Baru 6 bulan lalu saja, banyak prediksi mengatakan bahwa memakai output model sebagai data pelatihan akan membuat semua model gagal karena bencana pembelajaran berulang, jadi jangan bicara seolah-olah hal itu sudah jelas sejak awal
Distilasi API hanya berguna untuk cepat melewati cold start dalam reinforcement learning di domain baru; yang sebenarnya lebih penting adalah kualitas dan keragaman lingkungan reinforcement learning tempat model belajar
AS belum memilih kontrol ala rare earth Tiongkok, tetapi jika distilasi meluas, pihak yang tidak melakukannya pun kemungkinan akan menanggung biaya regulasi seperti pemblokiran akses atau kontrol berlebihan. Seperti orang yang permisif terhadap penyalinan musik tetapi marah besar pada seni visual, apakah ini dianggap pencurian atau praktik bisnis biasa pada akhirnya bergantung pada konsensus sosial, dan tanpa terobosan besar jaraknya akan menyempit
Kita mencapai titik ini jauh lebih cepat daripada perkiraan. Saya penasaran seperti apa dunia jika pemerintah Barat menetapkan akses ke model frontier berbobot terbuka sebagai risiko keamanan nasional dan mengklasifikasikan penggunaannya sebagai tindakan terorisme
Kimi K3 bisa menjadi seperti Napster, yang semua orang pakai meski tahu itu ilegal, atau muncul pasar bawah tanah ala ganja tempat seseorang di lingkungan sekitar menyewakan secara metered rig 8×5090 di ruang bawah tanah yang dibuat dari komponen eBay. Sebaliknya, jika kontrol berhasil, pilihan terbuka yang tersisa hanyalah Cohere dan Mistral yang sudah dilemahkan, dan kita mungkin harus membayar mahal untuk model ‘American Frontier’ dari Anthropic dan OpenAI yang tertinggal dari Tiongkok
Seperti Kindle Fire yang disubsidi iklan, bisa saja muncul Kindle AI yang menjual pengaruh kepada penawar tertinggi, propaganda perusahaan rokok masuk ke pipeline pelatihan, lalu LLM mengatakan bahwa merokok itu sehat
Pemerintah AS baru-baru ini mengumumkan pembatasan mirip Wolf Amendment pada kerja sama sains NSF dan memindahkan yurisdiksinya ke ranah militer, sembari menarik berbagai negara ke dalam Pax Silica untuk mengecualikan Tiongkok dan pada saat yang sama memaksa sekutunya memakai produk domestik dengan fungsi terbatas. Wilayah netral seperti Swiss atau Singapura mungkin masih tersisa, tempat pengguna AS dan UE bisa mengakses sisi lain tirai tanpa konsekuensi hukum
https://nitter.net/RnaudBertrand/status/2069574934972797089
Saat saya menyerahkan ke Kimi K3 sebuah tugas yang biasanya saya uji dengan semua model, ia berpikir jauh lebih lama dan hampir menghabiskan seluruh kuota 5 jam pada paket 19 dolar. Jika tugas yang sama dijalankan pada paket OpenAI 20 dolar, hanya butuh beberapa menit dan kuotanya hampir tidak berkurang
Batas langganan sulit diukur karena tidak menyediakan angka yang bisa dibandingkan seperti token, tetapi ini pertama kalinya saya melihat langganan di kisaran 20 dolar yang begitu ketat sampai satu tugas sepele saja menghabiskan kuota yang seharusnya dipakai untuk pekerjaan nyata. Kecepatannya lambat dan biaya per tugas juga tampak tinggi, tetapi ia berhasil menemukan bug yang dibuat sembarangan oleh Gemini 3.5 Flash
Saat saya meminta GLM 5.2 memindahkan sekitar 50 baris JavaScript ke Python, ia juga berulang kali melakukan pencarian web dan peninjauan ulang hingga menghabiskan biaya API 0,25 dolar; eksekusi pertama gagal, tetapi yang kedua berhasil. Claude Code/Fable jauh lebih cepat tetapi menghasilkan kesalahan yang sama, dan saya berharap pemeriksaan diri berlebihan pada model terbuka berkurang atau cara prompting-nya membaik
Model Tiongkok belum mencapai patokan ini, dan tampaknya lebih berfokus memaksimalkan skor benchmark daripada efisiensi
max, tetapi level lain akan segera disediakan. Dalam catatan pelacakan benchmark terlihat banyak langkah mundur dan ketidakpastian seperti “sebentar, tapi…”, dan hal serupa juga terlihat pada GPT 5.6 danxhigh·maxmilik Fable meski dengan tingkat yang lebih rendahJika intensitas penalaran yang lebih rendah didukung, inefisiensi token kemungkinan bisa membaik
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-review, tetapi tanpa perubahan kode penggunaan melonjak hingga 99%, dan dengan sisa 1% bahkanreview.mdpun tidak bisa dibuatBiasanya peninjauan memakai 10–20%, tetapi kadang dalam 15 menit saja 65–69% menghilang, sehingga variabilitas penggunaan sangat besar
Pada paket berbayar Kimi, panjang konteks 1 juta token hanya tersedia mulai 79 dolar per bulan ke atas, sedangkan paket di bawahnya dibatasi 256 ribu token. Pada paket terendah 15 dolar per bulan berdasarkan diskon pembayaran tahunan, K3 sendiri saat ini tidak didukung
https://www.kimi.com/code/docs/en/kimi-code/models.html
Saya justru melihatnya sebaliknya. Kimi K3 memiliki 2,8 triliun parameter, dan meski skala ChatGPT 5.6 atau Opus 4.8 tidak dipublikasikan, kemungkinan mirip; Fable·Mythos dikabarkan sekitar 10 triliun
Harga input-output per sejuta token adalah 3 dolar·15 dolar untuk K3, 5 dolar·30 dolar untuk ChatGPT 5.6 Sol, dan 5 dolar·25 dolar untuk Opus 4.8, jadi selisihnya tidak besar. Ini lebih seperti pesaing yang berkumpul pada performa yang sama dan menjual sedikit lebih murah, bukan titik balik historis. Bobot K3 saat ini juga tertutup, jadi situasinya tampaknya tidak akan berubah
Di thread ini pun utilitas nyata Kimi mendapat penilaian beragam. Secara pribadi saya menganggapnya di bawah Fable dan 5.6 Sol, tetapi pusat pembahasannya tampak lebih dekat ke reaksi balik terhadap langkah regulasi pemerintah AS daripada performa
Kemarahan dan frustrasi terhadap situasi saat ini tampaknya juga memunculkan keinginan agar Kimi lebih unggul
Ini sangat bergantung pada jenis tugas dan cara pemakaian, tetapi penilaian bahwa K3 tidak setara dengan model frontier AS tidak sesuai dengan pengalaman penggunaan saya
Di sini perlu diperjelas apakah ‘Claude’ yang dimaksud adalah Opus atau Fable, dan pada level mana intensitas penalarannya
Ungkapan aslinya kurang akurat; saya tidak memakai Fable atau K3 hampir sepanjang waktu, dan biasanya saya menangani tugas dengan cakupan kecil lalu meninjaunya sendiri
Kebijakan privasi juga bukan masalah kecil. Saat menggunakan langganan Kimi, mereka menyatakan bahwa interaksi akan dipakai untuk pelatihan model, dan hanya tidak dipakai ketika menggunakan API secara langsung dengan harga API. Apakah ini bisa dipercaya adalah soal lain
Saya berencana menunggu sampai penyedia lain muncul di OpenRouter, lalu menilai tingkat kepercayaannya. Kalaupun tidak terlalu memercayai mereka, jika penyedianya tidak melatih model sendiri, kemungkinan data dipakai untuk pelatihan akan lebih rendah
99% pengguna tidak menangani kekayaan intelektual khusus yang perlu dikhawatirkan
Sampai sekarang pun, pada akhirnya semuanya adalah distilasi. Seperti yang dikatakan Suhail, laba dari model AI harus dibuat mendekati nol
Karena dilatih dengan data umat manusia, itu seharusnya menjadi hadiah bagi umat manusia sendiri, agar segelintir orang tidak bisa mengendalikan umat manusia
Model open-source sudah mencapai level model komersial terbaik. Bottleneck terakhir adalah hardware, tetapi ambang itu juga turun dengan cepat
Menjalankan Kimi K3 di rumah masih sangat mahal, tetapi sudah ada banyak model gratis yang mumpuni dan bisa dijalankan di hardware yang wajar, dan tren ini akan terus berlanjut