2 poin oleh GN⁺ 1 hari lalu | 1 komentar | Bagikan ke WhatsApp
  • Dalam pekerjaan coding sehari-hari, penggunaan Kimi K3 dan Claude secara berdampingan menunjukkan bahwa perbedaan nyata dalam kualitas output dan jumlah token yang dibutuhkan untuk jawaban sulit dibedakan
  • API Kimi K3 jauh lebih murah, dengan input $3 dan output $15 per 1 juta token, dibandingkan model teratas Claude yang masing-masing $10 dan $50
  • Kimi mulai dari $19 per bulan, dan tier coding $39 per bulan juga cukup longgar, sementara batas penggunaan Claude cepat habis selama pekerjaan agen dan akses Fable pun tidak bisa dipertahankan pada paket $20 per bulan
  • Dalam benchmark keamanan siber Semgrep, ketika Claude yang dibatasi menolak sebagian tugas, GLM 5.2 menjalankannya dan unggul; model ini dirilis dengan lisensi MIT dan lebih murah daripada Opus terbaru
  • Pembatasan yang hanya berlaku pada model AS hanya mengurangi pilihan pelanggan AS, tetapi tidak menghentikan persaingan dari model terbuka luar negeri; dengan Kimi K3 yang kualitasnya mirip dan harganya lebih rendah, alasan untuk terus membayar Claude makin berkurang

Perbandingan kualitas dan harga Kimi K3 dan Claude

  • Saat Kimi K3 digunakan bersama Claude untuk pekerjaan coding umum, hasilnya menunjukkan tugas dan kualitas output yang sama, dengan penggunaan token yang hampir sama
    • Ini berbeda dari dugaan bahwa model terbuka akan menghasilkan keluaran yang lebih berantakan atau memakai lebih banyak token untuk mendapatkan jawaban yang sama
  • Harga API Kimi K3 adalah $3 per 1 juta token input dan $15 per 1 juta token output
    • Model teratas Claude masing-masing $10 dan $50 untuk satuan yang sama
  • Paket berbayar Kimi mulai dari $19 per bulan, dan tier coding $39 per bulan menawarkan kuota penggunaan yang lebih longgar dibandingkan produk Claude pada kisaran harga serupa
    • Paket Claude memiliki batas penggunaan yang ketat, sehingga pada hari kerja agen biasa pun kuota bisa habis sebelum makan siang
    • Claude tidak bisa mempertahankan akses Fable pada paket $20 per bulan sehingga akses itu dimatikan dan beralih ke Opus, tetapi tier Kimi tidak memiliki kondisi yang sama

Kebijakan AI AS dan persaingan model terbuka

  • Pemerintah AS memperlambat peluncuran Fable, dan model final juga menerapkan pembatasan yang menolak berbagai kategori tugas; sementara itu, model terbuka kelas frontier dari laboratorium Tiongkok dapat diunduh sehingga berada di luar jangkauan regulasi pemerintah AS
  • Dalam benchmark keamanan siber Semgrep, GLM 5.2 mengungguli Claude
    • Model yang dibatasi menolak tugas, tetapi model terbuka menjalankannya, dan perbedaan ini memengaruhi hasil
  • GLM 5.2 dirilis dengan lisensi MIT, dan meski tidak memosisikan dirinya sebagai model frontier, dalam pekerjaan nyata model ini memberikan hasil yang lebih baik daripada Opus terbaru dengan biaya yang jauh lebih rendah
  • GPT-5.6 dari OpenAI juga melalui prosedur pembatasan pemerintah, tetapi OpenAI memiliki lebih banyak ruang dibandingkan Anthropic karena dapat menyediakan model utamanya dalam paket $20 per bulan
  • Ke depannya, pemerintah AS dapat menerapkan pendekatan subsidi, bailout, dan tarif protektif yang pernah digunakan pada industri otomotif ke AI dan open source
    • Melalui kerja sama publik-swasta, mereka dapat mendukung model domestik yang hanya digunakan di dalam AS dan tidak mampu bersaing secara internasional
    • Akibatnya, pengguna AS mungkin harus membeli model domestik alih-alih mendapatkan kualitas terbaik atau harga terendah, dan bisa tidak dapat menggunakan model terbaik dengan harga terbaik

1 komentar

 
GN⁺ 1 hari lalu
Opini Hacker News
  • Entah performa setara dicapai lewat distilasi atau dikembangkan secara independen dari awal, akhir bagi laboratorium frontier AS memang sudah ditentukan sejak awal. Distilasi bukan serangan, dan laboratorium frontier sendiri juga mendistilasi pengetahuan yang ditulis manusia ke dalam model, jadi wajar bila laboratorium yang datang belakangan memampatkannya menjadi model yang lebih murah
    Karena secara realistis tidak ada cara untuk mencegah percakapan disimpan dan dipakai melatih model mereka sendiri, tampaknya lebih baik berinvestasi pada perusahaan hardware daripada perusahaan model

    • Mengatakan bahwa itu sudah begitu jelas lebih mirip revisi sejarah setelah kejadian. Distilasi masih merupakan bidang riset yang aktif, dan fakta bahwa model bisa didistilasi semudah sekarang adalah capaian yang menarik, bukan hasil yang sudah dianggap pasti sejak 12 bulan lalu
      Baru 6 bulan lalu saja, banyak prediksi mengatakan bahwa memakai output model sebagai data pelatihan akan membuat semua model gagal karena bencana pembelajaran berulang, jadi jangan bicara seolah-olah hal itu sudah jelas sejak awal
    • Saya sangat setuju dengan premis bahwa distilasi bukan serangan, tetapi K3 bukan versi distilasi dari Fable atau Sol. Fable baru saja dirilis, Sol baru diluncurkan, dan dalam penilaian pengguna Arena, K3 lebih unggul daripada keduanya di beberapa area
      Distilasi API hanya berguna untuk cepat melewati cold start dalam reinforcement learning di domain baru; yang sebenarnya lebih penting adalah kualitas dan keragaman lingkungan reinforcement learning tempat model belajar
    • Dampak serangan distilasi tampaknya agak dilebih-lebihkan. Sekarang sebagian besar data fine-tuning adalah data sintetis, dan karena isi yang sama tidak bisa sekadar diulang, pendekatannya lebih mirip meminta LLM lain menulis buku ajar yang menjelaskan suatu topik secara detail tanpa ada bagian yang terlewat
    • Hampir semua pasar bergantung pada regulasi dalam satu bentuk atau lainnya, dari “hanya melarang pencurian dan sisanya bebas” hingga menuntut regulasi besar-besaran untuk semua pengadaan
      AS belum memilih kontrol ala rare earth Tiongkok, tetapi jika distilasi meluas, pihak yang tidak melakukannya pun kemungkinan akan menanggung biaya regulasi seperti pemblokiran akses atau kontrol berlebihan. Seperti orang yang permisif terhadap penyalinan musik tetapi marah besar pada seni visual, apakah ini dianggap pencurian atau praktik bisnis biasa pada akhirnya bergantung pada konsensus sosial, dan tanpa terobosan besar jaraknya akan menyempit
    • Anthropic bahkan membuat sulit untuk menggulir ke percakapan lama atau memeriksa token pemikiran dan sub-agen. Intinya, mereka ingin semua orang terus kembali ke layanan mereka sendiri, tetapi tidak membiarkan mereka belajar menggali sumur sendiri
  • Kita mencapai titik ini jauh lebih cepat daripada perkiraan. Saya penasaran seperti apa dunia jika pemerintah Barat menetapkan akses ke model frontier berbobot terbuka sebagai risiko keamanan nasional dan mengklasifikasikan penggunaannya sebagai tindakan terorisme
    Kimi K3 bisa menjadi seperti Napster, yang semua orang pakai meski tahu itu ilegal, atau muncul pasar bawah tanah ala ganja tempat seseorang di lingkungan sekitar menyewakan secara metered rig 8×5090 di ruang bawah tanah yang dibuat dari komponen eBay. Sebaliknya, jika kontrol berhasil, pilihan terbuka yang tersisa hanyalah Cohere dan Mistral yang sudah dilemahkan, dan kita mungkin harus membayar mahal untuk model ‘American Frontier’ dari Anthropic dan OpenAI yang tertinggal dari Tiongkok
    Seperti Kindle Fire yang disubsidi iklan, bisa saja muncul Kindle AI yang menjual pengaruh kepada penawar tertinggi, propaganda perusahaan rokok masuk ke pipeline pelatihan, lalu LLM mengatakan bahwa merokok itu sehat

    • Ini seperti munculnya Tirai Besi baru yang membagi dunia menjadi blok-blok digital. Semakin lama pertukaran terputus, semakin besar kemungkinan internet terbuka dan sains terbelah menjadi ekosistem yang tidak kompatibel satu sama lain
      Pemerintah AS baru-baru ini mengumumkan pembatasan mirip Wolf Amendment pada kerja sama sains NSF dan memindahkan yurisdiksinya ke ranah militer, sembari menarik berbagai negara ke dalam Pax Silica untuk mengecualikan Tiongkok dan pada saat yang sama memaksa sekutunya memakai produk domestik dengan fungsi terbatas. Wilayah netral seperti Swiss atau Singapura mungkin masih tersisa, tempat pengguna AS dan UE bisa mengakses sisi lain tirai tanpa konsekuensi hukum
      https://nitter.net/RnaudBertrand/status/2069574934972797089
    • Hilangnya perangkat Mac Studio dengan RAM berkapasitas besar mungkin hanya kebetulan
    • Jika model open-source dijadikan ilegal, yang dirugikan hanya perusahaan AS. Dunia lainnya akan terus memakai open-source dan memperoleh peluang arbitrase terhadap perusahaan AS
    • Saya penasaran apakah ‘pemerintah Barat’ secara spesifik berarti AS. Tidak jelas mengapa negara lain yang tidak sekhawatir AS terhadap Tiongkok harus mengkhawatirkan masalah ini dengan cara yang sama
    • 8×RTX Pro 6000 pun hanya punya VRAM 768GB, jadi saya tidak tahu bagaimana K3 akan dijalankan
  • Saat saya menyerahkan ke Kimi K3 sebuah tugas yang biasanya saya uji dengan semua model, ia berpikir jauh lebih lama dan hampir menghabiskan seluruh kuota 5 jam pada paket 19 dolar. Jika tugas yang sama dijalankan pada paket OpenAI 20 dolar, hanya butuh beberapa menit dan kuotanya hampir tidak berkurang
    Batas langganan sulit diukur karena tidak menyediakan angka yang bisa dibandingkan seperti token, tetapi ini pertama kalinya saya melihat langganan di kisaran 20 dolar yang begitu ketat sampai satu tugas sepele saja menghabiskan kuota yang seharusnya dipakai untuk pekerjaan nyata. Kecepatannya lambat dan biaya per tugas juga tampak tinggi, tetapi ia berhasil menemukan bug yang dibuat sembarangan oleh Gemini 3.5 Flash

    • Kimi cenderung terus meragukan dirinya sendiri dan berpikir terlalu lama. Untuk satu detail kecil, ia mengulang paragraf seperti “sebentar, sebenarnya…” dan menghabiskan banyak token
      Saat saya meminta GLM 5.2 memindahkan sekitar 50 baris JavaScript ke Python, ia juga berulang kali melakukan pencarian web dan peninjauan ulang hingga menghabiskan biaya API 0,25 dolar; eksekusi pertama gagal, tetapi yang kedua berhasil. Claude Code/Fable jauh lebih cepat tetapi menghasilkan kesalahan yang sama, dan saya berharap pemeriksaan diri berlebihan pada model terbuka berkurang atau cara prompting-nya membaik
    • Kita perlu berhenti memakai harga per sejuta token sebagai patokan. Jumlah token yang benar-benar dipakai lebih besar pengaruhnya terhadap biaya daripada harga token yang ditampilkan, jadi yang penting adalah kurva biaya per tugas relatif terhadap kecerdasan
      Model Tiongkok belum mencapai patokan ini, dan tampaknya lebih berfokus memaksimalkan skor benchmark daripada efisiensi
    • Kimi K3 saat ini hanya mendukung intensitas penalaran max, tetapi level lain akan segera disediakan. Dalam catatan pelacakan benchmark terlihat banyak langkah mundur dan ketidakpastian seperti “sebentar, tapi…”, dan hal serupa juga terlihat pada GPT 5.6 dan xhigh·max milik Fable meski dengan tingkat yang lebih rendah
      Jika intensitas penalaran yang lebih rendah didukung, inefisiensi token kemungkinan bisa membaik
      https://platform.kimi.ai/docs/guide/use-thinking-effort
    • Saat Claude Code/Fable diminta mengimplementasikan fitur, dalam sekitar 60 menit ia memakai 30% dari sesi 5 jam pada langganan 100 euro. Setelah itu, di sesi bersih pada terminal terpisah, saya hanya menjalankan /code-review, tetapi tanpa perubahan kode penggunaan melonjak hingga 99%, dan dengan sisa 1% bahkan review.md pun tidak bisa dibuat
      Biasanya peninjauan memakai 10–20%, tetapi kadang dalam 15 menit saja 65–69% menghilang, sehingga variabilitas penggunaan sangat besar
    • Harga langganan AI terasa aneh. Tiap model punya pola penggunaan berbeda, diukur dengan token buram yang dikonsumsi secara arbitrer oleh antarmuka penyedia atau model, dan di atas itu masih ada batas jendela waktu yang tidak transparan
  • Pada paket berbayar Kimi, panjang konteks 1 juta token hanya tersedia mulai 79 dolar per bulan ke atas, sedangkan paket di bawahnya dibatasi 256 ribu token. Pada paket terendah 15 dolar per bulan berdasarkan diskon pembayaran tahunan, K3 sendiri saat ini tidak didukung
    https://www.kimi.com/code/docs/en/kimi-code/models.html

    • Saya ingin hanya memakai API, tetapi di DeepSeek kombinasi tool Reasonix/whale dan rasio cache hit yang tinggi membuatnya pada dasarnya hampir gratis, jadi sepertinya tidak mudah pindah ke layanan lain
  • Saya justru melihatnya sebaliknya. Kimi K3 memiliki 2,8 triliun parameter, dan meski skala ChatGPT 5.6 atau Opus 4.8 tidak dipublikasikan, kemungkinan mirip; Fable·Mythos dikabarkan sekitar 10 triliun
    Harga input-output per sejuta token adalah 3 dolar·15 dolar untuk K3, 5 dolar·30 dolar untuk ChatGPT 5.6 Sol, dan 5 dolar·25 dolar untuk Opus 4.8, jadi selisihnya tidak besar. Ini lebih seperti pesaing yang berkumpul pada performa yang sama dan menjual sedikit lebih murah, bukan titik balik historis. Bobot K3 saat ini juga tertutup, jadi situasinya tampaknya tidak akan berubah

    • Menurut pengumuman resmi, seluruh bobot model dijadwalkan akan dirilis paling lambat 27 Juli 2026
    • Jika mempertimbangkan bahwa OpenAI menghapus batas 5 jam dan sering mereset batas mingguan, saya meragukan apakah Kimi benar-benar lebih murah juga dari sisi harga efektif
  • Di thread ini pun utilitas nyata Kimi mendapat penilaian beragam. Secara pribadi saya menganggapnya di bawah Fable dan 5.6 Sol, tetapi pusat pembahasannya tampak lebih dekat ke reaksi balik terhadap langkah regulasi pemerintah AS daripada performa
    Kemarahan dan frustrasi terhadap situasi saat ini tampaknya juga memunculkan keinginan agar Kimi lebih unggul

    • K3 cukup bagus dan layak ditempatkan di antara Sol dan Fable. Kemampuan desain UI Sol tidak mengesankan, tetapi K3 kuat di area ini, sementara Fable secara keseluruhan memberikan performa paling cepat dan konsisten
      Ini sangat bergantung pada jenis tugas dan cara pemakaian, tetapi penilaian bahwa K3 tidak setara dengan model frontier AS tidak sesuai dengan pengalaman penggunaan saya
    • Ini terlihat seperti pengulangan kasus DeepSeek. Saat v3 keluar, banyak penilaian bahwa perusahaan AS sudah tamat, tetapi pada akhirnya semuanya tetap berjalan seperti sebelumnya
    • Saya tak terhitung sering mendengar bahwa model garis depan lebih dari 6 bulan di depan model open-weight, tetapi kini itu tidak lagi benar. Karena itu, standar evaluasinya sedang bergeser
    • Sulit menerima hal-hal yang dilakukan pemerintah AS terkait AI tahun ini, jadi bisa dipahami jika reaksi seperti itu muncul
  • Di sini perlu diperjelas apakah ‘Claude’ yang dimaksud adalah Opus atau Fable, dan pada level mana intensitas penalarannya

    • Jika seseorang mengatakan tidak melihat perbedaan dalam ‘tugas coding sehari-hari’, terdengar seperti ia menyerahkan tugas yang tidak cukup ia pahami untuk bisa membedakan hasilnya
    • Pembandingnya adalah Fable High dan K3 High, dengan penggunaan utama untuk pengembangan game. Tugasnya mencakup memperbaiki bug visual yang ambigu, mengubah tampilan adegan atau model, dan menambahkan fitur besar
      Ungkapan aslinya kurang akurat; saya tidak memakai Fable atau K3 hampir sepanjang waktu, dan biasanya saya menangani tugas dengan cakupan kecil lalu meninjaunya sendiri
  • Kebijakan privasi juga bukan masalah kecil. Saat menggunakan langganan Kimi, mereka menyatakan bahwa interaksi akan dipakai untuk pelatihan model, dan hanya tidak dipakai ketika menggunakan API secara langsung dengan harga API. Apakah ini bisa dipercaya adalah soal lain
    Saya berencana menunggu sampai penyedia lain muncul di OpenRouter, lalu menilai tingkat kepercayaannya. Kalaupun tidak terlalu memercayai mereka, jika penyedianya tidak melatih model sendiri, kemungkinan data dipakai untuk pelatihan akan lebih rendah

    • Kekhawatiran seperti ini makin lama terlihat konyol. Sebagian besar input hanyalah output yang sebelumnya dibuat oleh model yang sama dan perintah manusia yang ditulis asal seperti “perbaiki tanpa kesalahan”, jadi jika model masa depan menjadi lebih baik, tidak masalah bila dipakai untuk pelatihan
      99% pengguna tidak menangani kekayaan intelektual khusus yang perlu dikhawatirkan
    • Sekalipun semua pengguna hobi memakai model berbobot terbuka, pasar enterprise tanpa retensi data tetap akan memberi peluang bisnis yang cukup bagi perusahaan AS
    • Kebijakan ini adalah alasan untuk tidak menggunakannya. Saya akan menunggu sampai muncul layanan penyedia independen yang dimungkinkan oleh bobot terbuka
  • Sampai sekarang pun, pada akhirnya semuanya adalah distilasi. Seperti yang dikatakan Suhail, laba dari model AI harus dibuat mendekati nol
    Karena dilatih dengan data umat manusia, itu seharusnya menjadi hadiah bagi umat manusia sendiri, agar segelintir orang tidak bisa mengendalikan umat manusia

    • Masih menganggap model besar dari Tiongkok hanya sebagai ‘versi distilasi’ itu konyol. Banyak orang belum menyadari gelombang yang akan menghantam laboratorium frontier AS, yang selama ini mengambil data dalam jumlah sangat besar sambil mencoba mengikat pengguna pada model yang disensor dan performanya dibatasi
  • Model open-source sudah mencapai level model komersial terbaik. Bottleneck terakhir adalah hardware, tetapi ambang itu juga turun dengan cepat
    Menjalankan Kimi K3 di rumah masih sangat mahal, tetapi sudah ada banyak model gratis yang mumpuni dan bisa dijalankan di hardware yang wajar, dan tren ini akan terus berlanjut