1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Perbandingan Kimi K3 dan Fable 5 pada sekitar 1.030 tugas agen menunjukkan bahwa routing per tugas mencapai akurasi 93%, menghasilkan kualitas lebih tinggi daripada model individual
  • Performa keseluruhan pada tugas SWE, terminal, algoritme, multibahasa, dan hukum serupa, tetapi kedua model memiliki area tugas yang menjadi kekuatan berbeda
  • Routing oracle mengalokasikan 72–96% tugas ke K3, dan K3 lebih hemat biaya daripada Fable di semua 5 kelompok tugas
  • Dalam loop agen yang panjang, K3 menunjukkan efisiensi biaya hingga sekitar 50x lebih tinggi dibanding penggunaan Fable saja, tetapi jumlah tahap eksekusi yang lebih banyak dapat memperpanjang waktu pemrosesan
  • Router yang disesuaikan dengan workload, dengan model terbuka murah sebagai default dan tugas sulit dikirim ke model lain, dapat meningkatkan kualitas sekaligus biaya

Diukur dengan tugas agen nyata

  • Kimi K3 dan Fable 5 dijalankan pada harness yang sama untuk menyelesaikan sekitar 1.030 tugas dalam bentuk loop agen nyata
    • SWE: 460 tugas yang mirip dengan perbaikan bug pada repositori nyata
    • Terminal: 89 tugas agen jangka panjang seperti keamanan, kriptografi, reverse engineering, dan administrasi sistem
    • Algoritme: 100 soal tipe LeetCode dan AtCoder
    • Multibahasa: 225 tugas implementasi dalam 6 bahasa
    • Hukum: 120 tugas agen hukum yang dinilai oleh pengacara
  • Kedua model dibandingkan dengan merata-ratakan hasil benchmark pada berbagai jenis tugas

Makna dan batasan routing oracle

  • Routing oracle adalah metode pengukuran teoretis yang menjalankan setiap tugas pada semua model, lalu memilih model termurah di antara opsi yang memberikan jawaban benar
  • Router nyata tidak dapat menjalankan tugas terlebih dahulu pada beberapa model, sehingga harus memprediksi sebelumnya model dengan keseimbangan biaya dan kualitas terbaik
  • Dalam metode ini, K3 dipilih untuk 72–96% dari seluruh tugas
  • Router yang membedakan tugas sehari-hari dari tugas long-tail yang membutuhkan model papan atas mungkin dapat dibuat
    • Untuk memastikannya, diperlukan data routing tambahan sekitar 10x lebih besar, bukan skala satu digit, serta validasi performa di lingkungan nyata

Performa agregat mirip, tetapi kekuatannya berbeda

  • Hasil SWE representatif hampir sama: K3 92,4%, Fable 92,6%
  • Di seluruh 5 jenis tugas, perbedaan antara kedua model umumnya berada dalam beberapa poin persentase, dengan Fable sedikit unggul pada cakupan coding multibahasa
  • Berbeda dari skor agregat yang mirip, pada tugas-tugas rinci masing-masing model menunjukkan area keunggulan yang jelas

Perbedaan berdasarkan area tugas

  • Jika SWE dibagi berdasarkan area masalah, K3 unggul pada matematika simbolik dan developer tools, sedangkan Fable unggul pada tugas web dan visualisasi data
  • Pada tugas multibahasa, Fable unggul di Java, Python, dan C++, sementara K3 setara di JavaScript dan Rust
  • Pada tugas terminal jangka panjang yang memanipulasi shell puluhan kali, K3 menunjukkan kekuatan
    • K3 menyelesaikan hash 7z, kriptanalisis FEAL, rahasia yang bocor, kerentanan nyata, dan tugas asinkron yang tak terkendali yang tidak dapat diselesaikan Fable
  • Saat membandingkan akurasi dan biaya bersama-sama, Fable unggul pada multibahasa, K3 unggul pada terminal dan hukum, sementara sisanya secara umum mirip

Struktur yang menciptakan kesenjangan biaya

  • Keunggulan biaya K3 berasal dari harga token, prompt caching, dan input per tugas
  • Untuk satu tugas SWE, K3 menggunakan sekitar 55 turn dan 1,3 juta token, sedangkan Fable menggunakan sekitar 21 turn dan 130 ribu token
  • Pada tugas terminal yang panjang, sebaliknya Fable menggunakan hingga sekitar 64 turn dan 1,5 juta token, dan terkadang mencapai timeout
  • Meski K3 membaca token 10x lebih banyak pada SWE, biaya eksekusinya lebih rendah daripada Fable berkat prompt cache hit
  • Jika tahap eksekusi bertambah, waktu pemrosesan nyata dapat menjadi lebih lama
    • Pada tugas yang harus dijawab dalam 2 detik, latensi menjadi penting
    • Pada agen background berskala besar, tagihan biaya yang lebih rendah menjadi lebih penting

Hasil menggabungkan kedua model

  • Jika setiap tugas dikirim ke model yang lebih cocok, hasilnya bukan sekadar level menengah dari kedua model, melainkan performa lebih tinggi daripada masing-masing model tunggal
  • Routing oracle per tugas selalu menunjukkan performa lebih tinggi daripada menjalankan model individual, dan akurasi keseluruhan mencapai 93%
  • Dengan mengirim 72–96% traffic ke K3 sebagai model yang dioptimalkan biaya, kualitas keseluruhan tetap lebih tinggi daripada masing-masing model, sementara biaya mendekati penggunaan K3 saja
  • K3 lebih efisien biaya daripada Fable di semua 5 kelompok tugas, dan pada loop agen yang panjang mencatat efisiensi biaya hingga sekitar 50x lebih tinggi

Routing per workload, bukan satu model tunggal

  • Routing Kimi K3 dan Fable secara bersama dapat memanfaatkan kekuatan yang berbeda sambil menurunkan biaya
  • Karena tiap model memiliki harga dan area spesialisasi berbeda, AI berkualitas terbaik bisa berasal dari kombinasi beberapa model, bukan satu penyedia tunggal
  • Model terbuka seperti K3, yang biayanya hingga 50x lebih rendah dan menerima sebagian besar traffic dari oracle, dapat dijadikan pilihan default
  • Router harus disesuaikan dengan workload nyata dan terus mempelajari kecocokan antara tugas dan model

1 komentar

 
GN⁺ 3 jam lalu
Pendapat di Hacker News
  • Jika dijalankan dan diuji langsung, semua model ini overfit terhadap benchmark. Sekalipun mendekati model frontier pada metrik tertentu, dalam pekerjaan nyata mereka ambruk dan efisiensi tokennya juga sangat rendah
    Berbeda dari model tertutup, Fireworks mendapat keuntungan besar dari hosting K3, jadi insentif untuk mengangkat judul seperti ini sangat besar

    • Setelah beberapa hari menguji K3, Qwen 3.8 Max Preview, Fable, dan Sol, saya sebagian setuju bahwa benchmark sulit dipercaya, model Tiongkok lambat, dan efisiensi tokennya rendah
      Meski begitu, performanya kira-kira setara dengan model papan atas generasi sebelumnya seperti Opus 4.8 dan GPT 5.5, dan bisa juga dibandingkan di https://senko.net/vibecode-bench/
      Dengan API resmi dan tool coding masing-masing, saya meminta mereka membuat aplikasi web sederhana tetapi cukup menantang hanya dari spesifikasi rinci; hasil K3, Qwen 3.8, dan Fable hampir sama dalam uji pengguna, semuanya juga memadai dalam tinjauan kode oleh Sol, dengan Fable sedikit unggul
      Dalam pekerjaan nyata saya masih lebih memilih Opus 4.8 dan Sol, tetapi jika butuh alternatif, K3 dan Qwen 3.8 juga cukup layak dipakai
    • Semuanya memang overfit terhadap benchmark, tetapi intinya adalah seberapa overfit mereka dibandingkan satu sama lain
      Kami terutama menilai kemampuan coding dalam lingkungan multi-agen terbuka, tanpa kumpulan jawaban benar, tempat para agen saling memengaruhi; model Tiongkok cenderung tampil lebih rendah dibanding model AS daripada yang diiklankan di kartu model
      Kimi K3 adalah pengecualian yang benar-benar mendekati frontier, tetapi sangat lambat. Muse Spark 1.1 adalah yang terkuat setelah Fable dan Sol, sekaligus paling hemat biaya, sehingga berbalik besar sejak Llama 4. Datanya ada di https://gertlabs.com/rankings
    • Fable bekerja sangat baik bahkan pada codebase yang cukup besar. Memang perlu beberapa kali koreksi atau arahan, tetapi kebanyakan karena kebutuhan dalam prompt kurang memadai; kasus yang benar-benar salah hanya sekitar dua kali, jadi tingkat kesalahannya lebih rendah daripada sepanjang karier kerja saya
      Kualitas kode setara dengan yang akan saya tulis, dan lebih baik di area yang tidak saya kuasai. Ia juga konsisten mengerjakan hal-hal yang biasanya ditunda atau terasa membosankan bagi manusia, seperti refactoring, pengujian integrasi/regresi, audit log, dan pemeriksaan notifikasi error, sehingga menaikkan level rekayasa perangkat lunak secara keseluruhan
      Ini adalah layanan produksi Ruby on Rails yang relatif kompleks dengan PostgreSQL; pada paket Max 200 dolar per bulan, anggaran token bukan masalah dan biayanya sangat sepadan
    • Saya belum membaca artikelnya, tetapi sejak judulnya menonjolkan model kelas Mythos yang disediakan sendiri oleh penyedia layanan inferensi, sudah terasa mencurigakan. GLM 5.2, yang parameternya bahkan tidak sampai sepertiga Kimi K3, masih menjadi model utama
    • Semua penilaian ini perlu diberi catatan untuk saat ini. Melihat trennya, meski belum berada pada tingkat yang cukup baik untuk coding, jelas akan segera tercapai, dan kita harus bersiap untuk dunia tempat model terbuka menjalankan hampir semua pekerjaan perangkat lunak
  • Menarik bahwa mereka menguji Kimi K3 dan Fable pada sekitar 1.000 tugas yang dibagi ke 5 bidang seperti rekayasa perangkat lunak dan hukum
    Mereka menempatkan model router di depan untuk memprediksi model mana yang lebih murah dalam menghasilkan jawaban benar, dan pada akhirnya menurut saya harus terus dilatih dengan beban kerja masing-masing
    Router memilih Kimi pada 72–96% tugas di tiap bidang, dan mencapai penghematan biaya 1,5–50 kali tergantung bidangnya

    • Router di sini adalah patokan oracle yang menjalankan kedua model, memeriksa apakah lolos, lalu memilih model yang lebih murah
      Ini hanya asumsi Fireworks bahwa biaya bisa dihemat jika ada router yang mampu memprediksi hasil yang sama sebelumnya; keberadaan router semacam itu adalah premis besar
    • Router serupa ada beberapa, misalnya https://openrouter.ai/openrouter/auto
  • Kalau model bisa berbicara seperti manusia, saya rela menerima penurunan skor benchmark 5%

    • Saya justru lebih suka model yang tidak mencoba berbicara seperti manusia
    • Tidak perlu mengorbankan 5%; masukkan output Fable ke Gemini Flash dan minta ditulis ulang menjadi kalimat yang lebih mudah dibaca
    • Saya sangat lebih suka model tidak meniru gaya bicara manusiawi saya. Perilaku Claude yang bertingkah seperti teman dan membalas lelucon dengan LOL bukan hanya konyol, tetapi juga merugikan
    • Secara default, Opus menghasilkan gaya tulisan yang saya sebut bahasa Claude. Kalimatnya terlalu disederhanakan dan tidak utuh secara gramatikal sehingga menyakitkan dibaca; mungkin mudah dibaca dan ditulis bagi model, tetapi tidak bagi manusia
      Misalnya, panduan untuk makalah panjang pernah ia keluarkan dalam satu baris penuh berupa fragmen imperatif seperti “skim sekarang sekali dan rujuk kembali saat membaca Part II”, kata kunci tebal, dan panah yang saling tersambung rapat
    • LLM bukan manusia, jadi tidak ada alasan harus berbicara seperti manusia
  • Anthropic tampak seperti pemutaran cepat Kekaisaran Romawi: bahkan sebelum IPO, sepertinya sudah melewati puncak dan memasuki fase kemunduran

  • Saat berlangganan paket coding Kimi K3, saya penasaran bagaimana tata kelola data dan perlindungan privasi diterapkan. Saya ingin pindah dari Anthropic

    • Menurut https://platform.kimi.ai/docs/agreement/modeluse, konten dapat digunakan untuk menyediakan, memelihara, mengembangkan, dan meningkatkan layanan, dan pelanggan yang memerlukan pembatasan pelatihan harus membahas kontrak perusahaan atau kesepakatan tertulis terpisah
      Berbeda dengan Claude, tidak ada opsi opt-out untuk pelatihan model, dan berdasarkan ketentuan, Kimi dapat menggunakan kode pelanggan untuk pelatihan
    • Harus menunggu sampai penyedia Barat mulai meng-hosting-nya
    • Cara paling sederhana adalah mendaftar ke OpenRouter dan mengecualikan semua penyedia yang bukan zero data retention (ZDR). Namun tarif API bisa lebih mahal daripada paket coding, dan 1,7 miliar token yang disediakan paket MiniMax seharga US$20 per bulan bernilai lebih dari US$200–500 dalam tarif API, tergantung rasio input/output dan cache
      Jika tidak ingin berurusan langsung dengan perusahaan Tiongkok, AtlasCode US$20 per bulan, OpenCode Go US$10 per bulan, dan Cline Pass US$10 per bulan menyediakan kuota pemakaian 2–6 kali lebih besar untuk beberapa model open-weight populer
      Secara pribadi saya berlangganan Z.ai seharga US$17 per bulan dan membayar biaya API ke masing-masing penyedia asli untuk MiMo v2.5, Hy3, Qwen 3.7 Plus, dan DeepSeek v4
    • Ketentuan perlindungan privasi dapat dilihat di https://www.kimi.com/user/agreement/zh/userPrivacy
  • Saya penasaran apakah orang bisa dibayar untuk menulis artikel seperti ini demi mengangkat model terbuka, dan kalau iya, apa tujuannya
    Dari pengalaman mengerjakan FastAPI·Python dan Spring Boot·Java pada produk SaaS modern, satu-satunya model terbuka yang bagus sekaligus efisien adalah Qwen 3.7 Max
    GLM 5.2 dan Kimi sering menelusuri codebase hampir 70 ribu–80 ribu token sebelum menulis kode, lalu pada akhirnya tetap merusak kode. Keduanya bekerja baik jika diberi spesifikasi yang sangat detail seperti setahun lalu, tetapi Qwen 3.7 menyelesaikan tugas tanpa banyak repot

    • Ini content marketing yang bagus. Fireworks adalah penyedia inferensi model besar yang menjual akses Kimi K3
    • Fireworks berspesialisasi menjalankan model terbuka dengan cepat, dan sebagian besar pendapatannya berasal dari model Tiongkok, jadi insentif ekonominya pada dasarnya adalah keseluruhan model bisnisnya
    • Ada banyak uang dalam bisnis pengaruh di bidang teknologi, tetapi sebagian besar berasal dari pemain besar, seperti akuisisi tbpn oleh OpenAI atau akses awal untuk sebagian influencer
    • Lin Qiao adalah salah satu pendiri sekaligus CEO Fireworks AI. LLM adalah padanan perlombaan antariksa dalam Perang Dingin AS–Tiongkok, jadi insentif untuk membuktikan keunggulan etnis/peradaban mungkin lebih besar daripada uang
  • Saya penasaran apakah ada hal yang membuat Kimi secara khusus lebih unggul di sini. Setahu saya harganya mirip dengan Sonnet 5, jadi bagaimana jika memakai Sonnet 5 dan Fable, atau Grok 4.5 yang lebih murah?

    • Artikel ini mengatakan Kimi lebih baik daripada Fable pada beberapa tugas, tetapi kemungkinan besar itu tidak berlaku terhadap Sonnet
    • Model terbuka punya keunggulan karena perusahaan besar dapat menjalankan secara lokal dan melakukan fine-tuning di data center mereka sendiri
  • Saya sangat menyukai model Tiongkok dan hanya memakai DeepSeek, dan sekarang juga memanfaatkan Kimi K3 sebagai asisten perencanaan yang bagus untuk pekerjaan coding tingkat lanjut
    DeepSeek v4 Flash sangat cepat dan menangani hampir semua tugas yang saya berikan di Rust, PostgreSQL, Angular, dan Terraform
    Saya meng-hosting sendiri Bifrost sebagai gateway LLM, tetapi saya berharap penyedia menagih otomatis pemakaian aktual bulanan/harian seperti VPS, alih-alih memakai top-up prabayar dan auto-recharge. Saya ingin hanya membayar pemakaian tepatnya, bukan mempertahankan saldo minimum yang tidak bisa dikembalikan di banyak penyedia
    OpenRouter membantu, tetapi saya tidak menyukai layanannya sendiri dan biaya tambahannya

    • Akhir-akhir ini saya memakai DeepSeek v4 Pro sebagai utama, dan karena banyak pekerjaan paralel, kecepatan tidak terlalu penting. Jika gagal, saya beralih ke GPT 5.5 di tengah percakapan untuk mencari masalah, lalu kembali ke DeepSeek dengan analisis itu tetap ada di konteks
      Kimi k2.5/6 lebih lambat dan performanya memburuk, error engine overloaded juga meningkat, dan k3 berpikir lama tetapi hasilnya tidak membaik secara mencolok. Saya menduga mereka mungkin sementara menguantisasi model karena tekanan sumber daya komputasi
      Belakangan saya terutama memakai DeepSeek v4 Pro dan menggunakan GPT 5.5 saat butuh model yang kuat. GLM 5.2 bagus untuk sebagian tugas tetapi sangat buruk untuk tugas lain, sedangkan model Google atau Anthropic belum terasa mengesankan
    • Dengan alat seperti reasonix atau whale, cache hit rate sekitar 98% bisa dicapai sehingga biaya request praktis mendekati gratis. Ini juga memungkinkan di penyedia AS tanpa subsidi seperti Cloudflare atau DigitalOcean
    • Sistem prabayar mencegah pengguna menghabiskan sumber daya inferensi dalam jumlah besar lalu membatalkan kartu dan menghilang. VPS adalah investasi jangka panjang sehingga lebih sulit berpindah, dan biaya bagi penyedia relatif kecil meskipun sebagian pengguna tidak membayar tagihan satu bulan
    • Saya sedang mempertimbangkan Bifrost, jadi penasaran kenapa memilih gateway LLM
      OpenRouter menyediakan hampir semua model sejak hari peluncuran, tetapi daya tarik Bifrost adalah kalau nanti meninggalkan OpenRouter, sisa susunan teknologinya tidak perlu disentuh. Jika self-hosting menjadi realistis, ketergantungan pada OpenAI·Anthropic·OpenRouter bisa dikurangi, sekaligus menurunkan risiko model yang diandalkan tiba-tiba dihentikan
    • Selain biaya tambahan, apa yang tidak disukai dari layanan OpenRouter?
  • Ini situasi di mana perusahaan hosting model terbuka mengatakan bahwa model terbuka itu hebat

    • Mereka membuka metodologi dan hasilnya, dan saya jadi tahu kelebihan serta kekurangan relatif Kimi dan Fable yang belum saya lihat di tempat lain. Menjalankan bisnis hosting model tidak membuat mereka kehilangan hak untuk membagikan hasil
    • Fireworks tidak hanya meng-hosting model open-weight, dan fakta bahwa berita besar bisa menarik pelanggan baru tidak membuat isinya menjadi palsu
    • Siapa pun yang sudah mencobanya sendiri akan tahu bahwa penilaian mereka benar
  • Seperti dijelaskan dalam tulisan tersebut, saya sedang mencari alat routing yang bisa digunakan bersama Claude Code atau platform routing lain yang bagus. Saya tahu router dalam tulisan ini menggunakan pendekatan oracle.

    • https://github.com/code-yeongyu/oh-my-openagent mengimplementasikan pola oracle dari artikel asli di 11 peran.
      Tiap peran memiliki peringkat LLM yang direkomendasikan dari beberapa penyedia; misalnya, Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5) digunakan sebagai orkestrator utama.