1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp

1 komentar

 
GN⁺ 3 jam lalu
Opini Hacker News
  • Jika sebuah perusahaan besar menghabiskan jutaan dolar per bulan untuk biaya inferensi, membeli sendiri rack GB300 seharga sekitar $6 juta tampak masuk akal
    Dari 20,7TB memori, bahkan tidak sampai 10% yang dibutuhkan untuk memuat seluruh model MXFP4, dan total bandwidth HBM mencapai 576TB/s, sehingga lebih dari 6.000 pekerjaan agen dengan konteks rata-rata 100 ribu token bisa dijalankan paralel pada sekitar 30 token/detik
    Jika depresiasi tahunan dan biaya listrik diasumsikan $1,5 juta, dengan tingkat utilisasi rata-rata 50%, biayanya menjadi kurang dari $0,6 per 1 juta token output; data juga tetap berada di internal perusahaan dan biayanya lebih dari 10 kali lebih murah daripada layanan hosting
    Bagi perusahaan yang yakin model open-weight akan terus berkembang dan AI akan bertahan, ini terasa seperti alasan kuat pertama untuk memutuskan membeli rack sendiri

    • Menjalankan Kimi 2.8 di server seharga $107 ribu dan memproses lebih dari sekitar 50 ribu token per detik untuk sebagian besar tugas
      Penghematannya sudah melebihi biaya token yang dikeluarkan tahun lalu untuk Claude dan Gemini
    • Jika merekrut 2–3 staf DevOps untuk operasional, akan ada tambahan $400 ribu–$700 ribu, dan semua gangguan serta pemeliharaan menjadi tanggung jawab perusahaan
      Meski begitu, untuk data yang harus tetap privat, mereka tetap tidak mempercayai LLM yang di-host
    • Juga dibutuhkan ruang dengan pendinginan cair dan fasilitas listrik berdaya sangat tinggi, jadi colocation biasa atau ruang server internal perusahaan umumnya sulit menanggungnya
    • Jika sebuah perusahaan mampu membeli rack dan infrastruktur seharga $6 juta, mereka juga harus mempertimbangkan ketentuan lisensi komersial yang berlaku, jadi perhitungannya tidak sesederhana itu
  • Selain modelnya, mereka juga merilis berbagai infrastruktur open source
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    Sulit menerima anggapan bahwa open source dan model open-weight adalah tindakan yang memperlambat kemajuan AI

    • Justru pernah dianggap sebagai tindakan yang memperlambat kemajuan
      Alasannya, laboratorium lain bisa mengejar dengan mendistilasi model dari laboratorium terdepan sambil mengambil sebagian pendapatan yang seharusnya bisa diinvestasikan ulang ke generasi berikutnya
      Jika benar-benar ingin percepatan penuh, pernah ada pandangan bahwa dua laboratorium terbesar seharusnya dinasionalisasi dan ditutup seperti Manhattan Project sampai mencapai recursive self-improvement (RSI), tetapi setelah melihat bantahan di balasan, sudut pandangnya berubah drastis
  • Lisensi Kimi-K3 bisa dilihat di https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
    Penyedia Model as a Service dengan total pendapatan gabungan afiliasi selama 12 bulan berturut-turut melebihi $20 juta harus membuat perjanjian terpisah dengan Moonshot AI sebelum penggunaan komersial
    Dalam ketentuan yang ada juga terdapat klausul bahwa jika pengguna aktif bulanan melebihi 100 juta atau pendapatan produk komersial melebihi $20 juta, nama Kimi harus ditampilkan

    • Kimi 2.6 juga menggunakan lisensi dengan pola serupa, https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS... dan tampaknya ini sudah berlaku sejak K2
      Model yang dirilis pada 2025 memakai lisensi MIT yang bersih, tetapi mulai dari moonshotai/Kimi-K2-Thinking pada Januari 2026 mereka mulai memakai lisensi MIT yang dimodifikasi
    • Sejak awal sudah muncul pertanyaan lisensi ini sebenarnya berlaku untuk apa
      Bahkan belum jelas apakah bobot model bisa dikenai hak cipta
    • Di Amerika Serikat, ada tafsir bahwa bobot model machine learning bukan objek hak cipta karena merupakan hasil proses optimisasi otomatis seperti stochastic gradient descent, expectation maximization, dan genetic algorithm
      Ini memang belum sepenuhnya diuji di pengadilan, dan biaya gugatan juga besar, jadi pemberi kerja biasanya akan memilih aman dengan mematuhi lisensi
      Thaler v. Perlmutter menegaskan bahwa hak cipta memerlukan pencipta manusia, dan pedoman Kantor Hak Cipta AS juga menyatakan bahwa karya yang dihasilkan mesin secara otomatis tanpa campur tangan kreatif manusia tidak dapat didaftarkan
      Klausul berikutnya juga mengecualikan prinsip matematika, rumus, algoritme, dan persamaan dari objek hak cipta, jadi jika model dipandang sebagai algoritme, kesimpulannya relatif jelas
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • Fakta bahwa modelnya bisa diunduh memang lebih baik, tetapi dengan syarat seperti ini, rasanya sulit menyebutnya benar-benar open-weight atau open source
    • Juga muncul pertanyaan bagaimana mereka akan menemukan pelanggar lisensi dan menjadikannya target gugatan
  • Pendekatan berupa graf pengetahuan hierarkis yang berevolusi sendiri yang terus berkembang ketika agen menjelajahi bidang padat pengetahuan dan ranah pemrograman dalam skala web terasa menarik

  • Melihat fungsi aktivasi kembali ke tanh, rasanya tren teknologi memang berputar

    • Menurut halaman 6 makalah, mereka tidak memakai tanh secara langsung, melainkan f_gate(b,x) = b * tanh(x / b) * sigmoid(x) dan f_up(b,x) = b * tanh(x / b)
      Dari grafiknya, ini tampak seperti desain yang ingin mengambil sekaligus keunggulan GLU untuk daya representasi saat x lebih besar dari sekitar 5 dan keunggulan SwiGLU dengan lonjakan nilai di dekat 0
  • Komposisi tugas berbasis graf pengetahuan tampak cocok untuk persoalan lama tentang bagaimana mencakup beragam tugas tanpa ada yang terlewat
    Ini juga tampaknya bisa berlanjut menjadi riset teoretis tentang kecepatan lahirnya pengetahuan baru serta cara pembangkitan oleh manusia maupun mesin

  • Ingin tahu mana yang saat ini paling baik di antara LoRA+DPO, GRPO untuk fine-tuning yang disesuaikan dengan tugas agen sendiri

    • Untuk awal, LoRA+SFT tampaknya cocok, tetapi karena modelnya besar beban biayanya akan cukup signifikan
      Mungkin lebih baik menunggu API fine-tuning dari penyedia, dan sepertinya tidak perlu langsung memakai reinforcement learning atau pseudo-reinforcement learning off-policy seperti DPO sejak awal
  • Ingin tahu apa yang dimaksud model guru dalam distilasi on-policy multi-guru
    Untuk bidang yang bisa diverifikasi seperti matematika dan coding masih mudah dipahami, tetapi karena sampai mencakup biologi muncul pertanyaan apakah strukturnya adalah distilasi dari model yang lebih besar

    • Mengutip https://thinkingmachines.ai/blog/on-policy-distillation/
      Ini dipahami sebagai metode distilasi dengan reinforcement learning, di mana model guru menilai setiap token dari model siswa yang memecahkan masalah berdasarkan probabilitas generasi di tiap langkah, lalu menerapkannya sebagai reward atau loss
      Multi-guru tampaknya berarti melakukan distilasi dari beberapa model, dan bisa saja mencakup model tertutup mutakhir
      Namun dibutuhkan log probability; API OpenAI mengizinkannya, sedangkan Anthropic tidak menyediakannya, jadi mungkin ada cara untuk mengestimasinya dari luar
      Metode ini dapat diterapkan pada bidang apa pun yang diketahui guru, termasuk biologi
    • Guru berarti model-model lain
  • Ingin tahu apakah alasan harga inferensi dari berbagai penyedia semuanya sama adalah karena perjanjian lisensi dengan Moonshot

  • Ingin tahu apa yang dibutuhkan untuk membuat model terbuka buatan AS yang bisa bersaing dengan Kimi

    • Model terbuka skala besar terbaru dari laboratorium riset besar AS tampaknya terakhir adalah GPT-OSS-120b pada musim panas 2025, sekitar 1 tahun lalu
      Tampaknya sulit muncul secara sukarela, jadi sepertinya perlu ada dorongan agar dirilis dalam bentuk apa pun
      Belakangan sempat berharap Gemma hadir setidaknya di kelas 100B, tetapi tampaknya Google hanya menyimpan model sebesar itu untuk internal
    • MSL atau SpaceXAI tampaknya punya kemungkinan tinggi untuk merilis open source salah satu model besar berikutnya
      Keduanya ramah terhadap open source dan akan bersaing memperebutkan posisi Kimi versi AS
    • Jika anggapan umum bahwa Tiongkok cukup melakukan distilasi model lalu menyalinnya dalam 2 minggu itu benar, maka AS juga seharusnya bisa merilis model tiruan dalam 2 minggu
    • Inkling juga kurang lebih masih berada dalam kisaran yang kompetitif