1 poin oleh GN⁺ 2 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Model open weight dengan performa dan portabilitas yang memadai dapat menjadi fondasi yang dikembangkan bersama oleh developer, cloud, dan perusahaan, sehingga menciptakan ekosistem inovasi yang sulit diikuti oleh satu vendor tunggal
  • Seperti Kubernetes yang menarik tool networking, storage, dan observability ke atas antarmuka bersama, di AI juga sedang tumbuh stack produksi yang mencakup model serving, fine-tuning, runtime agen, dan evaluasi
  • Model publik di Hugging Face telah melampaui 2 juta; GLM-5.2 mencatat 62,1% dalam evaluasi SWE-bench Pro internalnya, mengungguli GPT-5.5 yang mencatat 58,6%, sementara Kimi K3 juga mendapat skor serupa dengan Opus 4.8 dan GPT-5.5 dalam evaluasi independen
  • Jika model open weight buatan Tiongkok dilarang secara luas, pengembangan global akan tetap berjalan sementara hanya peneliti dan perusahaan AS yang tersisih dari ekosistem, dan inovasi dapat terakumulasi di sekitar model-model Tiongkok yang menyumbang 41% unduhan Hugging Face selama setahun terakhir
  • AS harus bersaing bukan lewat pelarangan, melainkan dengan merilis model frontier yang dapat digunakan secara komersial, pengadaan pemerintah yang menekankan portabilitas dan interoperabilitas, pembangunan seluruh lapisan tool dan operasional, serta uji keamanan dan standar independen

Kekuatan platform terbuka yang ditunjukkan Kubernetes

  • Mesosphere mengembangkan software cloud-native open source berbasis Apache Mesos, lalu membangun DC/OS di sekitarnya dan mengomersialkannya sebagai distribusi enterprise yang mencakup dukungan dan fitur proprietari
  • Kemudian Kubernetes, proyek open source yang lebih baru dan lebih lengkap, menyatukan komunitas cloud-native dan mengguncang Mesosphere
    • Para engineer sistem terdistribusi dan infrastruktur kelas dunia mempertaruhkan karier mereka pada Kubernetes, dan sebagian anggota komunitas loyal Mesosphere pun ikut berpindah
    • Ketika pusat inovasi bergeser ke Kubernetes, komponen yang sebelumnya kurang—seperti networking, storage, observability, tool deployment, dan policy engine—berkembang dengan cepat
  • Dengan keterlibatan banyak startup dan vendor lama, hampir semua komponen yang dibutuhkan untuk menjalankan Kubernetes di produksi tersedia sebagai open source
    • Penyedia cloud serta Mesosphere/D2iQ, Rancher, Red Hat, dan Nutanix membangun bisnis di sekitar integrasi, fitur enterprise, dukungan, dan operasional
  • Keberhasilan Kubernetes bukan sekadar hasil dari membuka repository
    • Ia menjadi fondasi netral yang dapat diperluas oleh engineer, penyedia cloud, dan vendor enterprise sesuai kebutuhan pelanggan
    • Antarmuka bersama dan tata kelola yang netral terhadap vendor memberi peserta kepercayaan bahwa mereka dapat membangun produk untuk jangka panjang
  • Ketika platform terbuka yang dapat dikustomisasi menjadi pusat industri, sulit bagi satu vendor tunggal untuk mengikuti laju inovasi gabungan seluruh ekosistem

Perbedaan antara open weight dan AI open source

  • Sebagian besar model yang sering disebut open source sebenarnya lebih tepat disebut model open weight
  • Meski bukan open source sepenuhnya, ekosistem tetap dapat terbentuk di sekitar artefak yang dapat dijalankan dan dimodifikasi oleh pengguna
  • Ada juga perbedaan penting antara struktur Kubernetes dan AI
    • Kontributor Kubernetes dapat memeriksa dan mengubah source code nyata, lalu memasukkan perbaikan ke proyek upstream bersama
    • Hasil fine-tuning model umumnya tidak dibagikan dengan cara yang sama
    • Sekalipun weight model frontier dapat diunduh, menjalankannya bisa membutuhkan hardware mahal
    • Di AI belum ada organisasi seperti CNCF yang menyediakan tata kelola netral dan antarmuka bersama
  • Kesamaan kedua ekosistem ini adalah bahwa fondasi dengan performa dan portabilitas memadai menarik inovasi pelengkap yang melampaui apa yang dapat dibuat sendirian oleh pencipta aslinya

Dari self-hosting ke platform model

  • Alasan pertama mengadopsi model open weight adalah self-hosting
    • Perusahaan ingin menjalankan model di cloud atau data center mereka sendiri sambil tetap mengontrol data secara langsung
    • Seiring meningkatnya penggunaan dan biaya inferensi, kebutuhan untuk mengontrol biaya secara langsung juga tumbuh
  • Berdasarkan kebutuhan ini, terbentuk stack model serving open source seperti vLLM, SGLang, llama.cpp, Ollama, dan MLX
  • Open weight memungkinkan developer tidak hanya melakukan self-hosting, tetapi juga memodifikasi dan mendistribusikan ulang model itu sendiri
  • Di Hugging Face, terdapat lebih dari 2 juta model publik
  • Di sekitar keluarga model populer seperti Qwen dan Gemma, berbagai artefak turunan dibuat
    • Weight terkuantisasi dan terkonversi untuk berbagai arsitektur semikonduktor dan skala
    • Model fine-tuned dan adapter LoRA untuk coding, kedokteran, hukum, matematika, dan workflow agen
    • Penggabungan model yang mengombinasikan hasil fine-tuning yang berbeda
    • Varian model yang disesuaikan untuk berbagai runtime seperti TensorRT-LLM, vLLM, dan MLX

Frontier dan kesenjangan performa yang menyempit

  • Di masa lalu, performa dasar model terbuka kurang memadai untuk tugas coding dan agen yang paling sulit, sehingga mudah dikesampingkan dari persaingan frontier; namun kesenjangan itu menyempit dengan cepat
  • Z.ai merilis GLM-5.2, yang menyediakan weight terbuka dengan lisensi MIT
    • Skor SWE-bench Pro dalam evaluasi internalnya adalah 62,1%, lebih tinggi daripada GPT-5.5 yang mencatat 58,6%
    • Namun hasil dapat berbeda tergantung benchmark dan agent harness
  • Moonshot menyatakan Kimi K3 mendekati model frontier tertutup dalam tugas coding jangka panjang dan menjanjikan rilis weight pada 27 Juli
  • Ketika performa model dasar sudah cukup, runtime agen, coding harness, sandbox, evaluasi, observability, dan proyek fine-tuning khusus dapat tumbuh secara berantai
  • Komponen-komponen ini membentuk stack terbuka kelas produksi yang dapat disesuaikan dengan beban kerja, hardware, dan struktur biaya tim
    • Strukturnya adalah menjalankan model open weight di atas software open source
    • Tidak ada jaminan bahwa ia mengalahkan semua model tertutup di semua benchmark
  • AI frontier adalah persaingan talenta, dan ekosistem terbuka memberi talenta dari seluruh dunia alasan untuk mengembangkan di atas fondasi yang sama

Dampak pelarangan model Tiongkok terhadap AS

  • Setelah munculnya model Tiongkok yang kuat seperti Kimi K3, pemerintahan Trump dikabarkan sedang mempertimbangkan pembatasan terhadap model open weight buatan Tiongkok
    • Bentuk larangan potensial tersebut masih belum jelas
  • Jika penggunaan model open weight buatan Tiongkok dilarang secara luas, peneliti dan perusahaan AS dapat memisahkan diri dari ekosistem tempat berkumpulnya peneliti dan engineer AI global
    • Banyak peneliti Tiongkok juga berpartisipasi dalam ekosistem ini
    • Aktivitas pengembangan global akan tetap berlanjut, tetapi hanya developer AS yang kehilangan akses
  • Di sekitar Qwen, pola yang sama sudah terlihat
    • Berdasarkan Hugging Face, model Tiongkok menyumbang 41% dari seluruh unduhan model selama setahun terakhir
  • Jika model dasar open weight terbaik terus datang dari Tiongkok, tool dan inovasi dapat terakumulasi di sekitar model tersebut, seperti yang terjadi pada masa Kubernetes

Empat cara AS bisa bersaing

  • Merilis model AS kelas frontier

    • Laboratorium AS harus merilis model open weight kelas frontier dengan lisensi yang memungkinkan startup membangun produk nyata
    • Sebagian kemajuan sudah terlihat
    • NVIDIA Nemotron dapat digunakan secara komersial di bawah lisensi permisif NVIDIA
    • Inkling dari Thinking Machines, gpt-oss dari OpenAI, dan Gemma 4 dari Google dirilis dengan Apache 2.0
    • Namun model terkuat dari sebagian besar laboratorium frontier AS, termasuk model dengan performa tertinggi dari OpenAI dan Google, masih tertutup
  • Menciptakan pasar terbuka melalui pengadaan pemerintah

    • Pengadaan pemerintah harus menciptakan permintaan untuk sistem dengan portabilitas dan interoperabilitas, bukan sistem yang bergantung selamanya pada satu penyedia API
    • Departemen Pertahanan AS sudah menggunakan pendekatan serupa
    • Platform One menyediakan tool open source dan produk enterprise yang dapat menjadi fondasi bagi berbagai program militer
    • Cara pengadaan yang sama dapat mempercepat inovasi di sekitar model open weight
  • Membangun seluruh stack di luar model

    • Perusahaan AS juga harus membangun lapisan lain di sekitar model
    • Startup dapat mengustomisasi, memperluas, dan menanamkan model ke produk
    • Lapisan serving, tool, dukungan, dan operasional juga menjadi peluang bisnis
    • Perusahaan semikonduktor utama AS dapat terus meningkatkan hardware, sementara hyperscaler dan neocloud dapat melayani model dan ekosistemnya
  • Menerapkan pengujian dan standar, bukan pelarangan

    • Keamanan adalah argumen terkuat yang mendukung pembatasan, tetapi pelarangan menyeluruh terlalu luas dan mengorbankan akses ke seluruh ekosistem
    • Respons yang lebih baik adalah menetapkan pengujian dan standar independen untuk model frontier
    • Uji konformitas Kubernetes memverifikasi kompatibilitas, bukan keamanan, sehingga bukan contoh yang persis cocok untuk AI
    • Namun tolok ukur independen dan model tata kelola dapat dijadikan rujukan
    • Demis Hassabis mengusulkan badan standar independen yang dipimpin AS yang serupa

Strategi bersaing dalam ekosistem AI terbuka

  • AS seharusnya tidak membangun tembok di sekitar developernya sendiri, melainkan menjalankan langsung model Tiongkok, menganalisis bagian dalamnya, melakukan benchmark, dan memperbaikinya
  • Pada saat yang sama, AS harus membangun alternatif buatan AS yang lebih baik agar stack AI AS menjadi pilihan paling mudah diadopsi di dunia
  • Selama puluhan tahun, AS telah menarik talenta teknologi terbaik dunia dan menyediakan ruang bagi mereka untuk berkembang
  • Jika AS mengubah keunggulan ini menjadi ekosistem tertutup sementara negara lain mengadopsi stack yang lebih terbuka sebagai standar, AS akan menyerahkan sendiri posisinya sebagai pemimpin AI

1 komentar

 
GN⁺ 2 jam lalu
Komentar Hacker News
  • Pelarangan model Tiongkok tampaknya mustahil secara teknis. Bobot hanyalah angka, sehingga tidak bisa dibedakan antara buatan AS dan buatan Tiongkok, dan larangan berbasis asal-usul mudah dielakkan
    Pada akhirnya semua model berbobot terbuka harus diatur, dan Axios juga pernah melaporkan bahwa lab AI besar atau pihak terkait memang mengusulkan pelarangan model open source kepada pemerintahan setiap 3–5 bulan
    Bisa saja memaksakan skema lisensi mirip DRM agar hanya model AS yang tersertifikasi yang boleh dijalankan di server sendiri, tetapi itu akan memberi hak monopoli kepada lab besar dan juga menghalangi distribusi model turunan. Penegakannya sulit di luar negeri, sehingga pada akhirnya besar kemungkinan hanya warga AS yang dibatasi

    • Larangan model open source akan cepat berbenturan dengan Amandemen Pertama, seperti yang terjadi pada software. Bendera DeCSS versi modern bisa berbentuk teks seperti “menurut saya bobot yang bagus adalah {...weights go here...}”
      Sebagai gantinya, pembayaran biaya inferensi atau layanan AI kepada perusahaan Tiongkok atau operator yang dimiliki perusahaan Tiongkok bisa dilarang
    • Jika pemerintah AS memasukkan perusahaan model terbuka Tiongkok ke Entity List, semua perusahaan yang berbisnis dengan AS tidak akan bisa bertransaksi dengan mereka. Meski sulit mengidentifikasi asal-usul model secara sempurna, hukumannya berat, sehingga perusahaan AS kemungkinan besar tidak akan menyediakan atau menggunakan model Tiongkok yang jelas, apalagi mencoba jalan memutar
    • Cukup jika lembaga pemerintah membuat daftar model di Hugging Face dan melarang penyediaan akses. Tanpa redaksi hukum yang menakutkan pun, daftar larangan saja akan membuat perusahaan AS dan penyedia hosting tidak menjalankan model tersebut di server mereka
    • Kepatuhan bisa dipaksakan pada perusahaan AS sehingga model diturunkan dari Hugging Face, tetapi jika muncul layanan pengganti di luar negeri, semua orang akan pindah ke sana. Pada akhirnya ini menjadi hasil yang merugikan AS
    • Karena model juga merupakan software, penggunaannya bisa dilarang di lingkungan berjaminan tinggi yang memerlukan sertifikasi FedRAMP. Namun AS tidak memiliki Great Firewall, sehingga mustahil memblokir impor melalui internet itu sendiri
  • Salah satu hal paling aneh di industri AI adalah sistem harga token. Tidak jelas mengapa GPT-4 pada awal 2023 sangat mahal, lalu enam bulan kemudian dengan 20 dolar orang sudah bisa memakai inferensi dalam jumlah cukup besar; harga dari berbagai lab dan penyedia selama bertahun-tahun naik turun tanpa dasar yang jelas
    Model berbobot terbuka setidaknya memberi patokan dasar untuk biaya inferensi, sehingga membuat harga lebih rasional dan lebih mudah diprediksi. Bahkan jika Kimi K3 muncul, pengguna tetap bisa memakai K2 jika mau, jadi tekanan persaingan dan keberlanjutan dari model terbuka berguna bagi pengguna

    • Harga ditentukan pada tingkat yang bisa ditanggung pasar berdasarkan sumber daya komputasi yang tersedia dan kondisi persaingan, dan harus ditemukan dengan mencoba berbagai titik harga. Para penyedia sedang menguji berbagai paket tarif dan diskon, sementara permintaan juga masih berubah-ubah
      Jika terbiasa dengan pasar matang yang stabil, ini mungkin terasa kacau, tetapi fluktuasi harga di pasar baru adalah ciri yang umum
    • Seperti terlihat dari penolakan besar setelah GPT-4o dihentikan seusai peluncuran GPT-5, tiap model punya karakteristik unik, dan untuk sebagian penggunaan, model lama bisa lebih baik daripada model terbaru. Kemampuan untuk terus menjalankan model lama menjadi sangat penting, terutama karena lab tampaknya tidak berniat menyediakan rilis LTS
    • Dampak FlashAttention sangat besar
    • Seperti obat resep yang mahal dan obat generik yang murah, ini bisa jadi penggelembungan harga buatan untuk mengembalikan biaya riset dan pengembangan
    • Patut dipertanyakan apakah harga GPT-4 sendiri benar-benar diturunkan. Versi lama API masih sangat mahal, dan harga turun hanya karena model baru seperti Turbo dirilis
      Meski semuanya memuat gpt-4 dalam namanya, itu tidak berarti model internalnya sama; bisa saja banyak bagian diubah untuk menurunkan biaya layanan
  • Untuk mencapai posisi seperti Kubernetes, model AI dengan data pelatihan yang terbuka perlu dikembangkan bersama oleh beberapa perusahaan. Seperti perusahaan-perusahaan yang bersama-sama berkontribusi pada Linux, model AI diperlukan untuk bisnis tetapi terlalu mahal untuk dikembangkan sendiri, sehingga menggunakan model terbuka dan menyumbangkan fitur yang dibutuhkan bisa menjadi pendekatan yang masuk akal

  • OpenAI juga merilis dua model open source yang sangat baik menurut standar saat itu. Model 20B sangat bagus untuk meninjau teks di rumah atau membuat draf skrip Bash, tetapi 120B sulit dijalankan pada hardware konsumen dengan kecepatan token per detik yang realistis
    Namun, akan bagus jika OpenAI memperbarui model-model ini lebih sering

    • gpt-oss-120b berjalan di atas 30 token per detik pada Strix Halo, dan di atas 75 token per detik pada MacBook Pro M5 Max 128GB
      Penerus spiritualnya tampaknya adalah lini Nemotron 3, tetapi ini juga agak lama: https://research.nvidia.com/labs/nemotron/Nemotron-3/
      Ada juga Gemma 4 yang lebih baru: https://huggingface.co/collections/google/gemma-4
      Atau bisa memilih Qwen3.6: https://huggingface.co/collections/Qwen/qwen36
    • Dua setengah tahun setelah peluncuran GPT-3, Sam Altman menulis dalam email dewan bahwa jika mereka membuat model setara GPT-3 yang berjalan lokal, itu dapat menekan pihak lain agar tidak merilis model setara dan menyulitkan pendanaan bisnis baru
      Tiongkok merilis model terbuka untuk menaikkan tingkat teknologinya, sedangkan OpenAI dan Sam berbeda karena merilisnya dengan tujuan menekan pesaing
    • Model OpenAI memang lumayan, tetapi saat dirilis tidak lebih kompetitif daripada alternatif seperti Qwen3 Coder A3B. Jika sebuah startup, ada alasan kuat memilih Qwen3 yang telah menyediakan beberapa kali pembaruan berbobot terbuka daripada model pertama OpenAI yang tidak punya penerus untuk waktu cukup lama
      Bagi startup yang menginginkan model frontier dari lab AS, siklus rilis saat ini tidak berkelanjutan. Jika AS tidak ingin menyerahkan pasar ini sepenuhnya, OpenAI dan lainnya harus segera mempercepat langkah
  • Hingga Tiongkok memperluas produksi perangkat keras, menjalankannya sendiri belum ekonomis, tetapi fakta bahwa model terbuka memberi tekanan pada lab adalah hal positif. Pada akhirnya, ketika ponsel bisa menjalankan model yang cukup untuk sebagian besar pekerjaan, Apple kemungkinan akan menang

    • Model-on-Chip sedang mendekat. GPU adalah perangkat komputasi serbaguna sehingga ada bottleneck besar untuk inferensi model, tetapi model yang ditanam di chip akan memberikan keuntungan performa yang sangat besar meski tidak bisa diperbarui secara besar-besaran
      Karena tidak membutuhkan proses semikonduktor paling mutakhir, biayanya bisa ditekan drastis
    • Jika itu terjadi, praktis itu akan menjadi akhir bagi hyperscaler dan Oracle, jadi saya menantikan hari itu
    • Berdasarkan harga sebelum gelembung, Strix Halo 128GB memakai sekitar 200W seharga 1.400 dolar AS, dan jika empat unit digabungkan, ia bisa menjalankan model frontier 1 triliun parameter: https://www.amd.com/en/developer/resources/technical-article...
      Jika dihitung setara biaya langganan Claude Code selama 7 bulan per node, investasi kembali dalam 28 bulan; dengan depresiasi 5 tahun, Anda hampir bisa mencapai titik impas untuk dua klaster dan menangani dua alur permintaan bersamaan
      Perangkat keras generasi berikutnya sudah diumumkan dan dijadwalkan rilis sekitar dua siklus Hukum Moore lagi; harga stabilnya kemungkinan di bawah 1.400 dolar dalam nilai 2024 dan lebih cepat
      Ketika gelembung finansial pecah dan pembelian perangkat keras data center oleh lab berhenti, inferensi lokal akan menjadi lebih murah daripada langganan dan sangat praktis. Saya penasaran apakah saat itu UNIX Surplus akan menjual server inferensi dengan harga obral seperti setelah runtuhnya dot-com, atau kebutuhan dayanya terlalu khusus untuk penggunaan rumahan
    • Untuk pekerjaan selain coding, menjalankan model terkuantisasi semalaman dapat memenuhi sebagian besar kebutuhan
    • Saya menjalankan model di desktop rumah dan menggunakannya lewat aplikasi ponsel; tergantung model dan penggunaan, hasilnya 60–140 token per detik. Itu cukup cepat bahkan untuk mempertahankan percakapan suara
  • Ada nilai dalam gagasan bahwa pemerintah sebaiknya menciptakan permintaan dengan mengadakan sistem yang portabel dan interoperabel, alih-alih terikat permanen pada penyedia API tertentu. Ini bisa dilakukan bukan hanya oleh pemerintah federal, tetapi juga pemerintah negara bagian seperti California, Colorado, Illinois, dan New York

  • Saya penasaran dengan konfigurasi nyata untuk coding agentik memakai model berbobot terbuka. Alat eksekusi dan model apa yang dipakai, berapa biaya bulanannya, dan bagaimana dibandingkan dengan paket bersubsidi seperti Claude Code dan Pro?
    Saya ingin memastikan apakah klaim bahwa model terbuka murah dan efisien juga benar dalam praktiknya

    • Dulu saya memakai alat eksekusi kustom, tetapi karena tool makin bagus, konfigurasi saya jauh lebih sederhana. Model dasar pun gagal pada bagian kode yang sulit, jadi saya hanya memanfaatkannya ketika ada peluang yang cocok
      Di Zed saya memakai tiga model lokal: Qwen 3.6 27B dengan konteks 128K di llama.cpp pada satu RTX 3090 berjalan sekitar 50 token/detik; Qwen 3.6 35B-A3B konteks penuh di llama.cpp pada satu Titan V dan dua GTX 1080 Ti berjalan sekitar 30 token/detik; GPT-OSS 120B berjalan lambat di CPU
      Saya memakai agen paralel Zed untuk berpindah tugas, lalu jika model buntu, saya menghentikannya dan memperbaiki kode. Dengan cara ini saya bisa tetap fokus, membuat kode yang dapat dipelihara, dan mencapai sekitar 80% target
      Saya punya pengalaman 30 tahun dan selalu ingin memahami cara kerja kode, jadi saya mendapatkan sebagian besar keuntungan jangka pendek tanpa menyerahkan progres kode kepada pihak ketiga. Dengan dua GTX 5060 Ti 16GB, kartu yang mudah didapat, Qwen 3.6 35B-A3B kemungkinan bisa mencapai sekitar 100 token/detik
      Model cloud terbaru unggul untuk coding umum dengan memakai draft token dan semacamnya, tetapi performanya turun pada pekerjaan khusus domain. Karena ukuran draft model hanya 10–20% dari model dasar dan GPU Blackwell kelas tertinggi pun terbatas sekitar 250 token/detik, penskalaan performa tingkat dasar membutuhkan MoE atau draft model
      Namun penggunaan saya adalah masalah out-of-distribution (OOD) atau masalah yang contohnya sedikit di korpus pelatihan, sehingga optimisasi seperti ini justru merugikan. Ini lebih seperti situasi ketika yang dibutuhkan adalah minivan, bukan Lamborghini
    • Saya memakai Ryzen 5950X, memori 128GB, RTX 3060 12GB, alat eksekusi sendiri, dan qwen 3.6 35B unsloth 4 bit
      Pada konteks 10K, generasi sekitar 40 token/detik dan prefill sekitar 500 token/detik; pada konteks 100K, generasi sekitar 25 token/detik dan prefill sekitar 400 token/detik
      Sering kali saya terlebih dahulu membuat rencana langkah demi langkah yang rinci dengan GPT atau Claude, lalu meminta Qwen mengikutinya. Saya tidak yakin apakah ini ekonomis, tetapi perangkat kerasnya sudah ada dan listrik bukan masalah besar berkat panel surya di atap
      Keuntungan terbesarnya adalah semua pemrosesan dilakukan sepenuhnya lokal, dan saya bisa yakin alat eksekusinya tidak melakukan unggahan atau telemetri jarak jauh
    • Saya memakai Kimi K3 dan OpenCode; dengan tarif API berbasis pemakaian, penggunaan terus-menerus 1–2 sesi menghabiskan sekitar 10 juta token per jam dan sekitar 5 dolar AS
      Saya tidak membandingkannya dengan langganan karena tidak suka batasan dan cara operasional paketnya. Jauh lebih lambat daripada Fable, Opus, dan Gemini, tetapi jauh lebih murah daripada tarif API mereka
    • Saya memakai GLM-5.2 dengan paket Ollama Cloud 20 dolar AS per bulan. Dari paket yang sama saya mendapat beberapa API key untuk server OpenWebUI, OpenCode, dan sesi pengembangan Pi; biasanya 2–4 sesi sekaligus tidak membuat saya terkena batas
      Di kantor, Claude disediakan, dan saya mendapat laporan bahwa biaya penggunaan Opus adalah 75 dolar AS per jam kerja
    • Saya memakai GLM 5.2 awq4 di OpenCode; hasilnya lebih baik daripada Sonnet 4.8 yang disukai perusahaan, sedikit di bawah Opus 4.8, dan cukup untuk sebagian besar pekerjaan yang dibutuhkan tim pengembang. Tidak sebaik Sonnet 5, tetapi tokennya tidak habis
      Sebaliknya, untuk menjalankannya dibutuhkan empat H200, dan dengan konfigurasi ini hanya sekitar tiga pengguna yang bisa melakukan cache konteks
      Saya menantikan kedatangan mesin Blackwell dan bobot Kimi 3 benar-benar dirilis. Pada titik ketika pengembang menghabiskan sebagian besar gajinya untuk token, membeli sendiri server DGX yang sangat mahal, memasangnya di rak, dan mengoperasikannya justru menjadi lebih murah
  • Interpretasi bahwa pemerintah Tiongkok mendukung pelatihan dan publikasi model-model terbaik untuk memberi tekanan kompetitif terbuka pada OpenAI dan Anthropic sulit dipercaya. Sebaliknya, ini terlihat seperti sarana untuk melakukan reinforcement learning pada model-model mutakhir agar sesuai dengan cara penyebaran informasi yang disetujui pemerintah Tiongkok
    Jika harus memercayai sistem tidak transparan yang menjawab pertanyaan, saya akan memilih model perusahaan publik berorientasi laba asal AS yang mendapat tekanan pasar, ketimbang model yang disetujui pemerintah Tiongkok dan disubsidi besar-besaran

    • Ini selaras dengan strategi Tiongkok di pasar lain: melakukan dumping produk untuk menyingkirkan pesaing. Jika mereka merugi besar pada setiap token, pihak lawan juga bisa dengan sengaja meningkatkan konsumsi secara jahat untuk memperbesar biaya
      Dumping barang fisik memiliki permintaan yang terbatas dan biaya lingkungan yang besar, tetapi permintaan perangkat lunak pada dasarnya tak terbatas, dan biaya lingkungannya dibandingkan biaya produksi juga rendah, sehingga memanfaatkan balik dumping AI mungkin saja memungkinkan
    • Saya penasaran alat apa yang tersedia untuk melawan bias dukungan negara pada model-model Tiongkok. Jika individu dapat dengan mudah mengoreksi bias itu, strategi ini tampaknya tidak terlalu cerdas
  • Mereka menerima asumsi bahwa Tiongkok akan terus mengunggah bobot model frontier ke Hugging Face seolah-olah itu hukum alam. Namun momen Mythos Tiongkok tinggal beberapa bulan lagi, dan menurut berbagai laporan, Tiongkok kemungkinan besar akan merespons dengan cara serupa
    Sulit dipercaya bahwa Tiongkok akan mengunggah penerus Mythos ke Hugging Face dan membiarkan semua orang menghapus pengamannya. Situasinya tidak berjalan sesuai prediksi OpenAI dan Anthropic, maupun sesuai prediksi Tiongkok