- Model open weight dengan performa dan portabilitas yang memadai dapat menjadi fondasi yang dikembangkan bersama oleh developer, cloud, dan perusahaan, sehingga menciptakan ekosistem inovasi yang sulit diikuti oleh satu vendor tunggal
- Seperti Kubernetes yang menarik tool networking, storage, dan observability ke atas antarmuka bersama, di AI juga sedang tumbuh stack produksi yang mencakup model serving, fine-tuning, runtime agen, dan evaluasi
- Model publik di Hugging Face telah melampaui 2 juta; GLM-5.2 mencatat 62,1% dalam evaluasi SWE-bench Pro internalnya, mengungguli GPT-5.5 yang mencatat 58,6%, sementara Kimi K3 juga mendapat skor serupa dengan Opus 4.8 dan GPT-5.5 dalam evaluasi independen
- Jika model open weight buatan Tiongkok dilarang secara luas, pengembangan global akan tetap berjalan sementara hanya peneliti dan perusahaan AS yang tersisih dari ekosistem, dan inovasi dapat terakumulasi di sekitar model-model Tiongkok yang menyumbang 41% unduhan Hugging Face selama setahun terakhir
- AS harus bersaing bukan lewat pelarangan, melainkan dengan merilis model frontier yang dapat digunakan secara komersial, pengadaan pemerintah yang menekankan portabilitas dan interoperabilitas, pembangunan seluruh lapisan tool dan operasional, serta uji keamanan dan standar independen
Kekuatan platform terbuka yang ditunjukkan Kubernetes
- Mesosphere mengembangkan software cloud-native open source berbasis Apache Mesos, lalu membangun DC/OS di sekitarnya dan mengomersialkannya sebagai distribusi enterprise yang mencakup dukungan dan fitur proprietari
- Kemudian Kubernetes, proyek open source yang lebih baru dan lebih lengkap, menyatukan komunitas cloud-native dan mengguncang Mesosphere
- Para engineer sistem terdistribusi dan infrastruktur kelas dunia mempertaruhkan karier mereka pada Kubernetes, dan sebagian anggota komunitas loyal Mesosphere pun ikut berpindah
- Ketika pusat inovasi bergeser ke Kubernetes, komponen yang sebelumnya kurang—seperti networking, storage, observability, tool deployment, dan policy engine—berkembang dengan cepat
- Dengan keterlibatan banyak startup dan vendor lama, hampir semua komponen yang dibutuhkan untuk menjalankan Kubernetes di produksi tersedia sebagai open source
- Penyedia cloud serta Mesosphere/D2iQ, Rancher, Red Hat, dan Nutanix membangun bisnis di sekitar integrasi, fitur enterprise, dukungan, dan operasional
- Keberhasilan Kubernetes bukan sekadar hasil dari membuka repository
- Ia menjadi fondasi netral yang dapat diperluas oleh engineer, penyedia cloud, dan vendor enterprise sesuai kebutuhan pelanggan
- Antarmuka bersama dan tata kelola yang netral terhadap vendor memberi peserta kepercayaan bahwa mereka dapat membangun produk untuk jangka panjang
- Ketika platform terbuka yang dapat dikustomisasi menjadi pusat industri, sulit bagi satu vendor tunggal untuk mengikuti laju inovasi gabungan seluruh ekosistem
Perbedaan antara open weight dan AI open source
- Sebagian besar model yang sering disebut open source sebenarnya lebih tepat disebut model open weight
- Parameter yang sudah dilatih dapat diunduh dan dimodifikasi, tetapi data pelatihan dan seluruh proses pelatihan biasanya tidak dibuka
- Karena itu, model tersebut belum memenuhi definisi AI open source dari Open Source Initiative
- Meski bukan open source sepenuhnya, ekosistem tetap dapat terbentuk di sekitar artefak yang dapat dijalankan dan dimodifikasi oleh pengguna
- Ada juga perbedaan penting antara struktur Kubernetes dan AI
- Kontributor Kubernetes dapat memeriksa dan mengubah source code nyata, lalu memasukkan perbaikan ke proyek upstream bersama
- Hasil fine-tuning model umumnya tidak dibagikan dengan cara yang sama
- Sekalipun weight model frontier dapat diunduh, menjalankannya bisa membutuhkan hardware mahal
- Di AI belum ada organisasi seperti CNCF yang menyediakan tata kelola netral dan antarmuka bersama
- Kesamaan kedua ekosistem ini adalah bahwa fondasi dengan performa dan portabilitas memadai menarik inovasi pelengkap yang melampaui apa yang dapat dibuat sendirian oleh pencipta aslinya
Dari self-hosting ke platform model
- Alasan pertama mengadopsi model open weight adalah self-hosting
- Perusahaan ingin menjalankan model di cloud atau data center mereka sendiri sambil tetap mengontrol data secara langsung
- Seiring meningkatnya penggunaan dan biaya inferensi, kebutuhan untuk mengontrol biaya secara langsung juga tumbuh
- Berdasarkan kebutuhan ini, terbentuk stack model serving open source seperti vLLM, SGLang, llama.cpp, Ollama, dan MLX
- Open weight memungkinkan developer tidak hanya melakukan self-hosting, tetapi juga memodifikasi dan mendistribusikan ulang model itu sendiri
- Di Hugging Face, terdapat lebih dari 2 juta model publik
- Di sekitar keluarga model populer seperti Qwen dan Gemma, berbagai artefak turunan dibuat
- Weight terkuantisasi dan terkonversi untuk berbagai arsitektur semikonduktor dan skala
- Model fine-tuned dan adapter LoRA untuk coding, kedokteran, hukum, matematika, dan workflow agen
- Penggabungan model yang mengombinasikan hasil fine-tuning yang berbeda
- Varian model yang disesuaikan untuk berbagai runtime seperti TensorRT-LLM, vLLM, dan MLX
Frontier dan kesenjangan performa yang menyempit
- Di masa lalu, performa dasar model terbuka kurang memadai untuk tugas coding dan agen yang paling sulit, sehingga mudah dikesampingkan dari persaingan frontier; namun kesenjangan itu menyempit dengan cepat
- Z.ai merilis GLM-5.2, yang menyediakan weight terbuka dengan lisensi MIT
- Skor SWE-bench Pro dalam evaluasi internalnya adalah 62,1%, lebih tinggi daripada GPT-5.5 yang mencatat 58,6%
- Namun hasil dapat berbeda tergantung benchmark dan agent harness
- Moonshot menyatakan Kimi K3 mendekati model frontier tertutup dalam tugas coding jangka panjang dan menjanjikan rilis weight pada 27 Juli
- Dalam evaluasi independen Artificial Analysis, Kimi K3 juga mendapat skor serupa dengan Opus 4.8 dan GPT-5.5
- Ketika performa model dasar sudah cukup, runtime agen, coding harness, sandbox, evaluasi, observability, dan proyek fine-tuning khusus dapat tumbuh secara berantai
- Komponen-komponen ini membentuk stack terbuka kelas produksi yang dapat disesuaikan dengan beban kerja, hardware, dan struktur biaya tim
- Strukturnya adalah menjalankan model open weight di atas software open source
- Tidak ada jaminan bahwa ia mengalahkan semua model tertutup di semua benchmark
- AI frontier adalah persaingan talenta, dan ekosistem terbuka memberi talenta dari seluruh dunia alasan untuk mengembangkan di atas fondasi yang sama
Dampak pelarangan model Tiongkok terhadap AS
- Setelah munculnya model Tiongkok yang kuat seperti Kimi K3, pemerintahan Trump dikabarkan sedang mempertimbangkan pembatasan terhadap model open weight buatan Tiongkok
- Bentuk larangan potensial tersebut masih belum jelas
- Jika penggunaan model open weight buatan Tiongkok dilarang secara luas, peneliti dan perusahaan AS dapat memisahkan diri dari ekosistem tempat berkumpulnya peneliti dan engineer AI global
- Banyak peneliti Tiongkok juga berpartisipasi dalam ekosistem ini
- Aktivitas pengembangan global akan tetap berlanjut, tetapi hanya developer AS yang kehilangan akses
- Di sekitar Qwen, pola yang sama sudah terlihat
- Berdasarkan Hugging Face, model Tiongkok menyumbang 41% dari seluruh unduhan model selama setahun terakhir
- Jika model dasar open weight terbaik terus datang dari Tiongkok, tool dan inovasi dapat terakumulasi di sekitar model tersebut, seperti yang terjadi pada masa Kubernetes
Empat cara AS bisa bersaing
-
Merilis model AS kelas frontier
- Laboratorium AS harus merilis model open weight kelas frontier dengan lisensi yang memungkinkan startup membangun produk nyata
- Sebagian kemajuan sudah terlihat
- NVIDIA Nemotron dapat digunakan secara komersial di bawah lisensi permisif NVIDIA
- Inkling dari Thinking Machines, gpt-oss dari OpenAI, dan Gemma 4 dari Google dirilis dengan Apache 2.0
- Namun model terkuat dari sebagian besar laboratorium frontier AS, termasuk model dengan performa tertinggi dari OpenAI dan Google, masih tertutup
-
Menciptakan pasar terbuka melalui pengadaan pemerintah
- Pengadaan pemerintah harus menciptakan permintaan untuk sistem dengan portabilitas dan interoperabilitas, bukan sistem yang bergantung selamanya pada satu penyedia API
- Departemen Pertahanan AS sudah menggunakan pendekatan serupa
- Platform One menyediakan tool open source dan produk enterprise yang dapat menjadi fondasi bagi berbagai program militer
- Cara pengadaan yang sama dapat mempercepat inovasi di sekitar model open weight
-
Membangun seluruh stack di luar model
- Perusahaan AS juga harus membangun lapisan lain di sekitar model
- Startup dapat mengustomisasi, memperluas, dan menanamkan model ke produk
- Lapisan serving, tool, dukungan, dan operasional juga menjadi peluang bisnis
- Perusahaan semikonduktor utama AS dapat terus meningkatkan hardware, sementara hyperscaler dan neocloud dapat melayani model dan ekosistemnya
-
Menerapkan pengujian dan standar, bukan pelarangan
- Keamanan adalah argumen terkuat yang mendukung pembatasan, tetapi pelarangan menyeluruh terlalu luas dan mengorbankan akses ke seluruh ekosistem
- Respons yang lebih baik adalah menetapkan pengujian dan standar independen untuk model frontier
- Uji konformitas Kubernetes memverifikasi kompatibilitas, bukan keamanan, sehingga bukan contoh yang persis cocok untuk AI
- Namun tolok ukur independen dan model tata kelola dapat dijadikan rujukan
- Demis Hassabis mengusulkan badan standar independen yang dipimpin AS yang serupa
Strategi bersaing dalam ekosistem AI terbuka
- AS seharusnya tidak membangun tembok di sekitar developernya sendiri, melainkan menjalankan langsung model Tiongkok, menganalisis bagian dalamnya, melakukan benchmark, dan memperbaikinya
- Pada saat yang sama, AS harus membangun alternatif buatan AS yang lebih baik agar stack AI AS menjadi pilihan paling mudah diadopsi di dunia
- Selama puluhan tahun, AS telah menarik talenta teknologi terbaik dunia dan menyediakan ruang bagi mereka untuk berkembang
- Jika AS mengubah keunggulan ini menjadi ekosistem tertutup sementara negara lain mengadopsi stack yang lebih terbuka sebagai standar, AS akan menyerahkan sendiri posisinya sebagai pemimpin AI
1 komentar
Komentar Hacker News
Pelarangan model Tiongkok tampaknya mustahil secara teknis. Bobot hanyalah angka, sehingga tidak bisa dibedakan antara buatan AS dan buatan Tiongkok, dan larangan berbasis asal-usul mudah dielakkan
Pada akhirnya semua model berbobot terbuka harus diatur, dan Axios juga pernah melaporkan bahwa lab AI besar atau pihak terkait memang mengusulkan pelarangan model open source kepada pemerintahan setiap 3–5 bulan
Bisa saja memaksakan skema lisensi mirip DRM agar hanya model AS yang tersertifikasi yang boleh dijalankan di server sendiri, tetapi itu akan memberi hak monopoli kepada lab besar dan juga menghalangi distribusi model turunan. Penegakannya sulit di luar negeri, sehingga pada akhirnya besar kemungkinan hanya warga AS yang dibatasi
Sebagai gantinya, pembayaran biaya inferensi atau layanan AI kepada perusahaan Tiongkok atau operator yang dimiliki perusahaan Tiongkok bisa dilarang
Salah satu hal paling aneh di industri AI adalah sistem harga token. Tidak jelas mengapa GPT-4 pada awal 2023 sangat mahal, lalu enam bulan kemudian dengan 20 dolar orang sudah bisa memakai inferensi dalam jumlah cukup besar; harga dari berbagai lab dan penyedia selama bertahun-tahun naik turun tanpa dasar yang jelas
Model berbobot terbuka setidaknya memberi patokan dasar untuk biaya inferensi, sehingga membuat harga lebih rasional dan lebih mudah diprediksi. Bahkan jika Kimi K3 muncul, pengguna tetap bisa memakai K2 jika mau, jadi tekanan persaingan dan keberlanjutan dari model terbuka berguna bagi pengguna
Jika terbiasa dengan pasar matang yang stabil, ini mungkin terasa kacau, tetapi fluktuasi harga di pasar baru adalah ciri yang umum
Meski semuanya memuat
gpt-4dalam namanya, itu tidak berarti model internalnya sama; bisa saja banyak bagian diubah untuk menurunkan biaya layananUntuk mencapai posisi seperti Kubernetes, model AI dengan data pelatihan yang terbuka perlu dikembangkan bersama oleh beberapa perusahaan. Seperti perusahaan-perusahaan yang bersama-sama berkontribusi pada Linux, model AI diperlukan untuk bisnis tetapi terlalu mahal untuk dikembangkan sendiri, sehingga menggunakan model terbuka dan menyumbangkan fitur yang dibutuhkan bisa menjadi pendekatan yang masuk akal
OpenAI juga merilis dua model open source yang sangat baik menurut standar saat itu. Model 20B sangat bagus untuk meninjau teks di rumah atau membuat draf skrip Bash, tetapi 120B sulit dijalankan pada hardware konsumen dengan kecepatan token per detik yang realistis
Namun, akan bagus jika OpenAI memperbarui model-model ini lebih sering
gpt-oss-120bberjalan di atas 30 token per detik pada Strix Halo, dan di atas 75 token per detik pada MacBook Pro M5 Max 128GBPenerus spiritualnya tampaknya adalah lini Nemotron 3, tetapi ini juga agak lama: https://research.nvidia.com/labs/nemotron/Nemotron-3/
Ada juga Gemma 4 yang lebih baru: https://huggingface.co/collections/google/gemma-4
Atau bisa memilih Qwen3.6: https://huggingface.co/collections/Qwen/qwen36
Tiongkok merilis model terbuka untuk menaikkan tingkat teknologinya, sedangkan OpenAI dan Sam berbeda karena merilisnya dengan tujuan menekan pesaing
Bagi startup yang menginginkan model frontier dari lab AS, siklus rilis saat ini tidak berkelanjutan. Jika AS tidak ingin menyerahkan pasar ini sepenuhnya, OpenAI dan lainnya harus segera mempercepat langkah
Hingga Tiongkok memperluas produksi perangkat keras, menjalankannya sendiri belum ekonomis, tetapi fakta bahwa model terbuka memberi tekanan pada lab adalah hal positif. Pada akhirnya, ketika ponsel bisa menjalankan model yang cukup untuk sebagian besar pekerjaan, Apple kemungkinan akan menang
Karena tidak membutuhkan proses semikonduktor paling mutakhir, biayanya bisa ditekan drastis
Jika dihitung setara biaya langganan Claude Code selama 7 bulan per node, investasi kembali dalam 28 bulan; dengan depresiasi 5 tahun, Anda hampir bisa mencapai titik impas untuk dua klaster dan menangani dua alur permintaan bersamaan
Perangkat keras generasi berikutnya sudah diumumkan dan dijadwalkan rilis sekitar dua siklus Hukum Moore lagi; harga stabilnya kemungkinan di bawah 1.400 dolar dalam nilai 2024 dan lebih cepat
Ketika gelembung finansial pecah dan pembelian perangkat keras data center oleh lab berhenti, inferensi lokal akan menjadi lebih murah daripada langganan dan sangat praktis. Saya penasaran apakah saat itu UNIX Surplus akan menjual server inferensi dengan harga obral seperti setelah runtuhnya dot-com, atau kebutuhan dayanya terlalu khusus untuk penggunaan rumahan
Ada nilai dalam gagasan bahwa pemerintah sebaiknya menciptakan permintaan dengan mengadakan sistem yang portabel dan interoperabel, alih-alih terikat permanen pada penyedia API tertentu. Ini bisa dilakukan bukan hanya oleh pemerintah federal, tetapi juga pemerintah negara bagian seperti California, Colorado, Illinois, dan New York
Saya penasaran dengan konfigurasi nyata untuk coding agentik memakai model berbobot terbuka. Alat eksekusi dan model apa yang dipakai, berapa biaya bulanannya, dan bagaimana dibandingkan dengan paket bersubsidi seperti Claude Code dan Pro?
Saya ingin memastikan apakah klaim bahwa model terbuka murah dan efisien juga benar dalam praktiknya
Di Zed saya memakai tiga model lokal: Qwen 3.6 27B dengan konteks 128K di
llama.cpppada satu RTX 3090 berjalan sekitar 50 token/detik; Qwen 3.6 35B-A3B konteks penuh dillama.cpppada satu Titan V dan dua GTX 1080 Ti berjalan sekitar 30 token/detik; GPT-OSS 120B berjalan lambat di CPUSaya memakai agen paralel Zed untuk berpindah tugas, lalu jika model buntu, saya menghentikannya dan memperbaiki kode. Dengan cara ini saya bisa tetap fokus, membuat kode yang dapat dipelihara, dan mencapai sekitar 80% target
Saya punya pengalaman 30 tahun dan selalu ingin memahami cara kerja kode, jadi saya mendapatkan sebagian besar keuntungan jangka pendek tanpa menyerahkan progres kode kepada pihak ketiga. Dengan dua GTX 5060 Ti 16GB, kartu yang mudah didapat, Qwen 3.6 35B-A3B kemungkinan bisa mencapai sekitar 100 token/detik
Model cloud terbaru unggul untuk coding umum dengan memakai draft token dan semacamnya, tetapi performanya turun pada pekerjaan khusus domain. Karena ukuran draft model hanya 10–20% dari model dasar dan GPU Blackwell kelas tertinggi pun terbatas sekitar 250 token/detik, penskalaan performa tingkat dasar membutuhkan MoE atau draft model
Namun penggunaan saya adalah masalah out-of-distribution (OOD) atau masalah yang contohnya sedikit di korpus pelatihan, sehingga optimisasi seperti ini justru merugikan. Ini lebih seperti situasi ketika yang dibutuhkan adalah minivan, bukan Lamborghini
qwen 3.6 35B unsloth 4 bitPada konteks 10K, generasi sekitar 40 token/detik dan prefill sekitar 500 token/detik; pada konteks 100K, generasi sekitar 25 token/detik dan prefill sekitar 400 token/detik
Sering kali saya terlebih dahulu membuat rencana langkah demi langkah yang rinci dengan GPT atau Claude, lalu meminta Qwen mengikutinya. Saya tidak yakin apakah ini ekonomis, tetapi perangkat kerasnya sudah ada dan listrik bukan masalah besar berkat panel surya di atap
Keuntungan terbesarnya adalah semua pemrosesan dilakukan sepenuhnya lokal, dan saya bisa yakin alat eksekusinya tidak melakukan unggahan atau telemetri jarak jauh
Saya tidak membandingkannya dengan langganan karena tidak suka batasan dan cara operasional paketnya. Jauh lebih lambat daripada Fable, Opus, dan Gemini, tetapi jauh lebih murah daripada tarif API mereka
Di kantor, Claude disediakan, dan saya mendapat laporan bahwa biaya penggunaan Opus adalah 75 dolar AS per jam kerja
GLM 5.2 awq4di OpenCode; hasilnya lebih baik daripada Sonnet 4.8 yang disukai perusahaan, sedikit di bawah Opus 4.8, dan cukup untuk sebagian besar pekerjaan yang dibutuhkan tim pengembang. Tidak sebaik Sonnet 5, tetapi tokennya tidak habisSebaliknya, untuk menjalankannya dibutuhkan empat H200, dan dengan konfigurasi ini hanya sekitar tiga pengguna yang bisa melakukan cache konteks
Saya menantikan kedatangan mesin Blackwell dan bobot Kimi 3 benar-benar dirilis. Pada titik ketika pengembang menghabiskan sebagian besar gajinya untuk token, membeli sendiri server DGX yang sangat mahal, memasangnya di rak, dan mengoperasikannya justru menjadi lebih murah
Interpretasi bahwa pemerintah Tiongkok mendukung pelatihan dan publikasi model-model terbaik untuk memberi tekanan kompetitif terbuka pada OpenAI dan Anthropic sulit dipercaya. Sebaliknya, ini terlihat seperti sarana untuk melakukan reinforcement learning pada model-model mutakhir agar sesuai dengan cara penyebaran informasi yang disetujui pemerintah Tiongkok
Jika harus memercayai sistem tidak transparan yang menjawab pertanyaan, saya akan memilih model perusahaan publik berorientasi laba asal AS yang mendapat tekanan pasar, ketimbang model yang disetujui pemerintah Tiongkok dan disubsidi besar-besaran
Dumping barang fisik memiliki permintaan yang terbatas dan biaya lingkungan yang besar, tetapi permintaan perangkat lunak pada dasarnya tak terbatas, dan biaya lingkungannya dibandingkan biaya produksi juga rendah, sehingga memanfaatkan balik dumping AI mungkin saja memungkinkan
Mereka menerima asumsi bahwa Tiongkok akan terus mengunggah bobot model frontier ke Hugging Face seolah-olah itu hukum alam. Namun momen Mythos Tiongkok tinggal beberapa bulan lagi, dan menurut berbagai laporan, Tiongkok kemungkinan besar akan merespons dengan cara serupa
Sulit dipercaya bahwa Tiongkok akan mengunggah penerus Mythos ke Hugging Face dan membiarkan semua orang menghapus pengamannya. Situasinya tidak berjalan sesuai prediksi OpenAI dan Anthropic, maupun sesuai prediksi Tiongkok