- OpenAI meningkatkan performa per dolar untuk AI perusahaan dengan merefleksikan peningkatan efisiensi pada model, sistem inferensi, dan harness agen ke harga serta kecepatan pemrosesan
- Mulai 30 Juli, harga Luna turun 80% dan Terra 20%; pada API per 1 juta token, Luna dikenai input $0.20 dan output $1.20, sedangkan Terra input $2 dan output $12
- Luna memberikan performa setara model mutakhir sekitar setahun lalu dengan biaya sekitar 6% per tugas dan kecepatan hampir 9 kali lebih cepat; di Agents’ Last Exam, Luna mencatat performa lebih tinggi daripada Fable 5 dengan perkiraan biaya per tugas sekitar 99% lebih rendah
- Fast mode pada GPT‑5.6 Sol menggantikan Priority Processing, dan menawarkan kecepatan hingga 2,5 kali lebih cepat dibanding Standard dengan harga 2 kali lipat sambil mempertahankan tingkat kecerdasan
- Perusahaan dapat menyesuaikan keseimbangan kecerdasan, kecepatan, dan biaya melalui evaluasi bertahap, misalnya memakai Sol untuk perencanaan dan mengurai ketidakpastian, lalu Luna untuk implementasi dan pengujian yang sudah jelas
Penurunan harga Luna·Terra dan peningkatan kecepatan Sol
- Peningkatan efisiensi eksekusi GPT‑5.6 berujung pada penurunan harga Luna·Terra dan peningkatan kecepatan pemrosesan API Sol
- Luna, model tercepat dan termurah, turun 80%, sedangkan Terra, model seimbang untuk pekerjaan sehari-hari, turun 20%
- Pada langganan berbayar Codex dan ChatGPT Work, penggunaan kedua model juga dihitung dengan kredit yang lebih sedikit
- Harga langganan dan anggaran kuota itu sendiri tidak berubah
- Luna dapat menggunakan alat untuk menyelesaikan workflow multi-tahap, sehingga menurunkan biaya operasional untuk pekerjaan berskala besar yang membutuhkan kualitas tinggi
- Harga Sol tidak berubah
Memilih model sesuai hasil kerja
- Untuk menggunakan AI secara efisien, perlu menyeimbangkan kecerdasan, kecepatan, keandalan, dan biaya sesuai dengan tingkat pentingnya tugas, biaya kesalahan, urgensi, dan skala
- Bahkan dalam workflow yang sama, titik optimal bisa berbeda di tiap tahap
- Luna menawarkan performa setara model mutakhir sekitar setahun lalu dengan biaya sekitar 6% per tugas dan kecepatan hampir 9 kali lebih cepat
- Dalam Agents’ Last Exam yang mengukur pekerjaan profesional, Luna menunjukkan performa lebih tinggi daripada Fable 5 sambil memangkas estimasi biaya per tugas sekitar 99%
- Perusahaan dapat lebih dulu menetapkan hasil dan standar kualitas yang dibutuhkan, lalu melalui evaluasi membedakan bagian di mana kecerdasan tambahan benar-benar meningkatkan hasil dan bagian di mana pemrosesan berbiaya rendah tetap memberi kualitas yang sama
- Dalam workflow coding, Sol dapat mengurai ketidakpastian dan menyusun rencana
- Implementasi perubahan yang sudah didefinisikan dengan jelas, penulisan dan eksekusi pengujian, serta evaluasi hasil dapat ditangani Luna
- Keluarga GPT‑5.6 memperluas pilihan untuk menerapkan tingkat kecerdasan yang diperlukan di tiap tahap dan membayar biaya yang sesuai dengan nilai yang dihasilkan
Peningkatan efisiensi dari model hingga agen
- Peningkatan efisiensi terjadi bersama-sama pada model, sistem inferensi yang menjalankan model, dan harness agen yang menghubungkan alat serta konteks
- Model GPT‑5.6 memproses tugas melalui jalur yang lebih langsung
- Routing yang ditingkatkan meningkatkan pemanfaatan perangkat keras
- Perangkat lunak produksi yang dioptimalkan menghasilkan token dengan lebih efisien
- Manajemen konteks yang ditingkatkan membantu agen agar tidak mengulang pekerjaan yang sudah selesai
- Dengan sumber daya komputasi yang sama, lebih banyak pekerjaan berguna dapat diselesaikan sehingga waktu, token, dan biaya per hasil menurun
Optimasi tambahan yang didukung Sol
- Dalam proses yang dipandu manusia, GPT‑5.6 Sol secara otonom menulis ulang dan mengoptimalkan kernel produksi
- Sol merancang dan menjalankan ratusan eksperimen untuk meningkatkan generasi token, serta memantau pelatihan dan melakukan intervensi saat muncul masalah
- Pekerjaan pada kernel menurunkan biaya end-to-end penyediaan model sebesar 20%, sementara eksperimen juga meningkatkan efisiensi generasi token lebih dari 15%
- Seiring meningkatnya performa dan otonomi model, terbentuk loop umpan balik yang mempercepat penemuan peningkatan efisiensi berikutnya
- Proses rekayasa terkait dapat dilihat di pengantar peningkatan efisiensi GPT‑5.6
Strategi komputasi yang menopang skalabilitas
- Untuk memenuhi permintaan besar akan kecerdasan yang melimpah, dibutuhkan bukan hanya lebih banyak sumber daya komputasi tetapi juga komputasi dengan produktivitas tinggi
- OpenAI membangun portofolio infrastruktur yang tangguh dan menempatkan tiap workload pada sistem yang paling sesuai untuk mengeksekusinya
- Dengan penurunan harga Luna dan Terra, pekerjaan volume besar dapat dioperasikan secara ekonomis dalam skala yang lebih besar
- Fast mode menyediakan akses API yang lebih cepat untuk pekerjaan Sol yang sensitif terhadap waktu respons
- Kelayakan ekonomi meningkat untuk menjalankan analisis dokumen skala besar, klasifikasi interaksi pelanggan, dan pekerjaan implementasi berulang secara luas
- Workload Sol yang kompleks dapat diproses lebih cepat ketika kecepatan cukup penting untuk membenarkan biaya tambahan
- Model yang lebih kuat membantu peningkatan lanjutan oleh tim teknis, sehingga mempersingkat waktu yang dibutuhkan untuk meningkatkan performa dan menurunkan biaya
Cara kerja dan kompatibilitas Fast mode
- Fast mode pada API menggantikan Priority Processing dan berpadanan dengan
/fastdi Codex - Pada GPT‑5.6 Sol, mode ini menawarkan kecepatan hingga 2,5 kali lebih cepat daripada pemrosesan Standard dengan harga 2 kali lipat tanpa mengubah tingkat kecerdasan
- Kompatibilitas mundur tetap dipertahankan, sehingga permintaan API yang sudah ada dengan tag
priorityakan tetap berfungsi
Cakupan ketersediaan dan tarif API
- GPT‑5.6 Terra dan Luna tetap tersedia di ChatGPT Work, Codex, OpenAI API
- Pengguna Free dan Go di ChatGPT Work dan Codex dapat mengakses Terra
- Pengguna Plus, Pro, Business, dan Enterprise dapat memilih Terra dan Luna
- Mulai 30 Juli, harga API per 1 juta token adalah sebagai berikut
- Terra: input $2, output $12
- Luna: input $0.20, output $1.20
- Harga langganan dan anggaran kuota di ChatGPT dan Codex tetap dipertahankan, tetapi kredit yang dikonsumsi saat menggunakan Terra dan Luna berkurang
- Di AWS, perubahan harga diterapkan secara bertahap mulai lebih larut pada 30 Juli
- Tarif lengkap dapat dilihat di informasi harga API
1 komentar
Komentar Hacker News
Kutipan John Wanamaker, “Separuh dari biaya iklan terbuang, tetapi kita tidak tahu separuh yang mana,” lebih cocok untuk pemilihan model. Kita tahu sebagian besar pekerjaan tidak memerlukan model yang kuat, tetapi membedakan pekerjaan sederhana dan pekerjaan sulit itu sendiri adalah masalah yang sulit dipecahkan, bahkan mungkin tidak dapat diputuskan
HN bisa saja dijalankan seperti BBS dengan hardware era 1970-an, tetapi kenyataannya kita memakai CPU dengan sekitar 10 miliar transistor, bukan sekitar 10 ribu, untuk melakukan hal yang pada dasarnya sama, tanpa terlalu memikirkannya
Pernyataan “mulai hari ini, kami menurunkan biaya GPT‑5.6 Luna, model tercepat dan termurah kami, sebesar 80%” membuat saya kehabisan kata-kata. Saya kira kita sudah memasuki fase stagnan dengan peningkatan 5–10% selama berbulan-bulan, tetapi perubahan sedrastis ini membuat saya bertanya-tanya di mana batas bawah harga sebenarnya
Klaster GPU dinamis akan dipakai untuk 5% sisanya dan untuk memperluas batas paling mutakhir, sementara pekerjaan yang saat ini terlalu sulit bagi kebanyakan pekerja pengetahuan sehingga tidak dilakukan juga akan mulai ditangani
Jika ini benar-benar peningkatan efisiensi, tampaknya ada harga yang harus dibayar seperti kualitas menurun akibat kuantisasi agresif atau kompresi KV cache
Seiring token makin cepat dan murah setiap tahun, pabrik AI yang meniru tim ahli serta paralelisme yang jauh lebih tinggi akan menjadi nyata
Mengejutkan bahwa Luna, yang sudah murah dan berkinerja bagus, dibuat 5 kali lebih murah lagi. Di kantor saya memakai Sol, di rumah memakai Luna; perbedaannya jelas, tetapi tidak luar biasa besar. Selama setahun harga terus naik, lalu dengan hadirnya Luna, Kimi K3, dan GLM 5.2 rasanya kembali turun
OpenAI dan Anthropic juga menaikkan harga selama berbulan-bulan, lalu lab AS melakukan pemangkasan harga besar-besaran, jadi ini justru tampak seperti arah yang berlawanan
Mereka mengatakan “pekerjaan kernel mengurangi biaya end-to-end penyediaan model sebesar 20%, dan eksperimen meningkatkan efisiensi pembuatan token lebih dari 15%.” Jika biaya penyediaan GPT-5.6 turun 20%, apakah itu berarti menghemat miliaran dolar per bulan?
Menurut materi IPO SpaceX, Anthropic menghabiskan 1,25 miliar dolar untuk menyewa kapasitas inferensi di dua pusat data Colossus, tetapi jika mempertimbangkan kapasitas yang sudah ada seperti AWS, kita tidak tahu berapa porsi itu dari total. Biaya inferensi bulanan OpenAI juga kemungkinan besar berskala miliaran dolar, jadi penghematan 20% adalah perubahan yang sangat besar
Perubahan ini terasa seperti transisi dari dial-up ke broadband. Saya sudah sangat merekomendasikan Luna untuk riset mendalam, dan fakta bahwa dengan biaya yang sama kita bisa menjalankannya 5 kali lebih banyak itu luar biasa
Saat ini pun saya menjalankan 10 agen secara paralel untuk menghasilkan hipotesis, dan 50 agen sulit dibayangkan. Jika menjalankan prompt dan model yang sama puluhan kali tidak terlalu membebani biaya, statistiknya akan jauh lebih menarik dan kuat
Harga baru Luna di luar dugaan, dan tampaknya tidak ada produk di pasar yang bisa menandingi rasio harga terhadap performa ini
Untuk aplikasi produksi, OpenAI kini jelas penyedia terbaik. API-nya stabil, fiturnya kaya, dan rasio harga terhadap performa di seluruh model juga sangat bagus. Saya sudah lama memakai model open weight seperti Kimi K2.5 di Fireworks, tetapi ada masalah sesekali, begitu juga Anthropic dan Google. OpenAI cepat dan menunjukkan rasio harga terhadap performa yang lebih baik di hampir semua tingkat kecerdasan
Biasanya saya memeriksa grafik harga terhadap performa OpenRouter dan mengaktifkan
"Show Pareto"di sebelah kanan. Untuk proyek pribadi saya masih memakai GLM-5.2, tetapi sekarang Luna menjadi pilihan yang mudahPemangkasan harga 80% Luna sangat agresif. Untuk sebagian besar pekerjaan yang tidak memerlukan kecerdasan paling mutakhir, ini pilihan yang luar biasa bagus, dan ada kalanya Luna bisa menandingi Opus 5
xhighpada Sol danmaxpada Luna. Sol lebih memahami prompt, sementara Luna harus diberi instruksi yang lebih spesifik dan jelasSaya sudah membayar di muka banyak token DeepSeek v4 flash, dan setelah habis saya ingin mencoba membeli token Luna untuk sementara. Saya lebih suka model yang murah dan cepat, dan karena sudah pensiun, tidak masalah jika sesekali butuh waktu untuk beralih sendiri ke model yang lebih kuat
Mengejutkan bahwa Luna menjadi 80% lebih murah. Karena biaya komputasi terus turun, tahun depan biaya penggunaan API untuk model kuat mungkin lebih murah daripada biaya langganan