1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • OpenAI meningkatkan performa per dolar untuk AI perusahaan dengan merefleksikan peningkatan efisiensi pada model, sistem inferensi, dan harness agen ke harga serta kecepatan pemrosesan
  • Mulai 30 Juli, harga Luna turun 80% dan Terra 20%; pada API per 1 juta token, Luna dikenai input $0.20 dan output $1.20, sedangkan Terra input $2 dan output $12
  • Luna memberikan performa setara model mutakhir sekitar setahun lalu dengan biaya sekitar 6% per tugas dan kecepatan hampir 9 kali lebih cepat; di Agents’ Last Exam, Luna mencatat performa lebih tinggi daripada Fable 5 dengan perkiraan biaya per tugas sekitar 99% lebih rendah
  • Fast mode pada GPT‑5.6 Sol menggantikan Priority Processing, dan menawarkan kecepatan hingga 2,5 kali lebih cepat dibanding Standard dengan harga 2 kali lipat sambil mempertahankan tingkat kecerdasan
  • Perusahaan dapat menyesuaikan keseimbangan kecerdasan, kecepatan, dan biaya melalui evaluasi bertahap, misalnya memakai Sol untuk perencanaan dan mengurai ketidakpastian, lalu Luna untuk implementasi dan pengujian yang sudah jelas

Penurunan harga Luna·Terra dan peningkatan kecepatan Sol

  • Peningkatan efisiensi eksekusi GPT‑5.6 berujung pada penurunan harga Luna·Terra dan peningkatan kecepatan pemrosesan API Sol
  • Luna, model tercepat dan termurah, turun 80%, sedangkan Terra, model seimbang untuk pekerjaan sehari-hari, turun 20%
    • Pada langganan berbayar Codex dan ChatGPT Work, penggunaan kedua model juga dihitung dengan kredit yang lebih sedikit
    • Harga langganan dan anggaran kuota itu sendiri tidak berubah
  • Luna dapat menggunakan alat untuk menyelesaikan workflow multi-tahap, sehingga menurunkan biaya operasional untuk pekerjaan berskala besar yang membutuhkan kualitas tinggi
  • Harga Sol tidak berubah

Memilih model sesuai hasil kerja

  • Untuk menggunakan AI secara efisien, perlu menyeimbangkan kecerdasan, kecepatan, keandalan, dan biaya sesuai dengan tingkat pentingnya tugas, biaya kesalahan, urgensi, dan skala
    • Bahkan dalam workflow yang sama, titik optimal bisa berbeda di tiap tahap
  • Luna menawarkan performa setara model mutakhir sekitar setahun lalu dengan biaya sekitar 6% per tugas dan kecepatan hampir 9 kali lebih cepat
  • Dalam Agents’ Last Exam yang mengukur pekerjaan profesional, Luna menunjukkan performa lebih tinggi daripada Fable 5 sambil memangkas estimasi biaya per tugas sekitar 99%
  • Perusahaan dapat lebih dulu menetapkan hasil dan standar kualitas yang dibutuhkan, lalu melalui evaluasi membedakan bagian di mana kecerdasan tambahan benar-benar meningkatkan hasil dan bagian di mana pemrosesan berbiaya rendah tetap memberi kualitas yang sama
    • Dalam workflow coding, Sol dapat mengurai ketidakpastian dan menyusun rencana
    • Implementasi perubahan yang sudah didefinisikan dengan jelas, penulisan dan eksekusi pengujian, serta evaluasi hasil dapat ditangani Luna
  • Keluarga GPT‑5.6 memperluas pilihan untuk menerapkan tingkat kecerdasan yang diperlukan di tiap tahap dan membayar biaya yang sesuai dengan nilai yang dihasilkan

Peningkatan efisiensi dari model hingga agen

  • Peningkatan efisiensi terjadi bersama-sama pada model, sistem inferensi yang menjalankan model, dan harness agen yang menghubungkan alat serta konteks
    • Model GPT‑5.6 memproses tugas melalui jalur yang lebih langsung
    • Routing yang ditingkatkan meningkatkan pemanfaatan perangkat keras
    • Perangkat lunak produksi yang dioptimalkan menghasilkan token dengan lebih efisien
    • Manajemen konteks yang ditingkatkan membantu agen agar tidak mengulang pekerjaan yang sudah selesai
  • Dengan sumber daya komputasi yang sama, lebih banyak pekerjaan berguna dapat diselesaikan sehingga waktu, token, dan biaya per hasil menurun

Optimasi tambahan yang didukung Sol

  • Dalam proses yang dipandu manusia, GPT‑5.6 Sol secara otonom menulis ulang dan mengoptimalkan kernel produksi
  • Sol merancang dan menjalankan ratusan eksperimen untuk meningkatkan generasi token, serta memantau pelatihan dan melakukan intervensi saat muncul masalah
  • Pekerjaan pada kernel menurunkan biaya end-to-end penyediaan model sebesar 20%, sementara eksperimen juga meningkatkan efisiensi generasi token lebih dari 15%
  • Seiring meningkatnya performa dan otonomi model, terbentuk loop umpan balik yang mempercepat penemuan peningkatan efisiensi berikutnya
  • Proses rekayasa terkait dapat dilihat di pengantar peningkatan efisiensi GPT‑5.6

Strategi komputasi yang menopang skalabilitas

  • Untuk memenuhi permintaan besar akan kecerdasan yang melimpah, dibutuhkan bukan hanya lebih banyak sumber daya komputasi tetapi juga komputasi dengan produktivitas tinggi
  • OpenAI membangun portofolio infrastruktur yang tangguh dan menempatkan tiap workload pada sistem yang paling sesuai untuk mengeksekusinya
    • Dengan penurunan harga Luna dan Terra, pekerjaan volume besar dapat dioperasikan secara ekonomis dalam skala yang lebih besar
    • Fast mode menyediakan akses API yang lebih cepat untuk pekerjaan Sol yang sensitif terhadap waktu respons
  • Kelayakan ekonomi meningkat untuk menjalankan analisis dokumen skala besar, klasifikasi interaksi pelanggan, dan pekerjaan implementasi berulang secara luas
  • Workload Sol yang kompleks dapat diproses lebih cepat ketika kecepatan cukup penting untuk membenarkan biaya tambahan
  • Model yang lebih kuat membantu peningkatan lanjutan oleh tim teknis, sehingga mempersingkat waktu yang dibutuhkan untuk meningkatkan performa dan menurunkan biaya

Cara kerja dan kompatibilitas Fast mode

  • Fast mode pada API menggantikan Priority Processing dan berpadanan dengan /fast di Codex
  • Pada GPT‑5.6 Sol, mode ini menawarkan kecepatan hingga 2,5 kali lebih cepat daripada pemrosesan Standard dengan harga 2 kali lipat tanpa mengubah tingkat kecerdasan
  • Kompatibilitas mundur tetap dipertahankan, sehingga permintaan API yang sudah ada dengan tag priority akan tetap berfungsi

Cakupan ketersediaan dan tarif API

  • GPT‑5.6 Terra dan Luna tetap tersedia di ChatGPT Work, Codex, OpenAI API
    • Pengguna Free dan Go di ChatGPT Work dan Codex dapat mengakses Terra
    • Pengguna Plus, Pro, Business, dan Enterprise dapat memilih Terra dan Luna
  • Mulai 30 Juli, harga API per 1 juta token adalah sebagai berikut
    • Terra: input $2, output $12
    • Luna: input $0.20, output $1.20
  • Harga langganan dan anggaran kuota di ChatGPT dan Codex tetap dipertahankan, tetapi kredit yang dikonsumsi saat menggunakan Terra dan Luna berkurang
  • Di AWS, perubahan harga diterapkan secara bertahap mulai lebih larut pada 30 Juli
  • Tarif lengkap dapat dilihat di informasi harga API

1 komentar

 
GN⁺ 3 jam lalu
Komentar Hacker News
  • Kutipan John Wanamaker, “Separuh dari biaya iklan terbuang, tetapi kita tidak tahu separuh yang mana,” lebih cocok untuk pemilihan model. Kita tahu sebagian besar pekerjaan tidak memerlukan model yang kuat, tetapi membedakan pekerjaan sederhana dan pekerjaan sulit itu sendiri adalah masalah yang sulit dipecahkan, bahkan mungkin tidak dapat diputuskan

    • Tidak terlalu sulit. Pertama, cukup cari library yang bisa menyelesaikan halting problem secara memadai, lalu bisa langsung mulai
    • Kita belum sampai pada tahap menjalankan 1.000 agen secara bersamaan. Saat ini, kita masih mengelola sendiri pekerjaan penting yang dilakukan agen, jadi tidak ada alasan memilih model di bawah yang paling mutakhir. Untuk pekerjaan selain coding, mungkin bisa berbeda
    • Jika ada agen dan pengguna, kita bisa menjalankan evaluasi untuk melihat batas kemampuan model. Luna memang bukan yang terbaik dalam pemanggilan tool, tetapi jika masalah dan tool didefinisikan dengan jelas, biayanya jauh lebih murah dan bisa menyaingi Gemini 4 Flash
    • Sudut pandang di https://news.ycombinator.com/item?id=49113236 sangat tepat
      HN bisa saja dijalankan seperti BBS dengan hardware era 1970-an, tetapi kenyataannya kita memakai CPU dengan sekitar 10 miliar transistor, bukan sekitar 10 ribu, untuk melakukan hal yang pada dasarnya sama, tanpa terlalu memikirkannya
  • Pernyataan “mulai hari ini, kami menurunkan biaya GPT‑5.6 Luna, model tercepat dan termurah kami, sebesar 80%” membuat saya kehabisan kata-kata. Saya kira kita sudah memasuki fase stagnan dengan peningkatan 5–10% selama berbulan-bulan, tetapi perubahan sedrastis ini membuat saya bertanya-tanya di mana batas bawah harga sebenarnya

    • Jika kecerdasan model sudah mampu menangani 90–95% pekerjaan pengetahuan saat ini secara andal, bobotnya akan ditanamkan ke silikon dan rasio harga terhadap performa akan membaik 10x lagi
      Klaster GPU dinamis akan dipakai untuk 5% sisanya dan untuk memperluas batas paling mutakhir, sementara pekerjaan yang saat ini terlalu sulit bagi kebanyakan pekerja pengetahuan sehingga tidak dilakukan juga akan mulai ditangani
    • Kita tidak tahu berapa bagian dari harga saat ini yang merupakan biaya aktual dan berapa yang merupakan strategi penguasaan pasar lewat subsidi investor. Jika OpenAI yakin dengan kekuatan dananya, ini mungkin upaya menekan Anthropic yang punya produk unggulan
    • Angkanya begitu mengesankan sampai sulit dipercaya. Meski performanya beberapa persen lebih rendah, jika lebih dari 80% lebih murah daripada pesaing dan disediakan oleh perusahaan AS di hyperscaler cloud AS, sebagian besar perusahaan akan sulit membenarkan pilihan lain
    • Artinya biaya turun 80%, bukan efisiensi membaik 80%. Luna mungkin memang mahal sejak awal, dan informasi tentang model itu sendiri juga kurang
      Jika ini benar-benar peningkatan efisiensi, tampaknya ada harga yang harus dibayar seperti kualitas menurun akibat kuantisasi agresif atau kompresi KV cache
    • Peningkatan 5–10% setiap beberapa bulan saja sudah cukup mencengangkan. Saya penasaran tekanan seperti apa yang diberikan Kimi 3 di internal Anthropic, OpenAI, dan Google
      Seiring token makin cepat dan murah setiap tahun, pabrik AI yang meniru tim ahli serta paralelisme yang jauh lebih tinggi akan menjadi nyata
  • Mengejutkan bahwa Luna, yang sudah murah dan berkinerja bagus, dibuat 5 kali lebih murah lagi. Di kantor saya memakai Sol, di rumah memakai Luna; perbedaannya jelas, tetapi tidak luar biasa besar. Selama setahun harga terus naik, lalu dengan hadirnya Luna, Kimi K3, dan GLM 5.2 rasanya kembali turun

    • Sulit melihat ini sebagai tren yang sama dengan Kimi atau GLM. GLM 5.2 adalah kenaikan besar menurut standar model Tiongkok, dan Kimi K3 naik lebih jauh lagi hingga mendekati harga OpenAI
      OpenAI dan Anthropic juga menaikkan harga selama berbulan-bulan, lalu lab AS melakukan pemangkasan harga besar-besaran, jadi ini justru tampak seperti arah yang berlawanan
    • Karena perusahaan-perusahaan bersaing siang malam untuk merebut pasar, pada akhirnya ini hanya masalah waktu
    • Saya ragu Kimi benar-benar murah; malah itu model yang cukup mahal
    • Untuk pekerjaan yang hasilnya bisa diverifikasi seperti perbaikan bug, model apa pun bisa dimanfaatkan selama kita menulis prosedur verifikasi yang tepat
  • Mereka mengatakan “pekerjaan kernel mengurangi biaya end-to-end penyediaan model sebesar 20%, dan eksperimen meningkatkan efisiensi pembuatan token lebih dari 15%.” Jika biaya penyediaan GPT-5.6 turun 20%, apakah itu berarti menghemat miliaran dolar per bulan?
    Menurut materi IPO SpaceX, Anthropic menghabiskan 1,25 miliar dolar untuk menyewa kapasitas inferensi di dua pusat data Colossus, tetapi jika mempertimbangkan kapasitas yang sudah ada seperti AWS, kita tidak tahu berapa porsi itu dari total. Biaya inferensi bulanan OpenAI juga kemungkinan besar berskala miliaran dolar, jadi penghematan 20% adalah perubahan yang sangat besar

    • Sekitar 2 tahun lalu, Gemini 2.5 membantu meningkatkan kernel internal dan baru berhasil mencapai peningkatan efisiensi 1%, sekarang sudah sampai 20%
    • Bayangkan bisa menulis di CV: “Mengurangi biaya inferensi 20% sehingga perusahaan menghemat miliaran dolar setiap bulan
  • Perubahan ini terasa seperti transisi dari dial-up ke broadband. Saya sudah sangat merekomendasikan Luna untuk riset mendalam, dan fakta bahwa dengan biaya yang sama kita bisa menjalankannya 5 kali lebih banyak itu luar biasa
    Saat ini pun saya menjalankan 10 agen secara paralel untuk menghasilkan hipotesis, dan 50 agen sulit dibayangkan. Jika menjalankan prompt dan model yang sama puluhan kali tidak terlalu membebani biaya, statistiknya akan jauh lebih menarik dan kuat

    • Penasaran bagaimana tepatnya “riset mendalam” dijalankan
    • Saya ingin tahu lebih banyak tentang pembuatan hipotesis dan prosedur risetnya. Saya memakai Sol karena menganggap ide bagus membutuhkan kemampuan reasoning lebih besar, tetapi setelah titik tertentu, kuantitas mungkin lebih baik daripada kualitas
    • Saya penasaran pekerjaan apa yang mendapat manfaat dari peningkatan jumlah agen dan pekerjaan apa yang tidak
  • Harga baru Luna di luar dugaan, dan tampaknya tidak ada produk di pasar yang bisa menandingi rasio harga terhadap performa ini
    Untuk aplikasi produksi, OpenAI kini jelas penyedia terbaik. API-nya stabil, fiturnya kaya, dan rasio harga terhadap performa di seluruh model juga sangat bagus. Saya sudah lama memakai model open weight seperti Kimi K2.5 di Fireworks, tetapi ada masalah sesekali, begitu juga Anthropic dan Google. OpenAI cepat dan menunjukkan rasio harga terhadap performa yang lebih baik di hampir semua tingkat kecerdasan

    • OpenAI API sangat stabil, sampai-sampai saya tidak ingat kapan terakhir ada gangguan atau downtime
  • Biasanya saya memeriksa grafik harga terhadap performa OpenRouter dan mengaktifkan "Show Pareto" di sebelah kanan. Untuk proyek pribadi saya masih memakai GLM-5.2, tetapi sekarang Luna menjadi pilihan yang mudah

    • Saya penasaran apakah OpenRouter sejak peluncuran tidak memberi diskon 50% untuk Luna dan Terra. Setelah penurunan ini, saya tidak tahu apa yang terjadi pada diskon itu
    • Menurut dokumentasi resmi, Luna lebih dekat ke lini model Nano sebelumnya; saya penasaran apakah performa coding-nya benar-benar bagus
  • Pemangkasan harga 80% Luna sangat agresif. Untuk sebagian besar pekerjaan yang tidak memerlukan kecerdasan paling mutakhir, ini pilihan yang luar biasa bagus, dan ada kalanya Luna bisa menandingi Opus 5

    • Luna adalah model yang dibuat untuk bersaing dengan Haiku; saya penasaran dalam pekerjaan apa ia setara dengan Opus
    • Ada perbedaan mencolok antara xhigh pada Sol dan max pada Luna. Sol lebih memahami prompt, sementara Luna harus diberi instruksi yang lebih spesifik dan jelas
  • Saya sudah membayar di muka banyak token DeepSeek v4 flash, dan setelah habis saya ingin mencoba membeli token Luna untuk sementara. Saya lebih suka model yang murah dan cepat, dan karena sudah pensiun, tidak masalah jika sesekali butuh waktu untuk beralih sendiri ke model yang lebih kuat

  • Mengejutkan bahwa Luna menjadi 80% lebih murah. Karena biaya komputasi terus turun, tahun depan biaya penggunaan API untuk model kuat mungkin lebih murah daripada biaya langganan

    • Langganan memberi nilai besar bagi perusahaan karena terus mengikat pengguna, jadi API tidak akan menjadi lebih murah daripada langganan