Anthropic pada 24 Juli 2026 mengumumkan Claude Opus 5. Ini adalah model dengan peningkatan setingkat "pergantian generasi" di tier Opus, dengan positioning utama menghadirkan kecerdasan yang mendekati Fable 5 (model frontier) dengan harga setengahnya.
Ringkasan utama
- Positioning: Mendekati kecerdasan kelas frontier milik Fable 5 dengan harga setengahnya. Ditetapkan sebagai model default baru untuk Claude Max dan model terkuat yang tersedia di Claude Pro.
- Benchmark: Mencapai SOTA baru pada evaluasi coding dan knowledge work seperti Frontier-Bench dan GDPval-AA. Namun untuk tugas keamanan siber, masih tertinggal dari Mythos 5 (model tertinggi Anthropic).
- Performa coding: Mencatat performa terbaik di antara semua model pada Frontier-Bench v0.1, meningkat lebih dari 2x dibanding Opus 4.8 (dengan biaya lebih rendah). Pada pengaturan efisiensi tertinggi CursorBench, hasilnya berada dalam selisih 0,5% dari skor terbaik Fable 5 dengan biaya setengahnya.
- Knowledge work/pemecahan masalah: Di ARC-AGI 3, skornya 3x model peringkat kedua; di Zapier AutomationBench, tingkat kelulusannya sekitar 1,5x model peringkat kedua; di OSWorld 2.0 (benchmark penggunaan komputer), melampaui rekor terbaik Fable 5 dengan biaya sekitar sepertiganya.
- Riset ilmiah: Meningkat dibanding Opus 4.8 di seluruh evaluasi ilmu hayati. Dalam kimia organik (inferensi struktur molekul dari data spektral) naik +10,2 poin persentase, dan pada prediksi fungsi dari urutan protein naik +7,7 poin persentase.
- Gaya kerja: Kemampuan verifikasi mandiri dan iterasi meningkat besar. Diperkenalkan contoh seperti merekonstruksi model CAD 3D dari gambar teknik tanpa informasi visual, atau menemukan dan memperbaiki akar masalah yang terlewat oleh patch komunitas.
- Alignment: Dalam audit perilaku internal, dinilai sebagai model yang paling selaras sejauh ini. Rasio perilaku menipu lebih rendah daripada Opus 4.8, Sonnet 5, dan Fable 5, serta kemampuan menghindari tindakan berisiko yang tidak dapat dipulihkan juga berada di level tertinggi.
- Keamanan: Di bidang biologi dan keamanan siber ofensif, tertinggal dari Mythos 5. "Deteksi" kerentanan berada di tingkat yang mirip dengan Mythos 5, tetapi kemampuan "pengembangan exploit" jauh lebih rendah (hasil dari sengaja mengecualikan pelatihan untuk tugas siber).
- Safeguard: Dibanding Fable 5, intervensi classifier siber sekitar 85% lebih sedikit. Deteksi kerentanan source code diizinkan, tetapi scanning berbasis biner, penetration testing, dan pembuatan exploit diblokir. Permintaan terkait biologi yang sebelumnya diblokir di Fable 5 kini dirutekan ke Opus 5.
Harga dan ketersediaan
- Tersedia mulai hari ini di semua platform, API:
claude-opus-5 - Harga: input $5 / output $25 per 1 juta token (sama seperti Opus 4.8)
- Tersedia mode Fast (sekitar 2,5x lebih cepat dari default, dengan harga 2x)
- Tidak ada persyaratan retensi data (untuk penggunaan umum)
Dua beta yang dirilis bersamaan
- Perubahan tool di tengah percakapan: dapat mengubah tool yang tersedia di tengah percakapan tanpa membatalkan prompt cache
- Fallback otomatis: permintaan yang terkena classifier keamanan otomatis dirutekan ke model lain (menggunakan model terbaik yang tersedia sebagai default, alih-alih memblokir)
Ringkasan tambahan GN⁺
Neo merangkum tambahan berdasarkan naskah asli
- Menawarkan kecerdasan yang mendekati Fable 5 dengan biaya per tugas setengahnya, dan disediakan sebagai model default Claude Max serta model performa tertinggi di Claude Pro
- Mencatat level tertinggi pada evaluasi coding dan knowledge work seperti Frontier-Bench dan GDPval-AA, dan skor ARC-AGI 3 mencapai 3x model peringkat kedua
- Dapat memverifikasi pekerjaannya sendiri dan mengulang sampai berhasil, termasuk membangun pipeline computer vision, memperbaiki akar masalah bug open source, hingga mengimplementasikan market data feed dan test harness
- Harganya $5 per 1 juta token input dan $25 per 1 juta token output, sama dengan Opus 4.8; Fast mode yang sekitar 2,5x lebih cepat ditawarkan dengan harga 2x dari tarif dasar
- Kemampuan dual-use berisiko lebih rendah daripada Mythos 5; penemuan kerentanan diizinkan, tetapi binary scan, penetration test, dan pembuatan exploit diblokir, serta penggantian otomatis ke Opus 4.8 dapat diterapkan untuk permintaan yang ditandai
Performa dan efisiensi biaya
- Claude Opus 5 memberikan performa lebih tinggi dengan harga yang sama seperti Opus 4.8
- Pengaturan effort dapat disesuaikan untuk memprioritaskan kecerdasan atau memilih eksekusi yang lebih cepat dan murah dengan penghematan token
- Menjadi model default Claude Max dan model terkuat yang tersedia di Claude Pro
- Di Frontier-Bench v0.1, model ini melampaui semua model lain, dan mencapai lebih dari 2x performa Opus 4.8 dengan biaya per tugas yang lebih rendah
- Ini adalah hasil eksekusi internal yang diukur dari rata-rata reward atas 5 percobaan per tugas dengan mini-SWE-agent harness dan backend GKE
- Untuk permintaan yang ditolak Opus 5 dan Fable 5 karena classifier keamanan, Opus 4.8 digunakan sebagai model pengganti
- Pada CursorBench 3.2 dengan max effort, selisihnya kurang dari 0,5% dari skor terbaik Fable 5, sementara biaya per tugas hanya setengahnya
- Pada high, xhigh, dan max effort, performanya lebih tinggi daripada semua model lain pada basis biaya yang sama
- Juga menunjukkan efisiensi biaya tinggi pada evaluasi knowledge work dan pemecahan masalah
- Di ARC-AGI 3, skor penyelesaian masalah baru mencapai 3x model peringkat kedua
- Di Zapier AutomationBench, tingkat kelulusan pada basis biaya per tugas yang sama sekitar 1,5x model peringkat kedua, dan bahkan pada effort terendah tetap meluluskan lebih banyak tugas daripada semua model lain
- Di OSWorld 2.0, model ini unggul atas model lain di semua rentang biaya, dan melampaui hasil terbaik Fable 5 dengan biaya sedikit lebih dari sepertiganya
Riset ilmiah dan hasil visual
- Mencatat performa lebih tinggi daripada Opus 4.8 pada seluruh evaluasi ilmu hayati, termasuk biologi struktural, kimia organik, dan bioinformatika
- Pada benchmark kimia organik internal untuk inferensi struktur molekul dari data spektral, skornya lebih tinggi 10,2 poin persentase
- Pada tugas memprediksi dampak variasi urutan protein terhadap fungsi, skornya lebih tinggi 7,7 poin persentase
- Dapat menghasilkan output visual yang jauh lebih kuat daripada model sebelumnya
Verifikasi kerja dan iterasi otonom
- Kemampuan untuk memverifikasi hasil sendiri dan mengulang dengan hati-hati sampai berhasil telah diperkuat
- Pada tugas FreeCAD di Frontier-Bench, dalam kondisi tidak bisa melihat langsung gambar komponen mekanis, model ini menulis pipeline computer vision sendiri untuk mengekstrak bentuk dari piksel mentah dan merekonstruksi komponen 3D
- Berhasil setelah beberapa kali iterasi, sementara model pesaing pada kondisi yang sama tetap gagal bahkan setelah 5 percobaan
- Pada bug nyata di package manager open source yang banyak digunakan, model ini menemukan akar masalah dan memperbaiki edge case yang terlewat oleh patch komunitas
- Model pesaing hanya memperbaiki gejala permukaan lalu menganggap bug sudah selesai
- Seorang engineer di perusahaan trading membangun market data feed untuk exchange baru dalam satu sesi
- Model sebelumnya gagal menyelesaikan tugas itu bahkan ketika engineer sudah memberi rencana rinci
- Saat tidak ada feed real-time untuk verifikasi, model ini membuat test harness sendiri untuk memastikan data exchange diparsing dengan benar
Evaluasi coding dan agen oleh pengguna awal
- Di FrontierCode 1.1 milik Devin, performanya mendekati level Fable dengan biaya setengahnya, dan kuat dalam debugging sulit serta analisis akar masalah
- Di CursorBench, performanya sedikit di bawah Fable 5 tetapi menunjukkan karakteristik perilaku yang serupa, menghadirkan kecerdasan yang mendekati Fable 5 dengan kecepatan dan biaya khas Opus
- Di Zapier AutomationBench, model ini meraih peringkat pertama tanpa memakai lebih banyak token dibanding model Claude sebelumnya
- Pada workbook status akun, model ini menjalankan penuh prosedur pencegahan churn hingga 100% lulus, mulai dari identifikasi pelanggan berisiko, notifikasi penanggung jawab, sampai ringkasan untuk tim retensi
- Dalam analisis genom, model ini menyingkirkan faktor pengganggu dengan uji statistik yang tepat, memverifikasi silang hasil dengan metode independen, dan menjaga analisis panjang yang terdiri dari banyak tahap
- Dalam evaluasi internal Lovable, tugas coding agen tersulit meningkat 22% dibanding Opus 4.7, dan variasi antarrun juga menurun
- Pada pembangunan aplikasi full-stack yang sama, model ini menghasilkan pekerjaan animasi, game, dan 3D terbaik di keluarga Opus, dinilai sebagai peningkatan terbesar sejak Opus 4.5
- Dalam analisis open-ended, semakin sulit dan ambigu tugasnya, semakin besar peningkatannya dibanding Opus 4.8; jawabannya juga menjadi lebih jelas dan ringkas, dan efisiensinya membaik pada effort tinggi
- Saat mengelola environment pengembangan, model ini membuat monitor sendiri dan memanipulasi tiap environment sambil hanya meminta hal-hal yang memang membutuhkan penilaian manusia
- Pada codebase Fundamental Research Assistant, model ini melakukan perubahan berskala besar sesuai umpan balik, dan menangani pekerjaan yang biasanya dibagi menjadi beberapa bagian dalam satu workflow agen
- Pada evaluasi frontend, model ini membuka halaman langsung dalam lebar desktop dan ponsel untuk menemukan serta memperbaiki produk yang tersembunyi di bagian bawah tampilan mobile dan tombol checkout yang berada di luar layar
- Sebelum handoff PR, model ini memeriksa branch, template, dan dampak terhadap pengujian, tanpa tergesa-gesa memublikasikan sebelum verifikasi seperti model sebelumnya
- Dalam proses redesign, model ini membedakan kelebihan desain yang diusulkan dari satu isu tunggal, lalu mengusulkan kompromi yang mempertahankan kelebihannya sambil memperbaiki cacat
- Dalam perubahan kode, model ini membuat diff yang ringkas tanpa dead code, lebih baik menemukan risiko halus yang khas pada codebase, dan diadopsi untuk workload produksi
- Berbagai use case dan code review pada platform agen terintegrasi Cosmos dijadwalkan bermigrasi ke Opus 5
- Dalam evaluasi JetBrains, model ini meninjau dan merencanakan lebih dalam sebelum menulis kode, menemukan kesalahan logika pada tahap perencanaan, dan menilai bukan hanya apakah jawabannya bekerja, tetapi apakah alasannya juga benar
- Pada benchmark trading, model ini mencatat performa tertinggi di keluarga Opus sambil memangkas token reasoning menjadi sekitar seper-7 dibanding Opus 4.8, dan mengurangi latensi hingga kurang dari setengahnya
Evaluasi bisnis dan pekerjaan profesional
- Dalam riset keuangan, numerical reasoning, pekerjaan tabel, dan critical thinking presisi meningkat dibanding Opus 4.8
- Dalam evaluasi internal Box, performa analisis konten enterprise profesional 8% lebih tinggi daripada Opus 4.8
- Workflow analisis data meningkat 11%, dan due diligence meningkat 17%
- Menargetkan tugas yang dipakai di sektor teknologi, kesehatan, dan publik
- Pada financial modeling yang sulit, akurasi rata-rata naik 9 poin persentase di seluruh level effort, sementara jumlah giliran percakapan dan pemanggilan tool berkurang sepertiga, dan waktu yang dibutuhkan turun 60%
- Dalam tugas agen hukum, peningkatan paling menonjol terlihat pada tata kelola perusahaan dan arbitrase
- Kualitas serupa dipertahankan dengan rata-rata 26% lebih sedikit token dibanding max reasoning Opus 4.8
- Pada draf revisi kontrak percobaan pertama, model ini mendapat skor tertinggi di antara model yang diuji dan hampir 2x Opus 4.8
- Revisi NDA juga diselesaikan dengan waktu dan iterasi yang lebih sedikit sambil mempertahankan atau meningkatkan akurasi
- Pada tugas panjang, kemampuan membuat lalu merevisi seluruh presentasi meningkat, dan hasilnya lebih baik dalam pemahaman visual, format, dan kesalahan slide
Alignment dan kemampuan berisiko
- Dalam audit perilaku otomatis sebelum deployment, Opus 5 menunjukkan tingkat alignment tertinggi di antara model Anthropic
- Lebih patuh pada Konstitusi Claude daripada Opus 4.8, Sonnet 5, dan Fable 5
- Memiliki rasio perilaku menipu dan kerentanan terhadap dorongan penyalahgunaan yang paling rendah
- Juga paling baik dalam menghindari tindakan gegabah yang dapat menimbulkan efek samping yang sulit dibalikkan
- Model ini tidak mendorong naik frontier kemampuan dual-use yang berbahaya, dan dalam evaluasi bersama mitra swasta maupun pemerintah menunjukkan performa lebih rendah daripada Mythos 5 baik dalam riset biologi maupun keamanan siber ofensif
- Penilaian detail tersedia di System Card
- Seperti Opus 4.8, model ini sengaja tidak dilatih untuk tugas siber, tetapi seiring peningkatan kemampuan umum, performa terkait juga naik signifikan
- Penemuan kerentanan mendekati Mythos 5
- Namun pengembangan exploit untuk mengubah kerentanan yang ditemukan menjadi ancaman nyata tertinggal jauh dari Mythos 5
- Dalam evaluasi OSS-Fuzz, Opus 5 dan Mythos 5 menemukan kerentanan dengan tingkat keberhasilan yang mirip, tetapi skor pengembangan exploit Opus 5 jauh lebih rendah
Safeguard keamanan siber dan biologi
- Safeguard dirancang untuk memungkinkan penggunaan yang bermanfaat di bidang keamanan siber dan biologi, dan secara umum mirip dengan Opus 4.8 kecuali penambahan pembatasan yang lebih kuat pada lingkup sempit tugas siber
- Classifier siber relatif kurang ketat dibanding Fable 5
- Penemuan kerentanan dalam source code diizinkan
- Pemindaian kerentanan berbasis biner, penetration testing, dan pembuatan exploit yang berpotensi terkait pelaku jahat diblokir
- Dalam pengujian Anthropic, intervensi classifier diperkirakan sekitar 85% lebih sedikit daripada Fable 5
- Di Claude.ai, Claude Code, dan Claude Cowork, permintaan yang ditandai secara default digantikan ke Opus 4.8, dan ini juga bisa diaktifkan di API
- Perusahaan dan peneliti yang mengikuti Cyber Verification Program dapat langsung memakai Opus 5 dengan pembatasan keamanan yang lebih ringan
- Di bidang biologi, model ini mempertahankan safeguard yang mirip dengan Opus 4.8 sekaligus menjadi model riset ilmiah terkuat di antara model yang tersedia secara umum
- Untuk riset otonom jangka panjang masih ada keterbatasan penting, dan untuk jenis pekerjaan biologi ini Mythos 5 tetap lebih kuat
- Permintaan biologi yang diblokir di Fable 5 kini diteruskan ke Opus 5 alih-alih Opus 4.8
Harga dan fitur pengembang
- Tersedia di semua platform, dengan identifier model API Claude
claude-opus-5- Harganya $5 per 1 juta token input dan $25 per 1 juta token output, sama seperti Opus 4.8
- Untuk akses umum, tidak ada persyaratan retensi data seperti pada model Opus sebelumnya
- Fast mode berjalan sekitar 2,5x dari kecepatan dasar
- Di Claude Platform, harganya 2x tarif dasar, dan di Claude Code tersedia sebagai usage credit
- Dengan beta perubahan tool di tengah percakapan di Claude Platform, tool yang dapat digunakan Claude bisa diubah selama percakapan tanpa membatalkan prompt cache
- Jika beta fallback otomatis di API diaktifkan, permintaan Opus 5 atau Fable 5 yang ditandai classifier keamanan akan otomatis diteruskan ke model lain
- Alih-alih memblokir permintaan, sistem secara default merutekannya ke model terbaik yang tersedia
- Cara memanfaatkan model ini dapat dilihat di panduan prompting Opus 5
1 komentar
Pendapat Hacker News
Poin utamanya di sini bukan performa absolut, melainkan organisasi kini bisa memakai model setara Fable tanpa kewajiban penyimpanan data 30 hari
Opus 5, seperti Opus sebelumnya, tidak memiliki persyaratan penyimpanan data untuk akses umum, dan alasan Fable tidak punya skor ARC-AGI juga karena kebijakan penyimpanan ini
https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344
Menyenangkan juga bahwa Fable 5 tetap khusus kredit, dan ke depan tampaknya model papan atas akan makin sering ditempatkan di balik API bayar sesuai pemakaian atau kredit, sementara model lain didukung lewat langganan bulanan
Jika begitu, berarti informasinya tetap disimpan di suatu tempat sehingga cara penyimpanan data ini sulit dipahami
Saat ini sedang menguji konversi gambar→HTML, dan sebelumnya Fable adalah yang terbaik, sementara Gemini 3.1 Pro secara tak terduga berada di posisi kedua
Opus 5 mengikuti desain asli lebih akurat daripada Fable, membuat tombol sebagai persegi panjang membulat alih-alih bentuk pil, dan gambar yang dihasilkan juga lebih mirip aslinya
Asli: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5: https://html.non.io/solaraOpus/
Fable 5: https://html.non.io/solara/
Perilaku responsifnya memang meleset, tetapi rasanya sudah mencapai sekitar 90% dari produk jadi
Asli: https://image.non.io/9d5fed20-b476-49d3-841b-37eb553fb88e.we...
Opus 5: https://html.non.io/neonRamen/
Inkling tidak terlalu bagus: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Kimi 2.7, pendahulu Kimi3 terbaru, melakukannya dengan sangat baik: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Lingkungan pengujian: https://huggingface.co/spaces/abidlabs/vlm-screenshot-to-web...
Lebih berguna untuk memeriksa seberapa baik model memindahkan desain buatan manusia tanpa merusaknya
Jika melihat begitu banyak peluncuran, tidak mengherankan bahwa routing model adalah bidang dengan pertumbuhan tercepat di AI
Ada lebih dari 10 perusahaan, masing-masing dengan model dalam berbagai format dan ukuran, tingkat penalaran, mode agent·Pro·cepat, eksekusi standar·fleksibel·batch, serta harga token input·output·cache yang berbeda-beda
Perusahaan yang mengirim prompt ke kombinasi yang paling cocok dan ekonomis mengambil nilai besar dari celah yang diabaikan pengembang model
Ini adalah pengulangan Bitter Lesson, dan para pemain terdepan tampaknya pada akhirnya akan menyediakan fungsi ini sendiri
Sebagian besar pekerjaan kantor tidak memerlukan AGI superkuat, jadi trafik mengalir ke model murah, tetapi laboratorium terdepan memosisikan diri seolah hanya mereka yang bisa menghadirkan AGI kuat sekaligus menggantikan pekerjaan kantoran
Routing ke model murah berpotensi melubangi narasi itu
Sulit menerima model apa pun selain model terbaru dengan performa terbaik untuk tugas apa pun, dan satu-satunya aturan yang dibutuhkan hanyalah memilih model terkuat yang masih punya kuota paket tetap
Sebagai ganti penghematan biaya, kita harus menanggung bug dengan tingkat keparahan dan frekuensi yang tak bisa diukur, dan kita juga tidak tahu nilai asuransi dari menyerahkan semua penalaran ke model papan atas maupun biaya perbaikannya nanti
Pada level proyek pun tidak ada cara untuk menguji seberapa berbeda kodenya jika memakai model lain
Jika tidak ingin membaca PDF sekitar 190 halaman, ada tulisan blog ini: https://www.anthropic.com/news/claude-opus-5
Jika membandingkan gaya penulisan Opus 5 dan Fable 5, Opus 5 tetap memakai ungkapan khas Claude seperti 4.8, yang sempat ditinggalkan Fable
Ungkapan seperti “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, dan “move” terus berulang, jadi rasanya perlu benchmark ‘bahasa Inggris yang menyebalkan’
Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
Gaya khas Claude tampaknya sebagian berasal dari kecenderungannya mendorong percakapan atau pekerjaan maju secara ‘proaktif’, dan benchmark untuk mengukur rentang gaya per prompt juga tampaknya berguna
55,7% milik Anthropic dan sekitar 21% dalam makalah OSWorld 2.0 ternyata adalah metrik yang berbeda
Opus 4.8 sepenuhnya berhasil pada sekitar 1 dari 5 tugas dan mencatat completion rate 20,6%, lalu juga mendapat skor parsial pada sisanya sehingga mencapai partial score 54,8%
Namun, perbedaan metrik seperti ini memunculkan pertanyaan apakah benchmark antar makalah bisa dibandingkan dalam rentang galat yang masuk akal: https://arxiv.org/pdf/2606.29537
Pembuat benchmark cenderung menyukai angka rendah yang menunjukkan ruang perbaikan, sementara pembuat model menyukai angka tinggi yang menonjolkan kemampuan, tetapi 55,7% milik Anthropic dan 54,8% di makalah itu pada dasarnya adalah hasil yang sama
Mereka mengatakan “Opus 5 secara keseluruhan tidak lebih unggul daripada Fable 5”, tetapi di blog justru mencantumkan bahwa ia lebih baik di sebagian besar benchmark, sehingga komunikasinya membingungkan
System card juga menyatakan kemampuannya mirip dengan Claude Mythos 5, yang dianggap sebagai Fable dengan kemampuan R&D AI tanpa batasan
Opus 5 tidak dilatih untuk mengeksploitasi kerentanan perangkat lunak, jadi kemampuan menemukannya mendekati Mythos 5, tetapi kemampuan eksploitasi untuk mengubahnya menjadi ancaman siber nyata tertinggal jauh
Model yang tampak jauh lebih unggul daripada Fable juga dirilis tanpa masalah berarti karena tidak disertai promosi apokaliptik dari Anthropic
Secara teori, menurut standar Anthropic model ini seharusnya sudah setingkat AGI, tetapi kenyataannya ini cuma hari Jumat yang biasa saja
Model-model ini dilindungi dengan ketat, dan Mythos tanpa pengaman itulah sebabnya tidak bisa dirilis
OpenAI juga mirip ketika mengumumkan bahwa model tanpa pengaman telah menyusup ke server HuggingFace
Bahkan jika GPT-6 keluar pada musim panas, sekarang hampir tidak ada orang yang mengharapkan AGI, jadi menarik bagaimana mereka akan mempertahankan siklus sensasi
Contoh promosi bahwa Opus 5 membuat feed data pasar dan alat validasi untuk bursa baru dalam satu sesi, lucunya, adalah proyek yang biasa diberikan kepada intern di perusahaan trading
Pada grafik Frontier Code, saya penasaran mengapa efisiensi per tugas dari mode berpikir menengah jauh lebih tinggi, dan mengapa hasil evaluasi justru memburuk drastis saat jumlah penalaran ditambah
Kadang memang ada sedikit penurunan di level maksimum, tetapi sebesar ini tergolong tidak biasa: https://imgur.com/a/Nv8V7Ry
Secara subjektif, Opus 4.8 Medium hari ini dan Opus 5 Medium setelah pengumuman terasa lebih efisien pada rentang penggunaan 5 jam dibanding Opus 4.8 minggu lalu
Jika digunakan lebih berbasis prompt daripada agen, batasan seperti ini bisa terlihat, dan level menengah mungkin lebih seimbang
Terlalu banyak berpikir memang buruk, tetapi jika berpikir jauh lebih ekstrem justru membaik lagi?