Alat Baru untuk Membangun Agen
(openai.com)- OpenAI merilis Responses API, alat bawaan, Agents SDK, dan alat observabilitas untuk mempermudah pengembangan agen siap produksi
- Responses API menggabungkan kesederhanaan Chat Completions API dengan kemampuan penggunaan alat dari Assistants API, sehingga pencarian web, pencarian file, dan penggunaan komputer dapat ditangani dalam satu alur
- Untuk integrasi baru, penggunaan Responses API direkomendasikan; Assistants API akan masuk proses penghentian dengan target berakhir pada pertengahan 2026 setelah kesetaraan fitur tercapai
- Alat bawaan mendukung informasi web terbaru, pencarian dokumen berskala besar, serta otomatisasi tugas komputer berbasis mouse dan keyboard, tetapi untuk computer use, terutama di lingkungan non-browser, pengawasan manusia disarankan
- Developer dapat menggabungkan API, alat, SDK, serta fitur pelacakan dan evaluasi dalam satu platform untuk membangun, menerapkan, dan mengoptimalkan agen
Komponen baru untuk pengembangan agen
- OpenAI memandang agen sebagai sistem yang menjalankan tugas secara mandiri atas nama pengguna
- Selama setahun terakhir, penalaran tingkat lanjut, interaksi multimodal, dan teknik keamanan baru telah diperkenalkan, sehingga fondasi untuk menangani tugas multi-langkah yang kompleks telah tersedia
- Pelanggan mengalami kesulitan dalam mengubah kemampuan ini menjadi agen yang siap produksi
- Membutuhkan iterasi prompt yang luas
- Harus membuat sendiri logika orkestrasi khusus
- Kurangnya visibilitas yang memadai dan dukungan bawaan
- Komponen yang dirilis kali ini adalah sebagai berikut
- Responses API: menggabungkan kesederhanaan Chat Completions API dengan kemampuan penggunaan alat dari Assistants API
- Alat bawaan: web search, file search, computer use
- Agents SDK: mengorkestrasi workflow agen tunggal dan multi-agen
- Alat observabilitas: melacak dan memeriksa eksekusi workflow agen
Responses API
- Responses API adalah unit dasar API baru untuk membuat agen dengan memanfaatkan alat bawaan OpenAI
- Menggabungkan kesederhanaan Chat Completions dengan kemampuan penggunaan alat dari Assistants API
- Dalam satu panggilan Responses API, beberapa alat dan beberapa giliran model dapat digunakan untuk menangani tugas yang lebih kompleks
- Alat yang didukung pada tahap awal adalah sebagai berikut
- Pencarian web
- Pencarian file
- Penggunaan komputer
- Peningkatan kegunaan juga disertakan
- Desain terpadu berbasis item
- Polimorfisme yang lebih sederhana
- Event streaming yang intuitif
- Helper SDK seperti
response.output_text
- Dirancang untuk developer yang ingin menggabungkan model OpenAI dan alat bawaan ke dalam aplikasi tanpa harus mengintegrasikan beberapa API atau vendor eksternal secara terpisah
- Jika data disimpan di OpenAI, fitur pelacakan dan evaluasi mempermudah evaluasi performa agen
- Secara default, OpenAI tidak menggunakan data bisnis untuk pelatihan model, dan hal yang sama berlaku meskipun data disimpan di OpenAI
- Dapat digunakan oleh semua developer mulai hari ini tanpa biaya terpisah; token dan alat ditagih dengan tarif standar di halaman harga
- Dokumentasi awal tersedia di Responses API quickstart guide
Hubungan dengan API yang sudah ada
- Chat Completions API, sebagai API OpenAI yang paling banyak diadopsi, akan terus didukung
- Developer yang tidak membutuhkan alat bawaan dapat terus menggunakannya
- Model baru untuk fitur yang tidak bergantung pada alat bawaan atau beberapa panggilan model juga akan terus dirilis di Chat Completions
- Responses API adalah superset dari Chat Completions dan memberikan performa yang sama, sehingga Responses API direkomendasikan untuk integrasi baru
- Masukan beta dari Assistants API telah diterapkan ke Responses API agar lebih fleksibel, cepat, dan mudah digunakan
- Kesetaraan fitur penuh antara Assistants API dan Responses API sedang dikerjakan, termasuk objek mirip Assistant, objek mirip Thread, dan alat Code Interpreter
- Setelah kesetaraan fitur selesai, penghentian Assistants API akan diumumkan secara resmi
- Target waktu berakhir adalah pertengahan 2026
- Saat pengumuman penghentian, panduan migrasi yang memungkinkan retensi data dan pemindahan aplikasi akan disediakan
- Hingga pengumuman penghentian resmi, model baru akan tetap disediakan untuk Assistants API
- OpenAI menempatkan Responses API sebagai arah masa depan untuk membangun agen di OpenAI
Alat bawaan di Responses API
-
Pencarian web
- Developer dapat memperoleh jawaban yang cepat dan terkini dari web dengan kutipan sumber yang jelas
- Di Responses API, pencarian web tersedia sebagai alat saat menggunakan
gpt-4odangpt-4o-mini, serta dapat digunakan bersama alat lain atau pemanggilan fungsi - Use case pada pengujian awal muncul pada aplikasi yang membutuhkan informasi web terbaru, seperti asisten belanja, agen riset, dan agen pemesanan perjalanan
- Hebbia menggunakan alat pencarian web untuk membantu manajer aset, perusahaan private equity dan kredit, serta praktisi hukum mengekstrak insight yang dapat ditindaklanjuti dengan cepat dari dataset publik dan privat berskala besar
- Pencarian web di API berbasis model yang sama dengan yang digunakan pada ChatGPT search
- Di SimpleQA, GPT‑4o search preview mencatat akurasi 90%, sementara GPT‑4o mini search preview mencatat 88%
- Respons pencarian web di API menyertakan tautan sumber seperti artikel berita dan posting blog
- Situs web atau penerbit dapat memilih agar ditampilkan di pencarian web API
- Alat pencarian web tersedia sebagai preview untuk semua developer di Responses API
- Di Chat Completions API, model pencarian dapat diakses langsung melalui
gpt-4o-search-previewdangpt-4o-mini-search-preview - Harga mulai dari 30 dolar AS per 1.000 kueri untuk GPT‑4o search dan 25 dolar AS per 1.000 kueri untuk 4o-mini search
-
Pencarian file
- Dengan alat file search yang ditingkatkan, informasi relevan dari dokumen berskala besar dapat dicari dengan mudah
- Mendukung berbagai format file, optimasi kueri, pemfilteran metadata, dan reranking kustom
- Dapat diintegrasikan di Responses API hanya dengan beberapa baris kode
- Use case mencakup hal berikut
- Agen dukungan pelanggan mengakses FAQ
- Asisten hukum dengan cepat merujuk kasus terdahulu untuk tenaga profesional yang berkualifikasi
- Agen coding menelusuri dokumentasi teknis
- Navan menggunakan file search pada agen perjalanan berbasis AI untuk memberikan jawaban akurat dengan cepat dari dokumen knowledge base seperti kebijakan perjalanan perusahaan
- Dengan optimasi kueri dan reranking bawaan, pipeline RAG dapat dibangun tanpa tuning atau konfigurasi tambahan
- Dengan menyediakan vector store khusus untuk setiap kelompok pengguna, jawaban dapat disesuaikan dengan pengaturan akun dan peran pengguna
- file search tersedia untuk semua developer di Responses API
- Harga penggunaan adalah 2,50 dolar AS per 1.000 kueri, sedangkan penyimpanan file dikenakan 0,10 dolar AS per GB per hari dan 1 GB pertama gratis
- Tetap tersedia juga di Assistants API
- Endpoint pencarian baru ditambahkan ke objek Vector Store API, sehingga data yang akan digunakan di aplikasi dan API lain dapat dikueri secara langsung
-
Penggunaan komputer
- Alat computer use adalah fitur untuk membuat agen yang menjalankan tugas komputer di Responses API
- Alat ini digerakkan oleh model Computer-Using Agent(CUA) yang memungkinkan Operator
- Model research preview mencatat hasil benchmark berikut
- OSWorld: 38,1% pada keseluruhan tugas penggunaan komputer
- WebArena: 58,1%
- WebVoyager: 87% pada interaksi berbasis web
- Alat computer use bawaan menangkap tindakan mouse dan keyboard yang dihasilkan model
- Developer dapat mengubah tindakan ini menjadi perintah yang dapat dijalankan di lingkungan mereka sendiri untuk mengotomatiskan tugas penggunaan komputer
- Use case mencakup otomatisasi workflow berbasis browser seperti QA aplikasi web dan entri data lintas sistem legacy
- Unify menggunakan alat computer use dalam sistem untuk pertumbuhan pendapatan, di mana agen melakukan pemahaman intent, riset akun, dan kontak dengan pembeli
- Agen juga dapat memanfaatkan informasi yang sebelumnya tidak dapat diakses melalui API
- Sebagai contoh, perusahaan manajemen properti dapat memeriksa melalui peta online apakah suatu bisnis memperluas ukuran propertinya
- Luminai mengintegrasikan alat computer use untuk mengotomatiskan workflow operasional kompleks di perusahaan besar yang memiliki sistem legacy tanpa API dan data terstandardisasi
- Dalam sebuah pilot di organisasi layanan komunitas besar, mereka mengotomatiskan pemrosesan aplikasi dan prosedur pendaftaran pengguna hanya dalam beberapa hari
- RPA tradisional sulit mencapai pekerjaan yang sama meskipun dicoba selama berbulan-bulan
- Sebelum merilis CUA ke Operator, OpenAI melakukan pengujian keselamatan dan red teaming yang luas dalam tiga area: penyalahgunaan, kesalahan model, dan risiko frontier
- Evaluasi keselamatan tambahan dan red teaming juga dilakukan untuk menangani risiko ketika kemampuan Operator diperluas ke sistem operasi lokal melalui CUA di API
- Mitigasi untuk developer juga ditambahkan
- Pemeriksaan keamanan untuk pertahanan terhadap prompt injection
- Prompt konfirmasi untuk tugas sensitif
- Alat yang membantu isolasi lingkungan
- Deteksi yang ditingkatkan atas potensi pelanggaran kebijakan
- Meskipun mitigasi mengurangi risiko, model dapat melakukan kesalahan yang tidak disengaja, terutama di lingkungan non-browser
- Performa OSWorld sebesar 38,1% menunjukkan bahwa otomatisasi tugas sistem operasi belum memiliki reliabilitas tinggi, sehingga dalam kasus ini pengawasan manusia disarankan
- Detail pekerjaan keselamatan khusus API dapat dilihat di system card yang diperbarui
Agents SDK dan orkestrasi workflow
- Agen tidak hanya membutuhkan logika inti dan akses alat, tetapi juga orkestrasi workflow
- Agents SDK open-source baru menyederhanakan orkestrasi workflow multi-agen
- Ini merupakan peningkatan dari SDK eksperimental Swarm yang dirilis tahun lalu
- Fitur utamanya adalah sebagai berikut
- Agents: LLM yang mudah dikonfigurasi dengan instruksi yang jelas dan alat bawaan
- Handoffs: memindahkan kendali antar-agen secara cerdas
- Guardrails: pemeriksaan keamanan yang dapat dikonfigurasi untuk validasi input dan output
- Tracing & Observability: memvisualisasikan pelacakan eksekusi agen untuk membantu debugging dan optimasi performa
- Use case nyata yang dapat diterapkan mencakup otomatisasi dukungan pelanggan, riset multi-langkah, pembuatan konten, code review, dan prospek penjualan
- Coinbase menggunakan Agents SDK untuk dengan cepat membuat prototipe dan menerapkan AgentKit, yang memungkinkan agen AI berinteraksi dengan dompet kripto dan aktivitas on-chain
- Dalam beberapa jam, mereka mengintegrasikan custom action dari Developer Platform SDK ke agen yang berfungsi penuh
- Arsitektur AgentKit yang disederhanakan mempermudah penambahan aksi agen baru
- Box membuat agen dalam beberapa hari yang memanfaatkan pencarian web dan Agents SDK, sehingga memungkinkan pencarian, tanya jawab, dan ekstraksi insight dari data tidak terstruktur di dalam Box serta sumber internet publik
- Pelanggan enterprise dapat mencari data proprietary internal dengan cara yang mengikuti izin internal dan kebijakan keamanan, selain mendapatkan informasi terbaru
- Sebagai contoh, perusahaan jasa keuangan dapat membuat agen kustom yang menggabungkan analisis pasar internal yang tersimpan di Box dengan berita real-time dan data ekonomi dari web
- Agents SDK berjalan di Responses API dan Chat Completions API
- Jika menyediakan endpoint API bergaya Chat Completions, SDK ini juga dapat digunakan dengan model dari penyedia lain
- Dapat langsung diintegrasikan ke codebase Python, dan dukungan Node.js akan segera hadir
- Dalam desain Agents SDK, OpenAI terinspirasi oleh karya Pydantic, Griffe, dan MkDocs
- OpenAI berencana terus membangun Agents SDK sebagai framework open-source agar komunitas dapat memperluas pendekatan ini
Arah perluasan platform agen
- OpenAI memandang agen akan segera menjadi komponen inti tenaga kerja dan secara signifikan meningkatkan produktivitas di berbagai industri
- Seiring meningkatnya permintaan perusahaan untuk memanfaatkan AI pada tugas kompleks, OpenAI berfokus menyediakan komponen yang memungkinkan developer dan perusahaan membangun sistem otonom yang berdampak nyata
- Rilis kali ini adalah komponen awal untuk mempermudah pembangunan, penerapan, dan penskalaan agen AI yang andal dan berkinerja tinggi
- Seiring kemampuan model berkembang menjadi lebih agentic, OpenAI akan terus berinvestasi pada integrasi yang lebih dalam di seluruh API serta alat baru yang membantu penerapan, evaluasi, dan optimasi agen produksi
- Tujuannya adalah memberikan pengalaman platform yang mulus untuk membuat agen yang dapat membantu beragam tugas di industri apa pun
1 komentar
Komentar Hacker News
Saya tidak yakin seberapa membantu perubahan API seperti ini bagi developer yang ingin menghubungkan OpenAI ke produk nyata
Mesin status manajemen vendor yang menangani percakapan, pesan, penyampaian prompt, dan sebagainya pada akhirnya terasa kurang memadai, terlalu banyak asumsi, atau malah menghalangi untuk kebutuhan saya
Pada akhirnya saya tetap memakai Chat Completions API dengan output terstruktur diaktifkan, dan bahkan di dalamnya saya sudah cukup melakukan penggunaan tool, percakapan rekursif, RAG, dan sebagainya
Saya tidak merasa ada nilai dalam menyerahkan pengelolaan status “agent” saya ke pihak ketiga, dan hal seperti ini jauh lebih otonom jika disimpan secara lokal
Intinya hanya soal memasukkan string literal tertentu ke dalam black box lalu menerima string baru, sebisa mungkin dalam format yang diminta seperti JSON
Jika fokus pada sudut pandang merangkai string yang tepat setiap saat, sisanya menghilang, dan ini menjadi mirip pekerjaan membuat string yang sangat terstruktur dari status bisnis di database
Pada dasarnya ini sama saja dengan server-side rendering halaman web dengan PHP, perbedaan nyatanya hanya pada cara penyajiannya
Saya masih belum menemukan framework agent yang menambahkan apa yang saya butuhkan di atas pemanggilan generasi terstruktur yang sederhana
Sebagian besar request ke LLM seharusnya berupa “input prompt, output terstruktur”, dan ini juga selaras dengan filosofi Unix untuk melakukan satu hal dengan baik
Framework agent masih terlalu dini, hanya lapisan abstraksi atas sekumpulan pola desain yang belum benar-benar umum
Abstraksi seharusnya dibuat hanya ketika sudah jelas semua orang sedang menciptakan ulang roda, tetapi pada agent tidak ada roda yang perlu diciptakan, semuanya hanya pemanggilan model bahasa yang sederhana
Saya sering mengatakan, “model bahasa seharusnya menjadi bagian paling tidak menarik dalam kode”
Sebagian besar waktu seharusnya dipakai untuk membangun software dan tool yang nyata, dan LLM hanyalah komponen kecil dari software itu
Framework agent, menurut selera saya, membuat keberadaan model bahasa di codebase jadi terlalu dominan
Bahkan abstraksi function calling milik OpenAI pun berhalusinasi soal parameter dan skema, dan JSON Schema sendiri terlalu bertele-tele sehingga begitu sedikit lebih kompleks dari lima pemanggilan fungsi yang sangat sederhana, semuanya runtuh total
Ini terlihat seperti menumpuk sesuatu di atas abstraksi black box yang sudah rusak, dan tidak terlalu berguna untuk aplikasi nyata
Meski begitu, mungkin berguna untuk cepat membuat aplikasi proof of concept kecil
Harus naif kalau mau membangun perusahaan di atas API seperti ini
LLM akan menjadi komoditas, dan OpenAI tidak punya pilihan selain melawan nasib itu jika ingin membenarkan valuasi perusahaan serta besarnya investasi yang terus dibutuhkan
Jika Anda membangun di atas Assistant API, petunjuknya adalah jangan sekadar menulis ulang ke Responses API, tetapi milikilah produk Anda sendiri
LLM saat ini lebih baik dibungkus sebagai black box
Ini karena bagian yang mengatakan, “Saat menggunakan Chat Completions, model selalu mengambil informasi dari web sebelum merespons. Jika Anda ingin model seperti gpt-4o dan gpt-4o-mini hanya memanggil web_search_preview sebagai tool saat diperlukan, beralihlah ke Responses API”
Memindahkan ke Responses API tidak sesederhana itu, dan kami sudah punya histori, RAG, serta hal-hal yang dibutuhkan untuk assistant
Saya sudah mengembangkan beberapa agent hanya dengan function calling dan output terstruktur, dan sudah menjalankannya di production selama lebih dari setahun
Dulu saya bahkan tidak menyebut ini agent
Yang ini tampaknya memang ditujukan bagi orang-orang yang sudah memakai framework agent bersama API OpenAI
Ada thread Twitter yang bagus dari perancang API baru yang menjelaskan latar belakang berbagai keputusan desain: https://twitter.com/athyuttamre/status/1899541471532867821
Ada juga tautan alternatif untuk orang yang tidak login ke Twitter: https://nitter.net/athyuttamre/status/1899541471532867821
Upaya-upaya AI agent seperti ini tampaknya meleset dari inti persoalan
Karena alih-alih menciptakan cara baru, pendekatan ini justru berusaha menggantikan manusia dalam sistem yang sudah ada
Ekonomi, kehidupan, semuanya pada akhirnya berkaitan dengan interaksi antarmanusia, jadi ini pada dasarnya berpandangan pendek
Pendekatan AI agent saat ini terlihat seperti variasi dari lelucon “AI memperpanjang satu kalimat menjadi email panjang yang meyakinkan, lalu AI penerima merangkum email panjang itu kembali menjadi satu kalimat”
Saya paham kegunaannya untuk mengotomatisasi pekerjaan dalam sistem yang ada, tetapi peluang yang sesungguhnya adalah menghilangkan sebagian besar sistem yang ada itu
Manusia tidak seburuk itu
Saya ragu apakah membuat UI untuk manusia dengan AI lalu membiarkan AI lagi yang mengoperasikan UI itu benar-benar jalan ke depan
Seberapa sering Anda memakai keranjang yang dianyam dari ranting yang dipatahkan dengan tangan?
Sejarah menunjukkan bahwa apa pun yang bisa diotomatisasi akan diotomatisasi, dan apa pun yang bisa dibuat lebih murah atau lebih cepat juga akan demikian
Misalnya dalam ekosistem B2B SaaS, sebagai pengalaman pengguna pendamping yang memungkinkan pengguna tingkat lanjut di dalam organisasi memakrokan konfigurasi pelanggan dan tugas manajemen proyek
Jika abstraksi, konteks, dan himpunan penggunanya dibatasi dengan baik, penggunaan tool bisa cukup andal
Hal yang paling terasa kurang: Model Context Protocol
https://www.anthropic.com/news/model-context-protocol
Agen akan selalu membutuhkan semacam protokol komunikasi, dan dunia framework agent itu lautan logo, jadi tanpa standar terbuka semuanya jadi sulit
Sekarang ada di Comet, juga sempat mengerjakan implementasi MCP sendiri dan berkontribusi ke Agent SDK dalam bentuk integrasi native serta perbaikan test suite
https://github.com/comet-ml/opik-mcp
https://github.com/openai/openai-agents-python/pull/91
Integrasi terbarunya bahkan dirilis langsung pada hari pertama
https://www.comet.com/docs/opik/tracing/integrations/openai_...
Menurut saya, inti arah yang dituju OpenAI adalah memberi kesederhanaan kepada developer lewat komponen yang mudah dipakai
Saya tidak akan membahas strategi atau harga, tapi dari sudut pandang developer, saat pertama melihatnya, pendekatan modular SDK yang sederhana dan minim embel-embel terasa menyegarkan
Ini bukan untuk penggunaan umum, melainkan untuk memakai pemanggilan tool mcp.run dengan model OpenAI
Meski begitu, tidak mendukung MCP secara langsung itu nyaris merupakan langkah yang paling tidak ramah bagi developer, dan kalau dari OpenAI sih tidak terlalu mengejutkan
Akan sangat bagus kalau ini ditambahkan
Untuk pertanyaan “Apakah Agents SDK mendukung koneksi MCP? Apakah lewat koneksi klien-server MCP kita bisa dengan mudah memberi tool ke agen tertentu?”, jawabannya adalah “karena Anda bisa mendefinisikan tool yang diinginkan, tool MCP bisa diimplementasikan lewat function calling”
Singkatnya, Anda tetap harus mengerjakan sedikit plumbing sendiri
Isu terkait: https://github.com/openai/openai-agents-python/issues/23
Ini swyx
Saya sempat melihat seluruh API baru lebih awal bersama tim API/DX dan bertanya soal FAQ
https://latent.space/p/openai-agents-platform
Inti menariknya adalah sekarang respons pada dasarnya disimpan gratis, jadi apakah Responses API bisa disalahgunakan seperti database
Ada juga pertanyaan yang sepertinya bakal disukai orang-orang HN
Hyperparameter pencarian web, yaitu cara mengatur kedalaman dan keluasan pencarian saat membuat DIY Deep Research
Sekarang OAI juga menyediakan RAG dan reranking secara default sebagai bagian dari Responses API, jadi kapan sebaiknya tetap membangun RAG sendiri
Secara pribadi, saya rasa seseorang perlu membuat benchmark untuk performa RAG di Files API. Kesan komunitas tampaknya belum banyak berubah sejak peluncuran awal Assistants API
Perbedaan antara Agents SDK dan OAI Swarm kira-kira ada pada type, tracing, dan LLM yang bisa diganti
Saya juga penasaran apakah fine-tuning
search-previewdancomputer-use-previewakan digabungkan ke GPT50 - https://ai.pydantic.dev/
Salah satu alasan utama membangun sendiri tool pencarian AI seperti ini adalah agar bisa sepenuhnya mengendalikan kedalaman dan keluasan, serta mengustomisasi loader sesuai data atau situs yang diinginkan
Saat ini tidak transparan situs mana yang punya teks lengkap dan situs mana yang hanya memakai snippet dalam pencarian web
Memiliki computer use dan pencarian web sekaligus jelas sangat kuat. Pada dasarnya ini seperti Deep Research milik OpenAI
Dalam presentasi, harganya tidak diumumkan
Kemungkinan besar karena mereka tahu biayanya akan sangat mahal
Pencarian web [0]: GPT‑4o search dan 4o-mini search masing-masing $30 dan $25 per 1.000 kueri
Pencarian file [1]: $2,50 per 1.000 kueri, penyimpanan file $0,10/GB/hari, 1GB pertama gratis
Alat penggunaan komputer (model
computer-use-preview) [2]: $3 per 1 juta token input, $12 per 1 juta token output[0] https://platform.openai.com/docs/pricing#web-search
[1] https://platform.openai.com/docs/pricing#built-in-tools
[2] https://platform.openai.com/docs/pricing#latest-models
Saya tidak begitu paham bagaimana API ini lebih baik daripada https://www.anthropic.com/news/model-context-protocol
Motivasinya terlihat lebih seperti “bagaimana menghasilkan lebih banyak uang” daripada “bagaimana menjadi lebih berguna bagi pengguna”
Saya suka, langkah yang berani
Saat orang-orang Google yang lambat akhirnya berhasil mengejar, mungkin sudah terlambat bagi Google
Saya juga menulis skrip yang menelusuri web dan bekerja cukup baik. Menggunakan vercel ai sdk [1]
[0] - https://brave.com/search/api/
[1] - https://gist.github.com/bramses/41e90b27d156590154bcefd4119f...
Saya membuat versi yang jauh lebih sederhana dan kuat daripada Responses API, dan ini bekerja dengan semua penyedia LLM
https://github.com/Anilturaga/aiide
Tampilannya bagus, dan benar-benar terlihat menjanjikan
Ada kalimat yang berbunyi, “Kami berencana secara resmi mengumumkan penghentian dukungan Assistant API, dengan target akhir masa layanan pada pertengahan 2026”
Responses API yang baru adalah satu langkah ke arah yang benar, termasuk fitur “handoff” bawaan
Namun untuk kasus penggunaan bergaya agen, ini masih terasa agak terbatas, dan kurang memiliki guardrail serta logika state machine yang resmi
Mereka mengatakan “tujuannya adalah memberikan pengalaman platform yang mulus agar pengembang dapat membangun agen”, jadi menarik untuk melihat bagaimana mereka akan bergerak ke platform ini
Saya rasa dalam beberapa bulan kita akan melihat alur kontrol berbasis graf
Bahkan sekarang sudah ada tak terhitung banyaknya solusi open source, tetapi kebanyakan masih kurang matang atau menambahkan ketidakjelasan dan kompleksitas yang tidak perlu
Kita memang sudah bisa membuat alur bergaya agen dengan kombinasi pemanggilan alat dan respons JSON, tetapi masih belum ada komponen tingkat atas yang sampai sekarang benar-benar berhasil diselesaikan siapa pun
Perkembangan Computer Use yang disebut di sini cukup mengesankan, jadi saya penasaran apakah ini sudah cukup matang untuk dipakai dalam pengujian kegunaan
Secara umum, jika UI sulit dijelajahi oleh AI, apakah itu juga bisa dianggap sebagai sinyal bahwa UI tersebut kemungkinan relatif sulit bagi manusia, dan perlu disederhanakan atau diperbaiki dalam satu atau lain bentuk?
Cara LLM berinteraksi dengan UI dan cara manusia menggunakan UI sangat berbeda
Agents SDK yang ditautkan menampilkan 404
Sebagai referensi, di MindRoot ada task API yang menggunakan sesuatu yang mirip dengan Responses dan sebagian dari File Search: https://github.com/runvnc/mindroot/blob/main/api.md
Ini bisa digabungkan dengan alat
query_kbdari plugin mr_kb, dan karena memungkinkan pencarian di beberapa KB, bisa jadi sebenarnya lebih baik daripada File SearchSiapa pun yang ingin membantu program saya, membuat plugin, atau mengirim PR, silakan hubungi lewat GitHub, email, atau Discord/Telegram (runvnc)
Mungkin karena saya sudah login