1 poin oleh GN⁺ 2025-03-12 | 1 komentar | Bagikan ke WhatsApp
  • OpenAI merilis Responses API, alat bawaan, Agents SDK, dan alat observabilitas untuk mempermudah pengembangan agen siap produksi
  • Responses API menggabungkan kesederhanaan Chat Completions API dengan kemampuan penggunaan alat dari Assistants API, sehingga pencarian web, pencarian file, dan penggunaan komputer dapat ditangani dalam satu alur
  • Untuk integrasi baru, penggunaan Responses API direkomendasikan; Assistants API akan masuk proses penghentian dengan target berakhir pada pertengahan 2026 setelah kesetaraan fitur tercapai
  • Alat bawaan mendukung informasi web terbaru, pencarian dokumen berskala besar, serta otomatisasi tugas komputer berbasis mouse dan keyboard, tetapi untuk computer use, terutama di lingkungan non-browser, pengawasan manusia disarankan
  • Developer dapat menggabungkan API, alat, SDK, serta fitur pelacakan dan evaluasi dalam satu platform untuk membangun, menerapkan, dan mengoptimalkan agen

Komponen baru untuk pengembangan agen

  • OpenAI memandang agen sebagai sistem yang menjalankan tugas secara mandiri atas nama pengguna
  • Selama setahun terakhir, penalaran tingkat lanjut, interaksi multimodal, dan teknik keamanan baru telah diperkenalkan, sehingga fondasi untuk menangani tugas multi-langkah yang kompleks telah tersedia
  • Pelanggan mengalami kesulitan dalam mengubah kemampuan ini menjadi agen yang siap produksi
    • Membutuhkan iterasi prompt yang luas
    • Harus membuat sendiri logika orkestrasi khusus
    • Kurangnya visibilitas yang memadai dan dukungan bawaan
  • Komponen yang dirilis kali ini adalah sebagai berikut

Responses API

  • Responses API adalah unit dasar API baru untuk membuat agen dengan memanfaatkan alat bawaan OpenAI
  • Menggabungkan kesederhanaan Chat Completions dengan kemampuan penggunaan alat dari Assistants API
  • Dalam satu panggilan Responses API, beberapa alat dan beberapa giliran model dapat digunakan untuk menangani tugas yang lebih kompleks
  • Alat yang didukung pada tahap awal adalah sebagai berikut
    • Pencarian web
    • Pencarian file
    • Penggunaan komputer
  • Peningkatan kegunaan juga disertakan
    • Desain terpadu berbasis item
    • Polimorfisme yang lebih sederhana
    • Event streaming yang intuitif
    • Helper SDK seperti response.output_text
  • Dirancang untuk developer yang ingin menggabungkan model OpenAI dan alat bawaan ke dalam aplikasi tanpa harus mengintegrasikan beberapa API atau vendor eksternal secara terpisah
  • Jika data disimpan di OpenAI, fitur pelacakan dan evaluasi mempermudah evaluasi performa agen
  • Secara default, OpenAI tidak menggunakan data bisnis untuk pelatihan model, dan hal yang sama berlaku meskipun data disimpan di OpenAI
  • Dapat digunakan oleh semua developer mulai hari ini tanpa biaya terpisah; token dan alat ditagih dengan tarif standar di halaman harga
  • Dokumentasi awal tersedia di Responses API quickstart guide

Hubungan dengan API yang sudah ada

  • Chat Completions API, sebagai API OpenAI yang paling banyak diadopsi, akan terus didukung
    • Developer yang tidak membutuhkan alat bawaan dapat terus menggunakannya
    • Model baru untuk fitur yang tidak bergantung pada alat bawaan atau beberapa panggilan model juga akan terus dirilis di Chat Completions
    • Responses API adalah superset dari Chat Completions dan memberikan performa yang sama, sehingga Responses API direkomendasikan untuk integrasi baru
  • Masukan beta dari Assistants API telah diterapkan ke Responses API agar lebih fleksibel, cepat, dan mudah digunakan
    • Kesetaraan fitur penuh antara Assistants API dan Responses API sedang dikerjakan, termasuk objek mirip Assistant, objek mirip Thread, dan alat Code Interpreter
    • Setelah kesetaraan fitur selesai, penghentian Assistants API akan diumumkan secara resmi
    • Target waktu berakhir adalah pertengahan 2026
    • Saat pengumuman penghentian, panduan migrasi yang memungkinkan retensi data dan pemindahan aplikasi akan disediakan
    • Hingga pengumuman penghentian resmi, model baru akan tetap disediakan untuk Assistants API
  • OpenAI menempatkan Responses API sebagai arah masa depan untuk membangun agen di OpenAI

Alat bawaan di Responses API

  • Pencarian web

    • Developer dapat memperoleh jawaban yang cepat dan terkini dari web dengan kutipan sumber yang jelas
    • Di Responses API, pencarian web tersedia sebagai alat saat menggunakan gpt-4o dan gpt-4o-mini, serta dapat digunakan bersama alat lain atau pemanggilan fungsi
    • Use case pada pengujian awal muncul pada aplikasi yang membutuhkan informasi web terbaru, seperti asisten belanja, agen riset, dan agen pemesanan perjalanan
    • Hebbia menggunakan alat pencarian web untuk membantu manajer aset, perusahaan private equity dan kredit, serta praktisi hukum mengekstrak insight yang dapat ditindaklanjuti dengan cepat dari dataset publik dan privat berskala besar
    • Pencarian web di API berbasis model yang sama dengan yang digunakan pada ChatGPT search
    • Di SimpleQA, GPT‑4o search preview mencatat akurasi 90%, sementara GPT‑4o mini search preview mencatat 88%
    • Respons pencarian web di API menyertakan tautan sumber seperti artikel berita dan posting blog
    • Situs web atau penerbit dapat memilih agar ditampilkan di pencarian web API
    • Alat pencarian web tersedia sebagai preview untuk semua developer di Responses API
    • Di Chat Completions API, model pencarian dapat diakses langsung melalui gpt-4o-search-preview dan gpt-4o-mini-search-preview
    • Harga mulai dari 30 dolar AS per 1.000 kueri untuk GPT‑4o search dan 25 dolar AS per 1.000 kueri untuk 4o-mini search
  • Pencarian file

    • Dengan alat file search yang ditingkatkan, informasi relevan dari dokumen berskala besar dapat dicari dengan mudah
    • Mendukung berbagai format file, optimasi kueri, pemfilteran metadata, dan reranking kustom
    • Dapat diintegrasikan di Responses API hanya dengan beberapa baris kode
    • Use case mencakup hal berikut
      • Agen dukungan pelanggan mengakses FAQ
      • Asisten hukum dengan cepat merujuk kasus terdahulu untuk tenaga profesional yang berkualifikasi
      • Agen coding menelusuri dokumentasi teknis
    • Navan menggunakan file search pada agen perjalanan berbasis AI untuk memberikan jawaban akurat dengan cepat dari dokumen knowledge base seperti kebijakan perjalanan perusahaan
    • Dengan optimasi kueri dan reranking bawaan, pipeline RAG dapat dibangun tanpa tuning atau konfigurasi tambahan
    • Dengan menyediakan vector store khusus untuk setiap kelompok pengguna, jawaban dapat disesuaikan dengan pengaturan akun dan peran pengguna
    • file search tersedia untuk semua developer di Responses API
    • Harga penggunaan adalah 2,50 dolar AS per 1.000 kueri, sedangkan penyimpanan file dikenakan 0,10 dolar AS per GB per hari dan 1 GB pertama gratis
    • Tetap tersedia juga di Assistants API
    • Endpoint pencarian baru ditambahkan ke objek Vector Store API, sehingga data yang akan digunakan di aplikasi dan API lain dapat dikueri secara langsung
  • Penggunaan komputer

    • Alat computer use adalah fitur untuk membuat agen yang menjalankan tugas komputer di Responses API
    • Alat ini digerakkan oleh model Computer-Using Agent(CUA) yang memungkinkan Operator
    • Model research preview mencatat hasil benchmark berikut
    • Alat computer use bawaan menangkap tindakan mouse dan keyboard yang dihasilkan model
    • Developer dapat mengubah tindakan ini menjadi perintah yang dapat dijalankan di lingkungan mereka sendiri untuk mengotomatiskan tugas penggunaan komputer
    • Use case mencakup otomatisasi workflow berbasis browser seperti QA aplikasi web dan entri data lintas sistem legacy
    • Unify menggunakan alat computer use dalam sistem untuk pertumbuhan pendapatan, di mana agen melakukan pemahaman intent, riset akun, dan kontak dengan pembeli
    • Agen juga dapat memanfaatkan informasi yang sebelumnya tidak dapat diakses melalui API
      • Sebagai contoh, perusahaan manajemen properti dapat memeriksa melalui peta online apakah suatu bisnis memperluas ukuran propertinya
    • Luminai mengintegrasikan alat computer use untuk mengotomatiskan workflow operasional kompleks di perusahaan besar yang memiliki sistem legacy tanpa API dan data terstandardisasi
      • Dalam sebuah pilot di organisasi layanan komunitas besar, mereka mengotomatiskan pemrosesan aplikasi dan prosedur pendaftaran pengguna hanya dalam beberapa hari
      • RPA tradisional sulit mencapai pekerjaan yang sama meskipun dicoba selama berbulan-bulan
    • Sebelum merilis CUA ke Operator, OpenAI melakukan pengujian keselamatan dan red teaming yang luas dalam tiga area: penyalahgunaan, kesalahan model, dan risiko frontier
    • Evaluasi keselamatan tambahan dan red teaming juga dilakukan untuk menangani risiko ketika kemampuan Operator diperluas ke sistem operasi lokal melalui CUA di API
    • Mitigasi untuk developer juga ditambahkan
      • Pemeriksaan keamanan untuk pertahanan terhadap prompt injection
      • Prompt konfirmasi untuk tugas sensitif
      • Alat yang membantu isolasi lingkungan
      • Deteksi yang ditingkatkan atas potensi pelanggaran kebijakan
    • Meskipun mitigasi mengurangi risiko, model dapat melakukan kesalahan yang tidak disengaja, terutama di lingkungan non-browser
    • Performa OSWorld sebesar 38,1% menunjukkan bahwa otomatisasi tugas sistem operasi belum memiliki reliabilitas tinggi, sehingga dalam kasus ini pengawasan manusia disarankan
    • Detail pekerjaan keselamatan khusus API dapat dilihat di system card yang diperbarui

Agents SDK dan orkestrasi workflow

  • Agen tidak hanya membutuhkan logika inti dan akses alat, tetapi juga orkestrasi workflow
  • Agents SDK open-source baru menyederhanakan orkestrasi workflow multi-agen
  • Ini merupakan peningkatan dari SDK eksperimental Swarm yang dirilis tahun lalu
  • Fitur utamanya adalah sebagai berikut
    • Agents: LLM yang mudah dikonfigurasi dengan instruksi yang jelas dan alat bawaan
    • Handoffs: memindahkan kendali antar-agen secara cerdas
    • Guardrails: pemeriksaan keamanan yang dapat dikonfigurasi untuk validasi input dan output
    • Tracing & Observability: memvisualisasikan pelacakan eksekusi agen untuk membantu debugging dan optimasi performa
  • Use case nyata yang dapat diterapkan mencakup otomatisasi dukungan pelanggan, riset multi-langkah, pembuatan konten, code review, dan prospek penjualan
  • Coinbase menggunakan Agents SDK untuk dengan cepat membuat prototipe dan menerapkan AgentKit, yang memungkinkan agen AI berinteraksi dengan dompet kripto dan aktivitas on-chain
    • Dalam beberapa jam, mereka mengintegrasikan custom action dari Developer Platform SDK ke agen yang berfungsi penuh
    • Arsitektur AgentKit yang disederhanakan mempermudah penambahan aksi agen baru
  • Box membuat agen dalam beberapa hari yang memanfaatkan pencarian web dan Agents SDK, sehingga memungkinkan pencarian, tanya jawab, dan ekstraksi insight dari data tidak terstruktur di dalam Box serta sumber internet publik
    • Pelanggan enterprise dapat mencari data proprietary internal dengan cara yang mengikuti izin internal dan kebijakan keamanan, selain mendapatkan informasi terbaru
    • Sebagai contoh, perusahaan jasa keuangan dapat membuat agen kustom yang menggabungkan analisis pasar internal yang tersimpan di Box dengan berita real-time dan data ekonomi dari web
  • Agents SDK berjalan di Responses API dan Chat Completions API
  • Jika menyediakan endpoint API bergaya Chat Completions, SDK ini juga dapat digunakan dengan model dari penyedia lain
  • Dapat langsung diintegrasikan ke codebase Python, dan dukungan Node.js akan segera hadir
  • Dalam desain Agents SDK, OpenAI terinspirasi oleh karya Pydantic, Griffe, dan MkDocs
  • OpenAI berencana terus membangun Agents SDK sebagai framework open-source agar komunitas dapat memperluas pendekatan ini

Arah perluasan platform agen

  • OpenAI memandang agen akan segera menjadi komponen inti tenaga kerja dan secara signifikan meningkatkan produktivitas di berbagai industri
  • Seiring meningkatnya permintaan perusahaan untuk memanfaatkan AI pada tugas kompleks, OpenAI berfokus menyediakan komponen yang memungkinkan developer dan perusahaan membangun sistem otonom yang berdampak nyata
  • Rilis kali ini adalah komponen awal untuk mempermudah pembangunan, penerapan, dan penskalaan agen AI yang andal dan berkinerja tinggi
  • Seiring kemampuan model berkembang menjadi lebih agentic, OpenAI akan terus berinvestasi pada integrasi yang lebih dalam di seluruh API serta alat baru yang membantu penerapan, evaluasi, dan optimasi agen produksi
  • Tujuannya adalah memberikan pengalaman platform yang mulus untuk membuat agen yang dapat membantu beragam tugas di industri apa pun

1 komentar

 
GN⁺ 2025-03-12
Komentar Hacker News
  • Saya tidak yakin seberapa membantu perubahan API seperti ini bagi developer yang ingin menghubungkan OpenAI ke produk nyata
    Mesin status manajemen vendor yang menangani percakapan, pesan, penyampaian prompt, dan sebagainya pada akhirnya terasa kurang memadai, terlalu banyak asumsi, atau malah menghalangi untuk kebutuhan saya
    Pada akhirnya saya tetap memakai Chat Completions API dengan output terstruktur diaktifkan, dan bahkan di dalamnya saya sudah cukup melakukan penggunaan tool, percakapan rekursif, RAG, dan sebagainya
    Saya tidak merasa ada nilai dalam menyerahkan pengelolaan status “agent” saya ke pihak ketiga, dan hal seperti ini jauh lebih otonom jika disimpan secara lokal
    Intinya hanya soal memasukkan string literal tertentu ke dalam black box lalu menerima string baru, sebisa mungkin dalam format yang diminta seperti JSON
    Jika fokus pada sudut pandang merangkai string yang tepat setiap saat, sisanya menghilang, dan ini menjadi mirip pekerjaan membuat string yang sangat terstruktur dari status bisnis di database
    Pada dasarnya ini sama saja dengan server-side rendering halaman web dengan PHP, perbedaan nyatanya hanya pada cara penyajiannya

    • Saya juga merasakan hal yang sama
      Saya masih belum menemukan framework agent yang menambahkan apa yang saya butuhkan di atas pemanggilan generasi terstruktur yang sederhana
      Sebagian besar request ke LLM seharusnya berupa “input prompt, output terstruktur”, dan ini juga selaras dengan filosofi Unix untuk melakukan satu hal dengan baik
      Framework agent masih terlalu dini, hanya lapisan abstraksi atas sekumpulan pola desain yang belum benar-benar umum
      Abstraksi seharusnya dibuat hanya ketika sudah jelas semua orang sedang menciptakan ulang roda, tetapi pada agent tidak ada roda yang perlu diciptakan, semuanya hanya pemanggilan model bahasa yang sederhana
      Saya sering mengatakan, “model bahasa seharusnya menjadi bagian paling tidak menarik dalam kode”
      Sebagian besar waktu seharusnya dipakai untuk membangun software dan tool yang nyata, dan LLM hanyalah komponen kecil dari software itu
      Framework agent, menurut selera saya, membuat keberadaan model bahasa di codebase jadi terlalu dominan
    • Saya juga sependapat
      Bahkan abstraksi function calling milik OpenAI pun berhalusinasi soal parameter dan skema, dan JSON Schema sendiri terlalu bertele-tele sehingga begitu sedikit lebih kompleks dari lima pemanggilan fungsi yang sangat sederhana, semuanya runtuh total
      Ini terlihat seperti menumpuk sesuatu di atas abstraksi black box yang sudah rusak, dan tidak terlalu berguna untuk aplikasi nyata
      Meski begitu, mungkin berguna untuk cepat membuat aplikasi proof of concept kecil
    • Benar
      Harus naif kalau mau membangun perusahaan di atas API seperti ini
      LLM akan menjadi komoditas, dan OpenAI tidak punya pilihan selain melawan nasib itu jika ingin membenarkan valuasi perusahaan serta besarnya investasi yang terus dibutuhkan
      Jika Anda membangun di atas Assistant API, petunjuknya adalah jangan sekadar menulis ulang ke Responses API, tetapi milikilah produk Anda sendiri
      LLM saat ini lebih baik dibungkus sebagai black box
    • Rasanya seperti sedang didorong keluar dari API yang lama karena alasan nonteknis
      Ini karena bagian yang mengatakan, “Saat menggunakan Chat Completions, model selalu mengambil informasi dari web sebelum merespons. Jika Anda ingin model seperti gpt-4o dan gpt-4o-mini hanya memanggil web_search_preview sebagai tool saat diperlukan, beralihlah ke Responses API”
      Memindahkan ke Responses API tidak sesederhana itu, dan kami sudah punya histori, RAG, serta hal-hal yang dibutuhkan untuk assistant
    • Sulit mengatakannya dengan lebih baik lagi
      Saya sudah mengembangkan beberapa agent hanya dengan function calling dan output terstruktur, dan sudah menjalankannya di production selama lebih dari setahun
      Dulu saya bahkan tidak menyebut ini agent
      Yang ini tampaknya memang ditujukan bagi orang-orang yang sudah memakai framework agent bersama API OpenAI
  • Ada thread Twitter yang bagus dari perancang API baru yang menjelaskan latar belakang berbagai keputusan desain: https://twitter.com/athyuttamre/status/1899541471532867821
    Ada juga tautan alternatif untuk orang yang tidak login ke Twitter: https://nitter.net/athyuttamre/status/1899541471532867821

  • Upaya-upaya AI agent seperti ini tampaknya meleset dari inti persoalan
    Karena alih-alih menciptakan cara baru, pendekatan ini justru berusaha menggantikan manusia dalam sistem yang sudah ada
    Ekonomi, kehidupan, semuanya pada akhirnya berkaitan dengan interaksi antarmanusia, jadi ini pada dasarnya berpandangan pendek
    Pendekatan AI agent saat ini terlihat seperti variasi dari lelucon “AI memperpanjang satu kalimat menjadi email panjang yang meyakinkan, lalu AI penerima merangkum email panjang itu kembali menjadi satu kalimat”
    Saya paham kegunaannya untuk mengotomatisasi pekerjaan dalam sistem yang ada, tetapi peluang yang sesungguhnya adalah menghilangkan sebagian besar sistem yang ada itu
    Manusia tidak seburuk itu
    Saya ragu apakah membuat UI untuk manusia dengan AI lalu membiarkan AI lagi yang mengoperasikan UI itu benar-benar jalan ke depan

    • Jika “ekonomi dan kehidupan, semuanya berkaitan dengan interaksi antarmanusia”, lalu seberapa sering Anda memakai mangkuk tanah liat buatan tangan yang dibentuk setiap hari dan dibakar dengan tungku bertenaga manusia?
      Seberapa sering Anda memakai keranjang yang dianyam dari ranting yang dipatahkan dengan tangan?
      Sejarah menunjukkan bahwa apa pun yang bisa diotomatisasi akan diotomatisasi, dan apa pun yang bisa dibuat lebih murah atau lebih cepat juga akan demikian
    • Saya melihat jalur paling bernilai bagi model AI generasi saat ini adalah mengintegrasikannya ke area konfigurasi dan administrasi produk
      Misalnya dalam ekosistem B2B SaaS, sebagai pengalaman pengguna pendamping yang memungkinkan pengguna tingkat lanjut di dalam organisasi memakrokan konfigurasi pelanggan dan tugas manajemen proyek
      Jika abstraksi, konteks, dan himpunan penggunanya dibatasi dengan baik, penggunaan tool bisa cukup andal
  • Hal yang paling terasa kurang: Model Context Protocol
    https://www.anthropic.com/news/model-context-protocol

    • 100% setuju, tapi ini bukan hal yang sama dan juga tidak akan menggantikan Agent SDK, begitu pula sebaliknya
      Agen akan selalu membutuhkan semacam protokol komunikasi, dan dunia framework agent itu lautan logo, jadi tanpa standar terbuka semuanya jadi sulit
      Sekarang ada di Comet, juga sempat mengerjakan implementasi MCP sendiri dan berkontribusi ke Agent SDK dalam bentuk integrasi native serta perbaikan test suite
      https://github.com/comet-ml/opik-mcp
      https://github.com/openai/openai-agents-python/pull/91
      Integrasi terbarunya bahkan dirilis langsung pada hari pertama
      https://www.comet.com/docs/opik/tracing/integrations/openai_...
      Menurut saya, inti arah yang dituju OpenAI adalah memberi kesederhanaan kepada developer lewat komponen yang mudah dipakai
      Saya tidak akan membahas strategi atau harga, tapi dari sudut pandang developer, saat pertama melihatnya, pendekatan modular SDK yang sederhana dan minim embel-embel terasa menyegarkan
    • Bukan berarti tidak didukung hanya karena tidak diimplementasikan langsung: https://github.com/dylibso/mcpx-openai-node
      Ini bukan untuk penggunaan umum, melainkan untuk memakai pemanggilan tool mcp.run dengan model OpenAI
      Meski begitu, tidak mendukung MCP secara langsung itu nyaris merupakan langkah yang paling tidak ramah bagi developer, dan kalau dari OpenAI sih tidak terlalu mengejutkan
      Akan sangat bagus kalau ini ditambahkan
    • Sudah disebut di thread utama: https://nitter.net/athyuttamre/status/1899511569274347908
      Untuk pertanyaan “Apakah Agents SDK mendukung koneksi MCP? Apakah lewat koneksi klien-server MCP kita bisa dengan mudah memberi tool ke agen tertentu?”, jawabannya adalah “karena Anda bisa mendefinisikan tool yang diinginkan, tool MCP bisa diimplementasikan lewat function calling”
      Singkatnya, Anda tetap harus mengerjakan sedikit plumbing sendiri
      Isu terkait: https://github.com/openai/openai-agents-python/issues/23
    • Keduanya bisa dijembatani sampai tingkat tertentu: https://github.com/SecretiveShell/MCP-Bridge
    • Kalau pernah memakai MCP, saya penasaran bagaimana pendapat Anda
  • Ini swyx
    Saya sempat melihat seluruh API baru lebih awal bersama tim API/DX dan bertanya soal FAQ
    https://latent.space/p/openai-agents-platform
    Inti menariknya adalah sekarang respons pada dasarnya disimpan gratis, jadi apakah Responses API bisa disalahgunakan seperti database
    Ada juga pertanyaan yang sepertinya bakal disukai orang-orang HN
    Hyperparameter pencarian web, yaitu cara mengatur kedalaman dan keluasan pencarian saat membuat DIY Deep Research
    Sekarang OAI juga menyediakan RAG dan reranking secara default sebagai bagian dari Responses API, jadi kapan sebaiknya tetap membangun RAG sendiri
    Secara pribadi, saya rasa seseorang perlu membuat benchmark untuk performa RAG di Files API. Kesan komunitas tampaknya belum banyak berubah sejak peluncuran awal Assistants API
    Perbedaan antara Agents SDK dan OAI Swarm kira-kira ada pada type, tracing, dan LLM yang bisa diganti
    Saya juga penasaran apakah fine-tuning search-preview dan computer-use-preview akan digabungkan ke GPT5

    • “qtns” itu apa?
    • Saya suka Agents SDK, tapi kalau tidak suka framework yang terikat ke OpenAI, PydanticAI cukup saya sukai
      0 - https://ai.pydantic.dev/
    • Terima kasih untuk pertanyaan soal hyperparameter pencarian web
      Salah satu alasan utama membangun sendiri tool pencarian AI seperti ini adalah agar bisa sepenuhnya mengendalikan kedalaman dan keluasan, serta mengustomisasi loader sesuai data atau situs yang diinginkan
      Saat ini tidak transparan situs mana yang punya teks lengkap dan situs mana yang hanya memakai snippet dalam pencarian web
      Memiliki computer use dan pencarian web sekaligus jelas sangat kuat. Pada dasarnya ini seperti Deep Research milik OpenAI
  • Dalam presentasi, harganya tidak diumumkan
    Kemungkinan besar karena mereka tahu biayanya akan sangat mahal
    Pencarian web [0]: GPT‑4o search dan 4o-mini search masing-masing $30 dan $25 per 1.000 kueri
    Pencarian file [1]: $2,50 per 1.000 kueri, penyimpanan file $0,10/GB/hari, 1GB pertama gratis
    Alat penggunaan komputer (model computer-use-preview) [2]: $3 per 1 juta token input, $12 per 1 juta token output
    [0] https://platform.openai.com/docs/pricing#web-search
    [1] https://platform.openai.com/docs/pricing#built-in-tools
    [2] https://platform.openai.com/docs/pricing#latest-models

    • Khususnya, harga pencarian web terasa tidak masuk akal
      Saya tidak begitu paham bagaimana API ini lebih baik daripada https://www.anthropic.com/news/model-context-protocol
      Motivasinya terlihat lebih seperti “bagaimana menghasilkan lebih banyak uang” daripada “bagaimana menjadi lebih berguna bagi pengguna”
    • Pada akhirnya, sepertinya mereka berputar dari menjual teks berdasarkan satuan bobot menjadi menjual pencarian web dan penyimpanan cloud
      Saya suka, langkah yang berani
      Saat orang-orang Google yang lambat akhirnya berhasil mengejar, mungkin sudah terlambat bagi Google
    • Bagi yang sedang mencari, Brave Search harganya $3 per 1.000 permintaan [0]
      Saya juga menulis skrip yang menelusuri web dan bekerja cukup baik. Menggunakan vercel ai sdk [1]
      [0] - https://brave.com/search/api/
      [1] - https://gist.github.com/bramses/41e90b27d156590154bcefd4119f...
  • Saya membuat versi yang jauh lebih sederhana dan kuat daripada Responses API, dan ini bekerja dengan semua penyedia LLM
    https://github.com/Anilturaga/aiide

    • Saya heran karena meski bintang GitHub-nya sedikit, ini sudah kali keempat saya melihat proyek aiide dalam dua hari
      Tampilannya bagus, dan benar-benar terlihat menjanjikan
  • Ada kalimat yang berbunyi, “Kami berencana secara resmi mengumumkan penghentian dukungan Assistant API, dengan target akhir masa layanan pada pertengahan 2026”
    Responses API yang baru adalah satu langkah ke arah yang benar, termasuk fitur “handoff” bawaan
    Namun untuk kasus penggunaan bergaya agen, ini masih terasa agak terbatas, dan kurang memiliki guardrail serta logika state machine yang resmi
    Mereka mengatakan “tujuannya adalah memberikan pengalaman platform yang mulus agar pengembang dapat membangun agen”, jadi menarik untuk melihat bagaimana mereka akan bergerak ke platform ini
    Saya rasa dalam beberapa bulan kita akan melihat alur kontrol berbasis graf
    Bahkan sekarang sudah ada tak terhitung banyaknya solusi open source, tetapi kebanyakan masih kurang matang atau menambahkan ketidakjelasan dan kompleksitas yang tidak perlu
    Kita memang sudah bisa membuat alur bergaya agen dengan kombinasi pemanggilan alat dan respons JSON, tetapi masih belum ada komponen tingkat atas yang sampai sekarang benar-benar berhasil diselesaikan siapa pun

  • Perkembangan Computer Use yang disebut di sini cukup mengesankan, jadi saya penasaran apakah ini sudah cukup matang untuk dipakai dalam pengujian kegunaan
    Secara umum, jika UI sulit dijelajahi oleh AI, apakah itu juga bisa dianggap sebagai sinyal bahwa UI tersebut kemungkinan relatif sulit bagi manusia, dan perlu disederhanakan atau diperbaiki dalam satu atau lain bentuk?

    • Saya tidak tahu mengapa membuat asumsi seperti itu
      Cara LLM berinteraksi dengan UI dan cara manusia menggunakan UI sangat berbeda
  • Agents SDK yang ditautkan menampilkan 404
    Sebagai referensi, di MindRoot ada task API yang menggunakan sesuatu yang mirip dengan Responses dan sebagian dari File Search: https://github.com/runvnc/mindroot/blob/main/api.md
    Ini bisa digabungkan dengan alat query_kb dari plugin mr_kb, dan karena memungkinkan pencarian di beberapa KB, bisa jadi sebenarnya lebih baik daripada File Search
    Siapa pun yang ingin membantu program saya, membuat plugin, atau mengirim PR, silakan hubungi lewat GitHub, email, atau Discord/Telegram (runvnc)