Saya mencoba mengukur eksekusi duplikat agen pada trace benchmark publik. Caranya adalah menghitung kasus ketika tool yang sama dipanggil dua kali dengan argumen yang sama dan hasilnya juga sama.
Dari 6.780 trace, ditemukan 8.042 kasus; jika hampir separuh yang berupa pengulangan seperti deklarasi penyelesaian tugas dikeluarkan, tersisa 4.249 kasus. Di antara itu, untuk 3.432 pemanggilan duplikat pada tool yang mengubah state, saya membandingkan ID entitas yang ada di respons, dan pada 159 kasus terkonfirmasi bahwa benar-benar ada dua entitas yang dibuat. Misalnya dua dokumen dengan judul yang sama, atau empat spreadsheet yang sama dibuat.
Ada batasan yang jelas di sini. Semua angka ini berasal dari trace benchmark. Ini adalah catatan 22 model yang menyelesaikan task, bukan layanan produksi sungguhan. Saya menelusuri delapan dataset publik, dan hanya satu ini yang memungkinkan fenomena tersebut diamati. Kebanyakan benchmark dirancang untuk penilaian akurasi, sehingga strukturnya membuat duplikasi langsung menjadi jawaban salah.
Karena itu, saya ingin bertanya kepada yang benar-benar mengoperasikannya di produksi.
- Berapa banyak tool (atau server) MCP yang kalian pasang dan gunakan?
Dua dataset yang kami lihat memiliki tingkat duplikasi berbeda 3 kali lipat (0,80% vs 2,41%). Jumlah tool-nya juga sangat berbeda, 20 vs 523, tetapi karena karakter task dan konfigurasi model juga berbeda, kami tidak bisa memisahkan apakah jumlah tool adalah penyebabnya.
Saat benar-benar dibagi berdasarkan jumlah server yang terpasang pada task di dalam benchmark, angkanya paling tinggi saat ada 4–5 server (sekitar 2,5%), lalu justru menurun setelahnya, membentuk pola non-monotonik. Kami tidak melihat hubungan sederhana bahwa “semakin banyak tool, semakin banyak duplikasi”. Saya penasaran bagaimana kenyataannya di operasi produksi.
- Pernahkah kalian mengalami eksekusi duplikat? Bagaimana kalian menemukannya?
Sebagian besar kasus yang kami lihat tidak menghasilkan error. Dua-duanya 200 dan log-nya juga bersih, jadi kalau hanya melihat log setelah kejadian, tidak terlihat. Dalam praktiknya, sepertinya sering kali baru tahu karena diberi tahu pelanggan; bagaimana pengalaman kalian?
- Apakah tool yang kalian gunakan mengembalikan ID entitas di respons?
Ini menjadi pembeda antara “dipanggil dua kali” dan “tercipta dua entitas”. API pembuatan dokumen kebanyakan memberikan ID, tetapi pengiriman email sering kali hanya memberikan string “sukses”. Dari 3.197 kasus yang tidak bisa dipastikan, 2.011 kasus termasuk kategori ini, dan ada 24 jenis tool yang sama sekali tidak pernah memberikan ID di respons.
Saya tidak mencari jawaban pasti; saya ingin memahami seberapa berbeda benchmark dan operasi produksi nyata. Cerita pengalaman saja sudah sangat membantu.
Belum ada komentar.