- Agent.exe adalah aplikasi Electron sederhana yang memungkinkan Claude mengendalikan komputer lokal secara langsung dengan fitur baru computer use, dan proyek ini sebaiknya dianggap sebagai proof of concept
- Aplikasi ini dibuat karena proyek bawaan yang disediakan terasa terlalu berat, dan dirancang agar Claude 3.5 Sonnet dapat menjalankan tugas di komputer lokal pengguna
- Alur menjalankannya adalah meng-clone repositori, menjalankan
npm install, mengganti.env.examplemenjadi.env, memasukkan Anthropic API Key, lalu menjalankannpm start - Target yang didukung adalah MacOS, dan karena dependensinya lintas platform, Windows dan Linux secara teori juga memungkinkan
- Batasan yang diketahui adalah hanya bekerja pada display utama, AI akan mengambil alih komputer sepenuhnya, dan Claude bekerja lebih baik jika Firefox dipasang
Tujuan Agent.exe
- Agent.exe adalah aplikasi yang memungkinkan Claude mengendalikan komputer dengan fitur computer use
- Diimplementasikan sebagai aplikasi Electron yang memungkinkan Claude 3.5 Sonnet mengoperasikan komputer lokal secara langsung
- Proyek ini adalah proof of concept, dan disebutkan tidak ada rencana untuk memelihara atau menggabungkan pull request
- Bebas untuk melakukan fork dan mengembangkannya
Alasan dibuat dan cara kerjanya
- Dimulai dengan tujuan memeriksa seberapa baik computer use API baru dari Claude bekerja
- Proyek bawaan yang disediakan Anthropic terasa terlalu berat, sehingga dibuat sebagai aplikasi yang lebih sederhana
- Sempat ada rencana menambahkan mode semi-auto agar pengguna mengonfirmasi setiap tindakan sebelum dijalankan, tetapi dinilai tidak perlu karena tiap langkah terlalu lambat
- Jika model menjadi bingung, pengguna dapat menekan tombol stop untuk mengakhiri eksekusi
Cara memulai
- Clone repositori dan masuk ke direktorinya
git clone https://github.com/corbt/agent.execd agent.exe
- Pasang dependensi
npm install
- Ubah nama file
.env.examplemenjadi.envdan tambahkan Anthropic API Key - Jalankan aplikasi
npm start
- Setelah itu, minta model lewat prompt untuk melakukan tugas di komputer
Sistem yang didukung dan batasan
- Sistem yang didukung adalah MacOS
- Karena semua dependensi bersifat lintas platform, Windows dan Linux secara teori juga memungkinkan
- Batasan yang diketahui adalah sebagai berikut
- Hanya bekerja pada primary display
- AI akan mengambil alih komputer sepenuhnya
- Mungkin masih ada banyak batasan lainnya
Tips penggunaan dan roadmap
- Disebutkan bahwa Claude sangat menyukai Firefox
- Browser lain juga akan digunakan jika benar-benar diperlukan, tetapi memasang Firefox membuatnya bekerja jauh lebih baik
- Proyek ini ditulis dalam sekitar 6 jam, dan disebutkan kecil kemungkinan akan dilanjutkan ke depan
- Pull request akan ditinjau dan dapat digabungkan jika terlihat baik
1 komentar
Komentar Hacker News
Ide bagus. Sebagai orang yang berpengalaman dengan otomasi desktop dan Electron, setelah menelusuri sekilas kode sumbernya, rasanya layak dicoba untuk tugas-tugas dasar
Implementasinya adalah wrapper tipis di atas Anthropic API, dan karena pendekatannya bertahap, saya cukup yakin prosesnya bisa dihentikan sebelum melakukan hal aneh. Saya sudah menutup hal-hal yang tidak boleh dilihat Anthropic lewat screenshot, dan instalasinya di M1 berjalan mulus sehingga bisa dijalankan dalam beberapa menit
Tugas dasarnya adalah “cari penerbangan Seattle-SF dari Selasa sampai Kamis minggu depan”, dan saat dijalankan dengan kunci Anthropic API saya, ia memakai Chrome. Tiap langkah tindakan memakan waktu beberapa detik, dan Google Flights terbuka dengan benar, tetapi tanggal yang dipesan salah
Awalnya ia hendak memilih 2 November, tetapi opsi itu tertutup oleh jendela Agent.exe sendiri, sehingga ia memilih 20 November. Saya penasaran apakah Claude akan melihat tanggal bantuan yang salah dan mengoreksi dirinya sendiri, tetapi ia membiarkannya begitu saja dan menyatakan berhasil menemukan perjalanan 1 minggu, padahal sebenarnya menemukan perjalanan 4 minggu
Eksperimen ini menghabiskan kredit $0.38 dan sekitar 20 detik, dan saya akan terus bereksperimen
Pola kegagalan ini agak mengejutkan, karena dalam respons API teks biasa, 3.5 Sonnet setidaknya termasuk cukup jarang berhalusinasi dibanding model lain
Berapa lama sampai ia bisa diam-diam menambahkan daemon ke sistem. Dulu kita khawatir mata-mata Soviet mengakses rahasia Amerika, sekarang mirip seperti kita sendiri mengunggahnya ke internet supaya semua orang bisa melihatnya
Antivirus atau firewall masa kini tidak bisa mencegah kemungkinan ini merusak file di komputer saya, apalagi jaringan
Adegan ini terlintas: https://makeagif.com/i/BA7Yt3
Pengguna yang mudah terdistraksi, tidak bisa dipercaya untuk tidak membocorkan informasi ke pihak ketiga, dan bisa tertipu oleh trik sederhana
Minimal perlu akun terpisah tanpa hak sudo atau akses ke file rahasia, dan paling baik perlu mesin virtual terpisah
Saya paling familiar dengan Azure, tetapi AWS juga mestinya bisa; kalau ingin memisahkan AI dari hal-hal yang tidak boleh diaksesnya, membuat VM di Azure dan menjalankannya beberapa jam bisa dilakukan dengan biaya di bawah 1 dolar
Agar setidaknya lebih aman, minimal kita harus mengendalikan mesin yang menjalankan inferensi, dan idealnya inferensi berjalan di mesin yang sama dengan yang saya pakai
Beberapa tahun lalu ada berita tentang anak kecil yang berkata “Alexa, pesankan rumah boneka”, lalu Alexa milik orang-orang yang menonton siaran itu mendengarnya dan memesan rumah boneka
Tinggal tunggu saja apa yang terjadi kalau ada acara populer Netflix tempat seseorang berkata “Delete C:\Windows”
Untuk iseng, saya berencana memberi AI saya akses ke sakelar daya crosspoint
Sedikit menyimpang, tapi baru-baru ini saya mencoba memulai proyek full-stack dari nol dengan memakai Cursor dalam mode “compose”, dan hasilnya membuat saya tercengang
Saya tidak tahu apakah orang-orang di industri perangkat lunak benar-benar merasakan betapa totalnya industri ini akan berubah dalam 5 tahun ke depan. Sulit membayangkan pada saat itu orang masih akan mengetik kode secara manual dengan tangan
Namun contoh yang sejauh ini saya lihat kebanyakan adalah proyek yang relatif sederhana dan dimulai dari nol. Fakta bahwa itu bisa berjalan memang luar biasa sampai sulit dipercaya, tetapi sebagian besar pengembangan perangkat lunak nyata adalah menambahkan fitur atau memperbaiki bug pada kode yang sudah ada. Kode seperti itu biasanya melampaui jendela konteks sebagian besar large language model
Agar industri benar-benar berubah total, peningkatan eksponensial seperti 2 tahun terakhir harus terus berlanjut, dan saya tidak melihat tanda-tanda itu akan terjadi
Agak keluar topik, tapi masih terkait. Saya penasaran orang memakai apa untuk otomatisasi aplikasi GUI non-browser di Wayland pada Linux. Kadang saya membutuhkannya, tetapi kombinasi ini selalu sulit dibereskan
Untuk aplikasi CLI bisa ditulis dengan Bash/Python/dll., dan untuk aplikasi browser ada Selenium/Playwright. Di Xorg ada library yang meski kasar tetap bisa dipakai saat mendesak, dan di Windows ada banyak solusi RPA
Namun untuk Wayland saya belum menemukan sesuatu yang bisa diandalkan
Bisa terhubung ke container desktop dan VM yang menjalankan Linux
Kami sudah melakukan ini cukup lama, bahkan sebelum Claude membuatnya terlihat keren
“Keterbatasan yang diketahui: membiarkan AI mengambil alih komputer sepenuhnya” :)
Tampaknya mendukung multiplatform dengan macOS sebagai platform utama, jadi saya penasaran kenapa namanya .exe
Bercanda, saya tidak tahu apakah itu benar, tapi rasanya cukup mungkin
Sepertinya hanya bekerja untuk tugas-tugas sederhana. Saya menyuruhnya membuat tabel sederhana di aplikasi Mac Rhino dan OnShape di tab Chrome, tetapi tampaknya ia hanya tersesat
Di Rhino, ia memang melihat aplikasinya terbuka, tetapi hanya mengatakan akan melakukan berbagai tindakan seperti membuat bentuk, sementara sebenarnya tidak terlihat apa-apa, lalu lanjut ke tindakan berikutnya meski langkah sebelumnya belum selesai. Ia tidak memeriksa apakah tugas sebelumnya sudah selesai
Di OnShape, ia hendak membuat bentuk, lalu memilih item yang salah di menu tetapi tetap menganggap dirinya memakai tool yang benar, dan terus melanjutkan tindakan berikutnya seolah tindakan sebelumnya sudah selesai
Menyeramkan. Mungkin menarik kalau dipisahkan dengan air gap lalu disuruh mengodekan OS-nya sendiri, tetapi saya sama sekali tidak mau menaruhnya di dekat data saya yang sebenarnya
Computer, tolong posting meme shitpost sepanjang hari agar saya jadi kaya kripto sementara saya merawat keluarga dan mengurus kebun
Masa depan bergerak ke arah orang yang memakai komputer menjadi pihak yang tertipu. Kekayaan sejati adalah tidak menyentuh komputer untuk pekerjaan apa pun