- Peserta yang menggunakan saran AI mengalami penurunan tajam pada tingkat jawaban “tidak tahu” dari 44% menjadi 3%, dan akurasi turun dari 27% menjadi 9%, sementara kepercayaan diri naik dari 30% menjadi 76%
- Untuk membedakannya dari delegasi alat yang rasional dan dapat dibenarkan, peneliti menggunakan pertanyaan yang sering salah dijawab AI seperti detail visual dalam film, serta Step 3.5 Flash yang umumnya memberikan jawaban keliru
- Beberapa peserta sebenarnya bisa menjawab benar jika sendirian, tetapi setelah bertanya ke AI justru memilih jawaban salah, yang menunjukkan bahwa saran AI yang keliru dapat merusak penilaian yang sudah ada
- Dengan insentif finansial, respons “tidak tahu” membaik menjadi 8% dan akurasi naik hingga 16%, tetapi masih jauh di bawah baseline 44% dan 27% saat tidak menggunakan AI
- Hanya dengan mengetahui bahwa AI tersedia saja, kebiasaan menyadari batas pengetahuan diri bisa melemah, sehingga ini sangat mengkhawatirkan terutama bagi anak-anak dan siswa yang kemampuan berpikir kritisnya masih berkembang
Dampak saran AI terhadap penilaian dan kepercayaan diri
- Studi dari tiga universitas di Prancis dan Italia ini mengukur bagaimana akses ke saran AI mengubah penangguhan penilaian, akurasi, dan kepercayaan diri
- Tingkat jawaban “tidak tahu” turun dari 44% menjadi 3%
- Akurasi turun dari 27% menjadi 9%
- Kepercayaan diri naik dari 30% menjadi 76%
- Penelitian ini melibatkan Valerio Capraro dari University of Milano-Bicocca, Chiara Marcoccia dari École Normale Supérieure, dan Walter Quattrociocchi dari Sapienza University of Rome
- Pertanyaan disusun dari detail visual film yang biasanya gagal dijawab model AI, seperti warna seragam tim dalam Bend It Like Beckham
- Mereka sengaja menggunakan Step 3.5 Flash, yang umumnya salah pada pertanyaan semacam ini, untuk membedakan hasil tersebut dari delegasi rasional kepada alat yang andal
- Beberapa peserta memilih jawaban salah setelah bertanya ke AI, padahal mereka bisa menjawab benar jika hanya mengandalkan diri sendiri
- Insentif finansial sedikit memperbaiki hasil, tetapi tetap tidak menyamai baseline tanpa AI
- Respons “tidak tahu” naik dari 3% menjadi 8%, tetapi masih di bawah baseline 44%
- Akurasi naik dari 9% menjadi 16%, tetapi tetap belum mencapai baseline 27%
Penyerahan kognitif dan kekhawatiran pendidikan
- Peneliti Wharton menamai fenomena ketika orang menerima jawaban AI yang salah dengan tingkat 80% sambil menunjukkan kepercayaan diri lebih tinggi daripada mereka yang bekerja tanpa AI sebagai
cognitive surrender - Hasil kali ini menunjukkan bahwa masalahnya bukan sekadar mempercayai jawaban AI yang salah, tetapi juga bahwa ketersediaan AI itu sendiri menekan kebiasaan menyadari apa yang tidak diketahui diri sendiri
- Capraro menekankan bahwa kemampuan untuk mengatakan “tidak tahu” penting bagi manusia karena itu berarti mengenali batas pengetahuan diri
- Anak-anak yang tumbuh bersama sistem AI sebelum kemampuan berpikir kritis mereka berkembang penuh menjadi kelompok yang paling mengkhawatirkan
- Perombakan pencarian AI Google menggantikan tautan dengan ringkasan buatan AI yang terdengar percaya diri, dan Common Sense Media menilai desain ini sebagai “risiko yang tidak dapat diterima” bagi siswa
- Jika orang terus menggunakan produk AI yang dirancang untuk selalu menjawab dan tidak mengatakan “tidak tahu”, manusia juga bisa mempelajari perilaku yang sama
1 komentar
Komentar Hacker News
Riset ini cukup buruk. Seperti yang ditunjukkan dengan tepat oleh komentar ini pada PDF, tidak ada sama sekali unsur yang benar-benar khas untuk sistem AI dalam hal yang diuji
Para peneliti memberi peserta sebuah LLM yang diketahui menghasilkan jawaban salah untuk pertanyaan tertentu, lalu memberikan tepat pertanyaan-pertanyaan itu dalam kondisi peserta boleh tidak menjawab jika tidak yakin
Ini sama seperti memberi buku teks tentang bidang asing yang sebagian faktanya salah, lalu menguji bagian yang salah dari buku itu. Sudah pasti peserta jadi lebih mungkin menjawab, dan juga lebih mungkin salah
Saya sangat tertarik pada bagaimana LLM modern memengaruhi pembelajaran dan keyakinan, seperti kecenderungan menjilat atau ketidakberdayaan kognitif, tetapi riset ini sama sekali tidak menguji unsur-unsur itu, dan desain eksperimennya nyaris tidak berubah meski LLM diganti dengan buku teks yang keliru
Judul yang lebih baik adalah “AI yang sangat tidak akurat membuat orang kurang akurat”, tetapi itu secara alami memunculkan pertanyaan “bagaimana dengan AI yang cukup akurat?”
Jika tidak ingin jawaban yang salah, kita seharusnya tidak membelikan buku teks yang buruk untuk karyawan; demikian pula, mungkin kita harus menghindari memberi AI di bidang yang tidak mereka pahami
Selain itu, mencari jawaban di buku teks jauh lebih merepotkan daripada bertanya ke LLM, jadi efeknya kemungkinan lebih kecil. Jika tidak wajib menjawab, hanya sedikit orang yang akan repot membongkar buku teks, apalagi jika di sampulnya tertulis “mungkin ada jawaban salah”
Seberapa sering manajer mengulang nasihat AI tanpa bertanya ke pakar, atau meragukan pakar hanya karena AI mengatakan hal yang berbeda? Mungkin ada kalanya AI benar, tetapi saat salah, memperbaikinya sangat sulit
Subreddit tentang nasihat dan informasi kualitasnya memburuk parah karena penggunaan AI. Penanya menginginkan jawaban dari orang yang benar-benar tahu, tetapi banyak orang malah meneruskan pertanyaan ke ChatGPT lalu memposting hasilnya seolah itu pengetahuan dan wawasan mereka sendiri
Saya tidak tahu kualitas risetnya, tetapi di Reddit, ruang yang setengah nyata itu, gejalanya sangat jelas. Ini bukan sekadar tidak mau bilang “saya tidak tahu”, melainkan aktif mencari kesempatan untuk sok tahu
Solusi saya adalah terus-menerus memeriksa sumber asli dan dasarnya, tetapi itu memakan banyak waktu dan tenaga, dan sulit juga menentukan apa yang harus diverifikasi lebih dulu
Jauh lebih baik mengatakan “masukkan xyz ke ChatGPT” atau membagikan tautan ke dokumen terstruktur. Jika hanya menyalin-tempel hasilnya, dalam proses itu Anda sama sekali tidak menambahkan nilai apa pun
Memang informasi bisa didapat dari IMDB atau video DIY, tetapi yang diinginkan adalah penjelasan yang punya konteks dan saran yang disesuaikan dengan kondisi lokal. Orang yang mengenal saya juga tahu apa yang mudah dan sulit bagi saya, jadi mereka bisa memberi tahu bahkan apakah film atau trik tertentu tidak cocok, atau toko mana yang harus didatangi
Kuncinya selalu ada pada moderator aktif yang mencurahkan perhatian dan waktu yang sangat besar. Begitu jumlah pengguna yang mengunggah kiriman berkualitas rendah melewati ambang batas, pengguna yang baik akan pergi dan pemulihannya jadi mustahil
Jika dilihat dari pesimisme AI, meskipun AI menjadi lebih pintar, AI akan terus menyenangkan pengguna, dan orang-orang terutama akan memakainya untuk memperkuat gagasan bodoh dengan keyakinan lebih tinggi di bidang yang tidak mereka pahami
Meski bisa diselesaikan secara teknis, orang tidak menginginkan model yang mengatakan bahwa mereka salah, sehingga besar kemungkinan mereka akan memilih kebohongan fasih yang menguatkan keyakinan mereka
Kebebasan berbicara membuat orang berpikir bahwa mereka bisa saja salah, tetapi kebebasan berasosiasi memungkinkan mereka menghindarinya. AI akan memperbesar ruang gema penghiburan internet ke skala yang sulit dibayangkan
Itu adalah masa ketika komputer mulai menghitung beberapa orde lebih cepat daripada manusia, dan keruntuhan Hartford Civic Center dibahas sebagai kegagalan akibat terlalu memercayai output komputer. Untungnya tidak ada korban jiwa
Ini memang tampak seperti contoh yang agak dipilih-pilih, tetapi kombinasi “akurasi rendah dan keyakinan tinggi” mengingatkan saya pada kecelakaan itu. Saya khawatir penggunaan yang tepat dari teknologi baru baru akan mapan setelah ada kematian warga sipil atau tanggung jawab hukum, dan setidaknya kita bisa mulai dari 1) tidak memakainya pada sistem yang kritis terhadap keselamatan dan 2) tidak mengganti pakar dengan algoritme
https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
Namun orang yang benar-benar bekerja dengan AI dan membayar mahal lebih memilih diberi tahu oleh AI bahwa mereka salah daripada terlihat salah di depan pelanggan
Karena AI harus memberi jawaban benar sekaligus mengikuti perintah, ini tidak mudah diselesaikan dan perlu keseimbangan. Model yang lebih pintar lebih mungkin tahu apa yang benar, sehingga umumnya lebih baik daripada model kecil yang menganggap pengguna benar lalu melanjutkan halusinasi
Namun akan menarik jika pengguna bisa dengan mudah memilih seberapa besar AI akan membantah kepribadian atau gagasan yang mereka masukkan
Tanpa pipeline retrieval-augmented generation (RAG) yang layak atau pencarian web, AI mau tak mau hanya bisa mengeluarkan halusinasi dengan keyakinan penuh
Akan lebih menarik jika eksperimen dilakukan dengan model papan atas yang benar-benar selaras untuk menolak menjawab saat probabilitas token rendah. Eksperimen saat ini hanya membuktikan bahwa orang cenderung memercayai tulisan yang ditampilkan dengan baik di UI chat
Bagi mereka yang masih menghargai kebenaran, ucapan Richard Feynman ini bisa menjadi penunjuk arah. “Saya punya keuntungan karena telah mengetahui betapa sulitnya benar-benar mengetahui sesuatu, betapa hati-hatinya eksperimen harus diverifikasi, betapa mudahnya membuat kesalahan dan menipu diri sendiri…”
https://www.youtube.com/watch?v=tWr39Q9vBgo
Struktur imbalan penelitian ini adalah dibayar US$0,10 jika benar, dipotong US$0,10 jika salah, dan tidak ada perubahan jika menolak menjawab
Tidak disebutkan apakah peserta benar-benar menerima uang, atau apakah jika saldo akhir negatif mereka harus membayar kerugian
Saya percaya efeknya memang nyata, tetapi mungkin tidak sebesar yang ditunjukkan data. Jika taruhannya jauh lebih besar, akal sehat kemungkinan akan bekerja lebih kuat
Bagus bahwa penelitian ini diperkenalkan, tetapi tidak satu pun tautan sumber yang langsung menuju penelitian yang dikutip, melainkan mengarah ke domain sendiri atau Business Insider
Marcoccia, C. dkk., 《AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized》, PsyArXiv, 15 Juli 2026
Saya ingin tahu apakah AI benar-benar membuat perbedaan substantif dibandingkan lingkungan yang sekadar menyediakan akses ke jawaban salah
Perlu dicek apakah hasil yang sama muncul ketika hasil pencarian memberi jawaban salah untuk pertanyaan, seberapa besar karakteristik khas AI seperti kecenderungan menjilat atau interaksi percakapan berperan, atau apakah ini sekadar orang mudah memercayai apa yang mereka baca
Singkatnya, mereka meneliti baik antarmuka chat LLM yang memberikan jawaban salah maupun kondisi dengan akses ke jawaban salah yang sudah dibuat sebelumnya, dan hasilnya serupa di kedua eksperimen
Beberapa guru dikatakan menyuruh siswa menulis tugas dengan ChatGPT lalu mengkritik bagian yang salah
Di tempat yang biasanya akan membuat orang langsung menyalin jawaban AI dan menyerahkannya, mungkin menarik untuk lebih dulu menyajikan jawaban AI lalu membiarkan komunitas mendiskusikan apa yang terlewat