- Kevin Bankston mengklaim bahwa saat ia membuka dokumen pribadi di Google Drive/Docs, Gemini merangkumnya tanpa diminta, sehingga perilaku default fitur AI Workspace dan cakupan persetujuan pengguna menjadi kontroversi
- Insiden ini bermula dari kasus PDF laporan pajak milik Bankston, lalu fokus masalah kemudian menyempit ke perilaku file yang dibuka di Google Drive, bukan Google Docs itu sendiri
- Meski pengaturan terkait sudah diperiksa, toggle ringkasan Gemini untuk Gmail, Drive, dan Docs ternyata sudah nonaktif, dan lokasi pengaturan yang ditunjukkan Gemini juga berbeda dari yang sebenarnya, sehingga pengguna sulit memahami status kendalinya
- Bankston mengamati pola bahwa setelah menekan tombol Gemini pada satu dokumen di Drive, Gemini tampaknya otomatis berjalan ketika dokumen dengan format file yang sama dibuka
- Google membantah dengan menyatakan bahwa data Workspace tidak digunakan untuk pelatihan dan tidak disimpan, tetapi hubungan antara status panel samping Gemini di Drive dan pengaturan ringkasan tetap menjadi isu yang harus diperiksa langsung oleh pengguna
Kontroversi ringkasan otomatis Gemini yang bermula dari dokumen pribadi
- Kevin Bankston memposting di X bahwa ketika ia membuka laporan pajak miliknya di Google Docs, Gemini merangkumnya tanpa diminta
- Ia mempertanyakan apakah Gemini otomatis memproses dokumen pribadi yang dibuka di Google Docs, dan mengkhawatirkan situasi di mana pengguna harus mencari dan mematikan pengaturan yang sebelumnya tidak mereka ketahui
- Belakangan, konteksnya dipahami lebih dekat dengan dokumen yang dibuka di dalam Google Drive daripada Google Docs itu sendiri
- Jenis dokumennya adalah PDF
- Kemungkinan bahwa hal ini juga dapat berlaku pada Docs masih tersisa
Toggle ringkasan yang sudah nonaktif dan panduan pengaturan yang tidak sesuai
- Bankston mengatakan ia mencoba mencari pengaturan privasi yang ditunjukkan Gemini, tetapi tidak menemukan pengaturan tersebut di lokasi sebenarnya
- Setelah itu ia memeriksa toggle terkait, tetapi Gemini summaries in Gmail, Drive, and Docs ternyata sudah dinonaktifkan
- Lokasi pengaturannya juga berbeda dari dua halaman web yang pertama kali ditunjukkan bot Gemini
- Pengalaman ini memperbesar kekhawatiran tentang kurangnya kontrol pengguna atas informasi pribadi yang sensitif
Pola eksekusi otomatis per format file yang diamati di Drive
- Masalah yang dialami Bankston tampaknya terbatas pada Google Drive
- Setelah tombol Gemini ditekan pada setidaknya satu dokumen, saat dokumen dengan format file yang sama dibuka, Gemini kemudian terlihat berjalan otomatis
- Format file dalam kasus ini adalah PDF
- Setelah itu, file dengan format yang sama yang dibuka di Google Drive menjadi sasaran pemicu otomatis
- Bankston juga mengemukakan kemungkinan bahwa Google Workspace Labs yang ia aktifkan pada 2023 telah menimpa pengaturan Gemini AI yang dimaksudkan
Bantahan Google dan penjelasan perlindungan data
- Juru bicara Google menjelaskan bahwa fitur AI generatif dirancang untuk memberikan pilihan pengguna dan kontrol data
- Posisi Google adalah bahwa penggunaan Gemini in Google Workspace memerlukan aktivasi terlebih dahulu oleh pengguna
- Jika pengguna mengaktifkannya, konten digunakan dengan cara yang melindungi privasi untuk menghasilkan respons yang berguna terhadap prompt, dan tidak disimpan secara terpisah tanpa izin
- Google menjelaskan melalui postingan blog tentang perlindungan data Workspace bahwa data Workspace tidak dikumpulkan atau digunakan untuk pelatihan
- Google menambahkan bahwa jika fitur aktif, konten dokumen yang dibuka dapat diringkas, tetapi konten tersebut tidak disimpan
Solusi panel samping dan beban pemeriksaan yang masih ada pada pengguna
- Google menyarankan bahwa Bankston mungkin telah menggunakan panel samping Gemini di Drive, dan masalah tersebut dapat diselesaikan dengan menutup panel
- Dalam pengalaman Bankston, karena pengaturan ringkasan terkait sudah nonaktif, masih ada perbedaan antara kondisi nonaktif yang diharapkan pengguna dan perilaku sebenarnya
- Saat membuka dokumen sensitif yang tersimpan di Google Drive, pengguna berada dalam situasi harus memeriksa sendiri status aktivasi fitur Gemini, status panel samping, dan perilaku berdasarkan format file
1 komentar
Pendapat di Hacker News
Ini kembali menunjukkan bahwa data yang diunggah ke penyedia cloud pada akhirnya tidak dikendalikan seperti milik kita sendiri
Kali ini ada sinyal yang jelas, tetapi saya rasa sistem Google sudah sejak lama membaca dan mengagregasi data di dalam dokumen privat
Kekhawatiran ini sudah muncul sejak Gmail diluncurkan 20 tahun lalu; saat itu orang-orang terkejut dengan gagasan bahwa “Google membaca email untuk menampilkan iklan”, tetapi inbox 1GB dan UI baru cukup meyakinkan
Setelah itu, di layanan seperti Google Drive, mereka belajar membuatnya tampak tidak terlalu menakutkan atau tidak terlalu terang-terangan, dan kemungkinan juga karena mereka menginginkan uang dari pelanggan korporat
Kalau tidak, bagaimana mereka bisa menyediakan pencarian dokumen?
Karena datanya dienkripsi baik saat transit maupun saat disimpan
Apple juga kini mengenkripsi sebagian besar data saat transit dan saat disimpan, serta mendokumentasikan data mana saja yang dilindungi
Namun saya tidak yakin apakah Apple di masa depan akan ingin menggunakan data saya untuk melatih model publik
Desain yang menambahkan lapisan fine-tuning yang dapat diganti dan berbasis pelatihan lokal pada model bahasa besar inti pralatih Apple terlihat cukup baik dari sisi privasi, tetapi pada praktiknya saya tidak benar-benar tahu
Saya cenderung kurang memercayai Google Drive karena saya memberi Colab Pro dan beberapa pihak ketiga izin akses ke Drive, dan jika tulisan ini benar, tingkat kepercayaan itu makin turun
Analogi Gmail awal cukup tepat
Tiga tahun sebelum Gmail dirilis ke publik, saya menggunakannya lewat undangan privat dari Peter Norvig, dan saat itu saya menyukai iklan relevan yang muncul di samping Gmail
Saya juga ingin bereksperimen dengan kegunaan model bahasa besar yang terintegrasi ke lingkungan seperti Workplace, jadi saya memberi layanan 20 dolar per bulan bernama Google AI Plus atau semacamnya akses ke seluruh aset Google saya
Pada akhirnya, saya secara sukarela menyerahkan privasi saya di layanan Google
Namun jika maksudnya menyiratkan bahwa data privat semua orang di-scrape dan dimasukkan ke model bahasa besar, itu jelas teori konspirasi
Mengejutkan bahwa ada yang percaya Google berhasil meyakinkan puluhan ribu insinyur untuk diam-diam menyembunyikan konspirasi raksasa yang menyalahgunakan data privat semua orang
Setelah itu saya meninggalkan Android, tetapi lebih sulit untuk lepas dari Gmail
Semua AI, baik untuk pelatihan maupun pemindaian, harus berdasarkan persetujuan eksplisit
Pengguna harus memilih sendiri kotak centang “Saya ingin menggunakan fitur AI”, dan teks yang menjelaskan artinya juga harus sangat jelas
Ini harus diwajibkan dan dipaksakan, dengan denda keras bagi perusahaan yang tidak mematuhinya
Secara harfiah itu hanya menjalankan algoritme pada data saya dan menampilkan hasilnya kepada saya
Secara mendasar, itu tidak berbeda dari pemeriksa ejaan atau membuat daftar isi otomatis dari gaya judul
Selama hasilnya tetap privat hanya untuk saya, seperti dalam kasus ini, saya tidak tahu apa yang perlu dikhawatirkan
Fakta bahwa algoritmenya berbasis model bahasa besar tidak ada hubungannya dengan privasi atau keamanan
Pengguna bukan pelanggan, melainkan produk
Alih-alih menghasilkan data untuk dijual perusahaan media sosial kepada pengiklan, kini strukturnya adalah pengguna menghasilkan data untuk pelatihan AI dan sebagai gantinya memakai layanan secara gratis
Sepertinya yang dimaksud bukan untuk tujuan pelatihan, melainkan membaca dokumen sementara untuk memberikan ringkasan; saya tidak mengerti mengapa itu harus menjadi objek regulasi
Saya ingat ada upaya awal bernama ai.txt, tetapi belum jelas siapa yang mengikutinya
Terlepas dari fakta bahwa tulisan ini jelas ditulis dengan cara yang menimbulkan salah paham, berikut rangkuman tautan yang dibagikan di thread tweet yang disebutkan dalam tulisan tersebut
Pengelolaan aktivitas Gemini: https://myactivity.google.com/product/gemini
Halaman yang memuat sebagian besar jawaban terkait opt-out untuk Google Workspace dan berbagai aplikasi Google: https://support.google.com/docs/answer/13447104#:~:text=Turn...
Judulnya membuat persoalan ini agak tidak jelas
Kalau Anda meminta Gemini merangkum dokumen, tidak mengherankan jika ia merangkumnya
Di sini istilah “pemindaian” bekerja terlalu berlebihan, dan judulnya menyiratkan seolah-olah Google melatih Gemini dengan dokumen privat
Isu sebenarnya adalah Gemini berjalan dengan dokumen privat sebagai input dan merangkumnya dalam kondisi ketika pengguna mengira mereka telah menonaktifkannya secara eksplisit
Meski begitu, fakta bahwa pengaturan tersebut tidak dipatuhi adalah bug yang signifikan di infrastruktur Google, dan bagi orang yang sepenuhnya menentang penggunaan AI generasi baru, ini cukup untuk membuat mereka meninjau strategi keluar
Namun jika setelah sekali meminta satu PDF dirangkum, Gemini kemudian merangkum semua PDF yang ada di Drive, itu baru mengejutkan
Saya rasa judulnya menyesatkan
Saya mengira isinya soal pemindaian untuk pelatihan atau pengujian, tetapi ternyata ini adalah fitur untuk merangkum tulisan yang sedang dilihat pengguna
Karena itu, penggunaan kata “caught” tidak jujur
Kita tidak menyebut seseorang “tertangkap” ketika ia sedang melakukan pekerjaan yang sudah ia beri tahu akan dilakukan
Judulnya benar
Tinggal soal waktu sampai seseorang mengekstrak sesuatu yang bernilai dari model Google
Bisa saja itu kata sandi bank atau kunci kripto
Insiden pizza lem menunjukkan bahwa mereka sekadar memaksakan ini secara asal-asalan
Ini mirip dengan perebutan data kesehatan yang terjadi pada masa COVID
Berbagai kelompok memanfaatkan krisis untuk mencoba memeras data keluar dari tabung sekali saja, dan sebagian berhasil
Karena biaya untuk mendapat teguran rendah, sementara nilai mengambil data besar
Pada dasarnya ini adalah serobotan birokratis
Bagi orang yang pernah bekerja di bidang privasi, ini mengecewakan tetapi dapat diprediksi, dan kebanyakan orang akan berpura-pura terkejut lalu melupakannya
Karena karier mereka bergantung pada kemampuan untuk terus mempertahankan narasi “niat baik” yang tidak masuk akal
Pesan SMS yang diretas di AT&T kemungkinan besar berikutnya, dan bahkan jika ketikan ponsel bocor atau pembaruan OS pada platform komersial menambahkan agen pengumpul untuk pelatihan model, semua orang akan sama-sama terkejut
Tentu saja akan ada juga kemasan bahwa ini adalah peningkatan privasi demi kepuasan pengguna
Jika manajer produk dan engineer yang membuat hal ini tidak dijadikan contoh, lain kali hal yang sama akan terulang dalam skala yang lebih buruk dan lebih besar
Tweet asli dan tulisan ini sengaja mencampur istilah agar disalahpahami
Tujuannya membuat seolah-olah model bahasa besar mengakses dokumen dengan cara apa pun sama dengan dokumen itu masuk ke dataset pelatihan model
Inilah umpan klik dari tulisan dan tweet aslinya, tetapi rangkaian tweet itu pada akhirnya mengakui perbedaannya lalu beralih menjadi kemarahan terhadap keberadaan fitur AI itu sendiri
Tidak ada substansi nyata dalam cerita ini selain seorang pengguna Twitter yang marah pada pop-up AI menulis utas pemicu amarah dan membungkusnya agar tampak sebagai sesuatu yang jauh lebih jahat
Mengejutkan bahwa bahkan di HN pun begitu banyak orang berhasil disesatkan tentang apa yang sebenarnya terjadi
Saya jadi bertanya-tanya apakah masih ada orang yang membaca tulisan sebelum mengunggahnya
Apakah mengejutkan bahwa Google belum melangkah cukup jauh dalam hal privasi dan akses data?
Mereka bicara, tetapi tidak akan pernah sampai pada titik layanan mereka sendiri tidak bisa mengakses data
Semua data yang disimpan secara jarak jauh harus sampai pada titik server tidak dapat mendekripsinya dan hanya didekripsi di perangkat kita
Kalau tidak, itu sama saja mengizinkan perusahaan menambang data sesuka mereka, dan kita sama sekali tidak punya cara untuk mengetahui apa yang mereka lakukan
Tentu saja masih ada masalah bahwa kita harus percaya data itu benar-benar tidak bisa didekripsi, dan tidak ada solusi yang bagus untuk itu
Akses AI ke data pribadi harus diproses di dalam perangkat, dan jika pemrosesan server diperlukan, semoga itu hanya masalah jangka pendek, tetapi harus ada pemberitahuan yang jelas bahwa data dikirim keluar dari perangkat
Bahkan jika saat ini tidak digunakan untuk pelatihan model, tidak tidak masuk akal untuk berpikir bahwa data yang melewati Gemini atau server jarak jauh mana pun dapat dicatat dalam log dan kemudian digunakan untuk pelatihan tambahan, tersimpan dalam log teks polos, atau dapat dilihat oleh tester
Pada akhirnya strukturnya menjadi perusahaan berkata “percaya pada kami”, dan sudah sangat jelas bahwa perusahaan tidak dapat dipercaya untuk menangani hal semacam ini