2 poin oleh GN⁺ 2024-07-16 | 1 komentar | Bagikan ke WhatsApp
  • Kevin Bankston mengklaim bahwa saat ia membuka dokumen pribadi di Google Drive/Docs, Gemini merangkumnya tanpa diminta, sehingga perilaku default fitur AI Workspace dan cakupan persetujuan pengguna menjadi kontroversi
  • Insiden ini bermula dari kasus PDF laporan pajak milik Bankston, lalu fokus masalah kemudian menyempit ke perilaku file yang dibuka di Google Drive, bukan Google Docs itu sendiri
  • Meski pengaturan terkait sudah diperiksa, toggle ringkasan Gemini untuk Gmail, Drive, dan Docs ternyata sudah nonaktif, dan lokasi pengaturan yang ditunjukkan Gemini juga berbeda dari yang sebenarnya, sehingga pengguna sulit memahami status kendalinya
  • Bankston mengamati pola bahwa setelah menekan tombol Gemini pada satu dokumen di Drive, Gemini tampaknya otomatis berjalan ketika dokumen dengan format file yang sama dibuka
  • Google membantah dengan menyatakan bahwa data Workspace tidak digunakan untuk pelatihan dan tidak disimpan, tetapi hubungan antara status panel samping Gemini di Drive dan pengaturan ringkasan tetap menjadi isu yang harus diperiksa langsung oleh pengguna

Kontroversi ringkasan otomatis Gemini yang bermula dari dokumen pribadi

  • Kevin Bankston memposting di X bahwa ketika ia membuka laporan pajak miliknya di Google Docs, Gemini merangkumnya tanpa diminta
  • Ia mempertanyakan apakah Gemini otomatis memproses dokumen pribadi yang dibuka di Google Docs, dan mengkhawatirkan situasi di mana pengguna harus mencari dan mematikan pengaturan yang sebelumnya tidak mereka ketahui
  • Belakangan, konteksnya dipahami lebih dekat dengan dokumen yang dibuka di dalam Google Drive daripada Google Docs itu sendiri
    • Jenis dokumennya adalah PDF
    • Kemungkinan bahwa hal ini juga dapat berlaku pada Docs masih tersisa

Toggle ringkasan yang sudah nonaktif dan panduan pengaturan yang tidak sesuai

  • Bankston mengatakan ia mencoba mencari pengaturan privasi yang ditunjukkan Gemini, tetapi tidak menemukan pengaturan tersebut di lokasi sebenarnya
  • Setelah itu ia memeriksa toggle terkait, tetapi Gemini summaries in Gmail, Drive, and Docs ternyata sudah dinonaktifkan
  • Lokasi pengaturannya juga berbeda dari dua halaman web yang pertama kali ditunjukkan bot Gemini
  • Pengalaman ini memperbesar kekhawatiran tentang kurangnya kontrol pengguna atas informasi pribadi yang sensitif

Pola eksekusi otomatis per format file yang diamati di Drive

  • Masalah yang dialami Bankston tampaknya terbatas pada Google Drive
  • Setelah tombol Gemini ditekan pada setidaknya satu dokumen, saat dokumen dengan format file yang sama dibuka, Gemini kemudian terlihat berjalan otomatis
    • Format file dalam kasus ini adalah PDF
    • Setelah itu, file dengan format yang sama yang dibuka di Google Drive menjadi sasaran pemicu otomatis
  • Bankston juga mengemukakan kemungkinan bahwa Google Workspace Labs yang ia aktifkan pada 2023 telah menimpa pengaturan Gemini AI yang dimaksudkan

Bantahan Google dan penjelasan perlindungan data

  • Juru bicara Google menjelaskan bahwa fitur AI generatif dirancang untuk memberikan pilihan pengguna dan kontrol data
  • Posisi Google adalah bahwa penggunaan Gemini in Google Workspace memerlukan aktivasi terlebih dahulu oleh pengguna
  • Jika pengguna mengaktifkannya, konten digunakan dengan cara yang melindungi privasi untuk menghasilkan respons yang berguna terhadap prompt, dan tidak disimpan secara terpisah tanpa izin
  • Google menjelaskan melalui postingan blog tentang perlindungan data Workspace bahwa data Workspace tidak dikumpulkan atau digunakan untuk pelatihan
  • Google menambahkan bahwa jika fitur aktif, konten dokumen yang dibuka dapat diringkas, tetapi konten tersebut tidak disimpan

Solusi panel samping dan beban pemeriksaan yang masih ada pada pengguna

  • Google menyarankan bahwa Bankston mungkin telah menggunakan panel samping Gemini di Drive, dan masalah tersebut dapat diselesaikan dengan menutup panel
  • Dalam pengalaman Bankston, karena pengaturan ringkasan terkait sudah nonaktif, masih ada perbedaan antara kondisi nonaktif yang diharapkan pengguna dan perilaku sebenarnya
  • Saat membuka dokumen sensitif yang tersimpan di Google Drive, pengguna berada dalam situasi harus memeriksa sendiri status aktivasi fitur Gemini, status panel samping, dan perilaku berdasarkan format file

1 komentar

 
GN⁺ 2024-07-16
Pendapat di Hacker News
  • Ini kembali menunjukkan bahwa data yang diunggah ke penyedia cloud pada akhirnya tidak dikendalikan seperti milik kita sendiri
    Kali ini ada sinyal yang jelas, tetapi saya rasa sistem Google sudah sejak lama membaca dan mengagregasi data di dalam dokumen privat
    Kekhawatiran ini sudah muncul sejak Gmail diluncurkan 20 tahun lalu; saat itu orang-orang terkejut dengan gagasan bahwa “Google membaca email untuk menampilkan iklan”, tetapi inbox 1GB dan UI baru cukup meyakinkan
    Setelah itu, di layanan seperti Google Drive, mereka belajar membuatnya tampak tidak terlalu menakutkan atau tidak terlalu terang-terangan, dan kemungkinan juga karena mereka menginginkan uang dari pelanggan korporat

    • Sudah sewajarnya Google membaca dan mengagregasi data dari dokumen privat
      Kalau tidak, bagaimana mereka bisa menyediakan pencarian dokumen?
    • Untuk data yang berada di penyedia cloud, saya lebih memercayai ProtonDrive
      Karena datanya dienkripsi baik saat transit maupun saat disimpan
      Apple juga kini mengenkripsi sebagian besar data saat transit dan saat disimpan, serta mendokumentasikan data mana saja yang dilindungi
      Namun saya tidak yakin apakah Apple di masa depan akan ingin menggunakan data saya untuk melatih model publik
      Desain yang menambahkan lapisan fine-tuning yang dapat diganti dan berbasis pelatihan lokal pada model bahasa besar inti pralatih Apple terlihat cukup baik dari sisi privasi, tetapi pada praktiknya saya tidak benar-benar tahu
      Saya cenderung kurang memercayai Google Drive karena saya memberi Colab Pro dan beberapa pihak ketiga izin akses ke Drive, dan jika tulisan ini benar, tingkat kepercayaan itu makin turun
      Analogi Gmail awal cukup tepat
      Tiga tahun sebelum Gmail dirilis ke publik, saya menggunakannya lewat undangan privat dari Peter Norvig, dan saat itu saya menyukai iklan relevan yang muncul di samping Gmail
      Saya juga ingin bereksperimen dengan kegunaan model bahasa besar yang terintegrasi ke lingkungan seperti Workplace, jadi saya memberi layanan 20 dolar per bulan bernama Google AI Plus atau semacamnya akses ke seluruh aset Google saya
      Pada akhirnya, saya secara sukarela menyerahkan privasi saya di layanan Google
    • Pernyataan bahwa “sistem Google sudah sejak lama membaca dan mengagregasi data di dalam dokumen privat” memang benar karena begitulah cara kerja pencarian
      Namun jika maksudnya menyiratkan bahwa data privat semua orang di-scrape dan dimasukkan ke model bahasa besar, itu jelas teori konspirasi
      Mengejutkan bahwa ada yang percaya Google berhasil meyakinkan puluhan ribu insinyur untuk diam-diam menyembunyikan konspirasi raksasa yang menyalahgunakan data privat semua orang
    • Saat saya membuat reservasi di Expedia, email jadwalnya masuk ke Gmail, dan beberapa menit kemudian muncul tombol ajakan native di layar beranda Android untuk menyiapkan produk perjalanan Google
      Setelah itu saya meninggalkan Android, tetapi lebih sulit untuk lepas dari Gmail
  • Semua AI, baik untuk pelatihan maupun pemindaian, harus berdasarkan persetujuan eksplisit
    Pengguna harus memilih sendiri kotak centang “Saya ingin menggunakan fitur AI”, dan teks yang menjelaskan artinya juga harus sangat jelas
    Ini harus diwajibkan dan dipaksakan, dengan denda keras bagi perusahaan yang tidak mematuhinya

    • Saya bisa memahami soal pelatihan, tetapi saya tidak mengerti mengapa pemindaian juga menjadi masalah
      Secara harfiah itu hanya menjalankan algoritme pada data saya dan menampilkan hasilnya kepada saya
      Secara mendasar, itu tidak berbeda dari pemeriksa ejaan atau membuat daftar isi otomatis dari gaya judul
      Selama hasilnya tetap privat hanya untuk saya, seperti dalam kasus ini, saya tidak tahu apa yang perlu dikhawatirkan
      Fakta bahwa algoritmenya berbasis model bahasa besar tidak ada hubungannya dengan privasi atau keamanan
    • AI sedang menjadi media sosial baru
      Pengguna bukan pelanggan, melainkan produk
      Alih-alih menghasilkan data untuk dijual perusahaan media sosial kepada pengiklan, kini strukturnya adalah pengguna menghasilkan data untuk pelatihan AI dan sebagai gantinya memakai layanan secara gratis
    • Saya penasaran apa tepatnya arti “pemindaian”
      Sepertinya yang dimaksud bukan untuk tujuan pelatihan, melainkan membaca dokumen sementara untuk memberikan ringkasan; saya tidak mengerti mengapa itu harus menjadi objek regulasi
    • Kita juga perlu ekstensi robots.txt agar file yang dapat diakses publik bisa dikecualikan dari dataset pelatihan AI
      Saya ingat ada upaya awal bernama ai.txt, tetapi belum jelas siapa yang mengikutinya
    • Saya penasaran apa sebenarnya dampak privasi dari pelatihan AI
  • Terlepas dari fakta bahwa tulisan ini jelas ditulis dengan cara yang menimbulkan salah paham, berikut rangkuman tautan yang dibagikan di thread tweet yang disebutkan dalam tulisan tersebut
    Pengelolaan aktivitas Gemini: https://myactivity.google.com/product/gemini
    Halaman yang memuat sebagian besar jawaban terkait opt-out untuk Google Workspace dan berbagai aplikasi Google: https://support.google.com/docs/answer/13447104#:~:text=Turn...

  • Judulnya membuat persoalan ini agak tidak jelas
    Kalau Anda meminta Gemini merangkum dokumen, tidak mengherankan jika ia merangkumnya
    Di sini istilah “pemindaian” bekerja terlalu berlebihan, dan judulnya menyiratkan seolah-olah Google melatih Gemini dengan dokumen privat
    Isu sebenarnya adalah Gemini berjalan dengan dokumen privat sebagai input dan merangkumnya dalam kondisi ketika pengguna mengira mereka telah menonaktifkannya secara eksplisit
    Meski begitu, fakta bahwa pengaturan tersebut tidak dipatuhi adalah bug yang signifikan di infrastruktur Google, dan bagi orang yang sepenuhnya menentang penggunaan AI generasi baru, ini cukup untuk membuat mereka meninjau strategi keluar

    • Saat meminta Gemini merangkum satu PDF, tidak mengherankan jika PDF itu dirangkum
      Namun jika setelah sekali meminta satu PDF dirangkum, Gemini kemudian merangkum semua PDF yang ada di Drive, itu baru mengejutkan
  • Saya rasa judulnya menyesatkan
    Saya mengira isinya soal pemindaian untuk pelatihan atau pengujian, tetapi ternyata ini adalah fitur untuk merangkum tulisan yang sedang dilihat pengguna
    Karena itu, penggunaan kata “caught” tidak jujur
    Kita tidak menyebut seseorang “tertangkap” ketika ia sedang melakukan pekerjaan yang sudah ia beri tahu akan dilakukan

    • Karena izinnya dimatikan, apa pun yang dilakukan terhadap dokumen itu berarti dilakukan tanpa izin
      Judulnya benar
  • Tinggal soal waktu sampai seseorang mengekstrak sesuatu yang bernilai dari model Google
    Bisa saja itu kata sandi bank atau kunci kripto
    Insiden pizza lem menunjukkan bahwa mereka sekadar memaksakan ini secara asal-asalan

  • Ini mirip dengan perebutan data kesehatan yang terjadi pada masa COVID
    Berbagai kelompok memanfaatkan krisis untuk mencoba memeras data keluar dari tabung sekali saja, dan sebagian berhasil
    Karena biaya untuk mendapat teguran rendah, sementara nilai mengambil data besar
    Pada dasarnya ini adalah serobotan birokratis
    Bagi orang yang pernah bekerja di bidang privasi, ini mengecewakan tetapi dapat diprediksi, dan kebanyakan orang akan berpura-pura terkejut lalu melupakannya
    Karena karier mereka bergantung pada kemampuan untuk terus mempertahankan narasi “niat baik” yang tidak masuk akal
    Pesan SMS yang diretas di AT&T kemungkinan besar berikutnya, dan bahkan jika ketikan ponsel bocor atau pembaruan OS pada platform komersial menambahkan agen pengumpul untuk pelatihan model, semua orang akan sama-sama terkejut
    Tentu saja akan ada juga kemasan bahwa ini adalah peningkatan privasi demi kepuasan pengguna
    Jika manajer produk dan engineer yang membuat hal ini tidak dijadikan contoh, lain kali hal yang sama akan terulang dalam skala yang lebih buruk dan lebih besar

  • Tweet asli dan tulisan ini sengaja mencampur istilah agar disalahpahami
    Tujuannya membuat seolah-olah model bahasa besar mengakses dokumen dengan cara apa pun sama dengan dokumen itu masuk ke dataset pelatihan model
    Inilah umpan klik dari tulisan dan tweet aslinya, tetapi rangkaian tweet itu pada akhirnya mengakui perbedaannya lalu beralih menjadi kemarahan terhadap keberadaan fitur AI itu sendiri
    Tidak ada substansi nyata dalam cerita ini selain seorang pengguna Twitter yang marah pada pop-up AI menulis utas pemicu amarah dan membungkusnya agar tampak sebagai sesuatu yang jauh lebih jahat

  • Mengejutkan bahwa bahkan di HN pun begitu banyak orang berhasil disesatkan tentang apa yang sebenarnya terjadi
    Saya jadi bertanya-tanya apakah masih ada orang yang membaca tulisan sebelum mengunggahnya

  • Apakah mengejutkan bahwa Google belum melangkah cukup jauh dalam hal privasi dan akses data?
    Mereka bicara, tetapi tidak akan pernah sampai pada titik layanan mereka sendiri tidak bisa mengakses data
    Semua data yang disimpan secara jarak jauh harus sampai pada titik server tidak dapat mendekripsinya dan hanya didekripsi di perangkat kita
    Kalau tidak, itu sama saja mengizinkan perusahaan menambang data sesuka mereka, dan kita sama sekali tidak punya cara untuk mengetahui apa yang mereka lakukan
    Tentu saja masih ada masalah bahwa kita harus percaya data itu benar-benar tidak bisa didekripsi, dan tidak ada solusi yang bagus untuk itu
    Akses AI ke data pribadi harus diproses di dalam perangkat, dan jika pemrosesan server diperlukan, semoga itu hanya masalah jangka pendek, tetapi harus ada pemberitahuan yang jelas bahwa data dikirim keluar dari perangkat
    Bahkan jika saat ini tidak digunakan untuk pelatihan model, tidak tidak masuk akal untuk berpikir bahwa data yang melewati Gemini atau server jarak jauh mana pun dapat dicatat dalam log dan kemudian digunakan untuk pelatihan tambahan, tersimpan dalam log teks polos, atau dapat dilihat oleh tester

    • Pada akhirnya semuanya runtuh di titik ini
      Pada akhirnya strukturnya menjadi perusahaan berkata “percaya pada kami”, dan sudah sangat jelas bahwa perusahaan tidak dapat dipercaya untuk menangani hal semacam ini