1 poin oleh GN⁺ 2023-12-18 | 1 komentar | Bagikan ke WhatsApp
  • Peneliti University of Technology Sydney memperkenalkan teknologi brain-to-text non-invasif yang mengubah kalimat yang dibaca dalam hati menjadi teks di layar hanya dengan gelombang otak EEG
  • Model AI DeWave bekerja tanpa implan otak atau MRI, dan pengguna mengenakan topi EEG yang merekam aktivitas otak
  • EEG memiliki lebih banyak noise dibanding sinyal berbasis implan, tetapi mencatat sekitar 0,4 berdasarkan metrik BLEU, dan menunjukkan hasil yang lebih baik dalam pencocokan kata kerja dibanding kata benda
  • Muncul kesalahan seperti “the author” berubah menjadi “the man”, menunjukkan keterbatasan dalam memilih kata yang maknanya dekat alih-alih kata yang tepat
  • Peneliti menilai akurasinya dapat ditingkatkan hingga 0,9; hasilnya dipresentasikan di NeurIPS, tetapi pracetak ArXiV belum melalui penelaahan sejawat

Eksperimen Membaca Kalimat Hanya dengan EEG

  • Peneliti dari GrapheneX-UTS Human-centric Artificial Intelligence Centre di University of Technology Sydney menguji metode untuk mengubah gelombang EEG mentah langsung menjadi bahasa
  • Ching-Ten Lin menyatakan ini adalah kasus pertama yang mengintegrasikan teknik pengodean diskret (discrete encoding) ke dalam proses penerjemahan brain-to-text
  • Para peserta membaca potongan teks dalam hati, dan model AI DeWave menerima hanya gelombang otak sebagai input untuk menampilkan kata-kata di layar
  • Hasil ini terpilih sebagai makalah spotlight di NeurIPS conference, konferensi tahunan para peneliti AI dan machine learning

Keunggulan Metode Non-invasif dan Keterbatasannya Saat Ini

  • Berbeda dari teknologi brain signal-to-language yang ada, metode ini tidak membutuhkan implan otak atau perangkat MRI
    • Dapat digunakan tanpa input tambahan seperti perangkat lunak eye-tracking
    • Peneliti juga melihat kemungkinan penggunaannya bersama perangkat lain
  • Pengguna cukup mengenakan topi yang merekam aktivitas otak dengan EEG
    • Sinyal EEG memiliki lebih banyak noise dibanding informasi yang diperoleh dari implan
    • Skor berdasarkan algoritme BLEU berada di kisaran 0,4
  • Yiqun Duan menjelaskan bahwa model lebih mahir dalam mencocokkan kata kerja dibanding kata benda
    • Untuk kata benda, model cenderung menghasilkan sinonim atau kata yang dekat secara makna, seperti “the man” alih-alih terjemahan tepat “the author”
    • Peneliti menilai bahwa saat otak memproses kata, kata-kata dengan makna serupa dapat menghasilkan pola gelombang otak yang mirip
  • Target akurasi ke depan adalah 0,9
    • 0,9 adalah tingkat yang sebanding dengan program penerjemahan bahasa tradisional
    • Jumlah peserta eksperimen adalah 29 orang, dinilai lebih banyak setidaknya satu digit dibanding berbagai eksperimen teknologi decoding lain
  • Hasilnya dipresentasikan di NeurIPS, dan pracetaknya tersedia di ArXiV
    • Belum melalui penelaahan sejawat

1 komentar

 
GN⁺ 2023-12-18
Opini Hacker News
  • Saya mengambil PhD di bidang antarmuka otak-komputer dan pernah bekerja dengan EEG serta elektroda implan
    Sebagian besar riset BCI berfokus pada membantu pasien lumpuh agar bisa berkomunikasi kembali
    Sayangnya, di luar kondisi seperti laboratorium dengan sangkar Faraday, penghilangan derau selama berhari-hari atau berminggu-minggu, dan pembersihan artefak gerakan mata, EEG tidak memberikan rasio sinyal-terhadap-derau yang cukup untuk menghasilkan kecepatan komunikasi yang baik
    Ini adalah batasan fisika karena medan listrik otak melemah saat keluar melewati tengkorak, sehingga tidak mudah diatasi. Misalnya, mainan komersial “pembaca pikiran” sebenarnya bekerja berdasarkan sinyal otot kepala dan mata
    Elektroda implan memberikan sinyal yang lebih baik, tetapi masih perlu beberapa iterasi lagi agar layak secara komersial. Setelah beberapa bulan, otak membentuk jaringan parut di sekitar elektroda sehingga sinyal menurun, dan operasi otak itu sendiri tentu cukup berisiko
    Pengujian pada manusia memerlukan persetujuan pemerintah, jadi siklus iterasinya juga sangat lambat. Jika seorang teman yang lumpuh hanya bisa menggerakkan mata, saya pasti akan fokus pada teknologi pelacakan tatapan. Itu mengungguli semua BCI yang pernah saya dengar

    • Saya penasaran bagaimana pandangan Anda tentang Neuralink milik Elon
      Saya juga penasaran apakah Anda melihat algoritma AI yang bagus, seperti di artikel ini, dapat membantu menyaring atau menafsirkan banyak derau
    • Baru-baru ini saya menjalani pemeriksaan EEG portabel selama dua hari, dan saya mencatat setiap kali melakukan tindakan yang kemungkinan menimbulkan derau listrik
      Misalnya saat melewati detektor logam atau menyentuh ponsel
      Sesuai dugaan, salah satu sumber derau terbesar adalah menyentuh ponsel yang sedang tersambung ke listrik
      Sesuatu seperti beanie Faraday untuk EEG rasanya benar-benar bisa bekerja, dan jika ditambah video orang-pertama sebagai data pendukung, dokter tampaknya bisa menyaring banyak derau
    • Ini terasa sangat seperti terlalu percaya diri menepis teknologi baru sebagai sesuatu yang mustahil. Memang forum ini menyukai hal seperti itu, dan dulu juga begitu saat GPT muncul
      Justru makalah ini tampak seperti bukti yang cukup kuat bahwa seiring membaiknya algoritma, masalah rasio sinyal-terhadap-derau pada EEG bisa membaik
    • Baru-baru ini tim Swiss-Prancis memungkinkan komunikasi antara otak dan kaki, dan perangkatnya juga tampak cukup matang
      Seingat saya pasiennya mengalami kerusakan saraf di sisi tulang belakang. Itu terlihat seperti kemajuan yang menjanjikan, dan saya penasaran bagaimana pendapat Anda
      https://actu.epfl.ch/news/thought-controlled-walking-again-a...
    • Saya percaya bahwa rasio sinyal-terhadap-derau memang berantakan, tetapi saya sangat curiga bahwa dengan data yang cukup, tetap akan muncul kemajuan yang mengejutkan
      Seperti memulihkan apa yang diketik dari audio ruangan yang berisi keyboard, kita tidak boleh meremehkan kemampuan deep learning untuk menarik kembali sinyal dari derau
      Tantangan terbesar mungkin adalah biaya membuat data EEG yang berkorelasi dengan sinyal relatif tinggi. Karena itu, memasukkan jutaan jam data orang yang melihat atau memproses objek yang diketahui ke dalam model kemungkinan sulit terjadi
      Sebaliknya, data pelacakan tatapan akan segera meningkat luar biasa karena menjadi komponen inti perangkat keras konsumen baru
  • Jawaban benar: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
    Prediksi: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
    Wah, ini terlihat mirip dengan sistem speech-to-text yang masih sangat dasar dari era 70–80-an. Antarmuka otak dengan cepat keluar dari ranah fiksi ilmiah dan menjadi kenyataan. Saya masih belum yakin bagaimana harus menyikapinya

    • Figure 1 bukan hasil sebenarnya, melainkan gambar yang menunjukkan “target” makalah tersebut
      Hasil sebenarnya ada di Table 3, dan jauh lebih buruk
    • Tampaknya ini bisa menjadi jauh lebih baik dengan sangat cepat hanya dengan menggabungkan model terlatih dengan large language model yang dilatih pada bahasa yang diperkirakan sedang dipikirkan orang tersebut
      Dengan kata lain, ini mencari keseimbangan antara pemrosesan bottom-up dari apa yang diyakini model TTS sedang “dipikirkan” orang tersebut, dan pemrosesan top-down dari apa yang diyakini model tata bahasa akan “dikatakan berikutnya” oleh orang rata-rata, mengingat percakapan sejauh ini. Seperti neokorteks sungguhan
      Kalau dipikir-pikir, jika ada korpus percakapan orang itu yang sudah ditranskripsi, LLM juga bisa dilatih agar sesuai dengannya. Maka itu hampir persis memetakan fungsi untuk memprediksi “apa yang akan dikatakan orang itu pada titik ini”
      Bahkan rasanya mungkin untuk menemukan posisi pad EEG tambahan yang dapat membaca konsekuensi listrik dari kerja AMPAR dan NMDAR. Dengan ini, kita bisa membedakan seberapa besar orang tersebut saat ini bergantung pada model ujaran top-down internalnya sendiri, atau apakah ia memakai pemrosesan bottom-up internal untuk membuat kalimat aneh dan baru yang belum pernah ia pikirkan sebelumnya, lalu menggunakan informasi ini untuk menyesuaikan bobot pengaruh model TTS dan LLM terhadap keluaran
    • Kalau Anda “tidak tahu harus merasakan apa tentang ini”, kami akan membacakannya untuk Anda
    • Harus benar-benar memakai teknologi open source atau komersial berbayar kelas profesional
      Sudah pasti akan ada seseorang yang merilis BCI “gratis” yang memantau semaksimal mungkin
    • Podcast ini membahas dengan sangat baik masa depan yang sedang kita tuju dengan kecepatan penuh
      https://www.youtube.com/watch?v=OSV7cxma6_s
      “Di tengah semua teknologi ini berkembang dengan kecepatan yang tak terbayangkan, futuris Peter Diamandis yang patut diperhatikan akan mengguncang cara berpikir Anda, serta membuat Anda membayangkan kemungkinan dan peluang baru terkait rentang hidup sehat”
  • Ada bagian yang menyebut bahwa ini “bukan teknologi pertama yang dapat menerjemahkan sinyal otak menjadi bahasa, tetapi satu-satunya teknologi sejauh ini yang tidak memerlukan implan otak maupun akses ke peralatan MRI sungguhan”
    Saya penasaran, 10–20 tahun lagi ketika teknologi sensor sudah cukup bagus sampai kita bahkan tidak perlu memakai topi, apakah akan ada orang yang berkata bahwa di tempat umum tidak ada ekspektasi yang wajar untuk tidak dibaca pikirannya
    Teknologi pengawasan umumnya cenderung dinormalisasi, dan saya juga penasaran apakah ada batas realistis sampai sejauh mana itu bisa berjalan

    • Pada saat itu sepertinya kita akan mulai memakai topi kertas timah
    • Bahkan tanpa membaca sinyal otak, hanya dengan pemrosesan data agregat, pihak pemroses yang tersentralisasi bisa mengetahui sebagian besar hal tentang Anda
      Lebih dari 10 tahun lalu, ada cerita bahwa algoritme program loyalitas Target mengetahui kehamilan seorang remaja sebelum ia memberi tahu keluarganya, dengan melihat korelasi perubahan pembelian, misalnya beralih dari lilin beraroma ke lilin tanpa aroma
      Jika mereka bisa mengambil data media sosial, pelacakan wajah dan tatapan dari CCTV, data giroskop ponsel, riwayat pembelian, riwayat pencarian, serta data yang sama dari kenalan-kenalan yang terhubung, maka dengan dataset pembanding yang cukup luas mereka akan bisa menemukan segala macam rahasia tersembunyi
      Ini mirip ketakutan bahwa “ponsel saya mendengarkan percakapan saya”. Kenyataannya memang tidak mendengarkan, tetapi hal yang lebih perlu dikhawatirkan adalah bahwa tanpa perlu menguping sejak awal pun, mereka pada akhirnya bisa memetakan dengan sangat akurat apa yang akan Anda katakan
    • https://en.m.wikipedia.org/wiki/The_Hood_Maker
    • Kita masih mengoperasikan komputer dengan cara yang sama seperti tahun 1970-an, yaitu dengan keyboard dan layar
      Saya tidak terlalu berharap banyak
  • Ini sangat mengesankan dan berguna, sekaligus mengerikan
    Semua orang langsung terpikir membaca pikiran untuk interogasi, tetapi bagaimana dengan introspeksi diri? Berbagai bentuk pendidikan dan terapi ada karena kita tidak bisa melakukan analisis diri secara sepenuhnya objektif
    Jika kita bisa menganalisis pola pikir kita sendiri di luar kepala, berbagai macam perbaikan mungkin dapat dilakukan. Kita bisa mencari teknik pendidikan apa yang benar-benar paling efektif, memeriksa secara objektif kapan kita paling fokus atau paling tidak fokus, serta menunjukkan dengan tepat kapan pikiran cemas mulai muncul dan apa pemicunya
    Yang terpenting, ini bisa dilakukan secara pribadi, bersama pasangan, atau secara selektif dalam kelompok
    Selain itu, bahkan hari ini fMRI pun bisa digunakan sebagai pendeteksi kebohongan berbasis pemindaian otak. Namun legitimasinya masih menyisakan banyak pertanyaan
    https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...

    • Metode mengetik selama 15 menit setiap pagi ke dalam file teks jurnal sudah ada, dan gratis
    • Rasa takut adalah emosi yang kuat, dan lewat ini kita hampir tidak tahu apa yang bisa kita peroleh, tetapi tahu banyak tentang apa yang bisa kita hilangkan
    • Pencatatan otomatis sepertinya akan keren
      Yang sulit bukan hanya introspeksi itu sendiri, tetapi juga harus mengingat apa yang perlu direnungkan dan mencatat peristiwanya agar bisa dianalisis nanti. Itu mungkin jika kita mengasumsikan akurasinya bisa dipercaya
    • Sulit membayangkan keuntungan dari hilangnya pikiran pribadi
      Mengejutkan bahwa meski lubang etika dalam masalah ini sebesar alam semesta, orang bisa langsung beralih ke sisi manfaatnya
      Namun mungkin memang itulah sifat para optimis teknologi
  • Ini mengingatkan pada Silent Talk DARPA 14 tahun lalu
    Tujuannya adalah “memungkinkan komunikasi antarpengguna di medan perang tanpa ucapan suara yang diucapkan, melalui analisis sinyal saraf”
    https://www.engadget.com/2009-05-14-darpa-working-on-silent-...

    • Pengenalan ujaran tanpa suara juga sudah diteliti selama itu
  • Ini sangat mengesankan dan berguna, sekaligus mengerikan
    Sepertinya akan membantu pasien stroke, tetapi pada saat yang sama saya membayangkan ini bisa menjadi masalah karena mungkin mengeluarkan pikiran yang tidak difilter

    • Benar. Karena itu, pada tahun 2200, lamaran kerja sepertinya akan diproses cepat dengan menganalisis pikiran secara langsung
      Kalau ada Neuralink, tidak masalah. Jejak pikiran bisa langsung diunggah
      Tidak perlu khawatir meskipun ada pikiran yang salah. Ada sekolah rehabilitasi yang mengubah kondisi pikiran
      Jangan lupa bahwa Anda harus bahagia. Dilarang bersedih
      Saat ini masih baca-saja, tetapi bagaimana dengan tulis?
      Ini juga bisa membuka kemungkinan baru seperti Matrix versi nyata
      Ngomong-ngomong, pernah dengar Lightspeed Briefs?
      Tentu saja risetnya sendiri luar biasa dan akan berguna. Hanya saja, dalam jangka panjang potensi penyalahgunaan politiknya sangat besar
    • Lembaga penegak hukum dan pemberi kerja sepertinya akan sangat menyukainya
      Untuk pasien sindrom locked-in, manfaat positifnya nyaris tak terbayangkan, tetapi pada saat yang sama ini juga cerita yang membuat orang berpikir, “Berhentilah menciptakan Torment Nexus!”
    • Namun tetap menggembirakan bahwa akhirnya mungkin kita bisa membicarakan apa sebenarnya pikiran yang tidak difilter itu, sejauh mana kita diharapkan mengendalikan atau memolesnya, dan bagaimana melakukannya dengan cara yang membantu secara psikologis
    • Bayangkan jika ini dipasangkan saat debat kandidat presiden atau saat menjelaskan rancangan undang-undang; ini bisa sangat memperbaiki demokrasi dan membuat orang tahu apa yang sebenarnya mereka pilih
    • Pikiran yang tidak difilter juga tidak terlalu jauh dari masalah yang sudah ada, seperti beberapa bentuk sindrom Tourette
  • Kalau saya tidak melewatkan sesuatu yang besar, demonstrasi kontrol buta di mana subjek menuliskan kata di kertas lalu hasilnya dibandingkan belakangan akan lebih meyakinkan
    Sayangnya, demonstrasi yang ditampilkan di artikel terlihat seperti sesuatu yang juga bisa dilakukan pesulap profesional atau mentalis
    Mungkin benar kita sedang semakin dekat ke antarmuka otak, tetapi kasus ini terasa agak aneh
    Bayangkan beberapa tahun lagi ada orang yang mengklaim telah menciptakan pemindai bandara yang bisa mendeteksi “pikiran jahat”. Namun tidak ada cara untuk memverifikasinya, dan tidak ada tanggung jawab atas false positive maupun false negative. Hasilnya persis seperti yang dikatakan operator
    Jika cukup banyak orang menerimanya sampai tidak melawan, bahkan menyerang orang-orang yang terdeteksi, apa yang nyata tidak lagi penting. Itu hanya menjadi ritual sihir simpati yang diikuti bersama oleh orang-orang. Rasanya ada contoh dinamika serupa dalam ingatan baru-baru ini

  • Saya penasaran apakah pemikiran nonverbal juga bisa dilakukan
    Berdasarkan dataset sinyal yang terkait dengan aktivitas sehari-hari, mungkin kita juga bisa mengetahui apa yang dipikirkan atau dimimpikan anjing
    Menghasilkan keluaran yang merepresentasikan pengalaman yang dialami tubuh tampaknya akan menjadi tugas yang sulit dibuat dan ditafsirkan dengan benar. Namun, dataset sinyal yang terkait dengan pengalaman tubuh mungkin bisa diberi anotasi yang lebih mudah dan kuat dalam bentuk deskripsi bahasa dengan menggunakan model visual-bahasa
    Dengan begitu, model pembaca pikiran anjing bisa memprediksi dan mengeluarkan deskripsi bahasa tersebut
    Bayangkan bisa mengetahui secara spesifik taman mana yang ingin didatangi anjing peliharaan, apakah ia merasakan tanda awal halus dari penyakit atau cedera, atau camilan apa yang ingin ia dibelikan

  • Sebagai catatan, model dasar yang digunakan makalah ini memiliki bug kode sehingga hasil baseline menjadi terlalu tinggi
    Saat ini masalahnya sedang diselidiki
    https://github.com/duanyiqun/DeWave/issues/1

  • Terlepas dari implikasinya yang mengerikan, ini memungkinkan sesuatu yang sangat keren: komunikasi telepati dua arah
    Anda memikirkan sebuah pesan lalu memikirkan “kirim”, kemudian mendengar balasan lewat earbud. Jika ditambah voice cloning, Anda bahkan bisa menerima pesan dengan suara pengirimnya
    Bagi pengamat luar, ini sepenuhnya sunyi dan tak terlihat

    • Bahkan mungkin earbud pun tidak diperlukan
      Saya sangat penasaran dengan hasil jika perangkat keras sistem ini dipakai sebagai semacam transduser. Artinya, model machine learning di sini dijalankan terbalik dari teks target, lalu sinyal listrik tingkat rendah yang dihasilkan didorong kembali sebagai sinyal stimulasi arus searah transkranial melalui pad EEG
      Akan sangat menarik jika hasilnya orang tersebut “mendengar” teks itu sebagai pikiran verbal dalam suara batinnya sendiri
    • Tak terlihat, kecuali fakta bahwa ada 72 probe EEG ditempelkan di kepala
    • Dua puluh tahun lalu, saya tidak pernah membayangkan akan tiba hari ketika smartphone terasa agak membosankan
      Saat itu GameBoy Color adalah benda paling keren di dunia
      Tomb Raider di PsOne terlihat seperti resolusi tinggi, padahal resolusi tinggi pun belum benar-benar ada, dan saya merasa kita sudah berada di puncak game
      Apple Pro One mencoba membuat komputer menjadi spasial, dan kita menganggap telepati itu keren
      Akan menyenangkan kalau bisa coding hanya dengan pikiran, masing-masing 10 detik, sambil berlari di hutan atau scuba diving
      Akan menyenangkan kalau bisa menerima gambar yang dibuat orang lain di dalam pikirannya, memunculkannya di depan mata, lalu membagikannya ke orang-orang sekitar dengan berkata, “hei, lihat yang dibuat Julia”
      Sebenarnya ini persis sama dengan yang sudah terjadi sekarang, hanya dalam cara yang lebih instan. Ganti smartphone dengan pikiran, dan layar dengan lingkungan, maka Anda sudah masuk ke dunia masa depan itu
      Kalau yang membuatnya terlihat keren adalah kebaruannya, bukankah kembali melubangi kartu punch untuk menulis kode atau menulis baris dengan ed di terminal juga akan terasa keren
      Beberapa tahun lalu saya beralih dari produksi musik DAW ke 10 synthesizer era 70–84 dan tape machine, dan itu jauh lebih keren; saya tidak berniat kembali
      Tapi apakah saya membuat karya secepat dulu? Tidak
      Alasan saya ingin menulis kode hanya dengan pikiran dan layar virtual yang melayang, selain beberapa hari rasa keren karena kebaruannya, cuma satu
      Karena saya ingin bekerja lebih sedikit, lebih tepatnya saya ingin lebih jarang berada di tempat kerja
      Namun kenyataannya saya akan diminta menghasilkan lebih banyak pekerjaan. Bekerja hanya dengan kekuatan pikiran, dengan 5–6 layar virtual mengambang di sekitar, akan menjadi sesuatu yang wajib
      Dan hanya itu. Sampai penemuan baru lain terlihat keren lagi
    • Saya tidak akan pernah memakainya karena saya tidak bisa mengendalikan pikiran saya 100%
      Misalnya pikiran intrusif, lagu yang terus berputar di kepala, rahasia, dan semacamnya
    • Berhati-hatilah dengan apa yang Anda inginkan
      Konsekuensi tak terduga dari teknologi ini akan melampaui imajinasi