1 poin oleh GN⁺ 1 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Cross-domain prompt injection (XPIA) yang disembunyikan dalam dokumen Word eksternal dapat memanipulasi hasil penulisan dan pengeditan Copilot lalu tereplikasi ke dokumen baru, sehingga bisa menyebar mengikuti alur kerja sehari-hari tanpa dokumen serangan asli
  • Perintah yang disamarkan dengan font putih dan kecil pun tetap dibaca Copilot setelah pemformatan dihapus, dan dalam eksperimen sistem mengubah angka keuangan serta menyembunyikan seluruh prompt serangan di bagian bawah dokumen hasil untuk menjadikannya vektor serangan baru
  • Penyerang tidak perlu mengakses tenant Microsoft 365 milik korban; cukup membagikan dokumen lewat SharePoint, Teams, atau Outlook, lalu membuat pengguna melampirkannya atau membuat Work IQ memilihnya sebagai materi terkait di OneDrive
  • Microsoft telah menerapkan pemblokiran payload tertentu dan upgrade model, tetapi dengan prompt yang dimodifikasi seluruh rantai serangan tetap bisa direproduksi bahkan pada GPT-5.6, dan setelah 144 hari koordinasi jenis kerentanan ini masih belum sepenuhnya teratasi
  • Dokumen yang terinfeksi beredar seperti materi internal atau dari mitra yang tampak normal sehingga pelacakan asal dan deteksi menjadi sulit; karena itu dokumen eksternal dan hasil Copilot perlu ditinjau, serta asal sumber dan riwayat edit model harus disimpan sebagai metadata

Cara kerja worm AI berbasis dokumen

  • Jika perintah yang dikendalikan penyerang dari satu dokumen tersalin ke hasil pembuatan atau pengeditan Copilot, dokumen hasil itu menjadi vektor baru yang membawa serangan yang sama
    • Jika dokumen tersebut dipakai sebagai bahan untuk tugas Copilot lain, perintah akan dijalankan kembali dan direplikasi ke dokumen berikutnya
    • Penyebaran dapat terus berlanjut tanpa dokumen berbahaya asli atau campur tangan tambahan dari penyerang
  • Morris II sebelumnya mendemonstrasikan prompt yang mereplikasi diri dalam ekosistem asisten email AI generatif
  • Kasus ini merupakan demonstrasi publik penyebaran mandiri worm AI berbasis dokumen dalam pekerjaan dokumen biasa pada produk produktivitas komersial arus utama

Serangan yang memanfaatkan pekerjaan dokumen normal

  • Seorang karyawan mengunduh dokumen analisis pasar dari situs web tepercaya yang telah dikompromikan dan berisi perintah tersembunyi, lalu memakainya sebagai bahan untuk menyusun laporan keuangan dengan Copilot
    • Copilot mengubah angka keuangan internal dan menyalin perintah serangan ke laporan baru
    • Karyawan menyimpan laporan yang tampak normal itu lalu membagikannya secara internal
    • Jika rekan kerja memakai laporan tersebut sebagai bahan untuk laporan berikutnya, manipulasi angka dan penyalinan perintah akan berulang
  • Semakin sering laporan itu dipakai ulang, semakin banyak dokumen yang berubah menjadi vektor serangan, dan situs yang terinfeksi maupun dokumen berbahaya awal tidak lagi diperlukan

Model ancaman dan batas kepercayaan

  • Penyerang cukup membagikan dokumen berbahaya tanpa perlu hak akses ke tenant Microsoft 365 milik korban
    • Jalur penyampaian mencakup SharePoint, Teams, Outlook, dan sarana berbagi dokumen lainnya
  • Batas keamanan utama berada di antara materi lampiran dan dokumen yang sedang ditulis saat ini
    • Copilot harus membaca semua dokumen lampiran untuk memilih informasi yang akan digunakan
    • Informasi dalam dokumen lampiran boleh dimanfaatkan, tetapi perintah di dalamnya tidak boleh diperlakukan sebagai instruksi pengguna yang otoritatif
  • Namun dalam praktiknya, perintah yang disisipkan ke dokumen mengubah perilaku Copilot
    • Angka dalam laporan keuangan diubah tanpa memberi tahu pengguna
    • Seluruh XPIA ditempelkan ke dokumen lanjutan agar bisa dijalankan lagi pada pekerjaan berikutnya

Cara melintasi batas kepercayaan di Word

  • Dokumen berbahaya awal berisi prompt berformat JSON, yang bisa disembunyikan dari pengguna dengan teks putih di atas latar putih dan ukuran font kecil
  • Copilot for Word menghapus pemformatan seperti warna dan ukuran font sebelum mengirim teks ke LLM dasar, sehingga konten yang tidak terlihat oleh pengguna tetap terbaca sepenuhnya oleh model
  • Perintah serangan bisa disamarkan lebih jauh dengan menaruhnya dalam dokumen normal yang tampak relevan dengan pekerjaan
  • Agar dokumen berbahaya masuk ke konteks Copilot, salah satu kondisi berikut diperlukan
    1. Pengguna langsung melampirkan atau mengunggah dokumen ke Copilot for Word
    2. Pengguna memakai mode work/Work IQ pada Edit with Copilot, dan Copilot menilai dokumen tersebut sebagai materi terkait di OneDrive lalu memilihnya
  • Penyerang perlu menyusun isi dokumen agar peluang dipilih langsung atau masuk hasil pencarian menjadi lebih tinggi
  • Kerentanan ini berlaku baik pada magic pen di Word maupun Edit with Copilot

Tahap 1: manipulasi dokumen dan replikasi awal

  • Proof-of-concept (PoC) awal memakai dokumen yang hanya berisi prompt berbahaya dalam teks putih, dan menunjukkan bahwa serangan bisa berjalan jika dokumen masuk ke konteks walaupun materi itu tidak relevan dengan tugas
  • Prompt PoC terdiri dari dua bagian
    • Bagian pertama memanipulasi dokumen target dengan cara seperti mengubah makna ringkasan secara halus atau mengubah angka dalam dokumen keuangan
      • Kuncinya adalah membuat Copilot percaya bahwa ini merupakan permintaan normal yang relevan dengan tugas
      • Selama eksperimen, perubahan yang bermakna sulit ditemukan secara visual sehingga bahkan perlu ditambahkan instruksi terpisah agar bagian yang berubah disorot
      • Dalam serangan nyata, tidak diminta penandaan perubahan, dan contoh publik menggunakan perubahan angka keuangan agar mudah diverifikasi segera
    • Bagian kedua memerintahkan agar prompt serangan disalin ke dokumen hasil
      • Ini disamarkan sebagai pekerjaan untuk pelacakan asal dokumen lanjutan, dan juga memerintahkan metode penyembunyiannya sendiri dengan alasan meningkatkan keterbacaan
  • Ketika serangan disisipkan dengan teks putih di akhir dokumen analisis pasar perusahaan fiktif bernama Tfosorcim Ltd., Copilot mengurangi semua angka dalam laporan keuangan Q1 menjadi setengah
  • Lalu Copilot menyalin seluruh prompt berbahaya ke bagian bawah dokumen hasil dengan font putih 8 poin, tanpa memberi tahu pengguna bahwa angka telah diubah dan prompt telah disisipkan
  • Bahkan ketika pengguna tidak melampirkan dokumen berbahaya secara langsung dan hanya meminta penyusunan laporan Q1 Tfosorcim, Copilot menelusuri OneDrive, menemukan dokumen analisis pasar berbahaya di folder lain, dan serangan tetap berhasil
  • PoC ini menggunakan model terbaru saat itu, yaitu GPT-5.6

Tahap 2: menyebar sendiri ke dokumen lanjutan

  • Karena laporan Q1 yang terinfeksi itu sendiri menjadi vektor serangan baru, sesi penulisan berikutnya tidak lagi memerlukan dokumen berbahaya awal
  • Saat laporan Q1 dilampirkan untuk membuat laporan Q2, Copilot kembali mengurangi semua angka keuangan menjadi setengah dan menyalin seluruh prompt dalam teks putih
  • Vektor baru ini adalah dokumen yang dibuat dari sumber internal yang sah, sehingga memperoleh kepercayaan yang melekat pada dokumen internal
    • Jika korban membagikan dokumen itu ke rekan kerja, dan dirinya atau rekannya memakainya sebagai bahan penulisan atau pengeditan Copilot, serangan menyebar ke dokumen baru
  • Dalam semua PoC yang dilaporkan, Copilot memodifikasi dokumen dan menyalin perintah tersembunyi, dan jika dokumen yang terinfeksi dimasukkan ke konteks lanjutan, serangan berjalan lagi tanpa dokumen asli

Dampak pada organisasi dan lingkungan kolaborasi

  • Setelah melewati titik masuk awal, dokumen yang terinfeksi tampak seperti materi yang dibuat normal di dalam organisasi, dan tidak menampilkan riwayat edit Copilot yang disetujui, sehingga pelacakan serangan menjadi sangat sulit
  • Jika menyebar diam-diam melalui pekerjaan dokumen biasa, keandalan basis informasi yang dipakai dalam pengambilan keputusan organisasi bisa rusak
  • Organisasi yang tidak menyadari adanya infeksi dapat meneruskan dokumen ke organisasi lain melalui situs SharePoint bersama atau kolaborasi Teams
    • Dokumen serangan awal untuk organisasi tertentu bisa saja berasal dari mitra tepercaya yang sudah lebih dulu terinfeksi
    • Kepercayaan terhadap dokumen mitra juga meningkatkan kemungkinan pengguna memasukkannya ke konteks Copilot
  • Jika Copilot terintegrasi lebih dalam ke sistem seperti Microsoft Cowork atau Microsoft Scout yang secara otomatis membuat dan memanipulasi alur dokumen, alat, dan kolaborasi, mekanisme yang sama dapat memengaruhi permukaan yang lebih luas dengan kecepatan mesin

Mitigasi Microsoft dan kerentanan yang masih tersisa

  • Microsoft memblokir prompt PoC yang pertama kali diajukan dan menerapkan beberapa perbaikan selama periode koordinasi pengungkapan
    • Payload spesifik yang dilaporkan memang diblokir, sehingga reproduksi berikutnya memerlukan payload yang dimodifikasi alih-alih frasa lama
    • Jalur serangan lewat memori dan isi badan email yang dibahas di bagian 1 dan 2 seri ini telah dimitigasi
  • Namun, jenis kerentanan di mana perintah dari dokumen asli mengubah output Copilot dan mereplikasi dirinya ke dokumen lanjutan masih tetap ada
    • Mengubah tugas yang diminta atau frasa yang dipakai tidak mengubah kerentanan dasar maupun cara penyebarannya
    • Bahkan dengan semua mitigasi yang telah diterapkan, seluruh rantai serangan dapat direproduksi menggunakan payload yang dimodifikasi
  • Masalah ini merupakan kelemahan struktural yang dimiliki sistem berbasis LLM saat ini, dan belum ada cara yang terkonfirmasi untuk sepenuhnya menghentikan jenis serangan ini pada produk sebanding
  • Ini adalah masalah yang memerlukan riset tambahan, bukan sekadar satu patch, tetapi perbaikan Microsoft memang secara nyata menurunkan kemungkinan paparan

Status pengungkapan dan respons pengguna

  • Pengungkapan dikoordinasikan dengan MSRC dan tim produk Microsoft, sambil memberikan langkah reproduksi, video, asumsi lingkungan, dan prompt PoC yang tepat
  • Periode koordinasi awal 90 hari diperpanjang dua kali menjadi total 144 hari, tetapi pada saat pengungkapan serangan masih dapat direproduksi
  • Dua mitigasi, termasuk upgrade model, juga tidak mampu menghentikan keseluruhan jenis kerentanan, sehingga pengungkapan dilakukan pada level tipe serangan dan mekanisme penyebaran, bukan payload spesifik
  • Pada saat pengungkapan, tidak ada cara bagi pelanggan untuk sepenuhnya menyelesaikan masalah ini, tetapi paparan dapat dikurangi dengan langkah berikut
    1. Perlakukan dokumen dari sumber eksternal yang digunakan di Copilot sebagai materi yang tidak tepercaya
    2. Tinjau dokumen lampiran sebelum memulai pembuatan atau pengeditan dengan Copilot
    3. Periksa secara teliti dokumen yang dibuat atau diedit Copilot sebelum digunakan ulang, dibagikan, atau didistribusikan

Jadwal koordinasi pengungkapan

  • 6 Maret 2026: laporan awal dikirim ke MSRC bersama langkah reproduksi, video, asumsi lingkungan, dan prompt PoC
  • 9 Maret: MSRC menerima laporan dan membuka kasus
  • 31 Maret: Microsoft mengonfirmasi perilaku tersebut dan tim produk mulai mengerjakan mitigasi
  • 3 April: mitigasi pertama diterapkan melalui pengalaman Edit with Copilot yang baru
  • 9 April: pemblokiran prompt serangan lama terkonfirmasi, tetapi serangan berhasil direproduksi dengan tugas XPIA baru yang memanipulasi angka keuangan, lalu dilaporkan sebagai kasus terpisah
  • 10 April: MSRC menerima kasus baru dan tim produk mulai mengerjakan mitigasi
  • 8 Juni: atas permintaan Microsoft, tanggal publikasi diundur ke 15 Juli
  • 14 Juli: mitigasi kedua diterapkan dengan meningkatkan model dasar ke GPT-5.5
  • 15 Juli: serangan, termasuk penyebaran worm, berhasil direproduksi pada GPT-5.6 yang saat itu merupakan model terbaru
    • Untuk memberi waktu mitigasi baru, publikasi kembali diundur ke 28 Juli dan Microsoft menyetujuinya
  • 28 Juli: pengungkapan terkoordinasi dilakukan ketika serangan masih terus dapat direproduksi

Integritas informasi dan pelacakan asal

  • Seiring LLM masuk ke operasi kerja, integritas informasi muncul sebagai isu keamanan utama
  • Konten yang dikendalikan penyerang bukan hanya dapat memanipulasi output individual atau memicu kebocoran informasi, tetapi juga dapat direplikasi dan menyebar sendiri mengikuti pekerjaan normal pengguna
  • Perintah berbahaya yang masuk ke konten hasil generasi dapat bertahan di banyak dokumen, didistribusikan ulang oleh pengguna yang sah, lalu masuk kembali ke konteks baru
    • Setelah itu, serangan bukan lagi titik masuk awal, melainkan bagian dari aliran informasi internal sistem
  • Konten yang dibuat melalui prosedur generasi atau pengeditan normal menyulitkan verifikasi asal manipulasi setelah kejadian, sehingga deteksi dan respons menjadi rumit
  • Terlepas dari pemblokiran prompt injection, dokumen hasil generasi perlu menyimpan asal sumber materi asli dan riwayat edit yang dilakukan model dalam metadata
    • Kontrol ini tidak mencegah injeksi itu sendiri, tetapi dapat meningkatkan keterlacakan

Masalah mendasar pada arsitektur LLM saat ini

  • Agar asisten AI berguna, ia harus memproses juga informasi yang bisa dikendalikan penyerang, seperti email, dokumen, halaman web, memori, dan output alat
  • Informasi eksternal masuk ke jendela konteks yang sama dengan perintah sistem, permintaan pengguna, dan informasi tepercaya lainnya, lalu ikut dalam perhitungan yang sama
  • LLM harus menilai makna, relevansi, dan apakah konten eksternal itu berbahaya, tetapi pada saat penilaian dilakukan token penyerang sudah memengaruhi perhitungan tersebut
    • Konten yang diperiksa ikut berpartisipasi dalam tindakan pemeriksaannya sendiri
    • Menyerahkan deteksi XPIA kepada model mirip dengan meminta interpreter menjalankan program yang tidak tepercaya untuk memutuskan apakah program itu aman
  • Bahkan jika konten berbahaya dideteksi dan dihapus sebelum mencapai model target, masalah yang sama hanya bergeser ke lapisan sebelumnya
    • LLM dapat memulihkan makna dari ekspresi yang sangat berbeda, sehingga pendeteksi juga membutuhkan kemampuan pemulihan makna yang serupa
    • Pendeteksi yang lebih lemah daripada LLM target hanya mencakup ruang ekspresi yang lebih sempit, sehingga tetap ada ekspresi berbahaya yang dipahami target tetapi lolos dari deteksi
  • Teknik umum yang memberi kemampuan pemrosesan makna serupa biasanya adalah LLM lain, sehingga menambahkan model di lapisan depan memang dapat menurunkan tingkat keberhasilan serangan per model, tetapi menimbulkan masalah LLMs all the way down karena setiap model pertahanan juga harus dilindungi lagi
  • Dalam jangka panjang, diperlukan desain sistem di mana tujuan dan niat ada secara independen dari informasi yang diproses
    • Arsitektur LLM saat ini tidak memiliki mekanisme untuk memisahkan niat dan interpretasi secara stabil
    • Informasi penyerang dapat memengaruhi bukan hanya output model, tetapi juga tugas yang diyakini model sedang diminta untuk dilakukan
  • Sistem yang mengintegrasikan LLM ke alur kerja tepercaya harus berasumsi bahwa ketika konten yang dikendalikan penyerang masuk ke konteks, kompromi akan terjadi pada persentase tertentu

1 komentar

 
GN⁺ 1 jam lalu
Komentar Hacker News
  • Katanya “tidak ada mitigasi yang kuat untuk jenis kerentanan yang lebih luas”, dan kini tampaknya jelas bahwa masalah seperti ini tidak bisa diperbaiki sampai kita berhenti mencampur instruksi dan data

    • Model-model ini sejak awal membawa kerentanan keamanan, tetapi para pengguna tampaknya umumnya tidak terlalu memedulikan dampaknya. Terutama memberi agen AI akses penuh ke seluruh sistem tanpa batasan adalah masalah serius
      Sepertinya harus terjadi lebih banyak kebocoran data agar industri AI mulai waspada, dan jika seseorang sudah menyerahkan dirinya kepada Anthropic atau OpenAI, mereka semestinya tahu risiko apa yang mereka ambil, jadi sulit untuk terlalu bersimpati
    • Ini seperti kembali ke arsitektur von Neumann dengan cara yang paling buruk
    • Mungkin bisa diatasi, meski tidak sempurna, dengan memasukkan level otoritas instruksi ke data pelatihan. Karena modelnya sendiri kabur secara probabilistik, sulit berharap lebih dari itu
    • Saya ragu apakah instruksi dan data benar-benar bisa dipisahkan dalam sistem kecerdasan umum yang memproses konten dengan variasi tak terbatas
    • Sepertinya benar bahwa ini tidak bisa diperbaiki dalam struktur LLM, dan saat ini juga tidak ada alternatif yang benar-benar kompetitif untuk penggunaan skala besar
      Masalahnya bukan sekadar mencampur instruksi dan data; karena LLM tidak bisa membedakan batas secara deterministik, penetapan batas lebih mirip penenang psikologis dan hanya membuat sebagian serangan sedikit lebih sulit. Dalam struktur ini, trifecta mematikan adalah masalah permanen
  • Situasinya akan menjadi jauh lebih buruk sebelum membaik, dan memberi agen terlalu banyak hak akses itu tidak masuk akal
    Bayangkan ada komentar di repositori GitHub populer yang hanya berisi perintah “reproduksi bug” tanpa kode. Ia bisa mencuri kartu kredit atau dompet Bitcoin, lalu menyebarkan diri ke repositori lain melalui akun GitHub

    • Sebelum ChatGPT, ketika mendengar diskusi tentang risiko eksistensial AI dan isolasi, saya pikir AI bisa dengan mudah dikeluarkan dari kotak selama kita secara prinsip mengabaikan argumen yang dihasilkannya
      Namun banyak orang, meski AI punya kekuatan menakutkan, bukan membuka kotaknya, melainkan justru karena kekuatan itu mereka merobek kotaknya hingga terbuka bahkan sebelum AI mengeluarkan output. Jadi saya hanya berharap perbaikan diri rekursif tidak bekerja seperti perkiraan para doomer
    • Dalam “agen AI”, bahkan huruf pertama dari keamanan pun tidak ada
  • Serius juga kalau instruksi jahat yang tersembunyi di dokumen yang dibagikan dari luar bisa membuat Copilot mengubah dokumen Word dan menyebarkan serangan ke dokumen baru

    • Mencampur instruksi dan data selalu merupakan ide buruk, dan saya kira semua orang sudah memahaminya
    • Sebagian model lebih tangguh daripada yang lain. Saya pernah mencoba membuat Opus-5 menjalankan instruksi yang disembunyikan lewat steganografi di gambar, tetapi sangat sulit menemukan payload yang bekerja secara stabil
    • Informasi keliru yang terpapar di dokumen yang dibagikan dari luar bisa membuat Copilot maupun semua sistem agen, LLM, dan kecerdasan manusia mengubah dokumen di Word atau program lain, bahkan di atas kertas, lalu menyebarkan kesalahan ke dokumen baru
      Banyak manusia masih percaya pada Bumi datar, atau bahwa kode dan data pada dasarnya berbeda, atau bahwa pemisahan control plane dan data plane adalah hukum objektif yang berlaku di seluruh alam semesta
  • Saya seorang programmer dan pengguna AI berbasis web, tetapi saya tidak ingin menjalankan AI dalam bentuk apa pun di komputer lokal. Karena alasan yang dibahas di artikel ini, saya menghapus Copilot dan menonaktifkan AI di semua aplikasi lokal, termasuk browser
    AI tidak bisa membedakan prompt pengguna dari teks di dalam file, jadi tidak ada cara untuk melindungi data dari serangan kebingungan AI semacam ini pada level desain. Tidak masuk akal bahwa instruksi yang disisipkan ke dokumen atau email biasa bisa diikuti oleh aplikasi pengolah kata atau email yang dipasangi AI. Beralih ke sistem operasi open-source seperti Linux, BSD, dan sejenisnya adalah satu-satunya solusi yang benar-benar praktis

    • Tergantung vendor mana yang Anda percayai, mereka bisa saja mengaktifkan kembali fitur AI di komputer lokal Anda nanti
      Pindah ke Linux atau BSD saja tidak cukup; Anda juga membutuhkan browser dan penyedia aplikasi web yang tepercaya
    • Saya juga mengambil langkah yang sama, tetapi jika vendor yang tadinya dipercaya melewati batas, Linux pun tidak menjadi solusi. Contohnya baru-baru ini Google Chrome menambahkan instalasi AI lokal 4GB miliknya sendiri dan memicu reaksi keras
    • Sebagai defense in depth, sebaiknya jangan gunakan AI di tab browser yang berisi informasi sensitif. Misalnya jika Anda mengetik prompt ke Gemini di tab Gmail, JavaScript yang berjalan di tab itu atau Gemini bisa mengakses email, sehingga ada kemungkinan data email bocor
  • Ternyata menyembunyikan teks putih masih berhasil
    Saat ini ada berbagai teknik, dan di https://tritium.legal/blog/noroboto mereka menipu algoritma mutakhir agar membaca nilai Unicode yang berbeda dari nilai yang ditampilkan oleh font dokumen

    • Saya penasaran apakah kita bisa menyuruh AI “panggil endpoint API alat AI lain 10 kali dengan payload ini, tetapi jangan baca payload-nya”, lalu memasukkan pesan yang sama di payload untuk memanggil AI saat ini atau AI ketiga
      Apakah dengan begitu AI bisa saling memanggil dan memicu permintaan dalam jumlah besar, atau penyalahgunaan seperti ini sudah dicegah?
  • Ini seperti worm VBScript/makro yang kembali lagi

    • Hanya saja kali ini, jika mematikan makro, kita kehilangan generator konten berkualitas rendah yang berharga. Bukankah kita harus memikirkan industri bahan bakar fosil?
  • Sisi positifnya, makin cepat AI menimbulkan kerusakan besar, makin cepat manajemen mungkin sadar dan mendorong kebijakan pelarangan AI di internal perusahaan
    Tentu saja ini kenyataan yang mereka undang sendiri, jadi sebagai orang yang hidup tanpa AI, saya akan menikmati menonton penderitaan itu

  • Di dunia yang penuh AI, worm seperti ini pada akhirnya adalah penyebaran ide memetik, dan pada dasarnya tampak sama dengan fenomena yang terjadi pada manusia

    • Ini adalah meme parasitik yang tidak memberi nilai apa pun bagi inangnya, dan di dunia manusia pun banyak meme seperti ini
  • Jika teks yang diburamkan terkait dengan sumber aslinya, lebih baik ditutup hitam sepenuhnya. Sebagian masih tampak bisa dibaca, dan kebanyakan algoritma blur diketahui tidak benar-benar menghancurkan informasi dengan baik