- Menghasilkan secara zero-shot ilusi optik multi-sudut pandang yang membuat satu gambar terlihat sebagai objek berbeda setelah transformasi seperti rotasi, pembalikan, dan inversi warna, dengan model difusi pralatih
- Metodenya adalah memperkirakan noise pada tiap sudut pandang transformasi, lalu menyelaraskan sistem koordinat dengan transformasi invers sudut pandang tersebut, dan melanjutkan langkah difusi berikutnya menggunakan noise rata-rata
- Transformasi yang didukung mencakup rotasi, pembalikan, inversi warna, kemiringan, penyusunan ulang puzzle jigsaw, permutasi patch acak, hingga 3 sudut pandang atau lebih
- Fungsi transformasi harus dapat dibalik, dan agar sesuai dengan asumsi noise pada model difusi diperlukan linearitas serta konsistensi statistik dari noise normal baku
- Permutasi piksel dan inversi warna yang memenuhi syarat matriks ortogonal cocok dengan kondisi teoretis sehingga mudah dimanfaatkan, tetapi semakin banyak sudut pandang, semakin sulit memperoleh ilusi yang baik
Gambar yang identitasnya berubah saat ditransformasikan
- Visual Anagrams membuat ilusi optik multi-sudut pandang di mana satu gambar tampak berubah bentuk atau identitasnya setelah melalui transformasi tertentu
- Ini adalah pendekatan zero-shot yang menggunakan model difusi yang sudah ada tanpa pelatihan tambahan
- Contoh transformasinya beragam seperti berikut
- Penyusunan ulang puzzle jigsaw: gambar dibagi menjadi kepingan puzzle lalu disusun ulang sehingga tampak berbeda, bekerja seperti puzzle jigsaw dengan banyak solusi
- Pembalikan dan rotasi 180 derajat: tampilan berubah ketika gambar dibalik atau diputar 180 derajat
- Rotasi 90 derajat: gambar dikenali sebagai bentuk lain saat diputar 90 derajat
- Inversi warna: gambar berubah ketika warnanya dibalik
- Kemiringan dan “inner circle rotations”: termasuk dalam contoh transformasi lainnya
- Permutasi patch acak: patch disusun ulang, dan saat jumlah patch diperbesar hingga (64 \times 64), kualitas menurun tetapi hasilnya masih bisa dikenali
- Bukan hanya dua sudut pandang, ilusi tiga sudut pandang juga bisa dibuat, tetapi jauh lebih sulit mendapatkan hasil yang bagus
- Ilusi empat sudut pandang sangat sulit dibuat berhasil, dan hanya ditemukan satu hasil yang kira-kira setengah layak
Prosedur generasi dan syarat teoretis
- Intinya adalah prosedur untuk menggabungkan noise yang diperkirakan model difusi pada beberapa sudut pandang transformasi
- Memperkirakan noise pada tiap sudut pandang (v_i)
- Menerapkan invers sudut pandang (v_i^{-1}) pada hasil perkiraan agar selaras dalam sistem koordinat yang sama
- Merata-ratakan estimasi noise yang sudah disejajarkan
- Menjalankan langkah difusi menggunakan estimasi noise rata-rata tersebut
- Tidak semua fungsi sudut pandang cocok dengan metode ini, dan (v_i) pertama-tama harus dapat dibalik
- Model difusi memperlakukan data ber-noise (\mathbf{x}_t) sebagai kombinasi berbobot dari sinyal murni (\mathbf{x}_0) dan noise (\epsilon)
- Agar transformasi (v) mempertahankan hubungan berbobot antara sinyal dan noise, transformasi itu harus berupa transformasi linear
- Transformasi linear direpresentasikan dengan matriks (\mathbf{A})
- Model difusi dilatih dengan asumsi bahwa noise berasal dari distribusi normal baku i.i.d.
- Noise yang telah ditransformasikan juga harus memenuhi (\mathbf{A}\epsilon \sim \mathcal{N}(0, I))
- Dalam transformasi linear, kondisi ini ekuivalen jika (\mathbf{A}) adalah matriks ortogonal
- Karena itu, syarat yang cukup agar transformasi bekerja dalam metode ini adalah transformasi ortogonal
- Sebagian besar transformasi ortogonal arbitrer tidak bermakna secara visual pada gambar, tetapi matriks permutasi adalah subhimpunan dari matriks ortogonal dan dapat ditafsirkan sebagai penyusunan ulang piksel
- Rotasi, pembalikan, kemiringan, inner rotations, penyusunan ulang jigsaw, dan permutasi patch dapat dipandang sebagai bentuk penyusunan ulang piksel tertentu
- Inversi warna bukan permutasi, tetapi merupakan transformasi yang membalik tanda nilai piksel sehingga termasuk transformasi ortogonal
Makalah dan materi eksekusi
- Paper: PDF makalah CVPR 2024
- arXiv: halaman arXiv
- Code: kode Visual Anagrams
- Colab: Colab untuk menjalankan
- Diffusion Illusions: menghasilkan ilusi multi-sudut pandang dan efek visual lain dengan score distillation sampling
- Illusion-Diffusion Colab: Colab Matthew Tancik dengan ide serupa; Visual Anagrams lebih baik dalam kualitas ilusi, cakupan transformasi, dan analisis teoretis
- Factorized Diffusion: karya lanjutan dari Visual Anagrams yang menghasilkan berbagai jenis ilusi hibrida
- Images that Sound: menghasilkan spektrogram yang tampak seperti gambar dengan teknik serupa
1 komentar
Komentar Hacker News
Pembalikan pria/wanita sangat saya suka
Saya penasaran, kalau teknik yang sama diperluas, berapa banyak permutasi yang bisa dibuat agar terbaca dalam satu gambar. Saya tidak terlalu paham matematika, tapi apakah ini tetap bekerja karena menerapkan dua transformasi ortogonal secara berurutan masih menghasilkan transformasi ortogonal?
Awal tahun lalu ada ide serupa, dan saya juga sempat sedikit mencoba metode papan catur
Di sini ada seekor kucing yang dibuat dari 9 gambar kucing dengan gaya pelukis terkenal: https://twitter.com/marekgibney/status/1521500594577584141
Mungkin Anda perlu sedikit memicingkan mata untuk melihatnya. Saya membuat beberapa, lalu entah kenapa minat saya hilang
Contoh pembalikan warna pria/wanita adalah yang paling mengesankan. Rotasi bisa saya putar di kepala untuk melihat sudut pandang lain, tetapi pembalikan warna sangat sulit dilakukan secara mental
https://dangeng.github.io/visual_anagrams/static/videos/grid...
Sebaliknya, rotasi benar-benar menakjubkan. Sangat jelas bahwa pikselnya tidak berubah. Ketika layar diputar secara fisik, gambarnya ‘berubah’. Sulit membayangkan contoh yang lebih baik untuk menunjukkan bahwa gambar dari model difusi bukan sekadar gema dari gambar yang sudah ada. Tentu ada sisi itu juga, tetapi pada dasarnya ini adalah jawaban atas masalah “carilah himpunan piksel yang cocok dengan deskripsi {prompt}”. Di sini, yang dicari adalah “piksel yang cocok dengan {A} dari arah ini, dan dengan {B} dari arah itu”
Teknik dan hasil di sini terpisah dari gambar ControlNet ‘spiral’ yang sempat terkenal beberapa bulan lalu: https://arstechnica.com/information-technology/2023/09/dream...
Dari sisi kode, ini berbasis DeepFloyd-IF, jadi tidak semudah menjalankan varian Stable Diffusion
Ekosistem di sekitar Stable Diffusion secara keseluruhan memang sangat besar
Apakah ada yang menjual puzzle jigsaw fisik seperti yang ditampilkan di sini?
Setiap contoh di sini terasa seperti “ya... mungkin... sampai batas tertentu”
Pinguin/jerapah mungkin yang terbaik, sedangkan nenek tua/gaun hampir tidak terlihat sebagai salah satu dari keduanya
Pinguin/jerapah sangat mirip dengan ini: https://www.pinterest.com/pin/giraffepenguin--13398215764267...
Yang satunya lagi terinspirasi langsung dari sini atau serupa, dan prompt “young lady” tampaknya membuat model memilih gaun. Lagi pula, mustahil membuat mata dan telinga, mulut dan choker benar-benar identik secara fotorealistis: https://www.reddit.com/r/RedditDayOf/comments/35cjn5/the_cla...
Bebek/kelinci yang bisa disusun ulang tampaknya akan sangat keren dipakai dalam sliding puzzle. Jadi ada dua solusi yang valid
Jika sudut dianggap sebagai node graf berarah yang terhubung oleh tonjolan dan lubang, pasangan yang mungkin akan saling terhubung. Pertukaran membentuk klaster berisi dua pasangan, sedangkan koneksi tambahan menjadi rantai empat elemen dengan kedua ujung terbuka. Jika koneksi itu berlanjut ke lebih banyak pasangan, bisa terbentuk klaster yang lebih besar dari tonjolan dan lubang yang identik. Karena sifat graf, kemungkinan besar sebagian besar akan seperti itu. Alasan untuk itu bisa dilihat dari paradoks tahanan [0]
Akibatnya, sebagian besar tonjolan akan cocok dengan sebagian besar lubang, sehingga puzzle menjadi jauh lebih sulit dipecahkan.
[0] Video Matt Parker yang bagus https://www.youtube.com/watch?v=a1DUUnhk3uE juga baik, tetapi saya lebih merekomendasikan diskusi lanjutannya dengan Derek dari Veritasium
Akan keren jika dibuat gambar seperti ini yang tampak berbeda di bawah pencahayaan merah/biru
Ledakan kreativitas yang dibawa AI generatif benar-benar menakjubkan