1 poin oleh GN⁺ 2023-12-01 | 1 komentar | Bagikan ke WhatsApp
  • Menghasilkan secara zero-shot ilusi optik multi-sudut pandang yang membuat satu gambar terlihat sebagai objek berbeda setelah transformasi seperti rotasi, pembalikan, dan inversi warna, dengan model difusi pralatih
  • Metodenya adalah memperkirakan noise pada tiap sudut pandang transformasi, lalu menyelaraskan sistem koordinat dengan transformasi invers sudut pandang tersebut, dan melanjutkan langkah difusi berikutnya menggunakan noise rata-rata
  • Transformasi yang didukung mencakup rotasi, pembalikan, inversi warna, kemiringan, penyusunan ulang puzzle jigsaw, permutasi patch acak, hingga 3 sudut pandang atau lebih
  • Fungsi transformasi harus dapat dibalik, dan agar sesuai dengan asumsi noise pada model difusi diperlukan linearitas serta konsistensi statistik dari noise normal baku
  • Permutasi piksel dan inversi warna yang memenuhi syarat matriks ortogonal cocok dengan kondisi teoretis sehingga mudah dimanfaatkan, tetapi semakin banyak sudut pandang, semakin sulit memperoleh ilusi yang baik

Gambar yang identitasnya berubah saat ditransformasikan

  • Visual Anagrams membuat ilusi optik multi-sudut pandang di mana satu gambar tampak berubah bentuk atau identitasnya setelah melalui transformasi tertentu
  • Ini adalah pendekatan zero-shot yang menggunakan model difusi yang sudah ada tanpa pelatihan tambahan
  • Contoh transformasinya beragam seperti berikut
    • Penyusunan ulang puzzle jigsaw: gambar dibagi menjadi kepingan puzzle lalu disusun ulang sehingga tampak berbeda, bekerja seperti puzzle jigsaw dengan banyak solusi
    • Pembalikan dan rotasi 180 derajat: tampilan berubah ketika gambar dibalik atau diputar 180 derajat
    • Rotasi 90 derajat: gambar dikenali sebagai bentuk lain saat diputar 90 derajat
    • Inversi warna: gambar berubah ketika warnanya dibalik
    • Kemiringan dan “inner circle rotations”: termasuk dalam contoh transformasi lainnya
    • Permutasi patch acak: patch disusun ulang, dan saat jumlah patch diperbesar hingga (64 \times 64), kualitas menurun tetapi hasilnya masih bisa dikenali
  • Bukan hanya dua sudut pandang, ilusi tiga sudut pandang juga bisa dibuat, tetapi jauh lebih sulit mendapatkan hasil yang bagus
  • Ilusi empat sudut pandang sangat sulit dibuat berhasil, dan hanya ditemukan satu hasil yang kira-kira setengah layak

Prosedur generasi dan syarat teoretis

  • Intinya adalah prosedur untuk menggabungkan noise yang diperkirakan model difusi pada beberapa sudut pandang transformasi
    • Memperkirakan noise pada tiap sudut pandang (v_i)
    • Menerapkan invers sudut pandang (v_i^{-1}) pada hasil perkiraan agar selaras dalam sistem koordinat yang sama
    • Merata-ratakan estimasi noise yang sudah disejajarkan
    • Menjalankan langkah difusi menggunakan estimasi noise rata-rata tersebut
  • Tidak semua fungsi sudut pandang cocok dengan metode ini, dan (v_i) pertama-tama harus dapat dibalik
  • Model difusi memperlakukan data ber-noise (\mathbf{x}_t) sebagai kombinasi berbobot dari sinyal murni (\mathbf{x}_0) dan noise (\epsilon)
    • Agar transformasi (v) mempertahankan hubungan berbobot antara sinyal dan noise, transformasi itu harus berupa transformasi linear
    • Transformasi linear direpresentasikan dengan matriks (\mathbf{A})
  • Model difusi dilatih dengan asumsi bahwa noise berasal dari distribusi normal baku i.i.d.
    • Noise yang telah ditransformasikan juga harus memenuhi (\mathbf{A}\epsilon \sim \mathcal{N}(0, I))
    • Dalam transformasi linear, kondisi ini ekuivalen jika (\mathbf{A}) adalah matriks ortogonal
    • Karena itu, syarat yang cukup agar transformasi bekerja dalam metode ini adalah transformasi ortogonal
  • Sebagian besar transformasi ortogonal arbitrer tidak bermakna secara visual pada gambar, tetapi matriks permutasi adalah subhimpunan dari matriks ortogonal dan dapat ditafsirkan sebagai penyusunan ulang piksel
    • Rotasi, pembalikan, kemiringan, inner rotations, penyusunan ulang jigsaw, dan permutasi patch dapat dipandang sebagai bentuk penyusunan ulang piksel tertentu
    • Inversi warna bukan permutasi, tetapi merupakan transformasi yang membalik tanda nilai piksel sehingga termasuk transformasi ortogonal

Makalah dan materi eksekusi

  • Paper: PDF makalah CVPR 2024
  • arXiv: halaman arXiv
  • Code: kode Visual Anagrams
  • Colab: Colab untuk menjalankan
  • Diffusion Illusions: menghasilkan ilusi multi-sudut pandang dan efek visual lain dengan score distillation sampling
  • Illusion-Diffusion Colab: Colab Matthew Tancik dengan ide serupa; Visual Anagrams lebih baik dalam kualitas ilusi, cakupan transformasi, dan analisis teoretis
  • Factorized Diffusion: karya lanjutan dari Visual Anagrams yang menghasilkan berbagai jenis ilusi hibrida
  • Images that Sound: menghasilkan spektrogram yang tampak seperti gambar dengan teknik serupa

1 komentar

 
GN⁺ 2023-12-01
Komentar Hacker News
  • Pembalikan pria/wanita sangat saya suka
    Saya penasaran, kalau teknik yang sama diperluas, berapa banyak permutasi yang bisa dibuat agar terbaca dalam satu gambar. Saya tidak terlalu paham matematika, tapi apakah ini tetap bekerja karena menerapkan dua transformasi ortogonal secara berurutan masih menghasilkan transformasi ortogonal?

    • Contoh pria/wanita juga paling menonjol buat saya, dan sepertinya saya sudah melihatnya sekitar sepuluh kali. Mungkin karena terlihat sendu, itu yang membuatnya lebih membekas
    • Mosaik bebek dan kelinci itu benar-benar lucu
    • Jika yang dimaksud dengan ‘transformasi ortogonal’ di sini adalah transformasi/matriks linear ortogonal biasa, maka ya, jawabannya benar
  • Awal tahun lalu ada ide serupa, dan saya juga sempat sedikit mencoba metode papan catur
    Di sini ada seekor kucing yang dibuat dari 9 gambar kucing dengan gaya pelukis terkenal: https://twitter.com/marekgibney/status/1521500594577584141
    Mungkin Anda perlu sedikit memicingkan mata untuk melihatnya. Saya membuat beberapa, lalu entah kenapa minat saya hilang

    • Sejujurnya, di mata saya itu lebih mirip cat-aclysm daripada kucing. Mungkin modelnya kewalahan oleh tuntutan yang saling bertabrakan, sehingga baik gambar individual maupun gambar gabungannya tidak terlalu bagus. Meski begitu, seperti yang Anda bilang, suatu hari nanti hal seperti ini mungkin akan dilakukan dengan lebih baik
    • Keren sekali. Apakah 3x3x3 juga mungkin? Maksudnya, dalam 9x9 ada 81 kucing berukuran 1 kotak, 9 kucing berukuran 9 kotak, dan 1 kucing berukuran 81 kotak
  • Contoh pembalikan warna pria/wanita adalah yang paling mengesankan. Rotasi bisa saya putar di kepala untuk melihat sudut pandang lain, tetapi pembalikan warna sangat sulit dilakukan secara mental

    • Luar biasa. Untuk yang tertarik, saya tinggalkan tautannya. Halamannya berisi banyak gambar
      https://dangeng.github.io/visual_anagrams/static/videos/grid...
    • Bagi saya justru sebaliknya. Pembalikan warna tidak terasa jauh lebih mengesankan daripada animasi morph yang populer pada 1990-an. Saya paham betapa sederhananya pembalikan warna di level data piksel, tetapi kesederhanaan itu tidak terlihat oleh mata. Bahkan tampak tidak jauh berbeda dari alpha blending yang sama sekali tidak terkait
      Sebaliknya, rotasi benar-benar menakjubkan. Sangat jelas bahwa pikselnya tidak berubah. Ketika layar diputar secara fisik, gambarnya ‘berubah’. Sulit membayangkan contoh yang lebih baik untuk menunjukkan bahwa gambar dari model difusi bukan sekadar gema dari gambar yang sudah ada. Tentu ada sisi itu juga, tetapi pada dasarnya ini adalah jawaban atas masalah “carilah himpunan piksel yang cocok dengan deskripsi {prompt}”. Di sini, yang dicari adalah “piksel yang cocok dengan {A} dari arah ini, dan dengan {B} dari arah itu”
    • Saat sosok pria terlihat, kalau dicari-cari sosok wanitanya juga tampak, tapi anehnya sebaliknya tidak berhasil
  • Teknik dan hasil di sini terpisah dari gambar ControlNet ‘spiral’ yang sempat terkenal beberapa bulan lalu: https://arstechnica.com/information-technology/2023/09/dream...
    Dari sisi kode, ini berbasis DeepFloyd-IF, jadi tidak semudah menjalankan varian Stable Diffusion

    • Saya belum menelitinya secara detail, tetapi bukankah ide ini seharusnya bisa dipakai juga pada jaringan difusi lain? Hanya saja, kode yang disediakan mungkin memerlukan modifikasi yang cukup besar. Tentu saja, koreksi saya kalau salah
    • Saya selalu merasa aneh bahwa justru model ControlNet itulah yang membuat ide ini muncul. Gambar-gambar yang sama juga menghasilkan hasil yang luar biasa dan kuat ketika dipadukan dengan banyak model ControlNet lain
      Ekosistem di sekitar Stable Diffusion secara keseluruhan memang sangat besar
    • Saya belum melihatnya, memang apa yang membuatnya terkenal buruk?
    • Mungkin maksudnya justru ingin bilang berkaitan? Gambar ‘spiral’ asli dari Ugleh diberi kredit secara eksplisit di bagian “Related Links”
  • Apakah ada yang menjual puzzle jigsaw fisik seperti yang ditampilkan di sini?

    • Anda bisa membuatnya sendiri. Hanya saja saya tidak tahu seberapa baik cara di atas bekerja kalau diperbesar sejauh itu https://www.createjigsawpuzzles.com/
    • Riset ini menggunakan DeepFloyd IF, yang melarang penggunaan komersial. Jika ingin menjualnya, Anda harus mencari atau melatih generator gambar lain yang sesuai
  • Setiap contoh di sini terasa seperti “ya... mungkin... sampai batas tertentu”
    Pinguin/jerapah mungkin yang terbaik, sedangkan nenek tua/gaun hampir tidak terlihat sebagai salah satu dari keduanya

    • Dua itu didasarkan pada ambigram yang sudah dikenal sebelumnya
      Pinguin/jerapah sangat mirip dengan ini: https://www.pinterest.com/pin/giraffepenguin--13398215764267...
      Yang satunya lagi terinspirasi langsung dari sini atau serupa, dan prompt “young lady” tampaknya membuat model memilih gaun. Lagi pula, mustahil membuat mata dan telinga, mulut dan choker benar-benar identik secara fotorealistis: https://www.reddit.com/r/RedditDayOf/comments/35cjn5/the_cla...
    • Hmm, saat pertama melihat pinguin/jerapah, saya berpikir “ini terlihat seperti pinguin terbalik, tapi jerapahnya di mana?” Sedangkan yang lain, saya langsung bisa melihat apa yang dimaksud
  • Bebek/kelinci yang bisa disusun ulang tampaknya akan sangat keren dipakai dalam sliding puzzle. Jadi ada dua solusi yang valid

    • Perlu dicek lagi, tetapi jika satu pasangan ‘tonjolan dan lubang’ bisa ditukar dengan pasangan lain, maka kedua pasangan itu harus sama baik bentuk maupun warnanya. Namun jika alih-alih saling ditukar, mereka bercabang dan menempel ke sudut lain, akan muncul koneksi tambahan
      Jika sudut dianggap sebagai node graf berarah yang terhubung oleh tonjolan dan lubang, pasangan yang mungkin akan saling terhubung. Pertukaran membentuk klaster berisi dua pasangan, sedangkan koneksi tambahan menjadi rantai empat elemen dengan kedua ujung terbuka. Jika koneksi itu berlanjut ke lebih banyak pasangan, bisa terbentuk klaster yang lebih besar dari tonjolan dan lubang yang identik. Karena sifat graf, kemungkinan besar sebagian besar akan seperti itu. Alasan untuk itu bisa dilihat dari paradoks tahanan [0]
      Akibatnya, sebagian besar tonjolan akan cocok dengan sebagian besar lubang, sehingga puzzle menjadi jauh lebih sulit dipecahkan.
      [0] Video Matt Parker yang bagus https://www.youtube.com/watch?v=a1DUUnhk3uE juga baik, tetapi saya lebih merekomendasikan diskusi lanjutannya dengan Derek dari Veritasium
    • Jika ada begitu banyak elemen yang bisa disusun ulang, akan ada sangat banyak solusi ‘valid’ yang tak bisa dibedakan tanpa foto, jadi ini rasanya akan lebih menjadi seni daripada puzzle
  • Akan keren jika dibuat gambar seperti ini yang tampak berbeda di bawah pencahayaan merah/biru

  • Ledakan kreativitas yang dibawa AI generatif benar-benar menakjubkan