2 poin oleh GN⁺ 2025-01-09 | 1 komentar | Bagikan ke WhatsApp
  • NeuralSVG adalah riset ICCV 2025 yang menghasilkan SVG dengan mengubah prompt teks menjadi bentuk-bentuk yang berurutan dan dapat diedit
  • Metode generasi teks-ke-vektor yang ada cenderung menghasilkan output yang terlalu banyak parameter atau memperlakukan struktur layer sebagai hal sekunder, sehingga bisa sulit digunakan sebagai grafik vektor yang benar-benar dapat diedit
  • Seluruh adegan SVG dienkode ke dalam bobot jaringan MLP kecil, lalu dioptimalkan agar sesuai dengan kondisi teks menggunakan Score Distillation Sampling (SDS)
  • Regularisasi nested dropout mendorong setiap bentuk memiliki peran yang bermakna secara mandiri, sehingga meski hanya menyisakan sedikit bentuk, struktur kasar adegan tetap terjaga
  • Dengan satu representasi yang telah dipelajari, palet warna berdasarkan warna latar, rasio aspek, dan jumlah stroke sketsa dapat disesuaikan pada saat inferensi

Pendekatan yang menargetkan pembuatan SVG yang dapat diedit

  • Grafik vektor adalah medium penting dalam desain karena memungkinkan pembuatan konten visual yang independen dari resolusi dan dapat diedit
  • Perkembangan model vision-language dan model difusi telah meningkatkan minat pada generasi grafik teks-ke-vektor
  • Pendekatan yang ada dapat memiliki dua keterbatasan
    • Output menjadi terlalu banyak parameter
    • Struktur layer, yang merupakan fungsi inti grafik vektor, diperlakukan sebagai tujuan sekunder
  • NeuralSVG mengusulkan representasi saraf implisit untuk menghasilkan grafik vektor dari prompt teks, dengan menekankan pentingnya representasi SVG berlapis

Cara mengenkode adegan ke dalam MLP kecil

  • NeuralSVG terinspirasi oleh NeRF dan mengenkode seluruh adegan ke dalam bobot jaringan MLP kecil
  • Untuk optimisasi, digunakan Score Distillation Sampling (SDS)
  • Untuk membuat representasi yang berurutan, diperkenalkan teknik regularisasi berbasis dropout
    • Mendorong setiap bentuk yang dipelajari memiliki peran yang bermakna dan berurutan dalam keseluruhan adegan
    • Bahkan jika jumlah bentuk yang dipertahankan pada rendering akhir diubah, struktur kasar adegan tetap dapat ditangkap hanya dengan sedikit bentuk

Kontrol dinamis pada saat inferensi

  • Dengan menggunakan representasi saraf, SVG yang dihasilkan dari satu representasi terlatih dapat disesuaikan secara dinamis menurut input pengguna
  • Contoh kontrol yang didukung antara lain
    • Mengubah warna latar untuk merender palet warna SVG hasil dengan berbeda
    • Menampilkan hasil untuk warna latar yang diamati selama pelatihan maupun warna latar yang tidak diamati
    • Membandingkan hasil optimisasi NeuralSVG pada rasio aspek 1:1 dan 4:1
    • Menghasilkan sketsa dengan jumlah stroke berbeda menggunakan satu jaringan

Hasil evaluasi dan materi

  • Dalam evaluasi kualitatif dan kuantitatif, NeuralSVG menunjukkan hasil yang lebih baik dibanding metode sebelumnya dalam hal pembuatan SVG yang terstruktur dan fleksibel
  • Materi proyek

1 komentar

 
GN⁺ 2025-01-09
Komentar Hacker News
  • Luar biasa. Menurut saya kegunaan pembuatan vektor jauh lebih besar daripada pembuatan raster seperti DALL-E dan Midjourney yang sejauh ini mendapat banyak perhatian.
    Output raster sulit ditangani karena untuk menyempurnakannya secara iteratif hingga menjadi hasil yang benar-benar layak dipakai, kita perlu melakukan upscale atau inpainting lewat panggilan AI generatif lanjutan. Sebaliknya, vektor yang dihasilkan pada dasarnya bisa diskalakan dan mudah diedit.
    Khususnya, hasil-hasil ini memiliki kompleksitas rendah, dengan tiap bentuk tersusun dari sesedikit mungkin titik, sehingga sangat menguntungkan pengalaman ketika manusia turun tangan untuk mengedit di tengah proses. Dalam visual generatif, menurut saya membuat ekspresi yang disederhanakan lebih sulit dan lebih bernilai daripada ekspresi yang rumit dan berantakan.

    • Penasaran apakah akhir-akhir ini sudah melihat https://www.recraft.ai/. Sepertinya kualitas gambar dari output vektornya sudah cukup meningkat.
      Tentu saja masih tidak cocok untuk membuat tekstur rapat atau gambar seperti foto yang menjadi keunggulan Midjourney. Sekitar tahun lalu, di https://gwern.net/dropcap perlu memakai alur yang agak rumit: membuatnya dengan Midjourney lalu melewatkannya ke Recraft. Namun kalau membuat drop cap sekarang, saya rasa model Recraft terbaru saja sudah cukup.
    • Ada juga kemungkinan memakai gambar seperti ini sebagai panduan untuk model rasterisasi. Caranya, pertama buat gambar yang mudah dimanipulasi dan dikombinasikan, lalu setelah komposisinya memuaskan, tambahkan detail.
    • Ada juga proyek kecil untuk ekspresi yang rumit dan berantakan ;) https://github.com/KodeMunkie/shapesnap
      Ini pekerjaan yang berdiri di atas bahu raksasa, dan aslinya bukan milik saya. Bisa dipakai juga dari npm.
    • Saya selalu membayangkan betapa bergunanya jika Sora.ai, saat membuat animasi, terlebih dahulu menghasilkan model 3D untuk rendering.
    • Sepenuhnya setuju. Pendekatan block coding dan rasterisasi yang tersebar luas di berbagai codec audio, bahkan pendekatan “jaringan neural” modern, terasa seperti jalan buntu untuk kontrol halus yang diinginkan para musisi.
      Tentu saja itu oke untuk antarmuka teks-ke-musik. Saat ini saya terutama membuat codec audio sparse yang berfokus pada bunyi alami, dan menggunakan asumsi berbasis fisika, meski sangat kasar, untuk mendorong representasi sparse.
      https://blog.cochlea.xyz/sparse-interpretable-audio-codec-pa...
  • Saya sangat menyukai metode generasi bertahap seperti ini. Bahasa tidak cukup presisi untuk menggambarkan produk akhir secara akurat, jadi pendekatan yang menghasilkan tahap perantara sangat kuat.
    Saya juga ingin melihat pendekatan seperti ini dalam generasi musik. Alat seperti Suno memang keren, tetapi secara pribadi saya jauh lebih suka jika yang dibuat adalah MIDI dan pengaturan instrumen, bukan audio itu sendiri.
    Ini mungkin pelajaran yang bagus untuk alat generatif. Membuat titik awal yang lumayan itu mungkin, tetapi yang benar-benar diinginkan orang berada di ranah long tail. Karena itu, ada atau tidaknya kemampuan penyuntingan presisi menjadi pembeda antara demo yang sudah disiapkan dan alat yang kuat.
    Tertulis “Code coming soon”, dan contoh-contohnya cukup bagus, tetapi saya tidak tahu sejauh mana reprodusibilitasnya.

    • Kalau mencari alat yang menghasilkan MIDI dan pengaturan instrumen, mungkin sesuatu seperti https://www.aiva.ai cocok.
    • MIDI saja tidak cukup. Saya ingin MIDI + filter, serta track vokal terpisah dan track suara kustom.
    • Poin bagus. Beberapa hari lalu saya sempat berpikir untuk memulai kembali proyek ini dengan Glicol.
      https://github.com/chaosprint/RaveForce
      RaveForce adalah kumpulan alat bergaya OpenAI Gym untuk eksperimen generasi musik. Saya suka Suno, tetapi pada akhirnya untuk mengerjakannya saya butuh MIDI atau XML, atau sampel lossless.
    • Akan sangat keren kalau ada MIDI mikrotonal.
  • Menerapkan Sonnet ke animasi SVG saja sudah mengesankan, tetapi ini terlihat bisa jauh lebih kuat.
    Contoh menarik: https://gist.github.com/scosman/701275e737331aaab6a2acf74a52...

  • Saya selalu berpikir bahwa menghasilkan representasi perantara adalah jalan yang tepat. Alih-alih menghasilkan sintaks konkret, buat AST; alih-alih PNG, buat SVG; alih-alih membuat rangkaian gambar kontinu untuk animasi, hasilkan wireframe atau rigging dan skrip.
    Kalau ada representasi perantara, kita tinggal mengubahnya dan merendernya. Kalau sudah ada hasil render, di tahap akhir tinggal taburkan sedikit debu peri AI di atasnya.
    Suatu hari mungkin model generatif akan cukup kuat untuk memungkinkan kontrol detail hanya dengan bahasa alami. Namun sampai saat itu, cara ini tampaknya punya keunggulan dalam hal keterkendalian, interoperabilitas dengan alat yang sudah ada seperti Intellisense atau editor gambar, serta model yang lebih kecil dan lebih murah karena tidak perlu menangani ruang piksel berdimensi tinggi.

  • Saya penasaran seperti apa hasil model ini untuk prompt uji pembuatan SVG LLM dari Simon Willison: “buat SVG pelikan yang sedang naik sepeda”.
    Laju kemajuan AI cukup menakjubkan dan akan terus membaik, sehingga agak menakutkan juga.

    • Saya pernah meminta Claude dan ChatGPT o3 untuk “membuat SVG daratan utama Amerika Serikat dengan garis luar hitam”.
      Saya mencoba beberapa model, tetapi hasilnya salah parah. Claude lumayan bagus untuk “buat SVG pelikan yang sedang naik sepeda”.
  • Sangat bagus. Saya perlu mengonversi bitmask menjadi SVG dan ingin melewati tahap perantara, lalu menemukan ini ketika mencari paper tentang model segmentasi yang mengeluarkan SVG.
    https://arxiv.org/abs/2311.05276

  • Pembuatan sketsa-nya luar biasa. Selain itu, kelihatannya hampir seperti didapat gratis sebagai efek samping.

  • Sepertinya ini akan membuka banyak peluang untuk alat penulisan dokumen. Benar-benar keren, dan saya ingin segera mencobanya begitu kodenya dibuka.

    • Saya penasaran bagaimana ini bisa memperkuat penulisan dokumen. Bisa lemparkan beberapa ide?
  • Bagus. Dengan pendekatan serupa, saya juga menantikan pembuatan teks untuk diagram. Semacam Pic/Pikchr di era LLM.

    • Bukan PIC, dan memang belum terlalu cocok untuk diagram yang kompleks, tetapi dengan Chart Vizzard dari Vizzlo, beberapa jenis chart yang didukung, misalnya chart Gantt, bisa dibuat lalu terus diedit di editor chart: https://vizzlo.com/ai
    • Saya pernah cukup berhasil mengubah SQL menjadi diagram Mermaid Markdown.
  • Benar-benar keren. Saya selama ini menambahkan animasi ke SVG dengan Claude, dan hasilnya cukup bagus.

    • Kalau bisa dibagikan, saya ingin melihat contoh dan alur kerjanya.