16 poin oleh khj6051 2026-06-13 | 12 komentar | Bagikan ke WhatsApp

Halo, saya membuat sebuah model lalu merilisnya sebagai open source, jadi saya ingin membagikannya.

Pernahkah Anda membutuhkan suara tertentu untuk membuat video atau game?

Di kepala Anda sudah ada gambaran yang tepat tentang bunyinya, tetapi mungkin Anda tidak punya cara untuk mengekspresikan dan mencarinya.

Karena alasan itu, jika Anda masuk ke rapat terkait suara di studio game, sering kali Anda akan mendengar lebih banyak bunyi seperti ini daripada percakapan biasa.

“Pyu pyu- daripada itu, mungkin lebih bagus kalau piyu↘︎piyu↘︎”

Jadi saya membuatnya!

Model yang saya buat adalah model yang menghasilkan sound effect ketika Anda menirukan suara yang diinginkan dengan mulut lalu memasukkannya ke model bersama teks sebagai input. (menggunakan cukup banyak waktu dan data)

repo: https://github.com/thxxx/VTS
demo: https://spicy-pufferfish-699.notion.site/VTS-347cf95761f480f19dc0eb790…

(Jika Anda membuka tautan demo dan mendengarkannya, Anda akan jauh lebih memahami maksudnya, haha)

12 komentar

 
humblebee 2026-06-18

Ini benar-benar proyek yang keren!
"Bagaimana saya bisa menjelaskan dengan mudah apa yang saya inginkan kepada agen AI"
Saya pikir ini benar-benar titik yang penting belakangan ini dan merupakan area yang membutuhkan banyak pemikiran.

Seperti halnya kita telah menyaksikan berkembangnya ranah UI/UX pada layanan TI, pengalaman pengguna terhadap AI kini juga akan terus terakumulasi, dan saya menantikan banyak pembahasan tentang apa yang efektif dan penting.

 
illiil1lii 2026-06-18

Sepertinya cocok untuk dimanfaatkan dalam pengerjaan SFX film.

 
solvewithit 2026-06-17

Ini benar-benar seru wkwkwk

 
khj6051 2026-06-18

Terima kasih hehe

 
mssmss 2026-06-22

Seru banget wkwkwk, ini beneran bisa ya. Penasaran gimana cara melatih modelnya.

 
bichi 2026-06-18

Tapi di demonya, yang dibuat dengan suara mulut justru lebih keren sebagai efek suara.

 
khj6051 2026-06-18

Karena terlalu sering mengetes, jadi sudah mahir ya.

 
dukes123 2026-06-17

Menarik ya. Kira-kira selain suara manusia sebagai input, apakah suara seperti Pokémon? R2D2? semacam itu juga bisa?

 
khj6051 2026-06-17

Iya, pembelajarannya sendiri bukan dilakukan dengan suara, jadi sepertinya semua Sound to Sound bisa dilakukan. Meski begitu, saya memang belum pernah mencoba mengujinya dengan suara Pokémon hehe

 
dukes123 2026-06-18

Oh, kalau begitu LLM bisa membuat semacam rumus lalu menghasilkan suara elektronik dengan pengaturan kuat-lemah -> kemudian dimasukkan bersama teks sebagai input untuk mengeluarkan efek suara, jadi sepertinya efek suara yang pas untuk setiap situasi juga bisa dibuat ya. Keren juga.

 
m00nlygreat 2026-06-13

Ini lucu juga wkwkwk

 
khj6051 2026-06-15

Terima kasih wkwkwk