Halo, saya membuat sebuah model lalu merilisnya sebagai open source, jadi saya ingin membagikannya.
Pernahkah Anda membutuhkan suara tertentu untuk membuat video atau game?
Di kepala Anda sudah ada gambaran yang tepat tentang bunyinya, tetapi mungkin Anda tidak punya cara untuk mengekspresikan dan mencarinya.
Karena alasan itu, jika Anda masuk ke rapat terkait suara di studio game, sering kali Anda akan mendengar lebih banyak bunyi seperti ini daripada percakapan biasa.
“Pyu pyu- daripada itu, mungkin lebih bagus kalau piyu↘︎piyu↘︎”
Jadi saya membuatnya!
Model yang saya buat adalah model yang menghasilkan sound effect ketika Anda menirukan suara yang diinginkan dengan mulut lalu memasukkannya ke model bersama teks sebagai input. (menggunakan cukup banyak waktu dan data)
repo: https://github.com/thxxx/VTS
demo: https://spicy-pufferfish-699.notion.site/VTS-347cf95761f480f19dc0eb790…
(Jika Anda membuka tautan demo dan mendengarkannya, Anda akan jauh lebih memahami maksudnya, haha)
12 komentar
Ini benar-benar proyek yang keren!
"Bagaimana saya bisa menjelaskan dengan mudah apa yang saya inginkan kepada agen AI"
Saya pikir ini benar-benar titik yang penting belakangan ini dan merupakan area yang membutuhkan banyak pemikiran.
Seperti halnya kita telah menyaksikan berkembangnya ranah UI/UX pada layanan TI, pengalaman pengguna terhadap AI kini juga akan terus terakumulasi, dan saya menantikan banyak pembahasan tentang apa yang efektif dan penting.
Sepertinya cocok untuk dimanfaatkan dalam pengerjaan SFX film.
Ini benar-benar seru wkwkwk
Terima kasih hehe
Seru banget wkwkwk, ini beneran bisa ya. Penasaran gimana cara melatih modelnya.
Tapi di demonya, yang dibuat dengan suara mulut justru lebih keren sebagai efek suara.
Karena terlalu sering mengetes, jadi sudah mahir ya.
Menarik ya. Kira-kira selain suara manusia sebagai input, apakah suara seperti Pokémon? R2D2? semacam itu juga bisa?
Iya, pembelajarannya sendiri bukan dilakukan dengan suara, jadi sepertinya semua Sound to Sound bisa dilakukan. Meski begitu, saya memang belum pernah mencoba mengujinya dengan suara Pokémon hehe
Oh, kalau begitu LLM bisa membuat semacam rumus lalu menghasilkan suara elektronik dengan pengaturan kuat-lemah -> kemudian dimasukkan bersama teks sebagai input untuk mengeluarkan efek suara, jadi sepertinya efek suara yang pas untuk setiap situasi juga bisa dibuat ya. Keren juga.
Ini lucu juga wkwkwk
Terima kasih wkwkwk