- Agar video generatif real-time dapat merespons input seperti game, kecepatan pembuatan frame adalah kuncinya, dan Oasis diperkenalkan dengan target dunia AI interaktif 20fps
- Decart dan Etched menunjukkan pengalaman open-world yang menghasilkan fisika, aturan, dan grafis sebagai keluaran foundation model, bukan dari engine terpisah
- Rilisnya terdiri dari demo langsung, kode, bobot model 500M parameter yang bisa dijalankan secara lokal, dan demo berbasis checkpoint yang lebih besar
- Arsitekturnya adalah autoencoder spasial berbasis Transformer dan backbone difusi laten, yang menghasilkan frame secara autoregresif sesuai input pengguna
- Keterbatasan seperti blur pada jarak jauh, konsistensi temporal objek, generalisasi domain, kontrol inventaris, dan penanganan konteks panjang masih tersisa, sehingga perlu perluasan model/dataset dan peningkatan inferensi
Dunia AI yang Merespons Input
- Oasis adalah model AI open-world real-time yang diumumkan oleh Decart dan Etched
- Model ini menerima input keyboard pengguna untuk menghasilkan pengalaman interaktif seperti bergerak, melompat, mengambil item, dan menghancurkan blok
- Fisika, aturan, hingga grafis semuanya termasuk dalam keluaran model, dan pengalaman dibangun hanya dengan foundation model tanpa physics engine terpisah
- Sumber daya yang dirilis adalah sebagai berikut
- Try demo: demo langsung
- View code: kode
- Model weights: bobot model 500M parameter yang dapat dijalankan secara lokal
- Decart Blog, Etched Blog: penjelasan teknis
- Contoh hasilnya mencakup pembangunan, fisika pencahayaan, pengelolaan inventaris, pemahaman objek, interaksi dengan hewan, pemulihan HP saat memakan makanan, dan aksi sekop yang lebih cepat daripada tangan
- Lingkungan yang dapat dihasilkan mencakup tempat seperti luar angkasa yang gelap, adegan malam, penempatan berbagai objek, membuka peti inventaris, serta hewan dan karakter
- Arah pengembangan untuk mengendalikan pengalaman melalui teks, audio, dan modalitas lain juga dimungkinkan
Arsitektur Transformer dan Inferensi Real-Time
- Model ini terdiri dari autoencoder spasial dan backbone difusi laten
- Kedua komponennya sama-sama berbasis Transformer
- Autoencoder berbasis ViT, dan backbone berbasis DiT
- Tidak seperti model dunia berbasis aksi seperti GameNGen dan DIAMOND, alasan memilih Transformer adalah skalanya yang stabil dan dapat diprediksi, serta inferensi cepat pada ASIC Transformer Sohu milik Etched
- Tidak seperti model dua arah seperti Sora, Oasis menghasilkan frame secara autoregresif
- Setiap frame dapat dibuat secara kondisional berdasarkan input pengguna, sehingga interaksi real-time dimungkinkan
- Dalam pelatihan digunakan Diffusion Forcing, yang melakukan denoising dengan tingkat noise independen per token
- Stabilitas temporal agar keluaran tetap alami dalam waktu lama merupakan tantangan utama
- Pada model autoregresif, error menumpuk dan cacat kecil bisa membesar menjadi frame glitch
- Untuk menguranginya, digunakan dynamic noising yang menyesuaikan noise saat inferensi mengikuti jadwal
- Pada forward pass difusi awal, noise disuntikkan untuk mengurangi akumulasi error, lalu pada pass berikutnya noise dihilangkan secara bertahap untuk mempertahankan detail frekuensi tinggi dari frame sebelumnya
Performa 20fps dan Bottleneck Perangkat Keras
- Oasis menghasilkan keluaran real-time pada 20fps
- Model text-to-video dengan arsitektur DiT serupa seperti Sora, Mochi-1, dan Runway dapat membutuhkan 10–20 detik untuk membuat video 1 detik bahkan dengan banyak GPU
- Untuk interaksi real-time, frame baru harus dihasilkan setiap 0,04 detik, yang berarti lebih dari 100 kali lebih cepat
- Dengan stack inferensi Decart, frame rate langsung dapat dijalankan
- Untuk eksekusi yang lebih cepat, lebih besar, dan hemat biaya, dibutuhkan perangkat keras baru
- Oasis dioptimalkan untuk ASIC Transformer Sohu milik Etched
- Sohu dapat diskalakan hingga model generasi berikutnya 100B+ pada resolusi 4K
- Struktur Transformer end-to-end Oasis efisien di Sohu dan dapat melayani lebih dari 10 kali lebih banyak pengguna bahkan pada model 100B+ parameter
Keterbatasan yang Masih Tersisa
- Blur pada video jarak jauh, konsistensi temporal objek yang belum pasti, generalisasi domain, kontrol inventaris presisi, kontrol objek presisi, dan memori yang terbatas untuk rentang waktu panjang masih menjadi keterbatasan
- Setelah analisis sensitivitas terhadap konfigurasi arsitektur, data, dan ukuran model, diajukan hipotesis bahwa banyak masalah dapat diatasi dengan memperluas model dan dataset
- Bahkan jika model yang lebih besar dikembangkan, teknik inferensi baru tetap diperlukan untuk menjaga keseimbangan antara latensi dan biaya
1 komentar
Komentar Hacker News
Kalau sedang bermimpi di Minecraft, rasanya mungkin seperti ini
Karena kurangnya persistensi objek, ini benar-benar terasa seperti mimpi. Level pencahayaannya juga menarik; kalau terlalu lama melihat tempat gelap atau masuk ke “dalam air” sampai layar menjadi hitam, sulit untuk kembali ke keadaan selain layar hitam. Dalam satu sesi percobaan, saya tidak berhasil. Sensasinya cukup aneh
Saya kurang tahu bagaimana cara merancang dan merilis game dengan cara seperti ini. Kita tidak bisa merancang game dengan mengatur bobot model secara langsung
Suatu saat mungkin kita bisa mereplikasi game tanpa elemen yang hilang seperti persistensi objek atau state jangka panjang, tetapi biaya menjalankan inference engine kemungkinan besar lebih mahal daripada game engine yang ditirunya. Sebagai orang yang sudah lama berkecimpung di AI, saya benar-benar penasaran teknologi ini berguna di mana
Saya setuju bahwa alat-alat ini akan menjadi sangat berguna jika ada cara yang baik bagi kreator untuk “mengembangkan” dunia atau game baru di atas sistem ini, dan bagi pengguna untuk berinteraksi dengan dunia tersebut. Pada akhirnya ini harus menyediakan semacam “API” seperti game engine. Kreator membuat dunia, pengguna berinteraksi dengan dunia itu. Jika AI benar-benar bisa menjalankan peran ini, 1) membuat dunia dan game bisa menjadi jauh lebih mudah hanya dengan mengatakan hal seperti “tambahkan gajah merah muda yang terbang di sini”, dan 2) dunia yang berubah menyesuaikan tiap sesi bermain bisa berinteraksi dengan pengguna, sehingga dunia tak terbatas benar-benar menjadi mungkin. Apakah kita sudah sampai di sana? Tentu saja belum. Oasis v1 adalah pembuktian konsep pertama, dan kita tinggal menunggu sedikit lagi untuk v2 ;)
Namun dari sisi “desain”, mudah dibayangkan betapa bergunanya kemampuan membuat prototipe game dengan cepat, meskipun memakai GPU secara besar-besaran. Makalah seperti ini hanyalah batu pijakan ke arah tersebut
AI yang menghasilkan input untuk renderer atau engine sungguhan tampaknya bisa menyelesaikan masalah fidelitas visual
Gabungkan beberapa model, ambil potongan dari tiap “model dunia” game dan kombinasikan; hasilnya hampir seperti membuat game yang benar-benar baru. Elemen yang hilang seperti persistensi objek atau state jangka panjang bisa ditambahkan dengan sekumpulan variabel yang jauh lebih kecil. Karena seluruh frame sebelumnya dan input pengguna sudah dimasukkan ke bobot, rasanya tidak ada alasan state game yang disederhanakan tidak bisa ikut dimasukkan
Mereka menyebutnya “video game yang sepenuhnya dibuat AI”, tetapi saat saya mencari dengan Ctrl-F di halaman web, Minecraft muncul 0 kali. Entah kenapa
Ini bukan video game, melainkan salinan kasar dari video game nyata, dan bahkan tidak ada upaya untuk menyebut namanya atau memberi kredit
Mereka tidak bisa mengatakan “Minecraft” karena itu merek dagang Microsoft, tetapi sepertinya mereka menganggap penggunaan gambar Minecraft sebagai data latih diperbolehkan. Semua pihak, termasuk Microsoft, melatih model difusi dengan data proprietari. Masalahnya outputnya jelas mirip Minecraft, tetapi Microsoft sendiri juga punya masalah bahwa Bing dan DALL-E, meski ada pengaman, menghasilkan gambar yang jelas mirip hal-hal bermerek dagang
Saya tidak tahu apakah ini ditambahkan setelah komentar asli
Jika karya ilmiah menggunakan suatu karya tanpa memberi kredit, itu adalah ketidakjujuran akademik. Mereka bisa saja melatihnya dengan dataset lain, tetapi apa pun sumber yang dipakai harus dikutip
Ini sangat keren, dan menyenangkan melihat model seperti ini terus berkembang cepat. Namun saya penasaran bagaimana state jangka panjang akan bekerja
Misalnya membangun markas lalu kembali lagi nanti, aturan game yang dipaksakan oleh kode tradisional, multiplayer, atau state terpandu seperti memuat game tersimpan—saya tidak tahu bagaimana itu akan ditangani. Pada dasarnya state eksternal dan memori/simulasi adalah hal yang berbeda, jadi kemungkinan bukan sekadar memperbesar context window atau model. Tentu itu bisa membantu. Bagaimanapun, model seperti ini sepertinya segera akan dipakai untuk membayangkan tugas berorientasi tujuan. Misalnya agen yang harus menemukan gambar tertentu di komputer terus membayangkan jalur antara keadaan yang dilihat sekarang dan keadaan yang diinginkan. Model ini menerima input pengguna, tetapi agen semacam itu juga akan membayangkan input tersebut. Sejauh yang saya pahami, hal serupa sudah terjadi tanpa piksel di sebagian jaringan kontrol robot
Setelah beberapa putaran, detailnya hilang dan kita tertinggal di tengah lautan kosong. Dengan teknologi ini, tampaknya mustahil membuat versi Minecraft yang bisa dimainkan, apalagi Mario
Ini bukan video game, melainkan lebih mirip simulator tangkapan layar Minecraft cepat yang prompt di antara tiap frame-nya adalah state input dan frame sebelumnya
Ada semacam konsistensi sampai batas tertentu
Pada dasarnya mereka melatih model dengan Minecraft. Sama sekali tidak general-purpose
Gamenya kemungkinan bukan berasal dari prompt, melainkan dari dataset besar gameplay Minecraft dan fine-tuning. Saya ingin melihat karya semacam ini yang dunia atau gamenya muncul dari prompt
Sebagai catatan, saya bagian dari tim Oasis
Kalau saat bermain pengguna bisa menggambar langsung di frame buffer dan itu dimasukkan kembali sebagai input, mungkin akan muncul sesuatu yang cukup menarik
Antreannya terlalu panjang, jadi saya menyerah. Saya penasaran apakah modelnya menghasilkan piksel itu sendiri, atau hanya menghasilkan lingkungan lalu merendernya dengan cara “tradisional”
Mengapa ini menarik? Untuk hari ini mungkin belum terlalu menarik. Oasis v1 hanyalah pembuktian konsep. Tetapi jika memikirkan masa depan, secara harfiah versi-versi lanjutan Oasis yang akan muncul beberapa bulan lagi, kita bisa membayangkan situasi di mana semua piksel yang terlihat dihasilkan, termasuk piksel yang Anda lihat saat membaca pesan ini. Ini adalah antarmuka komunikasi baru antara manusia dan mesin. Jika LLM menarik dalam chat karena memungkinkan manusia dan mesin berinteraksi lewat percakapan, cara yang akrab bagi manusia, maka di sini komputer dapat melihat dunia dengan cara kita melihatnya, lalu menampilkannya kembali dengan cara yang akrab bagi kita. Singkatnya, bayangkan Anda berkata kepada komputer “buat gajah merah muda”, lalu benda itu langsung muncul di game yang sedang dimainkan
Mungkin mereka harus melatih model dengan game Mario agar Nintendo punya alasan “baik” untuk bertarung