- Model berbasis multimodal yang bertujuan menyatukan generasi, pemahaman, dan prediksi tindakan dengan melatih gambar, video, dan audio bersama dalam satu arsitektur, dan mulai tersedia lewat Early Access untuk FLUX 3 Video
- Mempelajari struktur spasial gambar, dinamika temporal dan fisik video, serta hubungan peristiwa dan suara pada audio sebagai kendala timbal balik, sambil menskalakan data dan sumber daya komputasi berbasis Self-Flow
- Dapat menghasilkan video dengan audio native hingga 20 detik dalam sekali proses, dan pada evaluasi awal lebih disukai dibanding Grok Imagine Video hingga 69%, Runway Gen-4.5 77%, dan Luma Ray 3.2 93%
- Mendukung sintesis dan pengeditan gambar serta rendering teks multibahasa, dan dapat dimanfaatkan sebagai model tindakan robot dengan melakukan fine-tuning backbone video yang telah dipra-latih menggunakan data tugas terbatas
- Akan merilis Video, Image, Action, dan FLUX 3 Dev berbasis bobot terbuka secara bertahap, dengan tujuan jangka panjang menyatukan prediksi persepsi, tindakan, dan bahasa dalam satu model
Model multimodal yang mempelajari realitas bersama
- FLUX 3 memperlakukan gambar, video, dan audio bukan sebagai elemen terpisah, melainkan sebagai hasil pengamatan atas realitas yang sama melalui sensor yang berbeda
- Gambar menangkap struktur dan hubungan spasial pada satu titik waktu tertentu
- Video memulihkan dimensi waktu untuk menampilkan gerakan, dinamika temporal, dan hukum fisika
- Audio menunjukkan fenomena mekanis dan hubungan kausal suara yang sulit dideteksi hanya melalui visual
- Bahasa menghubungkan persepsi ini dengan tujuan, abstraksi, dan instruksi
- Dengan mempelajari berbagai modalitas secara bersama, model dapat memanfaatkan kendala timbal balik seperti suara yang harus selaras dengan benturan, gerakan yang mengikuti massa, dan masa depan yang harus berlanjut dari masa lalu
- FLUX 3 adalah model pertama yang dibangun hanya berdasarkan prinsip-prinsip ini, dengan tujuan menghadirkan kecerdasan visual dunia nyata yang dapat merasakan, memprediksi, dan bertindak di lingkungan fisik maupun digital
- Hasil awal di pembuatan konten dan physical AI menunjukkan potensi pendekatan ini
Arsitektur terpadu berbasis Self-Flow
- Self-Flow adalah pendekatan untuk menyelaraskan generasi dan pemahaman multimodal secara efisien dalam satu arsitektur dasar
- Berdasarkan Self-Flow, FLUX 3 memperluas skala komputasi dan sumber daya data secara besar untuk melatih video, gambar, dan audio secara bersamaan
- Perbandingan yang dipublikasikan menggunakan Fréchet distance yang menormalkan kesalahan generasi per modalitas ke patokan Flow Matching 100, serta tingkat keberhasilan manipulasi pada 4 kelompok tugas setelah fine-tuning
Pembuatan video dan audio native
- FLUX 3 dapat membuat beragam video dan audio dengan durasi hingga 20 detik dalam satu kali generasi
- Cakupan dukungannya adalah sebagai berikut
- generasi teks-ke-video
- generasi gambar-ke-video yang melanjutkan frame awal atau menggunakan gambar sebagai referensi visual
- generasi video-ke-video yang memindahkan elemen inti seperti karakter asli ke adegan atau konteks baru
- generasi berkelanjutan video dan audio generatif yang melanjutkan video dan audio input
- generasi keyframe-to-video yang mengendalikan transisi di antara adegan yang ditentukan
- dialog multibahasa
- beragam gaya visual dan rasio aspek yang melampaui format film tradisional
- chaining bergaya agen yang menghubungkan klip individual menjadi rangkaian multi-shot yang lebih panjang
- rentang gaya luas dari rekaman camcorder hingga animasi dan cuplikan film
- generasi tipografi dan desain animasi
- Semua output video mencakup generasi audio native
Evaluasi video awal
- Evaluasi pendahuluan dilakukan dengan klip teks-ke-video 720p 10 detik yang menyertakan audio
- Dalam evaluasi perbandingan, tingkat preferensi terhadap FLUX 3 adalah sebagai berikut
- hingga 69% dibanding Grok Imagine Video
- 60% dibanding Kling v3 Pro
- 59% dibanding Happy Horse v1, dan 57% dibanding Happy Horse 1.1
- masing-masing 52% dibanding Seedance 2.0 dan Gemini Omni Flash
- 77% dibanding Runway Gen-4.5
- 93% dibanding Luma Ray 3.2
- Karena model dan harness pendukungnya masih dalam pengembangan, hasil ini masih bersifat awal dan akan terus ditingkatkan selama periode Early Access
- Area yang saat ini sangat kuat adalah penangkapan ekspresi manusia, keterkaitan antara peristiwa fisik dan suara, serta pemrosesan multibahasa
- Dengan menjaga konsistensi karakter di seluruh adegan melalui referensi visual, model dapat menggabungkan beberapa klip menjadi rangkaian berdurasi beberapa menit
- FLUX 3 Video tersedia dalam Early Access
Sintesis dan pengeditan gambar
- FLUX 3 dapat mensintesis dan mengedit gambar dalam berbagai gaya, rasio aspek, dan resolusi
- Pada evaluasi pendahuluan di tahap pelatihan menengah, kemampuan menangani prompt kompleks dan menghasilkan teks meningkat jauh dibanding versi FLUX sebelumnya
- Model dapat menghasilkan beragam gaya output dan merender teks dalam berbagai bahasa dengan akurasi tinggi
- Hasil evaluasi masih berada pada tahap awal dan akan terus ditingkatkan sebelum rilis resmi
- Early Access FLUX 3 Image direncanakan dimulai dalam beberapa minggu mendatang
Prediksi tindakan dan pembelajaran robot
- Untuk memperluas pemahaman realitas ke prediksi tindakan, digunakan dua jalur
- memperluas pekerjaan awal Self-Flow untuk mengintegrasikan prediksi tindakan native langsung ke FLUX 3
- menggunakan backbone video yang telah dipra-latih sebagai dasar pemahaman dinamika, lalu melakukan fine-tuning model tindakan khusus dengan data tugas terbatas
- Bersama mitra awal pendekatan ini, mimic robotics, mereka mengembangkan FLUX-mimic
- ini adalah model video-ke-tindakan yang menggabungkan backbone FLUX 3 dengan keahlian mimic dalam pembelajaran manipulasi robot tingkat lanjut dan deployment produksi
- Pengujian fondasi bersama physical AI dan pembuatan konten dalam pekerjaan produksi nyata Audi juga dipublikasikan secara terpisah
Peluncuran bertahap per fungsi
- Setiap fungsi akan disediakan selama beberapa minggu hingga beberapa bulan ke depan melalui Early Access untuk memastikan peluncuran yang mulus, pengumpulan masukan, dan pengujian keamanan yang ketat
- Semuanya diturunkan dari model yang sama berbasis multimodal Flow Matching
- FLUX 3 Video: generasi dan pengeditan video dan audio melalui API serta akses bobot privat
- FLUX-mimic·FLUX 3 Action: menyediakan prediksi tindakan kepada mitra riset dan komersial terpilih, dimulai dari mimic robotics
- FLUX 3 Image: sintesis dan pengeditan gambar melalui API serta akses bobot privat
- FLUX 3 Dev: menyediakan bobot terbuka dari backbone multimodal untuk generasi konten video, audio, gambar, dan prediksi tindakan
- Detail teknis tambahan dari pendekatan dasarnya juga akan dipublikasikan, dan permohonan Early Access sudah dibuka
Penyatuan persepsi, tindakan, dan bahasa
- Bidang penerapan ke depan mencakup pengeditan gambar dan video interaktif, simulasi, penggunaan komputer, dan physical AI
- Sambil meluncurkan fungsi saat ini secara bertahap, pengembangan model generasi berikutnya juga sedang berlangsung
- Tujuan akhirnya adalah menggabungkan prediksi persepsi, tindakan, dan bahasa ke dalam satu model terpadu
1 komentar
Pendapat Hacker News
Diharapkan versi bobot terbuka menjadi yang berkinerja terbaik (SOTA)
Disebutkan bahwa dalam beberapa minggu hingga bulan ke depan mereka akan menyediakan FLUX 3 Dev, model dasar multimodal untuk pembuatan konten dan prediksi perilaku, dengan bobot terbuka, serta juga akan mengungkap detail teknis dari pendekatan dasarnya
Jika model dasar dirilis sebagai versi Dev, sulit juga mengetahui apa yang dihilangkan hanya dari postingannya
Hampir tidak ada contoh yang menampilkan manusia, istilah world model dipakai dengan cukup ringan, dan meskipun mengklaim video 20 detik, yang ditampilkan sebenarnya hanya jump cut
Pada akhirnya inti semuanya adalah “akan segera dirilis”
Bisa jadi bidang reinforcement learning juga meminjam istilah itu dari ilmu perilaku, jadi mungkin lebih baik diterima saja. Mirip seperti para filsuf dan seniman visual sama-sama menyalahgunakan istilah object-oriented dengan caranya masing-masing
Reaksi di sini sangat negatif dan sinis secara mengejutkan, tetapi di mata saya kinerjanya terlihat sangat mengesankan
Ada juga yang bilang orang-orang negatif selalu yang paling dulu meninggalkan komentar pedas, jadi saya akan menunggu dan melihat dulu
Belakangan saya merasa suasana di HN makin negatif, semoga itu hanya perasaan saya
Jika memiliki lingkungan eksekusi yang tepat dan cukup memahami bidangnya untuk menilai apakah model terjebak dalam penalaran yang salah atau menghasilkan keluaran yang subtil tapi keliru, saya cukup optimistis. Sebaliknya, melihat media sosial dipenuhi gambar dan video buatan AI yang buruk, saya jauh lebih pesimistis soal kemungkinan generator gambar dan video sintetis penuh dipakai secara bermanfaat di dunia nyata. Ketika jatuh ke tangan jutaan orang, tampaknya lebih sering dipakai untuk hal yang merugikan daripada bermanfaat bagi masyarakat
Jika model video ini berada di level yang mirip dengan Seedance 2.0, biayanya akan terlalu tinggi untuk pembuatan konten berkualitas rendah dan lebih mungkin masuk ke pipeline VFX sebuah proyek
Saya penasaran apakah ada yang melatih model dengan data taktil
Hal yang paling saya inginkan dari robot adalah menyentuh benda, tetapi yang diberikan hanya audio, video, dan gambar, jadi model yang belum pernah menyentuh apa pun harus belajar cara melakukan kontak. Mungkin ini juga sebabnya robot terlihat ragu-ragu saat menyentuh benda
Flux 2 Dev Klein pada dasarnya adalah yang terbaik di antara model yang bisa dipakai pada hardware komersial biasa
Saya berharap Flux 3 juga menyertakan model bobot terbuka terbaru yang setara, dan jika tidak, itu akan menjadi kerugian besar bagi banyak pengguna hobi
Ini proyek AI pertama dari Eropa yang membuat saya punya ekspektasi besar
Mereka merekrut di Freiburg im Breisgau, jadi saya penasaran apakah perekrutan talenta di sana berjalan baik
Seorang teman yang tinggal di sana suka bersepeda jalanan di pegunungan sekitar, dan teman lain bermain ski lintas alam saat jam makan siang di musim dingin
Soal pool talenta saya kurang tahu, tetapi di sana ada universitas
Tidak aneh bagi startup di luar SF untuk merekrut dari kota universitas
Sampai adegan menari di ruangan yang kebanjiran, saya kira itu video live-action
Versi 2.3 sangat bagus, dan melihat video serta penilaian yang dibagikan orang-orang yang mendapat akses awal, saya sangat antusias karena model ini tampaknya akan menjadi yang terbaik baru untuk penggunaan rumahan
Jika model harus belajar mengekspresikan suara dunia dan peristiwa di dalamnya, demi lucu saya berharap mereka memasukkan terlalu banyak Wilhelm scream yang tidak realistis ke dalam proses pelatihannya