1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Black Forest Labs dan mimic robotics mengembangkan FLUX-mimic, yang menggabungkan prediksi tindakan robot dengan backbone FLUX 3 yang dilatih bersama pada gambar, video, dan audio, lalu diuji dan diterapkan di lini produksi Audi
  • Melalui prediksi video yang mencakup lebih dari 95% komputasi pelatihan, model mempelajari kontak, gerak, berat, dan hubungan sebab-akibat, sementara tindakan robot berdimensi rendah juga diperlakukan sebagai modalitas tambahan yang merepresentasikan realitas fisik yang sama
  • Segera setelah prediksi tindakan ditambahkan, kualitas generasi video turun hingga 10%, tetapi pulih ke level sebelumnya setelah 3.500 langkah, mengonfirmasi bahwa satu backbone dapat menjalankan generasi dan prediksi tindakan sekaligus
  • Dengan Self-Flow untuk menyatukan pembelajaran generatif dan representasi serta menghubungkan decoder tindakan ringan, sistem mencapai pemrosesan backbone di bawah 80 ms pada satu NVIDIA RTX 5090, dengan waktu respons robot total 101 ms
  • Model dunia yang dilatih dalam skala besar pada video umum dan tugas manipulasi beradaptasi ke tugas baru hanya dengan sedikit demonstrasi dan mencoba kembali setelah gagal, sehingga dapat digunakan pada pekerjaan produksi yang sebelumnya mahal untuk diotomatisasi, seperti komponen fleksibel dan manipulasi presisi

Satu backbone untuk pembuatan konten dan kontrol robot

  • Setelah FLUX 1·FLUX 2 berfokus pada generasi gambar, FLUX 3 sejak awal dilatih bersama pada gambar, video, dan audio untuk menghasilkan konten audiovisual secara terpadu
  • Black Forest Labs memberikan versi awal FLUX 3 kepada mimic robotics, lalu menggabungkan keahlian kedua perusahaan dalam pembelajaran dan deployment robot serta model fondasi untuk mengembangkan FLUX-mimic
    • mimic menangani robot miliknya sendiri, pembelajaran robot, manipulasi presisi, dan deployment di lingkungan produksi
    • Black Forest Labs menyediakan model berbasis visual serta kapabilitas pembelajaran dan pemodelan multimodal
  • FLUX-mimic adalah model video-aksi untuk manipulasi umum berbasis backbone FLUX 3, dan diintegrasikan ke dalam sistem deployment full-stack milik mimic
  • Backbone yang sama menghasilkan konten gambar, video, dan audio, sekaligus menjalankan tindakan dalam Physical AI

Dunia fisik yang dipelajari lewat prediksi video

  • Lebih dari 95% komputasi pelatihan FLUX 3 digunakan untuk prediksi video
    • Untuk membuat video realistis, model harus mempelajari kontak, gerak, berat, serta sebab dan akibat; jika hal ini salah ditangani, video hasilnya juga menjadi tidak alami
    • Proses merender dunia secara akurat terhubung dengan proses mempelajari cara dunia bekerja
  • Audio adalah modalitas berdimensi rendah yang mencakup kurang dari 0,5% token dalam video 720p dengan audio
    • Model yang memahami video dapat mempelajari hubungan sebab-akibat antara gerakan bibir dan suara yang sinkron, serta efek suara yang terkait dengan peristiwa fisik
  • Tindakan robot juga merupakan representasi status berdimensi rendah yang sangat terkait dengan observasi visual
    • Tindakan, audio, dan frame video masing-masing merepresentasikan sebagian dari satu realitas fisik
    • Alih-alih membuat model fondasi terpisah, prediksi tindakan menghubungkan satu cara observasi tambahan ke model dunia yang sudah ada

Kualitas generasi yang pulih setelah pembelajaran tindakan

  • Saat prediksi tindakan ditambahkan ke pelatihan skala besar, skor evaluasi manusia untuk generasi teks-ke-video dan gambar-ke-video awalnya turun hingga 10%
  • Kualitas pulih saat model mempelajari struktur ruang tindakan dan menyelaraskan representasi dunia internalnya; setelah 3.500 langkah, model mencapai level generasi video sebelumnya sekaligus mampu memprediksi tindakan
  • Ada kebingungan sementara selama tindakan diintegrasikan ke input dan output, tetapi hal itu tidak mengorbankan kapasitas kemampuan yang sudah ada secara permanen
  • Model fondasi terpisah tidak diperlukan untuk generasi video dan prediksi tindakan; satu backbone yang sama menjalankan kedua tugas tersebut

Arsitektur yang mendekode tindakan dari representasi dunia

  • FLUX-mimic mendekode tindakan robot dari representasi dunia internal yang dipelajari FLUX 3 untuk generasi video
  • Mengikuti pendekatan yang pertama digunakan pada mimic-video, fitur perantara diekstraksi dari jalur prediksi video FLUX, lalu decoder tindakan ringan dilatih di atasnya
  • Kinerja bergantung pada dua faktor yang saling terkait
    • Kualitas model dunia: jika model tidak memahami bagaimana dunia bergerak, simulasi yang akurat pun sulit dilakukan, dan ini berkaitan langsung dengan kualitas generasi
    • Kualitas representasi: jika hubungan sebab-akibat antar-modalitas terjalin secara nonlinier di ruang fitur, decoder tindakan harus menafsirkannya dengan tingkat kesulitan setara input mentah
  • Model generatif menyediakan simulasi berkualitas tinggi dan hukum penskalaan yang dapat diprediksi seiring peningkatan komputasi, tetapi dapat menghasilkan representasi yang kurang terpisah dibanding metode pembelajaran representasi khusus, sehingga membatasi kegunaannya untuk tugas hilir yang membutuhkan pemahaman dunia

Pembelajaran generatif dan representasi yang disatukan dengan Self-Flow

  • Self-Flow menyatukan pembelajaran generatif dan pembelajaran representasi dalam satu framework
  • Setelah diterapkan, kualitas model dunia dan representasi meningkat bersama
    • Kinerja model dunia, yang diukur melalui kualitas generasi video, gambar, dan audio, meningkat
    • Kualitas representasi, yang diukur melalui tingkat keberhasilan tugas kontrol robot simulasi, juga membaik
  • FLUX 3 memperluas Self-Flow untuk mempelajari dinamika dunia yang luas dan kemampuan manipulasi sejak awal
    • Puluhan juta jam konten video umum
    • Ratusan ribu jam konten video yang berfokus pada manipulasi manusia dan robot
  • Pelatihan skala besar ini memperluas hasil Self-Flow dari laboratorium ke lingkungan produksi dan logistik nyata

Tugas pabrik dan kinerja benchmark

  • mimic menerapkan FLUX-mimic pada pekerjaan pabrik nyata
    • Kitting, yaitu memasukkan komponen ke tray terstruktur
    • Memasukkan unit kontrol elektronik ke fixture dengan toleransi sempit
    • Perakitan komponen
    • Menangani material lunak dan fleksibel seperti benang dan kabel
  • Bahkan saat backbone FLUX dibekukan sepenuhnya, decoder tindakan menghasilkan kinerja lebih tinggi daripada model visual-bahasa-tindakan sebelumnya, sementara model sebelumnya tidak berhasil menyelesaikan tugas pada pengaturan ini
  • Ketika backbone dan decoder tindakan di-fine-tune bersama, FLUX-mimic mencatat tingkat keberhasilan tugas tertinggi
  • Pelatihan skala besar memberi backbone pengetahuan tentang dunia dan tindakan, sementara Self-Flow membuat pengetahuan itu mudah didekode dari representasi fitur

Belajar dari sedikit demonstrasi dan pulih dari kegagalan

  • Jika hukum fisika sudah tersimpan dalam representasi yang dapat diakses, adaptasi ke tugas baru menjadi proses menghubungkan tugas tertentu ke pengetahuan yang ada, bukan mempelajari ulang cara dunia bekerja
  • Dalam eksperimen Self-Flow, jumlah langkah pelatihan prediksi tindakan yang diperlukan untuk mencapai tingkat keberhasilan yang sama berkurang menjadi setengah dibanding model video tanpa Self-Flow
  • Dalam makalah mimic-video, model video-aksi menunjukkan efisiensi sampel hingga 10 kali lebih tinggi daripada model visual-bahasa-tindakan, dan FLUX-mimic menggabungkan kedua efek tersebut
  • Jika robot gagal menggenggam objek, robot dapat memperbaiki pose, menggenggam ulang, dan menyelesaikan tugas melalui pemulihan kegagalan yang alami
    • Karena tidak semua jenis kegagalan dapat dimasukkan ke data demonstrasi, tindakan pemulihan yang tidak didemonstrasikan berasal dari model yang sudah mempelajari cara dunia bekerja

Sistem robot yang merespons dalam 101 ms

  • Di lingkungan nyata, model harus bertindak sesuai kecepatan perubahan lingkungan, dan sebagian besar biaya komputasi FLUX-mimic terjadi pada komponen terbesarnya, yaitu backbone
  • Representasi dunia yang terstruktur dengan baik memungkinkan kinerja yang sama dicapai dengan parameter lebih sedikit, sehingga backbone yang lebih kecil dan lebih cepat dapat digunakan
  • Backbone yang dioptimalkan berjalan di bawah 80 ms pada satu NVIDIA RTX 5090, mulai dari input hingga pembuatan representasi dunia, pada skala yang sama dengan waktu respons visual manusia
  • mimic mengoptimalkan elemen berikut untuk mengurangi latensi tambahan di seluruh stack deployment
    • Decoder tindakan
    • Latensi antarproses antara sensor, model, dan aktuator
    • Real-time chunking yang menumpangtindihkan prediksi dan eksekusi untuk mencegah gerakan robot tersendat
  • Setelah semua optimasi diterapkan, waktu respons akhir sistem robot mandiri adalah 101 ms

Penerapan di lini produksi Audi

  • Meski tingkat otomatisasinya tinggi, Audi masih terus menangani komponen fleksibel dan tugas manipulasi presisi secara manual
  • Produksi produk premium memiliki banyak variasi, sehingga biaya untuk merancang ulang sel robot yang diprogram dengan cara konvensional untuk setiap kasus menjadi tinggi
    • Sistem berbasis pembelajaran mengubah struktur biaya ini
  • Audi Production Lab bekerja sama dengan mimic untuk menguji dan menerapkan FLUX-mimic
    • Melakukan manipulasi objek lunak yang kompleks yang sebelumnya tidak mungkin dilakukan dengan robot konvensional
    • Dapat digunakan untuk mendukung karyawan, meningkatkan efisiensi, dan memperluas otomatisasi fleksibel dalam produksi dan logistik
  • Efisiensi sampel dan ketangguhan FLUX-mimic berasal dari backbone FLUX 3 dan representasi yang dapat didekode, bukan dari rekayasa per tugas, serta mendukung transfer antar-tugas, industri, dan hardware
  • Satu model fondasi kecerdasan visual menghasilkan gambar, video, dan audio sekaligus menggerakkan robot di lini produksi

1 komentar

 
GN⁺ 3 jam lalu
Komentar Hacker News
  • Tampaknya di dalam model generasi video multimodal yang terlatih dengan baik terbentuk model representasi dunia, dan ketika itu diekstrak lalu diterapkan ke robot, hasilnya juga bekerja dengan baik
    Gagasan bahwa model video memahami materi, cahaya, dan dunia bukanlah hal baru, tetapi jarang ada lab video yang beralih menjadi lab robotika. Ini bisa menjadi jalur bisnis: memperbesar skala lewat generasi video lalu menggunakan kemampuan itu untuk melatih robot
    Tangan BFL yang tampak seperti menyembunyikan banyak perangkat di dalam sarung tangan juga menarik. Robotics-1 dari Xiaomi membuat video pelatihan dengan gripper biasa dan sarung tangan berbentuk gripper, tetapi model BFL tampaknya tidak memerlukan peralatan seperti itu. Karena hardware adalah bidang yang sulit, menarik untuk melihat pendekatan mereka ke depan

  • Sekitar menit 3:30, adegan lengan robot berhasil memasang kembali molding jendela setelah tiga kali mencoba terasa sangat mengejutkan. Ini pertama kalinya saya melihat pemecahan masalah setelah gagal, jadi saya penasaran apakah ini teknik baru

  • Dalam penjelasan bahwa “untuk tugas yang membutuhkan pemahaman dunia, representasi yang kurang terpisah kurang berguna”, kalimat yang memilih mengekspresikan konsep 'lebih terjalin' sebagai representasi yang kurang terpisah terasa lucu. Saat menjelaskan dunia nyata, konsepnya sendiri malah dibuat semakin terjalin; ini terdengar seperti gaya khas LLM

    • Sekarang sudah sampai tahap mencari jejak LLM di setiap kalimat tanpa dasar. Sudah saatnya menganggap semua tulisan sampai batas tertentu mendapat bantuan LLM dan hanya menilai kualitas hasil akhirnya
    • Manusia juga sering menulis kalimat yang canggung. Justru ungkapan seperti itu jarang ada di data pelatihan, jadi kemungkinan dibuat oleh LLM bisa lebih rendah daripada oleh manusia
    • Itu cuma bercanda
    • Tanda hubung di teks asli juga jelas bukti bahwa komentar ini ditulis LLM /s
  • Teknologi sudah berkembang sejauh ini, tetapi sedih rasanya film justru tampak lebih buruk dari sebelumnya. Saya sering menonton film puluhan tahun lalu untuk mencari karya yang layak, dan meski memakai boneka yang konyol, susunan ceritanya 1.000 kali lebih baik

    • Bisa jadi ini survivorship bias, karena kita tidak menonton film-film lama buruk yang tidak diingat siapa pun
    • Apakah Anda akan menolak berinvestasi di BFL hanya karena Robin Rombach tidak tahu cara membuat film? Sora sudah selesai, dan bahkan sulit mencari orang yang cukup berani untuk mengatakan secara terbuka bahwa Bill Peebles tidak tahu cara membuat film
      Ini bukan hanya masalah modal ventura, tetapi juga terkait dengan apa yang disebut Hollywood No. Sebaliknya, bisa jadi Hollywood No itu sendiri yang menjadi masalah, dan di industri game ini sudah lama disebut positivitas toksik
  • Senang melihat kolaborasi antar startup Eropa

    • Bukankah Flux sudah diakuisisi oleh Meta?
  • Ini adalah masa depan, sekaligus sudah menjadi masa kini. Saya harap ini juga dibagikan kepada orang-orang yang Anda kenal di luar pengembangan software dan engineering

  • Kita sedang melaju lurus menuju krisis di mana nilai manusia yang tidak memiliki alat produksi makin menurun. Tampaknya masa yang suram akan datang