- Sebagai model generasi gambar dasar generasi ke-3 dari seri Qwen-Image, model ini menjadikan ‘Real(实)’ sebagai tujuan utama agar dapat dimanfaatkan untuk pekerjaan produktivitas, bukan sekadar membuat gambar yang enak dilihat
- Memproses input hingga 4,5k token untuk menghasilkan sekaligus, dalam satu kali pembuatan, layout dengan banyak informasi seperti surat kabar, storyboard, dan lembar ujian, serta gambar dengan banyak konsep yang tersusun paralel dan bertumpuk
- Merender teks berukuran 10px, rumus LaTeX, dan anotasi tulisan tangan agar dapat dibaca, sekaligus mereproduksi tekstur sangat halus seperti pori-pori, rambut, kulit, dan sapuan kuas
- Mendukung 12 bahasa dan berbagai font, lebih dari 100 gaya seni, serta UI web, game, dan live streaming; juga dapat mencari informasi terbaru di internet dan memasukkannya ke dalam gambar
- Model ini bertujuan memperluas generasi gambar menjadi alat produktivitas yang siap diterapkan untuk desain, pembuatan konten, pendidikan, dan e-commerce, termasuk PDF surat kabar, storyboard drama pendek, dan UI kompleks
Model generasi ke-3 menuju ‘Real’
- Qwen-Image-3.0 adalah model generasi gambar dasar generasi ke-3 dari seri Qwen-Image
- Arah utama tiap generasi adalah sebagai berikut
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- ‘Real’ terdiri dari tiga kemampuan
- Konten kaya: dukungan input hingga 4,5k token dan layout kompleks
- Detail realistis: reproduksi teks 10px dan elemen halus seperti pori-pori serta rambut
- Pengetahuan mendalam: generasi dengan memanfaatkan 12 bahasa, beragam UI, dan pengetahuan dunia
- Tujuannya adalah mengembangkan generasi gambar dari ‘bisa digunakan’ menjadi ‘praktis’, dan dari ‘enak dilihat’ menjadi berguna
Konten kaya dan tata letak kompleks
- Pada slide matematika, model ini dapat merender hubungan spasial, simbol matematika, penjelasan teorema, serta posisi relatif tiap elemen secara bersamaan
- Dengan instruksi sekitar 3,7k token, model ini menghasilkan grid 3×3 dalam satu kali proses tanpa menyambungkan beberapa gambar
- Tiap sel tersusun sebagai infografik kompleks yang menggabungkan kalimat bahasa Mandarin dan Inggris, rumus, bagan, serta karakter kartun
- Satu gambar memuat komik keselamatan terowongan, pelajaran geometri ruang, analisis gaya bahasa 「Chu Shi Biao」, gerak parabola, parasitologi, diagram medis nyeri dada kanan, teorema Sylow, pengendalian internal bank, dan perbandingan struktur DNA sel
- Menerima instruksi hingga 4,5k token untuk memahami dan merender layout visual dengan kepadatan informasi tinggi
-
Ekspansi horizontal
- Mengacu pada kemampuan menempatkan banyak elemen paralel di satu kanvas
- Dengan memanfaatkan penjajaran semantik dan kontrol spasial, model ini menata banyak konsep agar tidak saling mengganggu
-
Kedalaman vertikal
- Kemampuan untuk mengurai makna dan menampilkan antarmuka yang bertumpuk secara logis tahap demi tahap
- Dengan satu instruksi, model ini menghasilkan struktur multi-layar yang menumpuk layar pemrograman VSCode, Qwen Chat, WeChat, dan poster kopi hand drip
- Tiap lapisan mempertahankan gaya dan elemen detail dari UI terkait
Dari teks kecil hingga restorasi lukisan
-
Teks kecil dan tata huruf kompleks
- Merender teks kecil berukuran 10px agar tetap dapat dibaca
- Dapat menghasilkan area yang padat teks dan ilustrasi, seperti infografik pengetahuan tentang hiu paus
- Pada satu halaman makalah geometri aljabar, model ini mereproduksi rumus LaTeX, superskrip dan subskrip, huruf Yunani, nomor teorema, kurung kurawal, garis pecahan, dan perataan multi-baris
- Menjaga keterbacaan rumus dan teks utama bahkan pada font kecil
- Menghasilkan gambar berbentuk surat kabar dengan menggabungkan tekstur kertas realistis dan teks yang rapat
-
Penyuntingan dan tulisan tangan
- Dapat menambahkan anotasi tulisan tangan berwarna merah di atas halaman buku
- Mencakup garis bawah, garis bergelombang, lingkaran, panah, dan catatan singkat
- Mewujudkan gaya tulisan tangan alami seperti catatan pelajaran siswa SMA
-
Ekspresi tekstur dan restorasi
- Pada foto potret, model ini menggambarkan elemen halus seperti pori-pori, rambut, dan tekstur kulit, sekaligus dapat menampilkan tekstur halus pada objek lain
- Memulihkan lukisan tradisional yang rusak atau sebagian hilang sesuai gaya lukisan dan sapuan kuas aslinya
- Pada lukisan pertarungan elang, model ini menghapus noda jamur dan jejak kerusakan serta melengkapi bagian yang hilang, sambil mempertahankan gradasi tinta, tekstur bulu, dan keseimbangan komposisi
Pemanfaatan bahasa, UI, dan pengetahuan dunia
- Mendukung 12 bahasa, berbagai font, lebih dari 100 gaya seni, dan beragam antarmuka UI
- Mencakup contoh yang merender bahasa Jepang, Korea, dan Spanyol secara akurat
- Dapat menghasilkan berbagai jenis layar UI yang realistis, seperti halaman web, game, dan live streaming
-
Infografik berbasis pengetahuan
- Mempertahankan subjek utama dari foto serangga nyata sambil memperluasnya menjadi infografik untuk penelitian
- Mencakup informasi taksonomi, anotasi karakteristik morfologis, tampilan detail yang diperbesar, dan batang skala
- Menyusun hasilnya dalam bentuk diagram penelitian yang dapat langsung digunakan untuk publikasi akademik
-
Pemanfaatan informasi terbaru dan IP
- Selain pengetahuan yang dimiliki model, model ini juga dapat terhubung ke internet untuk mencari informasi terbaru
- Mencari cuaca Hangzhou pada 21 Juli dan menghasilkan gambar prakiraan cuaca
- Dapat mencari tokoh IP tertentu dan membuat gambar berdasarkan tokoh tersebut
- Menghasilkan adegan Qi Baishi dan Van Gogh memperkenalkan Qwen-Image-3.0 di ruang live streaming
Ekspansi ke pekerjaan produktivitas
- Berdasarkan tiga kemampuan inti tersebut, model ini mendukung pekerjaan bernilai tinggi seperti PDF surat kabar, storyboard drama pendek, dan antarmuka UI kompleks
- Tujuannya adalah menghubungkan kemampuan generasi gambar dengan nilai produktivitas di lebih banyak bidang, seperti desain, pembuatan konten, pendidikan, dan e-commerce
1 komentar
Pendapat Hacker News
Rasanya aneh mendorong model seperti ini ke belanja online. Karena pakaian disesuaikan agar terlihat pas di tubuh dan pencahayaan juga dibuat menarik, rasa saat dipakai dan fit pakaian yang sebenarnya tetap sulit diketahui seperti sebelumnya
Dalam 50 tahun, ‘kebenaran iklan’ itu sendiri bisa dianggap sebagai masa lalu ideal yang tak mungkin direbut kembali
Tetapi untuk platform yang mengunggah 1.000 produk baru tiap bulan, foto asli yang tidak sempurna justru tampaknya lebih baik untuk konversi pembelian. Terutama gambar bergaya 3D yang membuat semua varian warna terlihat sama malah terasa mengganggu
Menarik bahwa pada meta keywords HTML ada lebih dari 100 entri terkait konten dewasa seperti hentai, nudes, dan sebagainya
Jalankan
document.querySelector('meta[name="keywords"]').contentdi console untuk melihat seluruh tagqwen, kemungkinan ikut memasukkan salah ketikgwenataubendalam konteks konten dewasakeywordssekarang, dan itu hanya menambahkan lebih dari 77KB data tak berguna ke halamanTerlihat seperti dilatih dengan output GPT Image 1, dan nada kuning khasnya sangat jelas
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
Bahasa Arab pada judul gambar utama jelas rusak, tetapi saat model dipakai langsung hasilnya tidak begitu. Bisa jadi gambar utama itu bukan dibuat dengan Qwen Image 3.0
Mereka bilang “dibutuhkan 3.700 token untuk mendeskripsikan seluruh grid 3×3 dengan akurat”, tetapi tidak merilis prompt-nya, jadi demonya kurang meyakinkan
Tidak ada sama sekali penjelasan tentang kapan dan apakah bobot model akan dirilis, jadi saya penasaran apakah ada tempat lain yang membahasnya
Saya memberi 2 logo asli, spesifikasi lengkap bahasa desain, dan 3 tangkapan layar aplikasi, tetapi yang keluar hanya 3 gambar mengerikan, dan tidak satu pun sama dengan logo asli yang saya berikan
Hasil uji di chat.qwen.ai menunjukkan komposisi dan akurasi anatominya bahkan tidak mencapai level Qwen Image 1. Ada hasil dengan tiga kaki atau mata bercahaya, kualitasnya setara Microsoft Lens yang sudah ditarik
Saya merasa model seperti ini akan sangat berguna jika sudah ada saat kuliah. Sebagai pembelajar visual, saya mungkin akan jauh lebih mudah memahami beberapa topik lewat diagram dan gambar penjelas daripada lewat teks panjang
Saya mencoba meminta ke Nano Banana 2 “poster infografik untuk mahasiswa sarjana yang menjelaskan cara kerja atom”, dan yang dihasilkan adalah model Bohr seperti buku pelajaran IPA SMP
Filter kekuningan masih tetap terlihat di seluruh gambar