2 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Sebagai model generasi gambar dasar generasi ke-3 dari seri Qwen-Image, model ini menjadikan ‘Real(实)’ sebagai tujuan utama agar dapat dimanfaatkan untuk pekerjaan produktivitas, bukan sekadar membuat gambar yang enak dilihat
  • Memproses input hingga 4,5k token untuk menghasilkan sekaligus, dalam satu kali pembuatan, layout dengan banyak informasi seperti surat kabar, storyboard, dan lembar ujian, serta gambar dengan banyak konsep yang tersusun paralel dan bertumpuk
  • Merender teks berukuran 10px, rumus LaTeX, dan anotasi tulisan tangan agar dapat dibaca, sekaligus mereproduksi tekstur sangat halus seperti pori-pori, rambut, kulit, dan sapuan kuas
  • Mendukung 12 bahasa dan berbagai font, lebih dari 100 gaya seni, serta UI web, game, dan live streaming; juga dapat mencari informasi terbaru di internet dan memasukkannya ke dalam gambar
  • Model ini bertujuan memperluas generasi gambar menjadi alat produktivitas yang siap diterapkan untuk desain, pembuatan konten, pendidikan, dan e-commerce, termasuk PDF surat kabar, storyboard drama pendek, dan UI kompleks

Model generasi ke-3 menuju ‘Real’

  • Qwen-Image-3.0 adalah model generasi gambar dasar generasi ke-3 dari seri Qwen-Image
  • Arah utama tiap generasi adalah sebagai berikut
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • ‘Real’ terdiri dari tiga kemampuan
    • Konten kaya: dukungan input hingga 4,5k token dan layout kompleks
    • Detail realistis: reproduksi teks 10px dan elemen halus seperti pori-pori serta rambut
    • Pengetahuan mendalam: generasi dengan memanfaatkan 12 bahasa, beragam UI, dan pengetahuan dunia
  • Tujuannya adalah mengembangkan generasi gambar dari ‘bisa digunakan’ menjadi ‘praktis’, dan dari ‘enak dilihat’ menjadi berguna

Konten kaya dan tata letak kompleks

  • Pada slide matematika, model ini dapat merender hubungan spasial, simbol matematika, penjelasan teorema, serta posisi relatif tiap elemen secara bersamaan
  • Dengan instruksi sekitar 3,7k token, model ini menghasilkan grid 3×3 dalam satu kali proses tanpa menyambungkan beberapa gambar
    • Tiap sel tersusun sebagai infografik kompleks yang menggabungkan kalimat bahasa Mandarin dan Inggris, rumus, bagan, serta karakter kartun
    • Satu gambar memuat komik keselamatan terowongan, pelajaran geometri ruang, analisis gaya bahasa 「Chu Shi Biao」, gerak parabola, parasitologi, diagram medis nyeri dada kanan, teorema Sylow, pengendalian internal bank, dan perbandingan struktur DNA sel
  • Menerima instruksi hingga 4,5k token untuk memahami dan merender layout visual dengan kepadatan informasi tinggi
  • Ekspansi horizontal

    • Mengacu pada kemampuan menempatkan banyak elemen paralel di satu kanvas
    • Dengan memanfaatkan penjajaran semantik dan kontrol spasial, model ini menata banyak konsep agar tidak saling mengganggu
  • Kedalaman vertikal

    • Kemampuan untuk mengurai makna dan menampilkan antarmuka yang bertumpuk secara logis tahap demi tahap
    • Dengan satu instruksi, model ini menghasilkan struktur multi-layar yang menumpuk layar pemrograman VSCode, Qwen Chat, WeChat, dan poster kopi hand drip
    • Tiap lapisan mempertahankan gaya dan elemen detail dari UI terkait

Dari teks kecil hingga restorasi lukisan

  • Teks kecil dan tata huruf kompleks

    • Merender teks kecil berukuran 10px agar tetap dapat dibaca
    • Dapat menghasilkan area yang padat teks dan ilustrasi, seperti infografik pengetahuan tentang hiu paus
    • Pada satu halaman makalah geometri aljabar, model ini mereproduksi rumus LaTeX, superskrip dan subskrip, huruf Yunani, nomor teorema, kurung kurawal, garis pecahan, dan perataan multi-baris
    • Menjaga keterbacaan rumus dan teks utama bahkan pada font kecil
    • Menghasilkan gambar berbentuk surat kabar dengan menggabungkan tekstur kertas realistis dan teks yang rapat
  • Penyuntingan dan tulisan tangan

    • Dapat menambahkan anotasi tulisan tangan berwarna merah di atas halaman buku
    • Mencakup garis bawah, garis bergelombang, lingkaran, panah, dan catatan singkat
    • Mewujudkan gaya tulisan tangan alami seperti catatan pelajaran siswa SMA
  • Ekspresi tekstur dan restorasi

    • Pada foto potret, model ini menggambarkan elemen halus seperti pori-pori, rambut, dan tekstur kulit, sekaligus dapat menampilkan tekstur halus pada objek lain
    • Memulihkan lukisan tradisional yang rusak atau sebagian hilang sesuai gaya lukisan dan sapuan kuas aslinya
    • Pada lukisan pertarungan elang, model ini menghapus noda jamur dan jejak kerusakan serta melengkapi bagian yang hilang, sambil mempertahankan gradasi tinta, tekstur bulu, dan keseimbangan komposisi

Pemanfaatan bahasa, UI, dan pengetahuan dunia

  • Mendukung 12 bahasa, berbagai font, lebih dari 100 gaya seni, dan beragam antarmuka UI
  • Mencakup contoh yang merender bahasa Jepang, Korea, dan Spanyol secara akurat
  • Dapat menghasilkan berbagai jenis layar UI yang realistis, seperti halaman web, game, dan live streaming
  • Infografik berbasis pengetahuan

    • Mempertahankan subjek utama dari foto serangga nyata sambil memperluasnya menjadi infografik untuk penelitian
    • Mencakup informasi taksonomi, anotasi karakteristik morfologis, tampilan detail yang diperbesar, dan batang skala
    • Menyusun hasilnya dalam bentuk diagram penelitian yang dapat langsung digunakan untuk publikasi akademik
  • Pemanfaatan informasi terbaru dan IP

    • Selain pengetahuan yang dimiliki model, model ini juga dapat terhubung ke internet untuk mencari informasi terbaru
    • Mencari cuaca Hangzhou pada 21 Juli dan menghasilkan gambar prakiraan cuaca
    • Dapat mencari tokoh IP tertentu dan membuat gambar berdasarkan tokoh tersebut
    • Menghasilkan adegan Qi Baishi dan Van Gogh memperkenalkan Qwen-Image-3.0 di ruang live streaming

Ekspansi ke pekerjaan produktivitas

  • Berdasarkan tiga kemampuan inti tersebut, model ini mendukung pekerjaan bernilai tinggi seperti PDF surat kabar, storyboard drama pendek, dan antarmuka UI kompleks
  • Tujuannya adalah menghubungkan kemampuan generasi gambar dengan nilai produktivitas di lebih banyak bidang, seperti desain, pembuatan konten, pendidikan, dan e-commerce

1 komentar

 
GN⁺ 3 jam lalu
Pendapat Hacker News
  • Rasanya aneh mendorong model seperti ini ke belanja online. Karena pakaian disesuaikan agar terlihat pas di tubuh dan pencahayaan juga dibuat menarik, rasa saat dipakai dan fit pakaian yang sebenarnya tetap sulit diketahui seperti sebelumnya

    • Tujuan jangka pendeknya adalah menjual produk, tetapi tujuan jangka panjang yang lebih ambisius adalah mengaburkan batas antara iklan dan kenyataan agar pada saat pembelian orang biasa bahkan tidak lagi mempertanyakan hal ini
      Dalam 50 tahun, ‘kebenaran iklan’ itu sendiri bisa dianggap sebagai masa lalu ideal yang tak mungkin direbut kembali
    • Yang diinginkan sebagian orang mungkin bukan AI generatif itu sendiri, melainkan transformasi image-to-image seperti “ubah ini agar terlihat seperti difoto fotografer yang kompeten”
      Tetapi untuk platform yang mengunggah 1.000 produk baru tiap bulan, foto asli yang tidak sempurna justru tampaknya lebih baik untuk konversi pembelian. Terutama gambar bergaya 3D yang membuat semua varian warna terlihat sama malah terasa mengganggu
    • Hal serupa juga terlihat pada iklan furnitur bekas di Facebook Marketplace. Sebagian besar gambar dihias dengan AI hingga seperti katalog Pottery Barn, lalu baru di akhir ditampilkan foto barang aslinya yang penuh goresan dan kerusakan, tergeletak di garasi yang berantakan
    • Saya ragu apakah ini benar-benar kurang mendistorsi dibanding cara lama, yaitu memakaikan kemeja ke model dan memotretnya dengan fotografer profesional di bawah pencahayaan sempurna
  • Menarik bahwa pada meta keywords HTML ada lebih dari 100 entri terkait konten dewasa seperti hentai, nudes, dan sebagainya

    • Kata kunci ini juga tampaknya diterapkan secara global bahkan pada halaman seperti https://qwen.ai/usagepolicy yang meminta agar produk tidak digunakan untuk konten seksual
      Jalankan document.querySelector('meta[name="keywords"]').content di console untuk melihat seluruh tag
    • Sepertinya ada alat optimasi mesin pencari yang menambahkan meta keywords secara otomatis. Saat mengumpulkan kata pencarian umum yang mengandung qwen, kemungkinan ikut memasukkan salah ketik gwen atau ben dalam konteks konten dewasa
    • Saya tidak tahu lagi apa gunanya tag meta keywords sekarang, dan itu hanya menambahkan lebih dari 77KB data tak berguna ke halaman
    • Tim Qwen mungkin juga tahu bahwa komunitas konten dewasa cepat mengadopsi model generasi gambar baru, seperti yang terlihat di Civitai. Ini tampak seperti strategi optimasi mesin pencari untuk mengekspos model tersebut pada hasil pencarian yang sudah mereka cek
  • Terlihat seperti dilatih dengan output GPT Image 1, dan nada kuning khasnya sangat jelas
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 juga mendapat nada kuning tanpa dilatih dari output model generasi gambar lain. Karena orang menyukai foto dengan cahaya senja yang lembut dan model preferensi mudah menangkap itu, jika mengoptimalkan daya tarik estetis maka semua gambar akan mendapat sedikit color cast kecuali sengaja ditekan
    • Color cast kuning dan merah adalah masalah yang sangat umum terlepas dari sumber foto pelatihan. Bahkan startup fotografi yang melatih dengan gambar asli pun mengalaminya, dan terus sulit dicegah
    • Karena gambar buatan AI kini sudah menjadi bagian dari web, dengan web scraping biasa tidak mungkin menghindari gambar generatif dalam data pelatihan
  • Bahasa Arab pada judul gambar utama jelas rusak, tetapi saat model dipakai langsung hasilnya tidak begitu. Bisa jadi gambar utama itu bukan dibuat dengan Qwen Image 3.0

    • Ini patokan yang bagus untuk menguji model baru. Saat GPT Image 2 dan Nano Banana Pro diuji dengan kutipan Al-Qur'an dalam Tamil dan Arab, hasilnya benar, mungkin berkat data pelatihan yang sangat besar
  • Mereka bilang “dibutuhkan 3.700 token untuk mendeskripsikan seluruh grid 3×3 dengan akurat”, tetapi tidak merilis prompt-nya, jadi demonya kurang meyakinkan

  • Tidak ada sama sekali penjelasan tentang kapan dan apakah bobot model akan dirilis, jadi saya penasaran apakah ada tempat lain yang membahasnya

    • Bobot Qwen-Image-2.0 juga tidak dirilis, jadi kali ini pun tampaknya kecil kemungkinannya
    • Setelah Z-Image dan Qwen-Image pertama, mereka tampaknya beralih total ke model tertutup. Dari gambar yang dipublikasikan saja, Qwen-Image 3.0 hanya terlihat sebagai alternatif yang lebih lemah dibanding model proprietari seperti gpt-image-2 atau nb-pro
    • Kalaupun dirilis, yang akan memonetisasinya hanya Cursor, Azure, dan Amazon, jadi tak ada alasan kuat untuk melakukannya. Kecuali OpenAI benar-benar membuka modelnya, kemungkinannya kecil
  • Saya memberi 2 logo asli, spesifikasi lengkap bahasa desain, dan 3 tangkapan layar aplikasi, tetapi yang keluar hanya 3 gambar mengerikan, dan tidak satu pun sama dengan logo asli yang saya berikan

  • Hasil uji di chat.qwen.ai menunjukkan komposisi dan akurasi anatominya bahkan tidak mencapai level Qwen Image 1. Ada hasil dengan tiga kaki atau mata bercahaya, kualitasnya setara Microsoft Lens yang sudah ditarik

  • Saya merasa model seperti ini akan sangat berguna jika sudah ada saat kuliah. Sebagai pembelajar visual, saya mungkin akan jauh lebih mudah memahami beberapa topik lewat diagram dan gambar penjelas daripada lewat teks panjang

    • Tetapi diagram yang dihasilkan hanyalah tiruan. Bahkan jika diminta poster yang menjelaskan komponen atom dengan akurat, alih-alih representasi terkait awan probabilitas, yang keluar adalah bola pingpong merah, biru, dan abu-abu yang mengitari lintasan melingkar, dan kalau beruntung paling hanya dapat diagram kulit elektron
      Saya mencoba meminta ke Nano Banana 2 “poster infografik untuk mahasiswa sarjana yang menjelaskan cara kerja atom”, dan yang dihasilkan adalah model Bohr seperti buku pelajaran IPA SMP
    • Istri saya memasukkan semua resep ke generator gambar ChatGPT dan mengubahnya menjadi halaman bergaya majalah; hasilnya luar biasa. Sekarang dia sedang membuat buku resep keluarga agar anak-anak bisa tahu hidangan yang mereka makan saat kecil
  • Filter kekuningan masih tetap terlihat di seluruh gambar