1 poin oleh GN⁺ 2024-09-26 | 1 komentar | Bagikan ke WhatsApp
  • XKCD 1425 “Tasks” adalah komik tentang sense dalam pengembangan perangkat lunak: sesuatu yang tampak mudah belum tentu memiliki tingkat kesulitan yang benar-benar sama, dan pada 24 September 2024 komik ini merayakan ulang tahun ke-10
  • Dalam komik tersebut, “memastikan apakah sebuah foto berisi burung” dulunya adalah masalah setingkat doktoral, tetapi kini menjadi tugas yang mudah diselesaikan dengan vision LLM, CLIP, ResNet+ImageNet, dan lain-lain
  • Contoh spesifiknya memang berubah seiring kemajuan teknologi, tetapi untuk menilai masalah mana yang mudah dan mana yang sulit tetap dibutuhkan pengalaman yang mendalam
  • LLM memiliki area lemah seperti matematika atau pencarian fakta, sehingga menjadi lebih sulit untuk menilai secara intuitif tugas mana yang bisa dipercayakan kepadanya secara andal
  • Seperti batasan analisis gambar di Claude Artifact, dalam pemrograman berbantuan AI kita perlu memahami bukan hanya kemampuan model, tetapi juga batasan keamanan web seperti header CSP

Pertanyaan yang Ditinggalkan XKCD 1425 Setelah 10 Tahun

  • XKCD 1425 “Tasks” adalah komik yang menunjukkan bahwa dalam pengembangan perangkat lunak, sulit menilai pekerjaan mana yang mudah dan mana yang sulit tanpa pengalaman
  • “Memastikan apakah sebuah foto berisi burung”, contoh paling terkenal dari komik itu, dulu merupakan masalah setingkat doktoral, tetapi sekarang dapat diselesaikan dengan mudah menggunakan berbagai teknologi computer vision
  • Contohnya sendiri berubah karena perkembangan teknologi, tetapi kemampuan membedakan masalah mudah dan masalah sulit tetap menuntut banyak pengalaman

Kesulitan Baru yang Diciptakan LLM dan Pemrograman Berbantuan AI

  • Tidak intuitif untuk menilai tugas seperti apa yang bisa diselesaikan LLM secara andal
    • LLM adalah sistem komputer, tetapi lemah dalam matematika
    • Pencarian fakta pun tidak bisa dilakukan secara konsisten dan andal
  • Seiring meluasnya alat pemrograman berbantuan AI, semakin banyak orang mulai membuat perangkat lunak kustom mereka sendiri
  • Programmer pemula berbantuan AI yang baru muncul kini berada dalam situasi di mana mereka harus cepat mempelajari perbedaan antara tugas yang mudah dan yang sulit
  • Ada contoh bahwa meskipun Claude sendiri dapat melakukan analisis gambar, kita tidak bisa membuat alat analisis gambar di Claude Artifact
    • Untuk memahaminya, perlu diketahui bahwa header CSP yang digunakan saat menyajikan Artifacts memblokir pemanggilan API LLM eksternal dari kode yang dihasilkan

1 komentar

 
GN⁺ 2024-09-26
Opini Hacker News
  • Mengejutkan melihat betapa banyaknya standar untuk apa yang dianggap mengesankan di AI/ML telah bergeser
    Saat makalah GAN muncul 10 tahun lalu, semua orang sangat antusias karena kualitas gambar yang dihasilkan dianggap luar biasa: https://arxiv.org/abs/1406.2661
    Jumlah kemajuan selama periode itu benar-benar sulit dipercaya

    • Ada lelucon yang melekat di ingatan: orang awam biasanya salah memahami kemampuan komputer dengan mengonversikannya sebagai setara dengan manusia
      Misalnya, karena seorang anak bisa melakukan aritmetika dasar dan komputer juga bisa melakukan aritmetika dasar, maka jika anak itu bisa berbicara, mereka mengira komputer tentu juga akan bisa berbicara
      Namun kemampuan komputer dicapai dengan cara yang sama sekali berbeda. Menariknya, LLM membuat kontur kemampuannya lebih mendekati manusia, tetapi cara mencapai hasilnya tetap sama sekali berbeda
    • Tak terbayangkan berapa banyak tenaga kerja yang bisa dihemat dalam bisnis saya 10–15 tahun lalu jika LLM yang ada sekarang sudah tersedia
      Contoh paling mengerikan adalah sekitar 180 ribu resep teks buatan pengguna yang ingin dinormalisasi oleh klien. Untuk penyesuaian porsi, perhitungan informasi gizi, dan sebagainya, kami harus mengekstrak jumlah, satuan, bahan, langkah, dan lain-lain
      Dibutuhkan setumpuk regex untuk prapemrosesan dan rangkaian alat tempat pasukan intern menormalisasi satu per satu, dan jauh lebih banyak waktu lagi habis untuk memperbaiki kekacauan yang dibuat para intern
      Kalau ada LLM, pekerjaan itu mungkin hampir langsung selesai. Dalam begitu banyak pekerjaan yang mengharuskan mengubah tumpukan sampah total menjadi data yang bisa dipakai, LLM kemungkinan besar akan langsung menanganinya
      Rasa sakit masa itu sedikit terobati karena melihat arus ini dan membeli NVDA sekitar waktu itu
    • Setelah OpenAI merilis ChatGPT, rasanya laju perkembangan tiba-tiba melambat karena semua orang menutup riset mereka sambil berharap mendapat uang
    • Perubahan ekspektasi tampaknya sangat terkait dengan perubahan audiens
      Dulu, model machine learning baru dibahas oleh praktisi yang memiliki pengetahuan latar, sehingga mereka bisa memahami mengapa perbaikan yang terlihat kecil itu hebat dan apa ekspektasi yang masuk akal
      Sekarang model machine learning baru, atau tepatnya model “AI”, dinilai oleh publik umum yang tidak tahu latar teknis tetapi tahu hiperbola marketing. Bahkan jika diberi model bahasa hebat yang mengungguli benchmark terkait bahasa, ekspektasinya begitu tidak masuk akal sehingga mereka selalu kecewa
      Saya masih takjub ketika model bahasa bisa melakukan hal yang relatif “sederhana” dalam tata bahasa dan sintaksis, seperti memahami kata ganti merujuk ke objek mana. Namun kebanyakan orang tidak pernah memikirkan bahasa atau komputer dari sudut pandang seperti itu, sehingga tidak melihat betapa sulit dan mengesankannya hal tersebut
    • Ucapan bahwa “orang melebih-lebihkan apa yang bisa dilakukan dalam 1 tahun, dan meremehkan apa yang bisa dilakukan dalam 5 atau 10 tahun” tampaknya juga sangat cocok untuk ekspektasi AI
  • Komik ini selalu terasa agak aneh. Manusia menghabiskan ribuan tahun untuk memecahkan masalah navigasi
    Komik ini hadir pada periode singkat ketika satu tugas akhirnya “terselesaikan” dan tugas lain baru mulai dikerjakan
    Jika menurut Anda pelatihan model menghabiskan banyak energi, pikirkan juga armada roket yang diluncurkan untuk mempertahankan konstelasi satelit

    • Saya melihatnya sebagai pembahasan tentang perbedaan hal-hal yang dianggap sulit oleh orang non-teknis
      Dalam karier saya, beberapa kali ada kebutuhan dadakan yang muncul di rapat dan mengubah estimasi proyek hingga berbulan-bulan
    • Masalah navigasi pun masih punya kesulitan yang tidak ditangani dengan benar oleh sebagian besar aplikasi
      Misalnya, pencari toko di situs web atau aplikasi ritel biasanya hanya menghitung jarak garis lurus antara lokasi saat ini dan toko, lalu menampilkan toko dalam radius tertentu berdasarkan urutan jarak
      Ini menjadi masalah di tempat-tempat di sebelah barat Puget Sound seperti Kingston dekat Seattle. Pencari toko Walgreens menampilkan 10 toko dalam pencarian dekat Kingston, dan 9 di antaranya berada di seberang Puget Sound, di sisi Seattle. Jika membawa mobil, Anda harus naik feri sekali jalan sekitar 20 dolar dan 30 menit
      Satu yang ditampilkan di sisi barat adalah toko di Bainbridge Island, tetapi itu bukan tempat yang wajar didatangi orang Kingston. Sebenarnya toko Silverdale lebih dekat berdasarkan jarak jalan, tetapi sedikit lebih jauh jika dihitung garis lurus
      Silverdale, 3 lokasi di Bremerton, dan 1 di Port Orchard jauh lebih dekat ke Kingston dibanding toko-toko di sisi Seattle dari segi waktu dan biaya perjalanan, tetapi baru muncul di peta setelah menekan tombol “load more”
      Fitur pengecekan stok lokal juga mirip: sering kali barang ditampilkan ada “di dekat sini”, tetapi sebenarnya hanya tersedia di toko di seberang Puget Sound
    • Justru itu yang mendekati intinya. Bagi orang awam, hal seperti navigasi terlihat jauh lebih rumit, tetapi sekarang siapa pun bisa melakukannya dalam beberapa jam
      Sebaliknya, hal yang tampak lebih sederhana bisa memakan waktu bertahun-tahun karena belum mudah diselesaikan dan disediakan sebagai API. Tentu saja sekarang sudah memungkinkan
    • Menurut saya intinya bukan GPS, melainkan GIS. Jadi ini bukan masalah navigasi, melainkan masalah “apakah titik ini berada di dalam poligon ini”, dan itu tergolong sedikit lebih mudah
    • Pengamatan ini tidak bertentangan dengan inti komiknya. Secara keseluruhan, yang dibahas bukan tugas apa yang sulit, melainkan apa yang sulit dengan teknologi saat ini
      Artinya, bagi non-developer sulit mengetahui tugas mana yang bisa diselesaikan secara sepele oleh teknologi saat ini dan tugas mana yang belum bisa. Seiring waktu, distribusi kedua kategori itu berubah, tetapi fakta bahwa orang awam tidak mudah mengetahuinya tetap sama
      Semua yang kita lakukan hari ini pun akan sangat sulit jika harus dibuat ulang dari nol, tetapi dalam praktiknya kita tidak perlu membuatnya ulang dari nol, jadi itu bukan hal yang sulit dilakukan
  • Bisa saja dibilang “tidak menua dengan baik”, tetapi menurut saya poin sebenarnya—“sulit menjelaskan perbedaan antara yang mudah dan yang pada dasarnya mustahil”—justru makin kuat
    Hampir ironisnya, hal-hal sulit dan hal-hal mudah saling bertukar tempat. Siapa yang akan menyangka 10 tahun lalu

    • Menurut saya ini menua dengan baik. Faktanya, masalah itu menjadi mudah 5 tahun setelah dipublikasikan
    • Teks alternatif xkcd itu sendiri layak dilihat: pada tahun 60-an, Marvin Minsky menyuruh beberapa mahasiswa S1 membuat program selama musim panas yang bisa mengidentifikasi objek dalam sebuah adegan lewat kamera. Ia mengira masalah itu akan selesai pada akhir musim panas, tetapi setengah abad kemudian kita masih bergulat dengan masalah itu
    • Bahkan pada 2014, sudah jelas bahwa untuk mengidentifikasi burung, yang dibutuhkan bukanlah riset baru itu sendiri, melainkan banyak data pelatihan burung
      https://en.wikipedia.org/wiki/DeepFace
    • Secara pribadi, saya tidak bisa menghilangkan perasaan bahwa komik inilah yang memicu revolusi AI
      Kalau ingatan saya benar, beberapa minggu atau bulan kemudian pihak Yahoo/Flickr menerbitkan makalah tentang masalah ini, yaitu identifikasi burung, dan sejak itu semuanya tampak meledak dalam semalam. Saya tahu kenyataannya tidak begitu, tetapi bagi saya terlihat seperti itu
    • Jika melihat jumlah komputasi dan energi yang dibutuhkan untuk tiap tugas, masih benar bahwa masalah yang tampak sederhana bagi manusia justru lebih sulit dipecahkan
  • Memahami tugas mana yang bisa diselesaikan LLM secara andal dan mana yang tidak masih sangat sulit dan tidak intuitif
    Beberapa waktu lalu putri saya sedang menyiapkan presentasi lalu bertanya, “Ayah, bisa carikan foto kata HELLO yang dibuat dari sayuran?”
    Saya berpikir, “Tentu saja, ini pekerjaan ChatGPT,” tetapi ChatGPT bisa membuat gambar kucing berbaju astronot sedang minum martini, namun jelas tidak bisa membuat gambar HELLO yang dibentuk dari sayuran
    Akhirnya saya memintanya membuat gambar tiap huruf alfabet dari sayuran secara terpisah, lalu putri saya menyusunnya menjadi kata yang dipakai di presentasi

    • Cerita seperti ini selalu menarik kalau tahu bagaimana ChatGPT sebenarnya bekerja. Kalau paham tokenisasi, langsung jelas kenapa ini bukan pekerjaan yang cocok untuk ChatGPT
      Alasannya persis sama dengan kenapa ia tidak bisa menghitung ejaan STRAWBERRY dengan benar. Bukan karena tidak memahami konsep buah atau sayuran, atau tidak bisa memahami konsep rumit seperti metafora atau meme
      Model tidak melihat “hello” sebagai kata yang tersusun dari huruf-huruf individual, melainkan sebagai satu token; pada gpt-4o, token dengan ID 24912. Ia tahu makna token ini dan hubungannya dengan token lain, tetapi secara fundamental tidak tahu huruf-huruf yang menyusun kata tersebut. Kecuali jika itu dilatih secara terpisah atau memanfaatkan relasi tambahan yang kebetulan ada di data pelatihan
    • Dengan flux.1 ini bisa dilakukan. Setahu saya, saat ini itu model gambar terbaik untuk pemrosesan teks
      Ini hasil memasukkan “vegetables spelling out the word "HELLO"” memakai flux-pro di Replicate: https://ibb.co/1RVKmdk
    • Ideogram v2 menghasilkan ini pada percobaan pertama:
      https://ideogram.ai/assets/image/lossless/response/v_LgyXI1Q...
      https://ideogram.ai/assets/image/lossless/response/V4RRDJZJS...
      Wortel di gambar pertama agak lucu
      Bonus Hacker News: https://ideogram.ai/assets/image/lossless/response/SW0B7y4jR...
    • Grok 2 Mini Beta melakukannya dengan cukup baik
      https://i.imgur.com/mvnusFd.jpeg
    • Saya baru mencobanya dengan ChatGPT 4o, dan hanya dengan prompt pertama hasilnya sudah cukup bagus
      Prompt-nya saya salin persis dari komentar di atas: https://chatgpt.com/share/66f530b0-3fb8-800a-8af9-8a3e48a31a...
  • Cukup deteksi apakah foto mengandung warna burung yang umum, lalu rilis. Setelah menghancurkan pesaing, perbaiki belakangan

  • Saya mengikuti seri tutorial ini untuk memahami konteks dan dasar-dasar deep learning, dan pelajaran pertamanya memang membuat pendeteksi burung dari komik ini
    Sangat mudah dan menyenangkan, dan keseluruhan kursusnya juga bagus. Sangat saya rekomendasikan untuk orang yang punya latar belakang pemrograman dan ingin memulai deep learning secara solid
    https://course.fast.ai/

  • Tidak ada yang menyinggungnya, tetapi LLM juga berkembang pada bagian pertama permintaan itu, sama seperti pada bagian keduanya
    ChatGPT menuliskan fungsi is_point_in_national_park dan memberi tahu shapefile terkait dalam sekitar 30 detik. Itu ratusan kali lebih cepat daripada “beberapa jam” yang disebutkan dalam komik

  • LLM visi benar-benar menakjubkan
    Saya pernah punya proyek untuk mendeskripsikan dan membuat katalog lebih dari 20 ribu gambar
    Kalau dilakukan dengan cara tradisional oleh manusia, itu akan memakan waktu berbulan-bulan dan biaya sangat besar. Deskripsinya harus berkualitas layak dibaca pelanggan
    API visi OpenAI memprosesnya dengan biaya beberapa sen per gambar, dan total biayanya mungkin bahkan tidak sampai 200 dolar

    • Saya penasaran apakah deskripsi dari OpenAI itu diperiksa oleh manusia untuk memastikan akurasinya
  • Saya penasaran apakah akan tiba hari ketika literasi teknologi mencapai titik kritis sehingga kesalahpahaman seperti ini sebagian besar menghilang
    Kalau 10 tahun lalu, saya mungkin akan bilang ya, tetapi sekarang saya melihat perkembangan UX/UI dan berubahnya segala hal menjadi aplikasi justru menjauhkan orang kebanyakan dari detail-detailnya
    Dari sudut pandang tiap produk, itu hal yang baik, tetapi secara keseluruhan bisa menimbulkan ekspektasi yang tidak realistis. Saya pernah mendengar anak muda bertanya, “kenapa x tidak langsung saja melakukan y,” dan dulu saya mengira pertanyaan seperti itu hanya akan terdengar dari generasi orang tua yang sangat tidak teknis
    Pada era 80-an, komputer terasa hampir seperti sihir bagi banyak orang, tetapi kebanyakan dari mereka sebenarnya tidak perlu berinteraksi dengan komputer. Ekspektasi terhadap komputer punya pengaruh sekecil ekspektasi saya terhadap kehidupan alien
    Namun saya khawatir pemikiran magis tentang teknologi akan membawa konsekuensi yang lebih besar, baik secara pribadi maupun sosial

  • @simonw, kalau kebetulan membaca ini, bolehkah saya mengajukan satu permintaan kecil?
    Apakah terlalu berlebihan jika meminta Anda live streaming pekerjaan coding yang bisa dibagikan secara publik?
    Terutama di ekosistem saat ini seputar Python, data SQLite, dan JavaScript, rasanya ada sangat banyak hal yang bisa dipelajari