8 poin oleh GN⁺ 2024-07-17 | 1 komentar | Bagikan ke WhatsApp
  • Transformer yang muncul pada 2017 berawal dari mesin penerjemahan lalu meluas ke hampir semua bidang, dan menjadi pengetahuan AI inti yang perlu dipahami engineer modern
  • Panduan ini disusun bertahap dari jaringan saraf hingga attention agar engineer hanya mengikuti bagian yang diperlukan untuk memahami Transformer
  • Disertai contoh kode Python yang bisa dijalankan langsung dan bahan referensi, sehingga pembelajaran tidak berhenti pada membaca saja tetapi bisa diverifikasi langsung lewat praktik
  • Isi utama dibagi menjadi jaringan saraf, RNN, NLP dan attention, Transformer, serta lampiran dasar Python·matematika, dengan tambahan topik PyTorch dan Multi-Agents berbasis LLM
  • Ketentuan penggunaan untuk tujuan pendidikan dan nonkomersial relatif terbuka, tetapi untuk menghubungi penulis diperlukan setidaknya 2 alamat SNS untuk verifikasi sehingga kontak anonim dibatasi

Jalur belajar untuk memahami Transformer

  • The Engineer’s Guide To Deep Learning adalah buku panduan ringkas yang menyediakan jalur minimum bagi engineer untuk memahami Transformer
  • AI saat ini disebut sebagai era keemasan ketiga
    • Dua era keemasan sebelumnya terjadi pada 1950~1960-an dan 1980-an
    • Pada masa itu, ekspektasi melampaui kemampuan teknis dan berujung pada kekecewaan
    • Era keemasan AI saat ini yang dimulai pada pertengahan 2010-an dijelaskan sebagai tren yang terus melampaui ekspektasi
  • Transformer adalah terobosan yang diperkenalkan pada 2017
    • Awalnya dikembangkan sebagai model penerjemahan mesin
    • Setelah itu pengaruhnya meluas ke hampir semua bidang
  • Sebagai bahan bantu belajar, tersedia contoh kode Python yang dapat dijalankan
  • Referensi tambahan juga diperkenalkan agar tiap pembaca bisa memilih materi yang paling sesuai

Struktur dokumen dan pembaruan

  • Panduan ini disusun agar pembaca membangun fondasi yang diperlukan secara berurutan, alih-alih langsung terjun ke Transformer
  • Riwayat perubahan berlanjut sejak versi pertama dirilis pada 21 Mei 2024
    • 23 Juli 2024: menambahkan versi PyTorch ke Parts 1·2
    • 16 September 2024: menambahkan bagian Multi-Agents berbasis LLM
  • Ke depannya, panduan ini mungkin juga akan membahas berbagai teknologi berbasis Transformer yang sedang dikembangkan saat ini serta terobosan besar lain dalam waktu dekat

Ketentuan penggunaan dan cara menghubungi

  • Ketentuan penggunaan dalam FAQ hak cipta cukup terbuka untuk pemanfaatan pendidikan dan nonkomersial
    • Guru dan siswa yang tergabung dalam institusi pendidikan dapat menggunakan dokumen dan gambar secara bebas untuk tujuan belajar
    • Dalam pertemuan dan kuliah nonkomersial, dokumen dan gambar dapat digunakan jika mencantumkan tautan situs dan hak cipta
    • Penjelasan tentang revenue share dan full buyout pada bagian penggunaan komersial adalah lelucon, dan dinyatakan bahwa tidak ada niat menjalin hubungan komersial
  • Email pertanyaan harus menyertakan minimal 2 alamat SNS seperti LinkedIn dan Twitter untuk tujuan verifikasi
  • Sejak insiden XZ backdoor, penulis tidak menerima kontak dari individu anonim

1 komentar

 
GN⁺ 2024-07-17
Opini di Hacker News
  • Ada cukup banyak materi yang lebih baik. The Annotated Transformer / Attention is All You Need: http://nlp.seas.harvard.edu/annotated-transformer/
    Transformers from Scratch: https://e2eml.school/transformers.html
    Seri pengantar dari Andrej Karpathy juga bagus: https://karpathy.ai/zero-to-hero.html
    Let's build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
    GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
    “But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning” dari 3Blue1Brown: https://www.youtube.com/watch?v=wjZofJX0v4M
    “Attention in transformers, visually explained | Chapter 6, Deep Learning”: https://www.youtube.com/watch?v=eMlx5fFNoYc
    Seluruh playlist jaringan saraf 3Blue1Brown: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
    • Sebagai tambahan, semua situs di atas gratis. Situs yang dibahas di sini mengatakan “pembelian hak penggunaan komersial penuh atas seluruh konten dan repositori GitHub adalah €10.000.000”, dan untuk penggunaan komersial juga meminta royalti 20%
      Untuk ukuran tutorial Keras, ini cukup mahal
    • Ini agak di luar topik, tetapi saya ingin mencoba ikut Vesuvius Challenge; saya tidak punya latar belakang machine learning dan hanya web developer umum. Saya penasaran apakah membangun latar belakang machine learning praktis lewat Zero to Hero dari Karpathy dan buku Understanding Deep Learning sudah cukup, atau masih ada hal lain yang perlu dipelajari
      Rencananya saya akan memahami solusi pemenang tahun lalu lalu memilih sub-tugas yang lebih kecil: https://scrollprize.org/
    • Slide dari Lucas Beyer juga cukup bagus: https://docs.google.com/presentation/d/1ZXFIhYczos679r70Yu8v...
  • Tutorial Transformer sepertinya sudah menjadi semacam tutorial Monad yang baru
  • Materi ini membahas dengan sangat ringkas dari perceptron hingga Transformer
    Misalnya, bagian yang menguraikan gradien LSTM bukan untuk membantu mengimplementasikannya di framework pilihan Anda, melainkan untuk membantu pemahaman
    Tujuan menampilkan solusi dalam berbagai framework juga untuk menghubungkan seperti apa rumusnya dan bagaimana bentuknya dalam kode
  • Hal yang paling membuat frustrasi dari dokumentasi Transformer adalah hampir semuanya hanya berfokus pada pemrosesan bahasa alami
    Padahal bagian yang sangat menarik dari arsitektur Transformer adalah mekanisme attention bersifat invarian terhadap permutasi. Ini makin menarik jika orang tidak menggunakan positional embedding untuk meniadakan sifat unik tersebut, dan karena node tertentu atau edge individual pada graf dapat di-mask secara arbitrer, fleksibilitas untuk memasukkan pengetahuan domain ke dalam arsitektur menjadi besar
    Dalam banyak kasus positional embedding mungkin tetap diperlukan, tetapi kita bisa merancangnya dengan lebih cerdas, keluar dari sudut pandang yang terlalu terbatas yang melihat input layer attention hanya sebagai sekuens 1 dimensi sederhana
  • Saya ingin bertanya kepada para ahli machine learning/kecerdasan buatan. Jika ada materi pengantar yang layak dibaca untuk orang yang ingin beralih dari CRUD/API backend ke bidang ML/AI, mohon dibagikan. Bidangnya bercabang banyak, jadi saya tidak tahu harus mulai dari mana
    Sejauh yang saya pahami, ML engineer adalah engineer yang membuat model dengan framework seperti PyTorch, AI engineer adalah engineer yang membuat aplikasi di atas solusi AI seperti prompt engineering atau API OpenAI/Claude, sedangkan MLOps adalah orang yang membantu deployment dan serving model; saya penasaran apakah pembagian ini benar
    • Istilah-istilah seperti ini tidak punya definisi resmi. Aturan asosiasi yang diperlukan hanya satu: jabatan yang terdengar meyakinkan → bisa berarti apa pun yang diinginkan perusahaan
      Peran-peran di atas secara realistis bisa mencakup semuanya, dari “melakukan riset mutakhir” sampai “pernah membuka CSV sekali”
    • 85% waktu proyek machine learning akan dihabiskan untuk kualitas data dan sedikit rekayasa fitur domain
      Jika ingin menciptakan dampak, jadilah sangat ahli di bagian itu. Itu juga keterampilan yang bisa dipakai di bidang seperti integrasi sistem atau analisis bisnis, sementara algoritme—dan belakangan ini bahkan model terlatih—bisa dibawakan oleh orang-orang yang menelitinya
    • “AI engineer” mungkin lebih tepat disebut application engineer yang terspesialisasi dalam mengintegrasikan machine learning ke perangkat lunak
    • Kaggle adalah titik awal yang bagus
  • Selain beberapa paragraf pengantar, tidak ada konten. Konten sebenarnya menghasilkan 404 not found
    • Tautan di dalam artikel rusak. Tautan di menu hamburger berfungsi dengan baik
    • Menu kiri di desktop berfungsi. Sepertinya hanya tautan di halaman pertama yang rusak
  • Ada kalimat, “Saat mengirim email, harap berikan setidaknya dua alamat media sosial seperti LinkedIn, Twitter untuk keperluan verifikasi… saya tidak lagi menerima kontak dari individu anonim”
    Rasanya cukup pahit melihat jejaring sosial diadopsi sebagai sarana verifikasi identitas dan kepercayaan bahkan di kalangan teknisi. Ketika beberapa pemerintah mulai meminta username jejaring sosial untuk pemeriksaan visa/imigrasi saja sudah cukup buruk, tetapi sekarang untuk mengirim satu email kepada teknisi pun perlu bukti sosial?
    • Kalimat “saya tidak lagi menerima kontak dari individu anonim” mengingatkan pada lelucon tentang seseorang yang muncul di pusat rekrutmen markas besar angkatan udara. Ketika ditanya “Lisensi pilot? Pengalaman? Kualifikasi?”, ia menjawab “Tidak ada. Saya cuma datang untuk bilang jangan berharap apa-apa dari saya!”
    • Jika bagian yang disingkat dibuka, bunyinya adalah “karena insiden backdoor XZ, saya tidak lagi menerima kontak dari individu anonim”
      Penyerang XZ kemungkinan bisa login ke banyak layanan melalui GitHub. Menurut saya penulis asli juga kemungkinan besar mengunduh sesuatu dari PyPI, yang berpotensi telah dikompromikan oleh kebocoran token yang dibiarkan lebih dari satu tahun
      Selain itu, karena berada di bidang machine learning, kemungkinan besar ia mengunduh framework Python besar yang sulit diaudit dari GitHub, conda, dan PyPI, dan orang-orang di bidang itu juga mengunduh model yang tidak tepercaya untuk dicoba
      Lalu yang dianggap masalah adalah email teks polos yang bisa dibaca di klien email command-line dengan MIME dan ekstensi lain dimatikan?
  • Materi yang sangat bagus untuk membangun pemahaman secara ringkas dari dasar