1 poin oleh GN⁺ 2023-12-23 | 1 komentar | Bagikan ke WhatsApp
  • Tanpa denominator untuk memahami keseluruhan platform, hasil riset tentang misinformasi atau dampak rekomendasi mudah kehilangan konteks, sehingga tim peneliti berupaya memperkirakan skala keseluruhan YouTube lewat sampel acak
  • ID video YouTube terdiri dari 11 karakter dan ruang alamat yang mungkin berjumlah 2^64, sehingga hampir mustahil menemukan video valid hanya dengan mencoba URL acak secara sederhana
  • Dengan metode “drunk dialing” dan teknik efisiensi, tim peneliti mengumpulkan lebih dari 10.000 video yang benar-benar acak selama beberapa bulan, dan memperkirakan bahwa saat ini YouTube memiliki sekitar 13,325 miliar video
  • Analisis sampel menunjukkan bahwa pada 2023 saja, lebih dari 4 miliar video diunggah, dan median jumlah penayangan adalah 39 kali, memperlihatkan betapa besarnya long tail YouTube
  • Tubestats berupaya terus memperbarui estimasi skala ini, tetapi tetap ada batasan etis untuk tidak mengekspos URL video yang meski berstatus publik pada praktiknya hampir tidak pernah ditemukan

Masalah denominator yang membuat riset YouTube sulit

  • Riset media sosial mudah berfokus pada fenomena yang mencolok seperti misinformasi atau ujaran kebencian, tetapi tanpa mengetahui porsinya di seluruh platform, penilaian skala menjadi goyah
    • Misalnya, menghitung jumlah hasil dengan kata kunci pencarian seperti “white genocide” atau “ivermectin” memang memungkinkan
    • Laporan misinformasi COVID Avaaz pada Agustus 2020 menghitung 3,8 miliar penayangan dalam satu tahun, tetapi tanpa denominator berupa total penayangan seluruh platform, sulit menilai apakah angka itu besar atau kecil
  • Reddit dan Twitter selama beberapa waktu menyediakan akses data yang memungkinkan peneliti memperkirakan keseluruhan platform
    • Reddit memungkinkan Pushshift mengumpulkan seluruh posting, sehingga perbandingan skala antar-komunitas dapat dilakukan
    • Setelah akses publik Pushshift diblokir pada musim panas 2023, Redditmap.social hanya dapat menggunakan data yang dibuat pada awal tahun tersebut
    • Twitter menyediakan sampel sepersepuluh atau seperseratus dari seluruh tweet melalui API riset, tetapi kemudian memblokir akses itu dan mengenakan biaya besar untuk akses yang lebih sedikit

Sulit mendapatkan sampel representatif di YouTube

  • YouTube adalah platform besar yang digunakan oleh hampir semua pengguna internet
    • Menurut Pew, 93% remaja menggunakan YouTube
    • Layanan terdekat berikutnya adalah TikTok 63% dan Snapchat 60%
  • Meski ada API terdokumentasi, tidak ada cara yang baik untuk mendapatkan sampel acak representatif dari seluruh YouTube
  • Riset YouTube yang ada umumnya bergantung pada dua pendekatan
    • Mengumpulkan dan menganalisis semua video dari kanal pengguna yang dipilih
    • Memulai dari video tertentu lalu mengikuti video-video yang direkomendasikan
  • Kedua pendekatan itu dapat digunakan untuk riset yang bermakna, tetapi tidak cukup untuk membuat sampel seluruh video YouTube atau menghitung skala platform

“Drunk dialing” dengan mencoba URL acak

  • Jason Baumgartner mengusulkan cara mencoba URL acak dengan memanfaatkan InnerTube, API tidak resmi YouTube
  • ID video pada URL YouTube adalah string 11 karakter yang muncul setelah watch?v=
    • 10 karakter pertama dapat berupa a-z, A-Z, 0-9, _, -
    • Karakter terakhir hanya dapat berupa salah satu dari 16 nilai
    • Alamat YouTube yang mungkin berjumlah 2^64, sekitar 18,4 kuintiliun
  • Bahkan dengan asumsi ada 1 miliar video YouTube, peluang satu URL acak valid kira-kira hanya 1 dari 18,4 miliar
  • Tim peneliti menyebut metode ini “drunk dialing”, dan Jason Baumgartner menemukan cara memutar yang meningkatkan efisiensi sekitar 32.000 kali
  • Kevin Zheng menulis skrip pencarian dan selama beberapa bulan mengumpulkan lebih dari 10.000 video YouTube yang benar-benar acak

Skala dan distribusi YouTube berdasarkan sampel acak

  • Estimasi skala YouTube saat ini adalah 13,325 miliar video, dan diperbarui setiap beberapa minggu di tubestats.org
  • Dari usia video acak, laju pertumbuhan YouTube dapat dihitung
    • Diperkirakan lebih dari 4 miliar video diposting ke YouTube pada 2023 saja
  • Distribusi jumlah penayangan menunjukkan long tail yang kuat
    • Median jumlah penayangan video YouTube adalah 39 kali
    • YouTube cenderung suka merekomendasikan video dengan lebih dari 10.000 penayangan
    • Video dengan lebih dari 10.000 penayangan hanya sekitar 4% dari dataset, tetapi menyumbang porsi besar dari total penayangan di seluruh YouTube
  • Video acak yang dikumpulkan juga digunakan untuk memperkirakan distribusi bahasa
    • Kevin Zheng menghubungkan skrip pencarian dengan beberapa sistem deteksi bahasa
    • Estimasi ini dapat dipertahankan, tetapi tidak sempurna

Dash method yang lebih efisien

  • Karena pencarian URL acak mencakup seluruh ruang alamat, metode ini dapat digunakan sebagai tolok ukur untuk memverifikasi keacakan metode sampling lain
  • Tim peneliti menilai bahwa jika metode lain untuk menghasilkan daftar video memberikan hasil yang mirip dengan pencarian acak, metode itu bisa dianggap “cukup acak”
  • Metode yang ditemukan Jia Zhou dan lainnya pada 2011 berfungsi sebagai cara pengumpulan sampel yang lebih efisien
    • Membuat string 5 karakter dengan salah satu karakter berupa tanda hubung
    • Autocomplete YouTube melengkapi URL tersebut dan, jika ada, mengembalikan video yang cocok
  • Kevin Zheng saat ini secara berkala menanyakan YouTube dengan dash method ini dan menjaga dasbor Tubestats tetap berjalan

Video long tail dan batasan etis

  • Sampel acak digunakan bukan hanya untuk melihat influencer sukses, tetapi juga untuk mengamati bagaimana kreator di bagian bawah long tail media buatan pengguna memakai berbagai alat
  • Sebagian besar video yang dikumpulkan hanya ditonton beberapa puluh orang
    • Jika URL-nya dipublikasikan, video yang berstatus “publik” tetapi pada praktiknya hampir tidak terlihat dapat terekspos ke pemeriksaan publik
    • Karena itu, makalahnya tidak menyertakan daftar URL video yang ditemukan
  • Ryan McGrady memimpin pekerjaan menonton langsung 1.000 video acak dan melakukan coding manual
  • Makalah terkait diterbitkan di Journal of Quantitative Description, dan pengantar hasil coding manual dirangkum dalam tulisan Ryan

Alasan mempertahankan Tubestats

  • Tim peneliti berencana mempertahankan Tubestats sejauh memungkinkan
  • YouTube mungkin saja menentang sumber daya ini atau metode pembuatannya
  • Platform besar media buatan pengguna adalah bagian penting dari ruang diskusi publik digital, sehingga data tingkat tinggi tentang apa yang ada di platform, siapa yang membuatnya, dan menjangkau siapa seharusnya dipublikasikan secara berkala

1 komentar

 
GN⁺ 2023-12-23
Komentar Hacker News
  • Cara pengambilan sampelnya benar-benar cerdik, salut untuk para penulis. Saat di Pew, kami pernah mencoba memetakan YouTube dengan random walk mengikuti endpoint "related videos" dari YouTube API, dan setelah sekitar satu tahun rasanya kami sudah mencapai titik jenuh. Namun melihat skala yang muncul di sini, tampaknya ada long tail yang cukup panjang di bawah radar.
    Begitu riset itu dipublikasikan, Google hampir langsung mulai mengunci API, jadi menyenangkan melihat masih ada orang yang melanjutkan riset dengan scraping gaya lama. Analisis kami saat itu berada di tingkat kanal dan hanya berfokus pada kanal populer, tetapi menarik juga bahwa sebagian angka TubeStats cukup mirip dengan yang kami temukan. Misalnya distribusi bahasa: https://www.pewresearch.org/internet/2019/07/25/a-week-in-th...

    • Mengingat bot Google terus-menerus menyisir web dan menghantam situs sampai nyaris tumbang, cukup ironis bahwa Google mengunci API-nya
    • Dengan cara ini, video seperti sebagian video publik dengan akses terbatas yang tidak ditautkan dari rekomendasi juga bisa ditemukan
    • Teknik ini bukan hal baru. Ini adalah metode yang digunakan ahli biologi untuk menghitung jumlah ikan di danau
      Misalnya menangkap 100 ikan, memberi tanda, menunggu seminggu, lalu menangkap 100 ikan lagi dan menghitung berapa ikan bertanda di antaranya
    • Sepertinya YouTube mengunci API setelah skandal Cambridge Analytica
  • Ini adalah cara yang menarik untuk menyerang mitigasi terhadap masalah tank Jerman https://en.m.wikipedia.org/wiki/German_tank_problem
    Solusi optimalnya mungkin memperbesar ruang alamat agar sampel acak tidak dapat mengumpulkan cukup data untuk mencapai kesimpulan yang signifikan secara statistik. Mungkin ada solusi bagus lain yang mencoba mengubah distribusi dengan berbagai cara, tetapi jika sampelnya benar-benar acak, penanggulangan ke arah itu akan terbatas

    • Saya tidak melihatnya di artikel, tetapi ini bergantung pada asumsi distribusi seragam diskret. Kita tidak tahu permainan apa yang Google lakukan pada identifier
    • Saya tidak paham bagaimana sampel acak bisa mengatasi sesuatu seperti distribusi yang berklaster. Bukankah estimasinya bersandar pada asumsi kontinuitas?
      Misalnya alamatnya dari /v=0x00 sampai 0xff, tetapi sebenarnya yang dipakai hanya f0 sampai ff; jika diasumsikan video tersebar acak, bukankah nilai estimasinya akan selalu bias?
      Dengan kata lain, seolah-olah menerapkan filter arbitrer pada ruang yang dapat dialamati lalu menetapkan alamat. Sampel acak dengan metode yang sama akan meleset dengan tingkat yang sama, tetapi saya tidak tahu kelangkaan yang saya terapkan sebagai filter
  • Dataset "YouTube dislikes" juga layak dicek: https://clickhouse.com/docs/en/getting-started/example-datas...
    Namanya seperti itu karena ini adalah upaya pengarsipan untuk mengumpulkan informasi sebelum fitur dislike dihapus. Dataset ini bisa digunakan untuk menemukan video paling kontroversial atau video teratas dengan deskripsi dalam bahasa tertentu

    • YouTube adalah platform yang begitu besar dan publik sehingga hampir menyerupai barang publik, jadi statistik seperti jumlah dislike itu penting
      Artikel itu juga mengatakan, “YouTube mungkin menolak sumber daya ini atau metode pembuatannya. Sebagai bantahan, kami percaya bahwa data tingkat tinggi seperti ini seharusnya dirilis secara berkala untuk semua platform media besar berbasis konten buatan pengguna. Platform semacam ini adalah salah satu bagian terpenting dari ruang publik digital, dan kita membutuhkan jauh lebih banyak informasi tentang apa yang ada di dalamnya, siapa yang membuatnya, dan kepada siapa konten itu menjangkau”
      Pemerintah seharusnya mengatur agar platform mengekspos statistik semacam ini supaya dapat dikumpulkan oleh lembaga statistik
    • Penulis komentar ini adalah CEO ClickHouse
  • Saya ingin tahu seberapa banyak data yang dimiliki YouTube, tetapi tidak ada angkanya. Jika dihitung kasar dari statistik yang tersedia, panjang video rata-rata sekitar 500 detik
    Jika bitrate diasumsikan 400KB/s dan jumlah video 13 miliar, hasilnya 2,7 eksabita. 400KB/s adalah angka yang saya dapat dari beberapa video FHD 24–30fps yang saya unduh sendiri, jadi ini estimasi yang sangat kasar. YouTube tentu akan mengenkode bagian-bagian dengan jumlah informasi yang terasa lebih sedikit pada bitrate yang lebih rendah, dan video punya resolusi serta frame rate yang berbeda-beda, dengan distribusi yang juga berubah sepanjang sejarah layanan. Jika semua video diasumsikan 4K dengan bitrate 1,5MB/s, hasilnya 10 eksabita
    Estimasi ini cenderung meremehkan ruang penyimpanan yang dibutuhkan YouTube. Video populer pasti disimpan di beberapa data center, dalam VP9 maupun AV1. Sebaliknya, jika video yang tidak populer dikompresi atau ditranscoding on-demand dari format lain, estimasi ini bisa saja terlalu tinggi, tetapi kemungkinannya tampak kecil

    • Estimasi ruang penyimpanan itu kemungkinan besar meleset satu orde besaran
      400KB/s, atau 3,2Mbps yang umum dipakai dalam encoding video, cukup rendah untuk kualitas sumber FHD, yaitu upload 1080p. Angka untuk video 4K cukup mendekati rata-rata upload sumber
      Selain itu, perlu dipertimbangkan bahwa YouTube setidaknya mengompresi dengan dua codec video, H.264 dan VP9. Untuk tiap codec, ada semua resolusi dari 320p sampai 1080p ke atas, bergantung pada kualitas upload sumber. Banyak video populer dan video 4K juga dienkode dalam AV1. Sebagian bahkan punya HEVC untuk video surround 360 derajat. Anda membacanya dengan benar. Di YouTube ada H.265 HEVC
      Dan semua ini bahkan belum mencakup replikasi atau penyimpanan redundan. Saya tidak akan terkejut jika totalnya dengan mudah melampaui 100EB. Itu setara ukuran 100 Dropbox pada 2020
    • Di satu sisi, ini bukan “cuma dua format?”. Ada juga hal-hal seperti H.264, dan bisa ada beberapa resolusi. Mungkin juga ada, atau pernah ada, kewajiban kontraktual untuk selalu menyediakan resolusi tertentu dalam format tertentu
      Di sisi lain, mungkin ada sangat banyak video dengan jumlah tayangan yang luar biasa rendah. Di sisi lain lagi, kita perlu mengingat bahwa YouTube sampai harus membuat chip transcoding sendiri. Secara harfiah memang rumit
      Sepuluh tahun lalu saya tahu jawaban untuk pertanyaan ini, dan membantu para penanggung jawab storage menurunkan biaya. Beberapa hari lalu saya mengetahui bahwa salah satu dari mereka, R.L., meninggal dunia pada Februari tahun ini. RIP
    • Anda melewatkan overhead replikasi dan erasure coding. Terus terang 10 eksabita tampak sangat rendah. Sekarang mungkin lebih dekat ke 50–100EB
    • Ketika saya menghitungnya pada 2013 berdasarkan angka laporan tahunan untuk durasi yang diupload per menit, kontennya mencapai 375PB dan bertambah 185TB per hari, dengan pertumbuhan tahunan 70%
      Perhitungan ini tidak mencakup beberapa versi encoding maupun penyimpanan sumber
    • Perlu juga dipertimbangkan bahwa YouTube menyimpan salinan upload sumber secara permanen. Sumbernya bisa saja berupa file yang lebih besar
  • Ada situs yang ditautkan bersama sebagai hasil dari tulisan ini: https://tubestats.org/

  • Google dulu kadang mengajukan pertanyaan skalabilitas terkait YouTube dalam wawancara untuk beberapa posisi. Biasanya itu berujung pada masalah sinkronisasi data log di infrastruktur terdistribusi yang terus membesar, dan menghasilkan semacam Big-O(f(n)) yang konyol sampai hampir sulit dijelaskan dengan kata-kata
    Sumber: pernah beberapa kali wawancara di Google

  • Penulis menyebut bahwa mereka memakai “cheats”. Bergantung pada apa yang dilakukan ini, asumsi iid bahwa sampelnya independen bisa jadi rusak
    Jika mirip dengan snowball sampling, tingkat keberhasilan yang “berlebihan” bisa muncul dan menggembungkan angkanya. Ada bagian yang mengatakan, “Jason menemukan beberapa cheat yang membuat metode ini kira-kira 32.000 kali lebih efisien, sehingga ‘panggilan telepon’ kami jauh lebih sering tersambung”

    • Baca saja tulisannya sampai selesai
      Di sana tertulis, “Ditemukan oleh Jia Zhou dkk. pada 2011, dan jauh lebih efisien daripada metode naif kami. Jika membuat string lima karakter dengan salah satu karakternya berupa tanda hubung, YouTube akan melengkapi otomatis URL itu dan, jika ada, menampilkan video yang cocok”
    • Kemungkinan besar ada checksum pada URL sehingga typo bisa dideteksi tanpa benar-benar mengakses video
      Sekalipun tidak tahu bagaimana checksum itu dibuat, untuk satu sampel dari ruang ID yang sebenarnya, kita bisa mencoba semua nilainya
    • Cheat itu kemungkinan memakai sesuatu seperti Playlist API yang mengembalikan keberadaan video sebagai hasil individual
      Misalnya, memanggil API untuk membuat playlist berisi ID x, x+1, x+2, ..., lalu mengambil daftarnya, dan yang masuk hanya x+2 yang merupakan ID teralokasi
    • Jika sampelnya terdistorsi, menurut saya datanya tidak akan terlihat serapi itu. Jika Google melakukan sesuatu yang menarik, rasanya tidak akan berhenti pada distorsi kecil saja
    • Setuju
      Bagi pemula statistik seperti saya, perlu ada pembuktian bahwa sekalipun memakai cheat dan autocomplete, independensi sampel tidak rusak dan sampling acak sebisa mungkin tetap dipertahankan
      Situasi seperti menelepon secara acak saat mabuk, tetapi setiap kali salah menekan nomor ada seseorang yang membantu menyambungkan Anda ke orang lain seperti operator, tidak terasa acak
      Namun saya belum membaca makalah 85 halaman itu. Mungkin saja hal ini dibahas di sana
  • Dataset yang menarik. Makalahnya memberi kesan yang sedikit keliru tentang statistik channel
    Sejauh yang saya pahami, ketika melihat jumlah subscriber, mereka tidak melakukan reweighting untuk mengoreksi kecenderungan sampling. Jika sampelnya hanya sebagian kecil dari seluruh populasi, probabilitas suatu channel muncul sebanding dengan jumlah video publik channel tersebut, jadi kira-kira harus diberi bobot 1/jumlah video per channel

    • Saya juga melihat poin itu. Bahwa 1 juta subscriber berada di persentil ke-98 terasa sangat tidak masuk akal, dan tampaknya kecil kemungkinan bukan persentil ke-99,999
  • Bagi yang penasaran, cara estimasi mereka kira-kira seperti ini
    Asumsikan rentang nilai, lalu asumsikan fungsi probabilitas yang adil untuk mengambil sampel dari rentang itu. Ukuran estimasinya adalah rasio hit dikalikan seluruh rentang nilai

    • Saya hanya membaca sekilas tulisannya, tetapi kalau begitu asumsinya cukup banyak
      Anggap saja rentang nilai yang mungkin memang benar. Jika bentuknya adalah 10 karakter dalam rentang tertentu ditambah 1, itu merepresentasikan satu lingkaran besar tempat video bisa saja ada
      Semuanya bergantung pada distribusi identifier, yaitu video yang valid. Jika YouTube menerapkan batasan atau distorsi pada ID yang tidak kita ketahui, ID video yang benar-benar ada bisa jadi berada dalam lingkaran yang lebih kecil di dalam lingkaran kemungkinan besar itu, dan mungkin tidak tersebar merata di seluruhnya. Mungkin juga ada pengelompokan. Kalau begitu, untuk mendapatkan siluet distorsi itu atau sekadar melihat apakah kira-kira acak, kita perlu mengambil sampel seperti melempar dart ke ruang tersebut, misalnya dengan distribusi Poisson
      Baru setelah itu ukuran bisa diestimasi. Apakah itu yang mereka lakukan? Dan apakah tidak ada yang sekadar bertanya ke YouTube?
  • Metode ini sebenarnya sangat mudah diblokir. Cukup kembalikan video acak untuk persentase tertentu dari identifier yang tidak ada. Menambahkan sedikit unsur acak di sana sudah cukup
    Inilah risiko dari menjelaskan metodenya

    • Kalau begitu, sepertinya akan sangat sulit diimplementasikan tanpa merusak banyak invarian di seluruh sistem
      Misalnya kondisi bahwa ID video harus tidak berubah, dan satu video hanya boleh direpresentasikan oleh satu ID video unik
    • Jika sebuah video muncul dari ID yang dibuat secara acak, cukup kueri lagi segera dan lihat apakah videonya sama seperti sebelumnya
      Jika tidak sama, buang hasil itu dan anggap ID yang dibuat tersebut sebenarnya tidak ada. Jika sama, kita tahu itu ID asli
      Selama URL video YouTube tidak berubah, metode ini bisa menangkal pemblokiran yang disebutkan di atas
    • Namun, jika YouTube tidak mengumumkan bahwa mereka melakukan hal seperti itu, kita tidak akan tahu apakah metode tersebut sudah dibuat tidak valid. Selain itu, karena video lain itu akan memiliki UID lamanya sendiri, secara teori kita juga bisa tahu apakah video itu diduplikasi untuk mengganggu pengukuran semacam ini
    • Sulit juga membayangkan men-debug error produksi pada sistem seperti itu
    • Apakah ID video bersifat berurutan di dalam domain yang tersedia, atau tersebar sepenuhnya? Apakah ada kesamaan di antara ID video aktif yang diketahui, sesuatu yang bisa memudahkan penelusuran kemungkinan berskala quintillion?