1 poin oleh GN⁺ 2023-10-21 | 1 komentar | Bagikan ke WhatsApp
  • Wikipedia memiliki artikel populer yang mendapat jutaan tayangan per minggu, sekaligus menyimpan artikel yang sangat tidak populer di antara lebih dari 6 juta artikelnya, yang hanya dibaca satu digit kali per tahun
  • Dalam sampel sekitar 32.000 artikel pada 2021, peringkat terbawah banyak diisi artikel disambiguasi; jika dikecualikan, rintisan pendek seperti spesies ngengat dan lalat, desa di Iran, serta nama keluarga hanya mendapat 7–9 tayangan per tahun
  • Tombol “Random article” memiliki probabilitas pemilihan yang berbeda-beda sesuai random gap antara nilai page_random tiap artikel dan nilai sebelumnya, sehingga sebagian artikel jauh lebih jarang terekspos daripada rata-rata
  • Setelah cakupan dipersempit ke 600.000 artikel dengan gap sekitar 1/10 atau kurang dari rata-rata, artikel dengan tayangan terendah pada 2021 adalah Trichromia phaeocrota dan Opharus corticea, masing-masing mencatat 3 tayangan yang diperkirakan berasal dari manusia
  • Di 500 artikel terbawah banyak ditemukan takson serangga, beberapa gastropoda dan fungi, bentang geografis, serta artikel set index; artikel spesies dan permukiman sering tetap ada meski hanya didukung sumber lemah karena standar kelayakannya rendah

Ciri artikel tidak populer yang terlihat dari sampel

  • Wikipedia memiliki lebih dari 6 juta artikel, dan artikel populer mendapat jutaan tayangan per minggu
  • Sebaliknya, ada juga artikel yang bahkan sulit mendapat beberapa tayangan per hari; contohnya sebagai berikut
  • Di antara artikel yang dibuat penulis, yang paling tidak populer adalah Sunday reading periodical, artikel tentang genre majalah era Victoria, dengan rata-rata sekitar 12 tayangan per bulan
  • Data tayangan Wikipedia tersedia secara publik melalui dump mentah dan API, tetapi tidak ada cara mudah untuk langsung mengurutkan artikel yang paling sedikit dilihat

Analisis sampel acak 32.000 artikel

  • Data tayangan tahun 2021 dikumpulkan dari sampel sekitar 32.000 artikel Wikipedia
  • Median tayangan tahunan dalam sampel sedikit di bawah 1.000, sementara rata-ratanya sekitar 13.000 karena ekor distribusi yang panjang
  • Dalam sampel, ada hampir 100 artikel dengan total tayangan sepanjang 2021 hanya satu digit
  • Namun, 50 artikel terbawah semuanya adalah artikel disambiguasi, dan dalam analisis ini tidak dianggap sebagai “artikel sungguhan”
  • Jika artikel disambiguasi dikecualikan, artikel dengan tayangan tahunan satu digit menyempit menjadi sejumlah kecil rintisan dalam kisaran 7–9 tayangan

Tombol “Random article” dan random gap

  • Jumlah tayangan yang sangat rendah mungkin merupakan hasil kunjungan pengguna yang menekan tombol Random article
  • Sejak 2015, tombol Random article diimplementasikan untuk mengabaikan artikel disambiguasi, yang dapat menjelaskan mengapa artikel disambiguasi terkumpul di jumlah tayangan terendah dalam sampel
  • Saat dibuat, artikel Wikipedia menerima nilai acak antara 0 dan 1 yang disebut page_random
  • Ketika ada permintaan Random article, server membuat angka acak antara 0 dan 1, lalu mengembalikan artikel terdekat di antara page_random yang lebih besar dari nilai tersebut
  • Cara ini tidak sepenuhnya adil
    • Probabilitas sebuah artikel terpilih sama dengan ukuran random gap, yaitu selisih antara nilai page_random artikel itu dan nilai page_random artikel tepat sebelumnya
    • Artikel dengan gap kecil juga memiliki peluang lebih rendah untuk terpilih lewat Random article

Hubungan antara batas bawah tayangan dan random gap

  • Jika ada sekitar 6 juta artikel Wikipedia, random gap rata-rata kira-kira 1/6,000,000, yaitu 1.67e-7
  • Nilai page_random untuk Erygia sigillata, artikel dengan tayangan paling sedikit dalam sampel, adalah 0.500764585777, sedangkan artikel tepat sebelumnya, Katherine Hanley, adalah 0.500764582314
  • Selisih kedua nilai itu sekitar 3e-9, 98% lebih kecil daripada random gap rata-rata, sehingga peluangnya terpilih di Random article 50 kali lebih rendah dibanding artikel rata-rata
  • Random gap dari 5 artikel lain dengan tayangan tahunan satu digit juga masing-masing 3e-9, 9e-9, 8e-9, 4e-9, 8e-9, 2e-8, semuanya sekitar satu orde magnitudo lebih kecil daripada rata-rata
  • Dalam keseluruhan sampel 32.000 artikel, hubungan antara random gap dan jumlah tayangan tidak terlihat jelas
    • Namun, pada kumpulan yang sejak awal tampak kurang diminati, seperti artikel dengan kurang dari 200 tayangan per tahun atau sekitar 1.500 artikel di Category:Phaegopterina stubs, hubungannya menjadi lebih jelas

Artikel dengan tayangan terendah pada 2021

  • Artikel dengan tayangan terendah bukan hanya harus bertopik dengan minat publik rendah, tetapi juga harus berupa artikel dengan random gap yang sangat kecil
  • Cakupan analisis dibatasi pada artikel dengan gap 1.7e-8 atau kurang, sekitar 1/10 dari gap rata-rata, untuk meninjau 600.000 artikel “paling sial”
  • Semua dari 600.000 artikel ini tetap mendapat setidaknya beberapa tayangan pada 2021
  • Artikel dengan tayangan terendah pada 2021 ditempati bersama oleh dua artikel yang mencatat 3 tayangan yang diperkirakan berasal dari manusia
  • Kedua artikel ini sama-sama tentang spesies ngengat

Pola berulang pada 500 artikel terbawah

  • Daftar 500 artikel terbawah dapat dilihat di Least viewed articles in 2021
  • Distribusi topiknya sangat konsisten
    • Sebagian besar adalah artikel tentang spesies serangga atau takson serangga lainnya
    • Termasuk juga 17 gastropoda dan 1 fungi bernama Harknessiella
    • Kategori berikutnya yang paling umum adalah bentang geografis, terutama desa di Iran dan Sri Lanka yang sering muncul
    • Ada juga artikel geografis pendek seperti Kälberbuckel
  • Kategori berulang lainnya adalah artikel set index
  • Set index article tampak seperti artikel disambiguasi dan bekerja mirip dengannya, tetapi dalam klasifikasi Wikipedia bukan artikel disambiguasi
  • Ada juga sejumlah kecil artikel seperti DMZ//38 atau EuroNanoForum 2009 yang mengingatkan pada standar kelayakan Wikipedia lama yang lebih longgar

Mengapa banyak ngengat

  • Wikipedia menerapkan persyaratan sumber yang ketat untuk topik seperti tokoh hidup, perusahaan, dan band
  • Karena topik semacam ini dapat disalahgunakan untuk penyuntingan demi promosi, keuntungan, atau konflik, artikel sulit dianggap layak hanya dengan verifikasi sumber primer sederhana; diperlukan liputan bermakna dari beberapa sumber sekunder independen
  • Karena itu, topik yang memenuhi persyaratan ini kemungkinan besar juga menarik bagi orang selain pengguna Random article, sehingga hampir tidak muncul di 500 artikel terbawah
  • Sebaliknya, artikel spesies dan artikel permukiman umumnya tidak dihapus
    • Sering kali tetap ada meski topiknya hanya bersumber lemah
    • Banyak artikel peringkat bawah bergantung pada satu sumber saja, seperti database, gazetteer, atau penyebutan singkat dalam buku atau jurnal akademik
  • Karena standarnya rendah, beberapa artikel tampak seperti rintisan yang dibuat secara mekanis
    • Pottallinda adalah rintisan 12 kata dan mendapat 5 tayangan pada 2021
    • Artikel itu dibuat pada 18 Januari 2011 oleh User:Ser Amantio di Nicolao, yang dalam 60 detik juga membuat banyak artikel serupa seperti Polmalagama, Polommana, Polpitiya, dan Polwatta
  • Artikel sangat kecil dan tidak populer seperti ini mungkin mengecewakan pengguna Random article, tetapi bisa menjadi pekerjaan dasar yang kelak dapat diperluas oleh penyunting lain

Data dan kode

  • Data tayangan serta kode scraping dan analisis tersedia di repositori GitHub wiki-pageview-floor

1 komentar

 
GN⁺ 2023-10-21
Opini Hacker News
  • Alasan hal seperti ini terjadi di Wikipedia bukanlah monetisasi atau sudut pandang kontroversial, melainkan karena kriteria kenotabelan yang berasal dari sifat dan kualitas sumber yang dikutip paling sering dipakai dalam keputusan penghapusan
    Dulu ada pedoman bahwa orang yang bertanding di olahraga tingkat internasional pada umumnya dianggap notable, sehingga pemain sepak bola yang hanya bermain satu pertandingan untuk tim nasional pun bisa lolos dari penghapusan meski sumbernya lemah
    Namun setelah pedoman itu dihapus dan kembali ke pedoman kenotabelan umum (GNG), artikel tentang tokoh membutuhkan liputan biografis yang signifikan dari media arus utama tepercaya berskala nasional, sementara laporan pertandingan, wawancara lokal, dan media penggemar umumnya dikecualikan
    Akibatnya, ratusan artikel rintisan dan puluhan artikel penuh tentang pesepak bola internasional perempuan tidak memenuhi GNG karena liputan media arus utama relatif kurang, bahkan untuk pemenang Piala Dunia; ketika seorang editor pada musim panas ini, setelah dimulainya Piala Dunia Wanita, mengajukan banyak artikel semacam itu untuk dihapus, hampir semuanya benar-benar dihapus
    Jadi alasan artikel tentang ngengat atau tempat tetap bertahan bukanlah monetisasi atau kontroversi, melainkan karena standar kenotabelan yang sama sekali berbeda diterapkan pada benda dan tempat, yang tidak bisa menuntut editor Wikipedia atas pencemaran nama baik

    • Tadi pagi saya membaca artikel Interstate 94 lalu sampai ke WikiProject yang mengelolanya, US Roads, dan melihat bahwa sebulan lalu mereka menulis surat terbuka bahwa mereka akan meninggalkan Wikipedia dan membuat wiki sendiri karena menderita akibat artikel dihapus berdasarkan pedoman kenotabelan yang arbitrer
      https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
    • Saya menulis artikel tentang sosok yang cukup niche, The Mexican Runner, dan harus sedikit berdebat untuk meyakinkan editor lain bahwa orang ini notable
      Karena ada liputan Polygon dan Kotaku, menurut saya itu sudah cukup, tetapi awalnya itu pekerjaan yang sulit
      Apakah seseorang yang menekan tombol dengan sangat cepat memang tokoh notable?
    • Apakah ada yang benar-benar percaya bahwa kriteria “sumber arus utama tepercaya berskala nasional” diterapkan secara konsisten dalam praktiknya?
      Sepertinya ada tak terhitung banyaknya artikel Wikipedia tentang orang-orang dengan berbagai peran dan jabatan di bidang teknologi, akademia, politik lokal, dan sebagainya yang tidak akan memenuhi kriteria itu
    • Wikipedia bukan satu entitas tunggal, dan di sini mungkin yang dimaksud adalah English Wikipedia, tetapi setahu saya Wikipedia dalam bahasa lain memiliki persyaratan kenotabelan sendiri yang kadang cukup berbeda
    • Pedoman kenotabelan Wikipedia sudah sejak lama terlalu ketat
      Saya masih ingat merasa tidak habis pikir saat melihat bahwa bahkan webcomic yang cukup populer pun tidak bisa punya artikel wiki
  • Menurut saya salah satu fitur terbaik Wikipedia yang kurang dikenal adalah kotak navigasi yang terlipat di bagian paling bawah setiap artikel
    Sangat bagus untuk melihat topik yang kompleks dari atas dan memahami suatu entri berada di mana dalam struktur hierarkis yang rumit
    Beberapa di antaranya terasa seperti karya seni kecil yang suatu hari ingin saya gantung di dinding
    https://imgur.com/gallery/ILp6TtA
    Saya paham mengapa secara default harus terlipat, tetapi dengan userjs saya memindahkannya ke bagian paling atas halaman, membukanya, lalu memakainya untuk navigasi
    Agar tidak memakan terlalu banyak ruang, saya mengatur CSS zoom ke 0.3

    • Menarik bahwa Anda merasa ini memikat sebagai “seni”, tetapi bagi saya sama sekali tidak terlihat begitu
  • Cara memilih artikel acak itu mengejutkan
    Randomisasinya jadi memiliki bias permanen, dan probabilitas tiap artikel terpilih berubah seiring waktu dengan ketergantungan jalur yang besar
    Mengambil bilangan bulat acak dari 1 sampai N itu bukan rocket science
    Jadi penasaran juga apakah mungkin ada pembobotan sengaja, misalnya mengosongkan ruang di depan artikel tertentu yang disukai agar lebih sering muncul

    • Memang mengejutkan, tapi yang lebih mengejutkan adalah melakukannya dengan benar ternyata cukup dekat dengan rocket science
      MySQL memang tidak dibuat untuk memilih baris acak dengan performa bagus
      Cara naif seperti ORDER BY RAND() LIMIT 1 performanya parah, dan LIMIT 0 OFFSET RAND() * row_count juga sama buruknya
      Kalau memakai cara yang performanya bagus seperti WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, muncul masalah yang sama: lubang ID akibat artikel yang dihapus membuat artikel tertentu lebih sering terpilih
      Solusi yang benar hanya ada dua: memilih ID acak lalu mencoba lagi jika tidak valid, atau memelihara kolom/tabel terpisah yang berisi semua artikel valid sebagai deret bilangan bulat berurutan
      Yang pertama, tergantung seberapa jarang ID yang valid, kadang bisa perlu mencoba ulang 20 kali sehingga performanya sulit diprediksi; yang kedua, setiap kali artikel dihapus, rata-rata setengah dari kolom bilangan bulat harus dihitung ulang dan ditulis ulang
      Pada akhirnya, untuk sesuatu yang lebih mirip fitur main-main, cara Wikipedia bisa dibilang “cukup baik”, dan kekurangannya bisa dikurangi dengan menghitung ulang angka acak lewat job batch harian/mingguan atau setiap kali artikel diedit
      Bisa juga jauh diperbaiki dengan tidak memilih hanya satu artikel terdekat dari metode lama, melainkan memilih sekitar 50 artikel sebelum dan sesudahnya lalu mengacak lagi dari 100 artikel itu
      Ini hack total, tapi dalam praktiknya kemungkinan masih sangat cepat
    • Kalau tidak bisa tahu sebelumnya artikel mana yang sudah dihapus, apa yang akan dilakukan?
      Jika memilih bilangan bulat acak dari 1 sampai N, ada kemungkinan mendapat hasil buruk
      Kalau memikirkan spam, tidak kecil kemungkinan halaman buruk lebih banyak daripada halaman bagus, dan kalau begitu harus mengundi ulang berkali-kali
      Menurut saya pengundian ulang adalah strategi yang baik, tapi sulit membayangkan semua orang akan begitu saja memercayai probabilitas itu
      Kalau benar-benar membuat wiki dengan 99 halaman buruk dan 1 halaman bagus, tombol artikel acak hampir selalu tidak akan berfungsi
      Bisa juga memilih dari 1 sampai M berdasarkan jumlah artikel valid M, tetapi masalah yang sama tetap ada: bagaimana memetakan angka itu ke ID artikel yang sebenarnya
      Metode ini bisa bias, tetapi memiliki performa waktu konstan
      Secara pribadi, saya lebih suka menaruh semua artikel valid di memori lalu memilih salah satunya
      Per Oktober jumlahnya hanya 7 juta, dan bahkan termasuk artikel yang dihapus mungkin sekitar 70 juta, skalanya mirip dengan jumlah seluruh item di HN
      Bahkan kalau membuat satu file di disk untuk tiap artikel valid, menjalankan find . -type f | shuf -n 1 untuk pencarian acak, lalu men-cache hasilnya setiap beberapa detik, rasanya tidak terlalu buruk, meski itu juga punya bias tersendiri
    • Kalau sampai dibuat seperti ini, kemungkinan besar karena pemilihan baris acak di database memang operasi yang lambat
      Karena ini murni fitur main-main, bobot yang tidak sama pun tidak terlalu masalah, dan katanya MariaDB melakukan full table scan untuk ORDER BY RAND() LIMIT 1
    • Jika ada database artikel yang punya ID terlepas dari status dihapus atau tidak, tiap server aplikasi mengetahui rentang ID, dan kita ingin memilih secara acak artikel yang belum dihapus, saya mungkin akan melakukannya begini
      1. sediakan remote cache untuk artikel yang dihapus dan 2) setiap kali server aplikasi mengambil artikel yang dihapus, tambahkan ke remote cache itu
        Remote cache itu lokal di data center, ditopang penyimpanan persisten, dan TTL-nya bisa dibuat panjang
        Selama TTL cache, artikel yang sudah dihidupkan kembali mungkin tidak bisa terpilih, tapi itu tidak apa-apa
        Lokalitas data center memberi tingkat toleransi kegagalan dan latensi rendah tertentu, sementara penyimpanan persisten mengurangi masalah cold cache saat restart
        Watermark maksimum rentang ID bisa diperbarui secara asinkron, dan artikel baru yang sesaat belum terlihat juga tidak masalah
    • Saya sempat berpikir mungkin bobot yang berbeda itu disengaja, karena mengingatkan saya pada arithmetic coding
      Ternyata itu cuma kebetulan
      Implementasi saat ini membuat bobot menjadi kira-kira makin mirip seiring jumlah artikel bertambah, dan pengguna individual kemungkinan besar tidak terlalu peduli soal keadilan selama mereka mendapat satu artikel acak, jadi ini memang masuk akal
  • Sungguh luar biasa bahwa kita bisa menemukan di satu tempat informasi seperti ngengat Peru yang biasa saja, desa kecil entah di Iran, atau bahan bacaan Minggu zaman Victoria di Inggris
    Sebelum internet, hal-hal seperti ini bahkan tidak sebanding dengan biaya kertas untuk mencetaknya, tetapi sekarang biaya penyimpanan cloud praktis mendekati nol sehingga kita mendapatkan informasi long tail yang sangat bernilai
    Terima kasih kepada orang-orang yang menyumbangkan dan memelihara konten semacam ini
    Sebagai tambahan, rasanya akan sangat keren kalau di suatu halaman kita bisa meninggalkan catatan seperti “Saya mengunjungi halaman ini dan ingin terhubung dengan orang lain yang tertarik pada Foovius Barivius Moth dari Peru”

    • Saya sangat menyukai Wikipedia saat ini, tetapi saya rindu kembali ke kebijakan inklusionisme yang dulu
      https://gwern.net/inclusionism
    • Terkait tambahan terakhir itu, saya selalu berpikir akan menjadi proyek pribadi yang menarik jika teknik pendorong engagement supertinggi yang dipakai aplikasi media sosial diterapkan ke Wikipedia
      Misalnya bisa ada feed vertikal ala TikTok yang mencarikan artikel yang kemungkinan paling lama dilihat pengguna, dan WikiScroll sudah agak bergerak ke arah itu
      Bisa juga menambahkan ruang chat di tiap artikel agar orang bisa mengobrol, atau menyediakan fitur DM tetapi hanya memperbolehkan pengiriman tautan Wikipedia
      Ide Wikipedia sebagai katalis sosial sangat menarik
      https://wikiscroll.blankenship.io/
    • Ini promosi yang sangat terang-terangan terkait “Edit” terakhir, tapi ekstensi web yang saya buat punya fungsi yang persis cocok: https://webcursors.click/
      Kalau meninggalkan catatan di sebuah halaman, orang lain yang memasang ekstensi yang sama bisa melihatnya, dan kalau beruntung Anda mungkin dihubungi
    • Saya benar-benar berterima kasih pada Wikipedia
      Menurut saya itu bagian terbaik dari internet
  • Secara matematis bisa dibuktikan bahwa di Wikipedia tidak ada satu pun artikel yang tidak menarik
    Cukup buktikan dengan reductio ad absurdum
    Urutkan semua artikel berdasarkan tingkat kemenarikan, lalu lihat nilai yang paling rendah; pasti ada artikel yang paling tidak menarik
    Namun fakta bahwa artikel itu adalah artikel paling tidak menarik di seluruh Wikipedia justru membuat artikel itu menarik
    Demikian pula, artikel-artikel dengan jumlah tayangan terendah yang disebut di tulisan blog ini sekarang mungkin sudah kehilangan status tersebut

    • Tentu saja ada juga artikel Wikipedia tentang itu: https://en.wikipedia.org/wiki/Interesting_number_paradox
    • Saya meragukan apakah pembuktian itu valid
      Sepertinya ia mengasumsikan hanya ada tepat satu artikel yang paling tidak menarik
      Namun bisa saja ada ratusan artikel dengan tingkat kemenarikan minimum yang sama, dan kalau begitu ratusan artikel itu harus dianggap sebagai artikel yang tidak menarik
    • Kalau mau tepatnya, tulisan itu sebenarnya melihat dokumen yang paling sedikit dilihat pada 2021
    • Kemenarikan yang muncul dari status sebagai artikel paling tidak menarik harus cukup besar untuk menutup selisih antara artikel paling tidak menarik dan artikel berikutnya yang paling tidak menarik
      Di sini juga harus memperhitungkan kemenarikan karena menjadi artikel berikutnya yang paling tidak menarik
      Mungkin benar, jadi QED
    • Harus benar-benar ditemukan dulu
      Sampai seseorang menemukan dan memikirkan artikel paling tidak menarik itu, artikel tersebut belum menjadi menarik
      Sifat matematis itu abadi, dan tetap ada terlepas dari ada yang melihatnya atau tidak
  • Saya jadi teringat seri Geoff Marshall tentang Least Used Stations milik Network Rail di Inggris
    https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
    https://www.youtube.com/@geofftech2

    • Kanal dan videonya benar-benar menyenangkan, terima kasih tautannya
  • Para administrator Wikipedia cukup aktif menghapus artikel yang mereka klaim tidak penting, jadi artikel dengan jumlah tayangan terendah tampaknya akan cukup sering berubah

    • Artikel Carrier_IQ yang saya tulis pernah dihapus dengan alasan tidak terkenal karena alasan politis yang jelas, lalu dibuat lagi beberapa tahun kemudian setelah perang opini publik tentang perusahaan itu mereda
      Mungkin juga ada permainan dari pihak badan intelijen
      Cara yang sangat bagus untuk menghapus fakta sejarah yang tidak nyaman
      Sekarang itu hanya menjadi cerita kecil yang lucu tentang rootkit, tanpa konspirasi politik tertentu sama sekali
    • Benar, tetapi dalam pengalaman saya ini lebih sering berlaku pada tokoh daripada beberapa topik yang dibahas artikel
      Misalnya, rasanya sulit menemukan kota, town, desa, atau permukiman kecil di AS yang tidak memiliki artikel Wikipedia
      Lihat Jack Wade, Alaska; di Google Maps tampaknya hanya ada sekitar 8 rumah, tetapi tetap ada di Wikipedia
      Saya juga tidak merasa artikel tentang spesies ngengat langka akan diturunkan
      Namun memang perlu ada kebijakan tertentu agar tidak setiap individu di bumi memiliki artikel Wikipedia
      Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
      Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
    • Penulisnya sebenarnya juga membahas poin itu, dan artikel-artikel seperti itu tampaknya kecil kemungkinannya dihapus
      Namun vandalisme yang muncul karena status unik semacam ini terungkap mungkin bisa menjadi pengecualian
      Sebagai bisikan untuk yang tertarik: mungkin ini produk sampingan dari dataset yang digunakan penulis, tetapi salah satu kesamaan artikel-artikel dengan jumlah tayangan paling rendah adalah bahwa topiknya termasuk kategori yang menurut pedoman konten Wikipedia biasanya bukan sasaran penghapusan
  • Penulis mengatakan artikel tentang ngengat kecil kemungkinannya menyediakan peluang untuk mendorong sudut pandang kontroversial, tetapi jika melihat riwayat penyuntingan, awal tahun ini ada perbedaan pendapat soal rentang sayap Scrobipalpula crustaria
    11–13 mm, atau 10–13 mm?
    Orang-orang punya perasaan kuat soal hal-hal seperti ini

  • Jika nama artikel Wikipedia dengan jumlah tayangan paling rendah ditemukan dan dipublikasikan, jumlah tayangan artikel itu akan naik, sehingga alasan menemukannya sejak awal pun hilang

    • Seperti efek pengamat
      https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
    • Saya kurang paham apa yang dimaksud dengan alasan awalnya
      Apakah ada masalah?
      Agar adil, yang dianalisis adalah dataset 2021, jadi jelas tidak terpengaruh
    • Pencarian hapax legomenon di internet juga mengalami masalah serupa, bahkan lebih parah
      Sekalipun menemukan satu, saat keberadaannya diumumkan, ia langsung hancur
      Lihat quizzaciously
  • Meski jumlah artikelnya lebih dari 6 juta, 6.0e6 sudah sejak beberapa dekade lalu merupakan angka yang bisa ditangani dengan brute force
    Pencarian linear mungkin akan memakan waktu lebih sedikit daripada membaca artikelnya, dan hampir pasti lebih sedikit daripada menulis tulisannya
    Tentu saja, kalau begitu dilakukan, hasilnya tidak akan semenarik atau sepintar ini, tetapi rekayasa yang baik hampir selalu seperti itu