Prediksi Membutuhkan Rentang Kesalahan
(andrewpwheeler.com)- Jika indikator yang sangat volatil seperti tingkat kejahatan tingkat nasional disajikan hanya sebagai prediksi titik, perbedaan tren kecil mudah ditafsirkan berlebihan, sehingga rentang prediksi perlu dilihat bersama agar penilaian bisa dilakukan
- Dengan model ARIMA(1,1,2) dari Python
statsmodels, tingkat kejahatan kekerasan 1960–2015 dilatih dan 2016–2025 diprediksi; kode dan data dipublikasikan di GitHub - Untuk prediksi 1 tahun ke depan pada 2016–2020, standard error kurang dari 20, tetapi jika beberapa tahun diprediksi secara berurutan, kesalahan terakumulasi sehingga rentang prediksi 95% untuk 2025 melebar menjadi 260,36–575,07
- Nilai observasi aktual 2021 dan 2022 menyimpang dari prediksi tren kenaikan Richard Rosenfeld, tetapi dalam rentang prediksi ARIMA masih tetap kompatibel dengan model
- Prediksi tingkat kejahatan nasional jangka panjang sulit digunakan langsung untuk respons kebijakan lokal; untuk alokasi personel dan sumber daya nyata, prediksi yang lebih spesifik seperti peningkatan panggilan layanan seiring pertumbuhan kota lebih berguna
Sulit Menilai Tren Tingkat Kejahatan Hanya dengan Prediksi Titik
- Richard Rosenfeld membahas prediksi tingkat kejahatan tingkat nasional di
Criminologist, dan dalam tulisan yang terbit pada akhir 2023 ia menyajikan prediksi untuk 2021–2025 - Ada keluhan bahwa statistik kejahatan FBI keluar terlambat 1 tahun, tetapi prediksi ini, berdasarkan waktu terbitnya, bersifat prediksi yang terlambat karena sudah mencakup tahun-tahun yang telah lewat
- Prediksi titik hampir selalu meleset, sehingga rentang prediksi di sekitar nilai prediksi juga harus disajikan
- Melihat rentang kesalahan memperlihatkan betapa mudahnya interpretasi yang didasarkan pada perbedaan tren kecil menjadi goyah
Eksperimen Prediksi yang Direproduksi dengan ARIMA
- Analisis menggunakan
pandas,statsmodels.tsa.arima.model.ARIMA, danmatplotlibdi Python - Data disusun dengan menggabungkan
UCR_1960_2019.csvuntuk 1960–2019 dan nilai tambahan untuk 2020–2022- Tingkat kejahatan kekerasan
VRatedihitung sebagaiViolent / Population * 100000 - Tingkat kejahatan properti
PRatejuga dihitung dengan cara yang sama
- Tingkat kejahatan kekerasan
- Kode dan data tersedia di GitHub
- Agar dapat dibandingkan dengan makalah Rosenfeld, periode 1960–2015 dijadikan rentang pelatihan dan model ARIMA(1,1,2) difit
- Rosenfeld menulis bahwa ia memfit ARIMA(1,0,2) untuk tingkat kejahatan kekerasan, tetapi ia juga mengatakan datanya didiferensiasi, sehingga ini setara dengan ARIMA(1,1,2)
- Model Rosenfeld memasukkan faktor eksogen seperti inflasi, tetapi di sini tidak dimasukkan
- Tidak dilakukan grid search terpisah untuk menemukan model optimal
Diagnostik Model dan Cara Kesalahan Membesar
- Koefisien AR(1) dari model yang difit bernilai negatif, sehingga ada kemungkinan over-differencing
- Berdasarkan
violent.test_serial_correlation('ljungbox'), tidak ada autokorelasi residual yang signifikan - Pendekatan ARIMA otomatis bisa saja memilih model yang lebih baik, tetapi dalam kasus ini sebagian besar model ARIMA kemungkinan menghasilkan prediksi dan rentang kesalahan yang sangat mirip
- Untuk 2016–2020, perbandingan dapat dilakukan sebagai prediksi 1 tahun ke depan sambil menambahkan data baru
- Standard error pada periode ini adalah 19,813228, kurang dari 20
- Ini masuk dalam rentang kesalahan absolut 10% yang diperkirakan Rosenfeld sebagai ambang kegunaan
- Jika memprediksi beberapa tahun ke depan, kesalahan terakumulasi
- Untuk memprediksi 2022, prediksi 2021 diperlukan terlebih dahulu
- Untuk 2023, 2021, 2022, dan 2023 harus diprediksi secara berantai
- Standard error umumnya meningkat seperti
sqrt(steps*se^2), dengan struktur di mana varians dijumlahkan
Rentang Prediksi dan Nilai Observasi 2016–2025
- Rata-rata prediksi model ARIMA untuk 2016–2025 umumnya berada di antara 379–420, tetapi rentang prediksi melebar seiring waktu
- 2021 rata-rata 412,99, rentang 95% 374,16–451,82
- 2022 rata-rata 420,17, rentang 95% 342,16–498,18
- 2023 rata-rata 416,91, rentang 95% 303,53–530,28
- 2025 rata-rata 417,72, rentang 95% 260,36–575,07
- Prediksi titik Rosenfeld pada beberapa tahun lebih dekat ke nilai aktual daripada rata-rata ARIMA
- Untuk nilai observasi 2020 sebesar 398,5, Rosenfeld memprediksi 394,9, sedangkan rata-rata ARIMA 379,21
- Untuk nilai observasi 2021 sebesar 387,0, Rosenfeld memprediksi 404,1, sedangkan rata-rata ARIMA 412,99
- Untuk nilai observasi 2022 sebesar 380,7, Rosenfeld memprediksi 409,3, sedangkan rata-rata ARIMA 420,17
- Point estimate MAPE ARIMA pada held-out sample lebih buruk daripada Rosenfeld pada beberapa periode, tetapi nilai observasi masuk dalam rentang prediksi ARIMA
- Nilai observasi 2021 dan 2022 menunjukkan bahwa prediksi tren kenaikan Rosenfeld sudah meleset
- Prediksi ARIMA pada dasarnya bersifat mean-reverting, dan cenderung konvergen ke komponen rata-rata dalam beberapa langkah
Prediksi 2023–2025 Menurun Setelah Memasukkan Data Terbaru
- Setelah data 2021–2022 ditambahkan, 2023–2025 diprediksi ulang
- Prediksi yang diperbarui menjadi lebih rendah daripada prediksi jangka panjang sebelumnya
- 2023 rata-rata 371,98, rentang 95% 333,14–410,81
- 2024 rata-rata 380,09, rentang 95% 302,08–458,11
- 2025 rata-rata 376,40, rentang 95% 263,03–489,78
- Jika dilihat melalui grafik, ukuran rentang kesalahan lebih mudah dipahami
- Jika faktor eksogen dimasukkan, pada prediksi beberapa tahun ke depan faktor eksogen itu sendiri juga harus diprediksi, dan kesalahannya pun harus ikut diperhitungkan
Keterbatasan Kebijakan dari Prediksi Tingkat Kejahatan Makro
- Prediksi tingkat kejahatan kekerasan tingkat nasional sulit digunakan langsung untuk respons kebijakan nyata
- Kota seperti Pittsburgh tidak punya alasan untuk menggunakan prediksi tingkat kejahatan nasional secara langsung dalam penilaian kebijakan
- Bahkan jika akurasi prediksi membaik ke tingkat 5% atau 1%, sulit bagi praktisi di tingkat federal untuk merespons seperti “karena tingkat kejahatan kekerasan akan naik 10 dalam 2 tahun, mari dukung tambahan 1.342 polisi”
- Prediksi tingkat kejahatan makro kerap dikritik karena tidak ada skin in the game yang harus ditanggung ketika prediksinya salah
- Dalam penerapan prediksi kejahatan nyata, estimasi bahwa setiap tambahan 1 rumah atau unit apartemen di sebuah kota meningkatkan panggilan layanan tahunan sekitar 1 kali lebih praktis
- Kota yang sedang tumbuh lebih tepat menyusun rencana alokasi personel jangka panjang dengan cara seperti ini
Referensi yang Juga Disebutkan
- Ashby, M. (2023). Forecasting crime trends to support police strategic decision making: Membandingkan kesalahan umum prediksi tingkat kota, dan prediksi beberapa tahun ke depan cenderung menghasilkan kesalahan jauh lebih besar daripada ambang kegunaan 10% Rosenfeld
- McDowall, D. (2023). Empirical Properties of Crime Rate Trends: Membahas hubungan antara tren tingkat kejahatan makro dan teori kriminologi dengan lebih hati-hati
- Rosenfeld, R. (2018). Studying crime trends: Normal science and exogenous shocks: Karya sebelumnya yang terkait dengan studi Rosenfeld tentang tren tingkat kejahatan makro
- Yim, H. N., Riddell, J. R., & Wheeler, A. P. (2020). Is the recent increase in national homicide abnormal?: Mengkaji penerapan fan chart dalam pemantauan tren tingkat pembunuhan nasional
1 komentar
Pendapat Hacker News
Ada dua hal menarik di sini. Yang satu dibahas oleh penulis, yang satu lagi tidak. Pertama, seperti di bagian akhir tulisan, prediksi biasanya harus berujung pada pengambilan keputusan, dan jika keduanya dipisahkan, nilainya bisa menjadi tidak jelas
Rosenfield tampaknya ingin memberi bobot tambahan berupa prediksi pada kesimpulan statistik atas data masa lalu, dan itu terdengar meragukan. Kedua, juga tidak jelas apa yang seharusnya dimaksud dengan batang galat. Yang satu adalah interval kepercayaan[1], yang lain adalah simpangan baku. Dengan kata lain, pada dasarnya kita memprediksi selisih kuadrat antara prediksi titik kita dan hasil aktual
[1] Saya akui istilahnya tidak sepenuhnya tepat
Ini bukan penjelasan yang mencakup seluruh statistik, tetapi merupakan sudut pandang yang berguna saat memikirkan prediksi
Misalnya untuk interval kepercayaan 95%, kita harus sama-sama bersedia menerima odds 19:1 bahwa nilai sebenarnya berada di luar interval, maupun odds 1:19 bahwa nilai sebenarnya berada di dalam interval. Cara ini secara umum benar, dan dalam pembahasan ketidakpastian, ia membuat maknanya jauh lebih terasa sehingga menjadi kriteria yang langsung dapat diterapkan. Jika dilakukan dengan benar, ini membuat kita menetapkan ketidakpastian yang tidak terlalu konservatif dan tidak terlalu optimistis
Jika Anda merasa sedikit tidak nyaman dengan gagasan membiarkan pembaca memilih sisi mana pun dari taruhan itu, berarti arahnya sudah benar. Perasaan itu akan berkurang ketika Anda cukup yakin bahwa batang galatnya sudah ditetapkan dengan benar dan penalarannya terdokumentasi serta dapat dipertahankan
Jawaban tambahan untuk pertanyaan awal: batang galat 1 simpangan baku adalah interval kepercayaan 68%, dan 2 simpangan baku adalah interval kepercayaan 95%. Tentu saja dengan asumsi kita memakai pendekatan frequentist
[1] https://www.nobelprize.org/prizes/physics/1997/phillips/fact...
Memang harus begitu. Saya pernah berada di organisasi yang menjalankan ribuan eksperimen online selama bertahun-tahun, dan ketika membandingkan efek perlakuan baru, adanya batang galat membuatnya jauh lebih mudah dipahami
Sebagian orang menganggap itu mengaburkan penilaian. Misalnya jika perlakuan baru menghasilkan “perbaikan” 1%, tetapi interval kepercayaannya dari -10% sampai 10%, maka eksperimen itu tidak memberi tahu bagaimana metrik tersebut terdampak. Ini membuat keputusan terasa arbitrer, tetapi justru itulah intinya. Dalam kasus itu, keputusannya memang benar-benar arbitrer, dan interval kepercayaan memberi tahu fakta tersebut sehingga kita bisa melihat trade-off lain. Jika interval kepercayaannya 0,9% sampai 1,1%, kita bisa jauh lebih yakin terhadap efeknya
Masalah besarnya adalah dalam beberapa kasus sangat sulit mendapatkan batang galat yang bermakna. Misalnya akan bagus membayangkan setiap prediksi model machine learning diberi nilai seperti itu, tetapi untuk sebagian besar jenis model saya tidak tahu cara mencapainya secara masuk akal. Hal yang sama berlaku untuk eksperimen online yang memerlukan desain eksperimen rumit karena kita tidak bisa melakukan pengacakan sehingga menghasilkan kelompok yang cukup independen
Demikian pula, untuk semua metrik penting, kita perlu secara rutin melihat histogram, yakni distribusi statistiknya. Suatu kali ada masalah kecepatan pada pemanggilan layanan web besar: banyak panggilan selesai di bawah 50 ms, tetapi terlalu banyak panggilan terkena timeout 500 ms. Pada saat yang sama, kami melihat dua puncak yang jelas pada histogram kecepatan, lalu setelah ditelusuri lebih jauh kami mengetahui bahwa kedua puncak itu mewakili pengguna yang logout dan pengguna yang login. Berkat itu, kami dapat mengabaikan rentang kode yang luas dan menemukan masalah kecepatan pada kode personalisasi yang baru saja dirilis, yang kalau tidak demikian mungkin tidak akan kami curigai
Mereka berusaha sangat keras untuk menambahkan pembenaran pada keputusan arbitrer. Kadang bentuknya berupa model statistik yang menampilkan noise seolah-olah sinyal, dan sering kali datang dari pakar palsu. Mereka tidak punya metodologi dan loop umpan balik untuk mengetahui apa yang mereka lakukan, tetapi memiliki aura keahlian yang dibentuk secara sosial sehingga dapat meminjamkan legitimasi pada keputusan. Dulu mereka disebut dukun, pendeta, dan astrolog; sekarang mereka disebut konsultan manajemen dan makroekonom
Saya lebih suka menjelaskan secara eksplisit apa yang sedang terjadi dan benar-benar melempar koin. Hanya saja itu bukan strategi untuk mendapatkan tumpukan batu berkilau dalam jumlah besar
Kadang ada satu proses tunggal yang menghasilkan nilai-nilai dengan distribusi yang kurang lebih mirip. Ini situasi yang bagus karena kita bisa memakai berbagai alat statistik untuk perencanaan, inferensi, dan sebagainya
Namun dalam praktiknya, sering kali ada dua proses atau lebih yang tercampur tetapi diperlakukan seolah-olah satu proses. Di dalam tiap proses, nilai-nilainya kurang lebih berasal dari distribusi yang serupa, tetapi analisis terhadap keseluruhan gabungan menjadi membingungkan. Jika Anda mengetahui komponen utama dari proses tunggal palsu yang sedang Anda amati, Anda akan selalu selangkah di depan pesaing
[1]: https://two-wrongs.com/statistical-process-control-a-practit...
Saya sepenuhnya setuju dengan gagasan ini. Tambahan lagi, estimasi tanggal, yaitu tenggat, juga harus memiliki error bar. Pada akhirnya tanggal pun adalah prediksi
Jika pemangku kepentingan meminta tanggal, mereka juga harus menentukan error bar seperti apa yang diinginkan. Tanggal mentah tanpa estimasi ketidakpastian tidak ada artinya. Demikian pula, jika engineer menyampaikan tanggal kepada pemangku kepentingan lain, mereka harus menyertakan estimasi ketidakpastian dalam bentuk apa pun. Ada perbedaan sangat besar antara mengatakan peluang selesai sebelum hari X adalah 90% dan mengatakan 99,9%
Distribusinya hampir seperti power-law yang condong ke satu sisi. Pekerjaan hampir tidak pernah selesai lebih awal, dan kalaupun selesai lebih awal biasanya tidak banyak. Sebaliknya, ketika terlambat, keterlambatannya bisa sangat tidak masuk akal
Membuat interval kepercayaan untuk hal seperti itu benar-benar sulit
Estimasi tanggal tanpa error bar tidak bisa dibuktikan salah. Tetapi jika Anda mengatakan “peluang selesai sebelum tanggal ini adalah 50%”, maka ketika melihat kembali 20 estimasi seperti itu baru-baru ini, kira-kira 10 seharusnya selesai tepat waktu. Kalau tidak, berarti estimasinya belum terkalibrasi. Setidaknya kita bisa mengetahui fakta itu. Tanpa error bar, kita tidak akan tahu
Kuantifikasi ketidakpastian adalah aspek yang terabaikan dalam data science, khususnya machine learning. Praktisi tidak selalu punya latar belakang statistik, dan di bidang machine learning umumnya ada sikap “prediksi dulu, pertanyaan belakangan”, sehingga ketelitian seperti ini tersisih
Saya selalu meminta error bar
Pada model nonlinear umum, membuat error bar—atau lebih umum, distribusi galat—yang benar-benar menjelaskan konsep ketidakpastian yang masuk akal bisa cukup membebani secara teoretis maupun komputasional, bahkan dalam kasus ideal. Ada metode praktis yang baik dengan landasan teori seperti Monte Carlo Dropout, tetapi error bar yang dihasilkan di sana tidak selalu merupakan galat yang Anda inginkan. MC DO memperkirakan ketidakpastian akibat bobot model, tetapi tidak memperkirakan, misalnya, ketidakpastian akibat data latih yang buruk
Saya sangat mendukung metode yang secara alami menyertakan ketidakpastian, tetapi ada banyak jenis model yang secara empiris menghasilkan hasil sangat berguna, sementara cara membuat atau menafsirkan estimasi ketidakpastian yang berguna secara efisien tidak jelas
Isu lain yang terpisah dan sering diabaikan adalah konsep output model yang terkalibrasi, dan itu lubang kelinci lain lagi
Namun tanpa prasyarat seperti ini, jutaan dimasukkan ke dalam model, dijual kepada orang sebagai solusi, lalu dilewati begitu saja dengan alasan “kalau orang membeli, berarti ada nilainya”. Orang juga membayar penipu
Saya teringat ucapan serupa Walter Lewin tentang pengukuran dalam kuliah 8.01-nya: “Pengukuran tanpa mengetahui ketidakpastiannya tidak bermakna”
https://youtu.be/6htJHmPq0Os
Prediksi bisa dikatakan sebagai pengukuran terhadap masa depan
Sumber: https://www.edge.org/response-detail/10459
Saya kira ini akan membahas cuaca
ECMWF menjalankan model ensemble; kemungkinan dengan sedikit membedakan kondisi awal atau mengubah parameter model dalam suatu rentang, mereka menjalankan 51 model secara bersamaan. Dari 51 model ini, interval kepercayaan yang cukup baik bisa diperoleh
Namun ini adalah model dengan resolusi lebih rendah dan lebih jarang dijalankan. Model “HRES” memiliki resolusi spasial dua kali lipat, jadi saya menduga model itu tidak dijalankan sebagai ensemble. Alasannya jelas: biayanya sangat mahal
[1]: https://en.wikipedia.org/wiki/Integrated_Forecast_System#Var...
https://content.meteoblue.com/en/research-education/specific...
Contoh menarik dalam tulisan ini adalah nowcasting. Ini adalah teknik memprediksi masa kini atau masa lalu sambil menunggu data masuk
Tanpa rentang galat, itu adalah sains dan statistik yang ceroboh
Agar prediksi menunjukkan ketidakpastian nyata, Anda harus berada dalam posisi yang cukup mewah, yaitu mengetahui proses pembentukan data. Jika memungkinkan, Anda bisa mencoba mengkalibrasi secara kasar dengan banyak data historis, tetapi tetap ada batasnya
Semua estimasi, prediksi, interpolasi, dan ekstrapolasi harus memiliki interval kepercayaan, interval prediksi, atau interval toleransi yang mencerminkan asumsi yang dimasukkan tim ke dalam masalah. Tergantung bidang penerapannya
Saya teringat makalah ini[1]
“Ilusi prediktabilitas dalam hasil ilmiah: bahkan para ahli pun mencampuradukkan ketidakpastian inferensial dan variabilitas hasil”
Secara tradisional, ilmuwan lebih banyak berfokus pada penyampaian ketidakpastian inferensial, yaitu presisi estimasi statistik, dibandingkan variabilitas hasil, yaitu seberapa dapat diprediksinya hasil individual. Makalah ini menunjukkan bahwa hal tersebut dapat menimbulkan kesalahpahaman besar tentang implikasi hasil ilmiah. Secara spesifik, dalam tiga eksperimen acak yang telah dipradaftarkan, peserta melihat temuan ilmiah yang sama dalam visualisasi yang hanya menampilkan ketidakpastian inferensial, hanya variabilitas hasil, atau keduanya, lalu menjawab tentang besaran dan pentingnya temuan tersebut. Hasil yang terdiri dari respons pakar medis, data scientist profesional, dan profesor jalur tenure menunjukkan bahwa cara umum yang hanya memvisualisasikan ketidakpastian inferensial dapat membuat bahkan para ahli yang sangat terlatih pun sangat melebih-lebihkan efek pengobatan. Sebaliknya, jika ketidakpastian inferensial dan variabilitas hasil ditampilkan bersama, rata-rata hal itu menghasilkan pemahaman yang lebih akurat sambil tetap mempertahankan kesan subjektif lain terhadap hasil
[1] https://www.microsoft.com/en-us/research/publication/an-illu...
Prediksi bisa tetap berguna meski tanpa error bar. Kadang satu prediksi titik saja sudah cukup untuk menentukan tindakan
Namun kadang, mengetahui seluruh distribusi prediksi berguna atau diperlukan untuk mengambil keputusan yang baik. Pernyataan “prediksi titik selalu salah” memang benar untuk data kontinu, tetapi jika Anda bisa memprediksi bahwa suatu saham akan naik 2,01 kali, bukan 2 kali, itu tetap berguna