3 poin oleh GN⁺ 2024-11-27 | 1 komentar | Bagikan ke WhatsApp
  • Manajemen kinerja ala Fortune 500 bergantung pada asumsi Gaussian bahwa kinerja karyawan tersebar membentuk kurva lonceng, tetapi jika kinerja lebih dekat ke distribusi Pareto, dasar evaluasi distribusi paksa menjadi goyah
  • Dengan menggabungkan teori upah produktivitas marginal, yang mengaitkan upah dengan nilai yang diharapkan dari karyawan, dan karakter Pareto pada distribusi upah di AS, kinerja dalam rentang gaji yang sama pun dapat tersebar secara asimetris
  • Dari sudut pandang Pareto, 10% terbawah yang harus dipangkas setiap tahun tidak muncul secara alami, dan sekitar 65% karyawan berkinerja di bawah ekspektasi nilai tengah rentang gaji
  • Karyawan berkinerja rendah sebaiknya diperlakukan sebagai pengecualian seperti kesalahan perekrutan, bukan sebagai target pemutusan hubungan kerja dengan rasio tetap; dalam rentang gaji yang sama, karyawan berkinerja rendah 3 kali lebih umum daripada karyawan berkinerja tinggi
  • Sistem manajemen kinerja perlu mempertimbangkan biaya pemecatan dan perekrutan pengganti, pencapaian sasaran, bias evaluasi, pengaruh manajer, hingga perubahan kinerja dari waktu ke waktu; pemecatan tahunan berbasis distribusi paksa kekurangan dasar statistik

Mengapa asumsi Gaussian goyah

  • Banyak perusahaan besar setiap tahun mengevaluasi kinerja karyawan untuk menentukan bonus, kenaikan jabatan, dan kelanjutan kerja di masa depan
  • Metode manajemen kinerja yang umum mencakup prosedur menempatkan karyawan pada vitality curve
    • Metode General Electric pada awal 1980-an sering dikutip sebagai pembagian 10-70-20
    • Strukturnya: 20% teratas mendapat kompensasi finansial, sedangkan 10% terbawah menjadi target pemutusan hubungan kerja
  • Asumsi tersirat dari metode ini adalah bahwa kinerja karyawan mengikuti kurva lonceng Gaussian
  • Ada juga hal-hal yang mengingatkan pada asumsi Gaussian
    • IQ, conscientiousness dalam ciri kepribadian Big Five, dan tinggi badan mengikuti distribusi Gaussian serta dapat memiliki daya prediksi yang berkaitan dengan kinerja kerja
    • Jumlah atau komposisi dari beberapa variabel Gaussian juga dapat menjadi Gaussian
  • Namun, sulit menganggap karyawan yang menerima gaji perusahaan mencakup hingga ujung terbawah dari keseluruhan kurva kinerja; simetri bahwa ada karyawan yang memberi dampak negatif sebesar jumlah karyawan yang memberi dampak positif besar juga tidak cocok dengan pengalaman

Melihat kinerja karyawan melalui distribusi Pareto

  • Jika dampak karyawan dilihat sebagai nilai dolar, hal itu dapat menghubungkan teori upah produktivitas marginal dengan distribusi upah
  • Teori upah produktivitas marginal adalah gagasan bahwa jumlah yang bersedia dibayarkan perusahaan kepada karyawan pada dasarnya terkait dengan nilai yang diharapkan dari karyawan tersebut
  • Dalam mikroekonomi, distribusi upah kadang diperlakukan sebagai distribusi Pareto, dengan karakter distribusi power-law
  • Jika upah yang dibayarkan para pemberi kerja di AS dalam rentang gaji yang sama secara kolektif membentuk distribusi Pareto, maka kinerja karyawan juga dapat tersebar dalam bentuk yang sama
  • Rentang minimum dan maksimum gaji yang ditampilkan dalam lowongan kerja perusahaan menjadi petunjuk untuk memperkirakan ukuran rentang gaji

Implikasi praktis dari evaluasi distribusi paksa

  • Dari sudut pandang persentil Pareto, 10% terbawah yang ekstrem rendah tidak terpisah secara alami seperti dalam sudut pandang Gaussian
    • 10% terbawah tidak jauh berbeda dari 10% berikutnya
    • Tidak terlihat titik potong yang jelas untuk menyingkirkan karyawan “paling bawah”
    • Sekitar 65% karyawan berkinerja di bawah baseline yang terkait dengan ekspektasi nilai tengah rentang gaji
  • Karyawan berkinerja rendah memang ada di perusahaan besar, tetapi mereka sebaiknya dilihat sebagai kesalahan perekrutan, bukan proporsi bawah yang niscaya dari suatu distribusi
    • Kesalahan perekrutan perlu ditangani, tetapi sulit menganggapnya telah ditentukan pada rasio tertentu
    • Memaksa manajer yang merekrut dengan baik untuk tetap mengurangi karyawan dapat menjadi masalah
  • Rasio yang seharusnya menerima kompensasi finansial tambahan juga tidak muncul jelas dari grafik Pareto
    • 35% teratas yang berkinerja di atas ekspektasi nilai tengah gaji dapat menjadi titik awal
    • Pembagian bonus “good - better - best” yang lebih terperinci daripada formula asli GE terlihat masuk akal
  • Kandidat promosi dapat dilihat sebagai outlier, bukan segmen alami dalam distribusi umum
    • Mereka mungkin tetap undervalued bahkan di bagian atas rentang gaji saat ini
    • Promosi diperlakukan sebagai cara untuk mengatasi inefisiensi pasar kecil semacam ini

Batasan pemecatan dan perekrutan pengganti

  • Dalam rentang gaji yang sama, karyawan berkinerja rendah 3 kali lebih umum daripada karyawan berkinerja tinggi
  • Ekspektasi ala Gaussian bahwa setelah memecat 10% terbawah perusahaan dapat merekrut orang yang jauh lebih baik adalah tidak akurat
  • Pengganti yang paling mungkin belum tentu orang yang secara signifikan lebih baik daripada karyawan yang dipecat
  • Tidak ada 10% terbawah inheren yang harus disingkirkan setiap tahun
  • Manajer boleh mengidentifikasi kesalahan perekrutan ketika menilai bahwa mereka dapat membuat tim lebih baik, tetapi jangan menetapkan rasio target berdasarkan asumsi statistik yang keliru

Unsur yang hilang dalam desain sistem manajemen kinerja

  • Monitoring

    • Sistem pengambilan keputusan berbasis statistik yang mahal harus dimonitor untuk memastikan apakah mencapai tujuan dan tetap bekerja seiring waktu
    • Pertanyaan yang perlu diperiksa adalah sebagai berikut
      • Apakah perusahaan mengklasifikasikan orang secara tidak akurat
      • Apakah manajer merekrut kambing hitam untuk melindungi anggota tim yang bernilai
      • Apakah ada perbedaan kinerja nyata antara orang yang dipecat dan orang yang dipertahankan
  • Analisis biaya ala teori keputusan

    • Prosedur manajemen kinerja itu sendiri membutuhkan banyak waktu dan upaya
    • Jika perusahaan memecat 10% karyawannya, muncul biaya seperti pesangon
    • Perekrutan pengganti juga mahal, dan total biaya seluruh proses perekrutan dapat dipandang kira-kira sebesar gaji 1 tahun
    • Secara statistik, karyawan baru mungkin bertahan di perusahaan selama 3–5 tahun
    • Perlu ditimbang apakah peningkatan kinerja lebih besar daripada total biaya prosedur, dan apakah sistem manajemen kinerja yang kurang intens lebih baik
  • Perspektif sumbu waktu

    • Manajemen kinerja biasanya berupa snapshot 1 tahun
    • Jika seorang karyawan menunjukkan kinerja luar biasa selama 3 tahun lalu kurang baik selama satu tahun, perlu diputuskan apakah ia langsung dikeluarkan atau dinilai kecocokan jangka panjangnya
  • Ketidakpastian pada hal yang diukur

    • Perlu memastikan apakah evaluasi kinerja benar-benar mengukur kinerja nyata
    • Jika karyawan dengan tingkat keberhasilan rendah mendapatkan tugas paling sulit, maka evaluasi tersebut sebenarnya mengukur cara penugasan proyek, bukan kinerja
    • Jika karyawan yang ekstrover mendapat penilaian lebih baik meski kinerjanya sama, evaluasi dapat mengukur ciri kepribadian dan bias manajer, bukan kinerja
    • Faktor besar dalam kinerja karyawan bisa jadi bukan kemampuan atau upaya, melainkan apakah manajer menciptakan kondisi agar mereka bisa berhasil
    • Manajer baru mungkin kurang optimal dalam mengamankan slot kinerja yang menguntungkan bagi bawahannya pada proses manajemen kinerja pertama
    • Dalam kasus ini, evaluasi mencerminkan bukan hanya kinerja karyawan, tetapi juga daya persuasi manajer dan modal politik dalam organisasi

Kesimpulan: verifikasi dan perhitungan biaya lebih dulu daripada memecat 10% terbawah

  • Manajemen kinerja yang digunakan banyak perusahaan besar pada 2024 lebih mirip teknologi usang yang perlu diperbarui
  • Jika asumsi Gaussian ditinggalkan dan distribusi Pareto diasumsikan, tidak ada dasar statistik untuk memecat 10% terbawah setiap tahun
  • Perusahaan harus memperlakukan kesalahan perekrutan sebagai outlier dan menilai apakah memecat 10% tenaga kerja setiap tahun benar-benar bernilai
  • Karena biaya manajemen kinerja besar, diperlukan monitoring untuk mengukur pencapaian sasaran serta analisis biaya
  • Pada kondisi GE awal 1980-an, ketika sistem manajemen kinerja modern lahir, ada asumsi bahwa jika tidak ada kesalahan besar, seseorang akan bekerja seumur hidup di satu perusahaan
  • 40 tahun kemudian, karyawan sering berpindah kerja, sehingga memberi bonus yang sangat kecil dan terasa menghina kepada karyawan berkinerja rendah saja mungkin sudah menjadi “cambuk” yang memadai, sekaligus bisa lebih sehat bagi semua pihak

Data dan literatur yang mendukung hipotesis Pareto

  • Data awal dan pertengahan abad ke-20 mendukung bahwa kinerja karyawan bukan Gaussian
  • Pada 1957, William Shockley menganalisis publikasi ilmiah dan paten dari Los Alamos, Brookhaven, dan Bell Labs pada awal 1950-an
    • Kesimpulannya adalah kinerja bukan Gaussian
    • Berdasarkan teori pribadinya, ia memandangnya sebagai distribusi log-normal, dan log-normal dapat memiliki bentuk yang mirip Pareto
  • Pada 1970, Clarence Zener meninjau data Shockley, data publikasi lain, serta sampel 6.891 penulis yang namanya diawali A atau B dalam Chemical Abstracts 1907–1916
    • Pokok perdebatannya adalah Log-Normal versus Pareto, dan ia menilai jelas bahwa jawabannya bukan Gaussian
  • Herman Aguinis menelaah data publikasi dari olahraga, hiburan, politik, dan jurnal Materials Science
    • Ia menilai data tersebut arahnya sesuai, tetapi bukan dataset yang menentukan
    • Karena berfokus pada total output seumur hidup, data itu mungkin lebih mencerminkan panjang karier daripada output tahunan
  • Literatur modern tampaknya nyaris melupakan makalah Zener dan Shockley, dan tulisan-tulisan yang menyatakan “bukan Gaussian” dinilai kurang memberi usulan konkret tentang apa yang harus dilakukan setelahnya

Asumsi perhitungan dan efek samping distribusi paksa

  • Rentang gaji dan parameter distribusi

    • Rentang gaji pada lowongan kerja perusahaan memberikan kisaran minimum dan maksimum
    • Nilai minimum rentang gaji umumnya cenderung sekitar 0,65 kali nilai maksimum
    • Contoh rentang gaji 78,1 → 121,2 dapat dilihat sebagai min/max = 0,65 dengan pusat di 100
    • Alpha Pareto yang digunakan adalah 1,75, yang disesuaikan dengan data gaji individu AS
    • Ini dapat diperiksa silang dengan koefisien Gini pendapatan individu AS yang sering dikutip, yaitu 0,4, dan rumus G = 1/(2a-1)
    • Dalam perbandingan Gaussian, bagian luar rentang gaji diasumsikan sebagai 3 sigma
    • Menggunakan 2,5 sigma pun menghasilkan hasil serupa
    • Dalam skenario 3 sigma, 7,06 cocok dengan rentang gaji 100 ± 21,2; dalam skenario 2,5 sigma, angkanya 8,48
    • Plot dibuat dengan n=25.000
    • Distribusi Pareto bersifat scale-invariant dan self-similar, sehingga nilai pusat 100 bersifat arbitrer; yang penting adalah rasio lebar rentang gaji
  • “rolling up” dan salah klasifikasi

    • Praktik menggabungkan beberapa kelompok evaluasi kecil dengan anggapan distribusi paksa secara keseluruhan akan menjadi adil adalah sesuatu yang bisa diuji melalui simulasi
    • Simulasi dilakukan dengan mengasumsikan kinerja karyawan berdistribusi Gaussian dan manajer secara ajaib menilai kinerja dengan sempurna
    • Peringkat kinerja dihasilkan secara akurat
    • Cutoff Welch GE, yaitu 10% terbawah dan 20% teratas, digunakan
    • Untuk setiap ukuran kohort, 32 kali evaluasi kinerja tahunan disimulasikan
    • Dihitung proporsi karyawan yang seharusnya masuk peringkat lebih tinggi bila memakai kriteria objektif, tetapi masuk peringkat lebih rendah karena metode rank-and-chop
    • Terlepas dari ukuran kohort, sekitar 2,5% kemungkinan besar diklasifikasikan secara keliru dan tidak adil; bahkan pada kohort berisi ratusan orang, salah klasifikasi 5% sering muncul
    • Jika karyawan yang secara menguntungkan dinaikkan klasifikasinya juga dihitung, angka salah klasifikasi kira-kira menjadi dua kali lipat

1 komentar

 
GN⁺ 2024-11-27
Opini di Hacker News
  • Ada beberapa kekeliruan mendasar dalam klaim bahwa manajemen kinerja ala perusahaan besar pada 2024 adalah teknologi usang yang perlu diperbarui
    Pertama, klaim itu berasumsi bahwa karyawan dibayar sesuai dengan seberapa besar mereka “secara pribadi” menghasilkan uang bagi perusahaan, tetapi pemberi kerja berusaha membayar kompensasi minimum yang masih bisa diterima dengan memanfaatkan kondisi seperti asimetri informasi dan distribusi normal. Keadilan sulit diharapkan, dan jika hal ini dikatakan secara jujur moral akan turun, jadi mereka bergerak dengan cara membiarkan karyawan tidak tahu sambil mengumpulkan riwayat kompensasi lewat jalur seperti Work Number
    Kedua, klaim itu berasumsi bahwa perusahaan selalu ingin menjadi lebih gesit dengan memangkas 5% terbawah, tetapi kenyataannya produktivitas gabungan lebih penting daripada bintang individu. Seberapa besar pendapatan yang bisa dibuat langsung oleh petugas kebersihan atau staf kafe? Engineering juga sama: seseorang harus mengerjakan pekerjaan yang tidak terlihat, dan jika tidak, perusahaan akan menjadi organisasi rusak yang hanya punya talenta hebat di atas kertas
    Sebagai tambahan, ada grafik terkenal yang menunjukkan produktivitas total pekerja dan pendapatan rata-rata naik bersama hingga 1970-an lalu kemudian terpisah. Selama 50 tahun terakhir, baik secara makro maupun mikro produktivitas terus naik, tetapi pendapatan menjadi jauh lebih datar

    • Di sini juga ada insentif yang terdistorsi karena pasar rekrutmen saat ini kacau
      Jika saya mengurangi 5% terbawah organisasi, dalam kasus saya 2–3 engineer, bisa jadi saya tidak akan bisa mendapat pengganti lagi. Demi memuaskan tim keuangan, saya mungkin harus menurunkan L5 menjadi L4, merekrut dari luar negeri, atau mengubah pegawai tetap menjadi kontraktor
      Selain itu, kita harus bersiap menghadapi pengurangan karyawan (RIF), jadi jika ada 5% terbawah yang bisa langsung ditunjuk, itu menguntungkan ketika atasan meminta “beri saya nama.” Karena itu, nilai waktu engineer yang sudah ditempatkan sekarang jauh lebih tinggi daripada beberapa bulan lagi. Manajemen yang aktif mengeluarkan orang memang menyenangkan para manajer, jadi nilainya tidak menjadi nol, tetapi saat ini jelas karyawan berkinerja rendah pun dibutuhkan
    • Sepenuhnya setuju. Engineer yang luar biasa memang cenderung mendapat kompensasi yang baik, tetapi hanya sedikit lebih tinggi daripada karyawan berkinerja menengah. Engineer 10x tidak mendapat kompensasi 10 kali lipat; mungkin lebih dekat ke 1,5–2 kali
      Jika ada cara ajaib untuk melacak produktivitas secara akurat, kemungkinan besar kita akan melihat pola yang mendekati Hukum Price atau distribusi Pareto, seperti yang dikatakan tulisan ini, bahwa 20% pekerja menghasilkan 80% hasil. Namun itu tidak berarti 80% sisanya tidak diperlukan, dan bagian itu terkait dengan poin kedua
      Membayar karyawan sesuai dengan seberapa besar mereka “menghasilkan” bagi perusahaan tidak sejalan dengan sistem ekonomi tempat perusahaan berusaha mencari laba. Memberi kompensasi “sebagaimana seharusnya mereka terima” berdasarkan kontribusi juga belum tentu diinginkan. Di dalam perusahaan pun tampaknya akan muncul dinamika ketimpangan pendapatan yang sama
      Di perusahaan besar ada efek perataan. Kontribusi individu diratakan, tetapi tanggung jawab juga diratakan. Apakah ini baik atau buruk bergantung pada orangnya, dan menurut saya Paul Graham menjelaskannya dengan baik dalam tulisannya tentang apa itu pekerjaan dan mengapa sebagian orang lebih memilih startup
      [1] https://www.kienbaum.com/blog/prices-law-and-the-trouble-of-...
      [2] https://paulgraham.com/wealth.html
    • Untuk sebuah tulisan yang disebut blog data science tentang kinerja karyawan, agak memalukan bahwa satu-satunya data non-simulasi yang langsung disajikan atau dibahas hanyalah distribusi upah AS. Penulis sekadar memberi label sumbu x sebagai “Performance”, dan meskipun mengklaim tentang apa yang dilakukan data scientist yang baik, justru tidak ada data yang berkaitan langsung dengan argumen yang bertele-tele itu
    • Ini mungkin agak ekstrem, tetapi jika sebuah perusahaan telah memecat orang dalam kelompok pekerjaan atau jabatan tertentu, seharusnya tidak ada satu pun visa H1B yang dialokasikan untuk kelompok pekerjaan itu pada tahun berikutnya
      Jika perusahaan menerapkan pemangkasan paksa untuk kelompok terbawah atau kebijakan PHK berbasis statistik untuk kelompok pekerjaan tertentu, atau meski disembunyikan tetapi secara substansial melakukan hal itu, maka alokasi H1B untuk kelompok pekerjaan tersebut pada tahun berikutnya harus diblokir
      Intinya, jika perusahaan menilai bahwa mereka bisa bertahan tanpa X% tenaga kerja, mereka tidak berhak mendatangkan pekerja asing. H1B adalah sistem untuk membantu posisi yang sulit diisi, tetapi jika perusahaan sedang melakukan PHK atau pengeluaran massal, itu berarti jelas mereka bisa menemukan orang untuk mengisi pekerjaan tersebut
    • Menurut saya pada dasarnya tidak ada cara untuk menilai “keadilan.” Karyawan A bisa mendapat pekerjaan terkait LLM, sementara karyawan B ditugasi patch keamanan Android 9/Mac OS 12
      Misalnya, teman saya ditugasi mengimplementasikan satu fitur; kalau itu aplikasi mandiri, pekerjaannya mungkin selesai dalam 1–2 minggu, tetapi di tim browser butuh 2 tahun karena edge case dan koordinasi dengan komite standar. Semua orang mengira pekerjaan itu bisa selesai dalam 1–2 minggu, jadi meskipun penyebabnya di luar kendalinya, ia mendapat penilaian buruk
      Saya merasa perlu ada keseimbangan. Superstar memang ada, dan mereka juga mudah ditunjuk dalam penilaian rekan kerja. Namun kita adalah tim, pekerjaan yang harus dilakukan banyak, dan tidak semua orang bisa menangani pekerjaan “berdampak” yang mudah terlihat
  • Ungkapan “IQ berdistribusi normal” baru menjadi jelas bagi saya setelah membacanya di suatu tempat; sebenarnya bukan IQ yang berdistribusi normal, melainkan distribusinya yang dibuat seperti itu
    Jika ada 1000 soal IQ, tes IQ dibuat dengan cara meminta banyak orang mengerjakannya lalu memilih 100 soal yang menghasilkan distribusi normal
    Ini bukan sesuatu yang absurd. Jika memilih 100 soal yang terlalu mudah, semua orang masuk ke kategori “tahu cukup banyak” sehingga jumlah informasinya kecil. Bisa saja dibuat distribusi seragam, dan itu tetap bisa menjadi tes yang berguna dan sensitif. Namun jika mengkhawatirkan akurasi tes, distribusi normal itu praktis. Persentil ke-50 dan ke-55 tidak terlalu berbeda, dan orang umumnya lebih tertarik pada selisih 5% antara persentil ke-90 dan ke-95
    Namun tampaknya orang tidak terlalu peduli pada perbedaan persentil ke-10 dan ke-5, dan ini sebenarnya mungkin mengisyaratkan distribusi Pareto, tetapi saya kira lebih mencerminkan masalah perhatian sosial. Bagaimanapun, ini agak menyimpang, tetapi mirip juga dengan inti tulisan tersebut

    • Ini adalah nuansa dalam pengukuran inteligensi yang tidak banyak dipikirkan orang
      Jika peningkatan kemampuan otak yang diperlukan untuk naik dari IQ 100 ke 130 adalah x, maka dari 130 ke 170 mungkin perlu 3x, dan dari 170 ke 171 mungkin perlu 9x dibanding patokan 100
      Karena tidak ada ukuran absolut untuk inteligensi, kita terpaksa memakai skala relatif dan merekayasa distribusi normal pada skor
      Jika suatu hari ilmu komputer berkembang hingga mampu menentukan secara matematis inteligensi absolut minimum yang diperlukan untuk menyelesaikan masalah tertentu, itu akan menjadi pencapaian luar biasa
    • Skor IQ telah menunjukkan korelasi tinggi dengan pencapaian pendidikan, pencapaian profesional, perkembangan karier, pendapatan seumur hidup, volume otak, ketebalan korteks, kesehatan, usia harapan hidup, dan sebagainya
      Bahkan setelah mengendalikan faktor-faktor seperti latar belakang sosial ekonomi, skor ini memprediksi hal-hal tersebut dengan cukup akurat
      Bagaimana tes itu disusun pada dasarnya adalah persoalan yang terpisah dari apakah hasilnya secara akurat memprediksi hal-hal yang kita pedulikan. IQ digunakan karena berfungsi sebagai alat ukur
      Jika Anda merasa ada alat ukur yang lebih baik, silakan ajukan dan raih berbagai penghargaan serta pujian. Banyak orang pintar sudah mencobanya selama puluhan tahun, tetapi belum menemukannya
    • Benar. IQ, seperti yang sering dikatakan, bukan ukuran inteligensi yang efektif. Paling-paling saya melihatnya lebih dekat sebagai alat untuk mengukur kesulitan belajar
    • Saya tidak tahu tes IQ dibuat dengan cara seperti itu
      Kalau begitu, mungkinkah ada sebagian kecil populasi yang berada di peringkat atas untuk keseluruhan 1000 soal, tetapi karena soal yang dipilih, hasil tes IQ akhirnya hanya rata-rata? Kalau begitu, lain kali saya harus ikut tes IQ, saya akan memakainya sebagai alasan. Saya hanya bertemu distribusi yang salah
    • Jumlah dari N variabel independen yang terdistribusi mirip, yaitu butir-butir soal, akan konvergen ke distribusi normal menurut teorema limit pusat. Tidak perlu dibuat secara artifisial
  • Saya mungkin akan lebih bisa menerimanya jika klaim seperti ini berasal dari data empiris, bukan sekadar retorika. Tampaknya cukup bisa diuji, dan data produktivitas per industri juga sudah banyak tersedia
    Meski talenta manusia mengikuti distribusi Pareto, hal itu belum tentu jelas; orang-orang yang dipekerjakan perusahaan adalah subset terseleksi dari seluruh populasi, sehingga kemungkinan besar memiliki distribusi berbeda tergantung cara seleksi dan tugasnya
    Distribusi yang disederhanakan seperti ini tampaknya tidak bisa digeneralisasi ke seluruh perusahaan dan industri. Misalnya, distribusi produktivitas karyawan AWS atau Google tidak mungkin sama dengan karyawan McDonalds atau Wal*Mart. Karena proses rekrutmen dan sifat pekerjaannya berbeda
    Klaim baru bisa diajukan setelah mengambil data nyata dari dalam perusahaan dan industri. Jika tidak, itu lebih mirip istana pasir tanpa fondasi yang kokoh

    • Saya membacanya sebagai cerita bahwa sistem kita dibangun di atas asumsi yang masuk akal tetapi belum teruji, yaitu kinerja berdistribusi normal, dan ketika asumsi itu diganti dengan asumsi lain yang sama masuk akalnya, yaitu kinerja berdistribusi Pareto, sistem itu tiba-tiba terlihat bodoh. Tulisan ini lebih memberi sudut pandang baru daripada solusi
    • Bonus Content #1 dan referensi di bawah tulisan terlihat cukup meyakinkan. Akan bagus jika perusahaan besar membuka data sedetail ini, tetapi kemungkinannya kecil
    • Pernyataan “sayang sekali ini tampaknya berasal dari retorika, bukan data empiris” juga berlaku persis untuk praktik penilaian kinerja berbasis distribusi normal. Itu murni politik internal perusahaan dan tidak didasarkan pada statistik yang layak
      Setidaknya penulis tulisan ini, jika membaca catatan kakinya, memberikan beberapa dasar statistik untuk keyakinannya
    • Produktivitas intelektual umumnya tidak bisa diukur secara langsung, sehingga pada akhirnya kita beralih ke pengukuran tidak langsung yang mengasumsikan distribusi normal
      IQ terkenal berdistribusi normal, tetapi bukan karena “inteligensi” manusia berdistribusi normal, melainkan karena didefinisikan demikian. Mendefinisikan inteligensi saja sudah sulit
      Jika melihat rating Elo pada board game, terlepas dari fakta bahwa itu merupakan proksi buruk untuk inteligensi, ia tidak mengikuti distribusi normal. Elo mengasumsikan distribusi normal untuk hasil pertandingan, tetapi tidak untuk distribusi populasi
      Ini menjadi bukti yang baik bahwa bakat atau keterampilan di ranah intelektual tidak berdistribusi normal. Namun seingat saya, distribusinya juga bukan Pareto
    • Setuju. Namun secara retoris, saya sudah sering melihat kasus seperti yang dikatakan penulis, semacam “orang berkinerja rendah 3 kali lebih umum daripada orang berkinerja tinggi”
      Saya selalu berpikir kita harus melakukan yang terbaik, dan seperti kata Tyler Cowen, rata-rata sudah berakhir; tetapi khususnya klaim ini akan jauh lebih baik jika didukung oleh data empiris
  • Salah satu hal yang saya sukai saat bekerja di Netflix adalah asumsi dasarnya: semua orang adalah top performer. Kalau bukan top performer, orang itu menerima pesangon dan keluar.
    Analogi yang dipakai adalah tim olahraga. Di tim olahraga profesional ada pemain yang sangat bagus dan pemain hebat. Ada juga superstar, tetapi kalau setidaknya tidak benar-benar sangat bagus, Anda tidak bisa berada di tim itu.
    Kinerja dan kompensasi benar-benar dipisahkan, dan itu juga bagus. Evaluasi kinerja berupa penilaian rekan kerja 360 derajat, sementara kompensasi terutama ditentukan HR berdasarkan biaya perekrutan baru, lalu semua orang dinaikkan ke level itu.
    Setidaknya di Netflix 10 tahun lalu, sulit melihat kinerja sebagai sesuatu yang terdistribusi; semua orang berada di 10% teratas industri.

    • Sulit dipercaya bahwa mereka benar-benar hanya mengumpulkan performer 10% teratas. Kalau tahu budaya perekrutan yang keras di sana, meski kompensasinya bagus, sepertinya hanya sedikit developer yang benar-benar mau mencoba bekerja di sana.
      Selain itu, saya belum pernah melihat cara yang baik untuk mengukur siapa top performer dan siapa yang bukan. Bahkan dalam peran yang sama, setiap orang punya kekuatan berbeda; untuk tugas tertentu Joe bisa jadi yang terbaik, tetapi untuk tugas lain Mary bisa jadi yang terbaik. Dalam knowledge work, menurut saya hampir mustahil mengukurnya secara stabil dan objektif.
      Sekalian sedikit menyerang Netflix: dari sudut pandang pelanggan, mereka sangat buruk dalam hal paling mendasar dalam bisnis mereka, yaitu membuat konten yang bagus, dan terutama tidak membatalkan konten yang bagus. Saya tadinya bilang tidak akan membahas betapa buruknya live streaming besar mereka baru-baru ini, tetapi ternyata sudah saya bahas.
    • Ringkasnya, Netflix pada dasarnya mengatakan kepada semua karyawannya bahwa mereka termasuk 10% teratas di seluruh dunia dan setara pemain NFL. Kalau tidak berkinerja di level paling atas, mereka akan dikeluarkan.
      Sebagai eksperimen pikiran, anggap Netflix berbohong dan para karyawannya sebenarnya bukan 10% teratas industri. Katakanlah kenyataannya Netflix membayar sedikit di atas rata-rata industri, sehingga menarik talenta yang sedikit di atas rata-rata.
      Namun jika karyawan itu dibuat percaya bahwa mereka bukan sekadar di atas rata-rata, melainkan pemain NFL elite, mereka akan merasa harus bekerja seperti atlet elite. Netflix memanipulasi ego sehingga karyawan bekerja lebih lama dan lebih keras daripada standar industri.
      Pesan “hanya orang setingkat atlet profesional jenius yang bisa bekerja di sini” jauh lebih memotivasi daripada “kalau tidak lembur sampai mati demi memenuhi kuota, Anda dipecat”. Itu karena ini manipulasi harga diri.
      Menurut saya eksperimen pikiran ini lebih dekat dengan kenyataan daripada yang mau diakui Netflix atau para karyawan yang mabuk oleh budayanya. Budaya “atlet profesional” Netflix adalah manipulasi psikologis yang merugikan pekerja.
    • Di sini, bagaimana top performer dan low performer didefinisikan?
      Dari pengalaman saya, dalam lingkungan perusahaan, label seperti ini lebih sering terkait dinamika sosial dan kepekaan politik daripada output nyata. Orang yang jaringan internalnya lemah atau tidak ikut politik kantor bisa dicap low performer terlepas dari kontribusi sebenarnya, sementara orang yang pandai membangun networking di tempat kerja bisa dianggap top performer.
      Wawancara di perusahaan seperti ini juga kerap jatuh ke pola bermasalah. Pewawancara mengajukan pertanyaan sulit yang baru saja mereka riset, atau pertanyaan yang disesuaikan dengan pengetahuan yang sempit dan sangat terspesialisasi karena mereka sudah bertahun-tahun berada di peran yang sama. Wawancara teknis berubah menjadi permainan menebak pengetahuan tertentu, alih-alih menilai kemampuan memecahkan masalah, kapasitas engineering yang luas, atau konsep kinerja.
      Jujur saja, berapa banyak orang yang benar-benar bisa memisahkan perasaan pribadi dari evaluasi kinerja? Meski ada prosedur penilaian terstruktur, apakah penilai akan memberi skor tinggi kepada orang yang secara pribadi tidak ia sukai ketika orang itu secara konsisten melakukan pekerjaan hebat?
    • Secara logis, perusahaan lain tidak akan mengikuti cara ini. Jika semua perusahaan bersaing memperebutkan talenta papan atas, upah akan naik dan menggerus seluruh laba.
      Menurut saya tenaga kerja dan modal mungkin memang seharusnya bersaing seperti ini. Agar itu memungkinkan, perlakuan pajaknya tampaknya perlu disetarakan.
  • Data dan idenya menarik, dan cocok dengan pengalaman anekdotal saya bersama rekan kerja di BigCo.
    Namun menurut pengalaman saya, evaluasi kinerja karyawan lebih mirip politik daripada data.
    Pada akhirnya, banyak eksekutif BigCo saat ini menginginkan kuota PHK 10% sebagai senjata atau sebagai sarana pengurangan karyawan secara halus, dan “data” berperan sebagai daun penutup yang memungkinkan itu. Kalau dilihat secara lebih positif, ini dianggap sebagai mekanisme yang memaksa manajer menemukan low performer meskipun sebenarnya tidak ada low performer di organisasi. Bagaimanapun, pada akhirnya tidak ada dasar selain bias konfirmasi diri.
    Ketatnya evaluasi kinerja hampir selalu terkait dengan arah perusahaan dan kondisi pasar tenaga kerja. Sekitar 2021, ketika situasinya sedang bagus, perusahaan yang sebelumnya punya ekspektasi kinerja ketat pun melonggarkan persyaratannya.

  • Karena membahas inti persoalan, yaitu kinerja karyawan, secara asal-asalan, ini terlihat seperti klaim kosong yang tersusun rapi. Jika hal itu tidak didefinisikan, kita tidak tahu grafiknya merepresentasikan apa.

    • Dalam analisis seperti ini, itu tidak terlalu penting. Pilih satu metrik dan ukur di seluruh tenaga kerja. Pada sebagian besar metrik bermakna yang diminati, seluruh karyawan kemungkinan tidak akan menunjukkan distribusi normal.
      Di pekerjaan sebelumnya saya pernah memodelkan ini, dan menyimpulkan bahwa karena galat pengukuran serta efek seleksi tenaga kerja dari tahun ke tahun, rank-and-yank ala Welch pada praktiknya berujung pada PHK acak.
    • Jawabannya cukup jelas, tetapi secara menjengkelkan bersifat sirkular.
      Kinerja adalah “membuat terlihat hal-hal yang diberi imbalan oleh perusahaan dalam proses evaluasi kinerja”.
      Secara teori, setiap peran di perusahaan seharusnya memiliki daftar pencapaian yang diharapkan secara jelas. Sayangnya, sering kali tidak demikian.
      Namun memang benar, subjektivitas kinerja dan ketiadaan skala numerik yang jelas adalah kesulitan dari seluruh prosedur ini.
    • Bahkan jika “kinerja karyawan” diganti menjadi “nilai bagi perusahaan”, argumen yang sama tetap berlaku. Kinerja sulit diukur, tetapi ketika seseorang mendapat tawaran pesaing dan membawa manajernya ke meja negosiasi, nilai orang itu bagi perusahaan dapat diperkirakan cukup baik.
      Jumlah yang bersedia disamai oleh manajer adalah nilai yang dipersepsikan perusahaan. Bagaimana perusahaan benar-benar bertindak, yakni apakah mereka menyamai tawaran itu atau tidak, bisa diketahui dengan jelas, dan tindakan itu mengisyaratkan nilai bagi perusahaan terlepas dari apa pun yang dikatakan siapa pun pada musim evaluasi kinerja.
    • Tulisan itu memang memberi peringatan singkat tentang sulitnya pengukuran. Namun jika kesimpulan utamanya menentang stack ranking dan PHK, maka pertanyaan “apa itu kinerja” pada akhirnya akan berpindah ke metrik yang ingin dipakai manajer yang memang hendak memecat 10% terbawah.
    • Saya tidak tahu apakah penulis tepatnya mengajukan argumen ini, tetapi bisa dikatakan bahwa untuk sebagian besar ukuran kinerja karyawan yang masuk akal dan benar-benar dipedulikan perusahaan, sisa argumennya benar.
  • Poin ini layak terus ditekankan dengan harapan setidaknya beberapa orang mendengarnya, tetapi ada masalah penting lain dalam kinerja karyawan. Jika membagikan bonus, dengan asumsi bahwa kinerja bisa diukur secara akurat, kinerja selama satu tahun bisa menjadi kriteria yang cukup baik
    Namun retensi dan promosi adalah soal memprediksi kinerja masa depan, dan mungkin juga harus memprediksi kinerja di berbagai jenis peran. Ini jauh lebih sulit dan tidak tercermin dengan baik dalam hasil 1 tahun terakhir
    Dalam olahraga pun hal seperti ini sering terjadi. Ada pemain yang tampil bagus selama satu tahun lalu mendapat kontrak jangka panjang bernilai besar, tetapi kemudian kolaps. Sebaliknya, NBA Golden State Warriors, salah satu dinasti yang lebih baik dalam 10 tahun terakhir, bisa mempertahankan salah satu pemain terhebat dalam sejarah dengan bayaran rendah karena ia mengalami beberapa cedera pergelangan kaki di awal kariernya sehingga tim-tim lain takut
    Kinerja satu tahun tidak selalu mencerminkan kemampuan rata-rata sebenarnya orang tersebut, dan ketika promosi serta tingkat tanggung jawab berubah, posisinya dalam distribusi Pareto juga tidak akan sama
    Dari sudut pandang perusahaan, untuk mendapatkan data yang berguna bagi prospek jangka panjang, kemungkinan besar semua orang perlu dipertahankan setidaknya 5 tahun dan selama itu diberi berbagai macam tugas

    • Benar-benar persis seperti ini. Saya sudah mengatakan hal ini sepanjang karier, tetapi para pemimpin perusahaan biasanya tidak mendengarkan orang di level terbawah
      Khususnya perusahaan teknologi cenderung menilai promosi dan kenaikan gaji berdasarkan pekerjaan setengah tahun terakhir, bukan pola keberhasilan berulang selama bertahun-tahun dalam berbagai pekerjaan dan konteks. Itu pun seseorang baru dipromosikan jika berada di tim yang tepat, mengerjakan hal yang tepat, pada waktu yang tepat, di bawah pemimpin yang tepat
      Karena itu, para performer hebat pergi ke tempat lain. Petugas kebersihan, pemelihara, dan pemadam kebakaran dalam organisasi membuat perusahaan berjalan efisien, tetapi tidak diberi imbalan, dihormati, atau diakui dengan semestinya oleh para pemimpin. Para pemimpin menganggap mereka sebagai “performer buruk” dan tidak memahami pentingnya talenta hebat yang bekerja pada proyek-proyek yang tidak tampak gemilang
      Yang diuntungkan dari evaluasi kinerja hanyalah pemegang saham yang harga sahamnya melonjak saat ada PHK, dan orang-orang yang mempermainkan sistem demi tujuan politik mereka sendiri. Talenta terbaik justru tidak berkembang baik dalam sistem seperti ini karena mereka mengerjakan hal-hal yang benar-benar bermakna dan penting
    • Jika ingin membaca lebih lanjut tentang cerita ini:
      https://www.essentiallysports.com/nba-active-basketball-news...
    • Menariknya, gaji olahraga mengikuti distribusi Pareto, dan ini mengatakan sesuatu tentang nilai tiap pemain menurut penilaian pasar
      https://marginalrevolution.com/marginalrevolution/2024/08/go...
  • Tulisan ini tidak terlalu meyakinkan. Penulisnya sendiri sudah mengakui salah satu alasannya
    Di perusahaan besar ada performer rendah, semua orang pernah melihatnya, dan penulis mengatakan ia menganggap mereka sebagai kesalahan rekrutmen. Namun ia juga mengatakan tidak ada dasar yang jelas bahwa persentase tertentu adalah kesalahan rekrutmen
    Tetapi kita bisa saja mengharapkan ada persentase tertentu dari kesalahan rekrutmen. Dan itu bukan dikotomi, melainkan sebuah kontinum. Ada banyak faktor lain: orang yang saat direkrut sangat bagus tetapi kemudian kehilangan minat dan sekadar bertahan seadanya atau mengalami burnout; orang yang promosi atau mutasinya tidak cocok sehingga tidak berhasil di level atau peran baru; dan sebagainya
    Distribusi Pareto tidak terlalu relevan di sini. Proses rekrutmen bukanlah upaya mengambil potongan dari seluruh pasar tenaga kerja dengan cutoff yang jelas. Untuk pekerjaan apa pun, tujuannya adalah memaksimalkan kinerja yang bisa diperoleh pada gaji tertentu, dan tidak ada alasan mengapa kesalahan dalam menilai kinerja terlalu rendah atau terlalu tinggi harus relatif simetris
    Melihat banyaknya faktor yang saling terkait, distribusi normal adalah asumsi yang jauh lebih masuk akal daripada asumsi bahwa kita mengambil sebagian potongan dari distribusi Pareto

    • Secara pribadi, saya melihat ketidakcocokan antara manajer dan bawahan langsung jauh lebih besar daripada kesalahan rekrutmen
      Fakta bahwa A tidak menyukai B bukan berarti A atau B tidak cocok bekerja di perusahaan, tetapi biasanya hasilnya adalah bawahan itu dikemas sebagai performer rendah atau tidak mendapat sumber daya untuk bisa berkinerja
    • “Distribusi normal adalah asumsi yang jauh lebih masuk akal” itu bukan asumsi. Lihat saja bukti yang dikutip dalam catatan kaki
  • Tulisan ini pada dasarnya mengatakan, “Bukankah keren kalau ketika kita mengukur kinerja karyawan, ternyata hasilnya lebih cocok dengan distribusi Pareto daripada distribusi normal?”
    Apakah itu keren? Kita bisa saja mengandaikan implikasi dari berbagai hal yang kecil kemungkinannya terjadi. Tetapi secara pribadi, saya rasa akan jauh lebih keren kalau P = NP
    Terlepas dari itu, PHK itu menyakitkan, dan tersingkir meski merupakan performer tinggi lebih menyakitkan lagi. Kebenarannya adalah “data science” tidak membantu kita memproses kesedihan seperti membaca Dostoevsky. Karena itu, meski bekerja sebagai pengembang perangkat lunak, mendapatkan nilai A dalam pendidikan liberal arts tetap bisa bernilai

  • Sebagai karyawan, cara kita mengharapkan manajemen kinerja berasal dari sistem nilai di sekolah
    Menariknya, nilai sekolah sering kali tidak mengikuti distribusi normal, terutama di kelas-kelas yang mudah. Di kelas olahraga saya, saya rasa lebih dari 95% bisa mendapat A, sementara di kelas kimia organik mungkin hanya 5–10% yang mendapat A
    Demikian pula, ada pekerjaan tertentu yang jauh lebih mudah dilakukan dengan baik
    Karena itu, pada dasarnya kita seharusnya memperkirakan semua posisi administratif dapat menunjukkan kinerja yang “unggul”. Artinya, mereka berhasil menyelesaikan semua hal yang diminta. Sebaliknya, bagi orang dengan lingkup tanggung jawab yang lebih penting, kinerja yang hanya sedikit di atas rata-rata pun bisa 10 kali lebih berarti bagi perusahaan

    • Ada titik di mana analogi ini tidak lagi cocok. Di perusahaan, jauh lebih daripada di sekolah, kinerja saya bisa sangat bergantung pada seberapa baik dan tepat waktu orang lain menyelesaikan pekerjaan mereka. Metrik manajer bisa saja menangkap hal ini, bisa juga tidak
      Misalnya, saya menangani proyek yang harus banyak berkolaborasi dengan departemen X, tetapi departemen X sudah kelebihan beban, sehingga pekerjaan mereka tidak selesai tepat waktu dan kinerja saya menjadi buruk. Setiap komunikasi bolak-balik memakan setengah minggu, dan tanpa kesalahan saya sendiri, saya menghabiskan separuh waktu secara tidak produktif. Sebaliknya, pihak mereka mungkin 110% produktif, tetapi sedang membuat seluruh organisasi kewalahan. Jika hanya melihat metrik itu, seharusnya saya dipecat dan jumlah orang di departemen X ditambah, tetapi kenyataannya mungkin cukup merekrut lebih banyak orang di sana atau menata ulang departemen
      Perbedaannya juga, di sekolah siswa biasanya mendapat tugas yang sama atau dapat dibandingkan. Di pekerjaan saya saat ini, sebagai orang yang menangani masalah sulit, saya yakin benar-benar mustahil membandingkan pekerjaan saya dengan rekan yang menangani masalah biasa. Bahkan bukan olahraga yang sama. Jika sama sekali tidak memahami area masalahnya, dari mana kita bisa mulai membandingkan produktivitas
    • Rata-rata yang bergeser bukan berarti itu bukan distribusi normal. Saya tidak mengatakan itu pasti distribusi normal, tetapi anekdot yang diberikan saja kurang meyakinkan
    • Apakah “melakukan semua yang diminta” benar-benar “unggul”? Saya tidak tahu apa yang unggul dari itu. Paling-paling itu “memenuhi ekspektasi”