1 poin oleh GN⁺ 2023-10-02 | 1 komentar | Bagikan ke WhatsApp
  • Eksperimen lapangan oleh Harvard Digital Data Design Institute dan BCG mengevaluasi seberapa besar AI mengubah produktivitas dan kualitas kerja pengetahuan pada 758 konsultan
  • Tugas dirancang agar mendekati pekerjaan nyata konsultan, mencakup kreativitas, pemikiran analitis, penulisan, dan daya persuasi, sehingga menilai penerapan kerja, bukan sekadar benchmark sederhana
  • ChatGPT-4 meningkatkan kecepatan kerja lebih dari 25%, kinerja berdasarkan penilaian manusia lebih dari 40%, dan tingkat penyelesaian tugas lebih dari 12% pada tugas-tugas yang cocok untuk AI
  • Tidak semua pekerjaan mendapatkan efek yang sama; batas kemampuan teknologi yang tidak merata antara area kuat dan lemah muncul sebagai kendala utama
  • Pemanfaatan di lapangan terbagi menjadi Centaurs, yang membagi pekerjaan, dan Cyborgs, yang meleburkan AI ke dalam alur kerja, sehingga kombinasi manusia dan AI perlu dipertimbangkan per tugas

Eksperimen lapangan pada konsultan BCG

  • Karim Lakhani dari Harvard Digital Data Design Institute dan rekan-rekannya bersama Boston Consulting Group (BCG) mengevaluasi dampak AI terhadap produktivitas dan kualitas pekerja pengetahuan
  • Subjek eksperimen adalah 758 konsultan, setara dengan 7% dari tenaga kontributor individual di BCG
  • Tugas mencerminkan cakupan pekerjaan sehari-hari konsultan
    • Kreativitas

    • Pemikiran analitis

    • Kemampuan menulis

      • Daya persuasi

Peningkatan kinerja dan keterbatasan

  • Pada area tugas yang bekerja baik dengan AI, ChatGPT-4 secara signifikan meningkatkan hasil
    • Kecepatan kerja meningkat lebih dari 25%
    • Kinerja berdasarkan penilaian manusia meningkat lebih dari 40%
    • Tingkat penyelesaian tugas meningkat lebih dari 12%
  • Sebaliknya, performa AI tidak seragam di semua tugas
    • Pada sebagian pekerjaan, hasilnya sangat baik, tetapi pada pekerjaan lain masih kurang
    • Perbedaan ini dirangkum sebagai jagged technological frontier

Dua pola penggunaan dalam pekerjaan pengetahuan

  • Pengguna AI secara umum terbagi dalam dua pola
    • Centaurs: membagi dan mendelegasikan pekerjaan antara manusia dan AI
    • Cyborgs: mengintegrasikan AI ke dalam alur kerja mereka sendiri
  • Lebih penting daripada dikotomi memakai atau tidak memakai AI adalah menilai nilai apa yang dihasilkan oleh kombinasi manusia dan AI dalam tiap alur kerja

1 komentar

 
GN⁺ 2023-10-02
Pendapat Hacker News
  • Tugas-tugas ini tampak seperti pekerjaan yang sangat pas untuk GPT: di ranah seperti kreativitas, pemikiran analitis, penulisan, dan persuasi, misalnya memintanya menulis 10 ide sepatu, segmentasi pasar, siaran pers, dan memo inspiratif untuk karyawan
    Respons GPT untuk tugas pertama: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
    Halusinasi GPT yang penuh keyakinan nyaris tidak bisa dibedakan dari materi konsultasi manajemen yang tipikal

    • Kalau pekerjaannya semacam “idenya jelek, ada spreadsheet, tidak ada yang peduli dengan copy marketing, tidak ada yang terinspirasi oleh omong kosong ala eksekutif puncak”, maka sejak awal nilainya rendah, sehingga hampir menjadi input sempurna untuk LLM
    • Kalau hanya melihat hasil akhirnya memang benar, tetapi nilai pekerja pengetahuan terutama berasal dari kualitas input
      Klien tidak menginginkan “10 ide”, melainkan “10 ide bernilai yang didasarkan pada pemahaman bisnis dan pasar”. Jika konsultan manajemen menjawab pertanyaan ini dengan sesuatu seperti “boat shoes”, mereka tidak akan mempertahankan klien lama-lama
      Dengan cara yang sama, dalam rekayasa perangkat lunak pun kalau kita meminta “tuliskan 10 baris kode”, bisa dibilang hasilnya tidak bisa dibedakan dari kode yang dihasilkan ChatGPT setiap hari
    • Saya tidak tahu harus membenci atau menyukai “untuk dog walker, dengan dispenser kantong kotoran terintegrasi”, dan “untuk tunanetra, umpan balik haptik” — sepatu haptik, sungguh inovatif
    • Jika halusinasi GPT yang penuh keyakinan mirip dengan materi konsultasi manajemen, itu tampaknya juga cocok untuk Harvard dan institusi di sekitarnya
      Perusahaan tempat saya bekerja beberapa kali mempekerjakan McKinsey, yang dikenal merekrut lulusan HYP, dan hasilnya, kalaupun dikatakan baik-baik, tetap kurang memadai. Pengalaman saya dengan institusi-institusi seperti ini umumnya serupa
      Saya tahu ini hanya anekdot, tetapi rasanya ada banyak bias konfirmasi dalam penelitian semacam ini
    • Jawaban GPT terbaca seperti diambil dari majalah MAD
  • Studi ini mengubur poin utamanya. LLM memang lebih baik dalam beberapa tugas, tetapi dalam tugas lain justru benar-benar membuat hasilnya lebih buruk
    Tugas pertama adalah tugas generalis yang dalam studi disebut “di dalam batas”, jadi tidak mengejutkan jika kinerjanya meningkat. Ini adalah pekerjaan meneliti area yang terdefinisi dengan baik tanpa perlu pengetahuan domain yang kuat, sehingga cocok dengan kekuatan LLM. Pekerjaan yang biasanya dilakukan konsultan junior di awal karier, seperti peran business analyst, juga umumnya berupa tugas generalis seperti ini
    Karena LLM telah menggeneralisasi banyak informasi, ia kuat dalam riset umum seperti ini, tetapi generalisasi yang sama juga merupakan kelemahannya. Anggap saja seperti jurnalis bidang riset. Saat membaca koran, kita merasa mendapatkan wawasan, tetapi begitu membaca artikel tentang bidang yang sangat kita kuasai, kita langsung tahu bahwa analisisnya banyak cacat dan penulisnya tidak memahami topik itu pada level kita
    Tugas kedua yang “di luar batas” menuntut analisis spreadsheet, wawancara, dan analisis lebih mendalam yang didukung bukti, yang merupakan jenis pekerjaan yang saat ini masih lemah bagi LLM. Karena itu kelompok non-LLM mendapat 84,5%, sementara pengguna LLM hanya 60–70,6%
    Kesimpulannya, LLM sangat bagus untuk riset yang digeneralisasi, tetapi kurang cocok untuk pekerjaan analisis profesional

    • Ini terasa seperti versi baru dari Gell-Mann amnesia. Saya ingin menyebutnya LLM-man amnesia
      Saat ditanya soal pemrograman, ChatGPT berhalusinasi sekitar 20%, dan saya cukup berpengalaman untuk menyadarinya. Sepertinya saya harus berasumsi bahwa ketika bertanya tentang bidang lain pun setidaknya ada halusinasi dan informasi keliru sebesar itu
    • LLM pada umumnya kuat dalam pekerjaan yang bisa dilakukan dengan baik oleh pekerja pengetahuan rata-rata, atau yang relatif cepat bisa mereka pelajari hingga mahir
    • Analogi LLM dengan jurnalis adalah wawasan yang bagus
  • Ini lucu. Kemampuan menulis GPT-3/4 memang mengesankan, tetapi yang lebih mengejutkan adalah betapa tulisan manusia dipenuhi omong kosong berbunga-bunga
    “Konsultan bisnis” adalah puncak dari peran yang membutuhkan tulisan penuh omong kosong semacam itu, dan ChatGPT bisa bertindak lebih seperti konsultan bisnis daripada konsultan bisnis terbaik sekalipun
    Agar dianggap serius di tempat kerja, kadang kita harus menggelembungkan ide atau data yang ringkas menjadi dokumen berhalaman-halaman atau slide deck. Dengan begitu orang lain langsung tahu bahwa “ada usaha yang dikeluarkan”
    Peran yang paling cocok untuk ChatGPT saat ini mungkin adalah menerima tulisan ringkas lalu mengembangkannya menjadi dokumen yang jauh lebih panjang dan penuh basa-basi. Pihak penerima akan menahan diri membaca dokumen atau slide yang bertele-tele itu, mengakui bahwa “pekerjaan sudah dilakukan”, lalu memasukkannya kembali ke ChatGPT untuk diringkas ke inti aslinya

    • Kebanyakan orang berfokus pada apa yang bisa dilakukan LLM, tetapi yang sama menariknya, atau bahkan lebih menarik, adalah apa yang tidak bisa dilakukannya dan alasannya
      Saat kita mengatakan “LLM bisa menghasilkan teks”, kita sedang melukis dengan kuas selebar jalan tol 10 lajur. Tampaknya kosakata kita cukup terbatas untuk menjelaskan apa sebenarnya menulis itu, serta kategori dan tingkatannya
      Misalnya, untuk email sopan, spam inspiratif ala LinkedIn, dan gaya bahasa korporat, menarik sekaligus menurut saya sepenuhnya bisa diduga bahwa GPT mengalahkan manusia sejak percobaan pertama. Sebaliknya, jika diminta menulis buku berikutnya dari Game of Thrones atau karya sastra yang bagus, ia runtuh menjadi membosankan, generik, penuh klise serta alur dan tokoh yang hampa
      Kini kita perlu memetakan lanskap penulisan ke ruang konsep yang lebih baik. Saat ini kita bahkan tampak belum bisa membedakan perbedaan setara aritmetika dan aljabar abstrak
  • LLM sangat mengesankan dalam tugas bahasa. Sebagian besar hal yang dulu disebut orang sebagai pemrosesan bahasa alami kini hampir tersapu. Ringkasan, tanya jawab, analisis sentimen, dan sebagainya benar-benar berada pada level yang mencengangkan.
    Ia juga sangat kuat untuk tugas generatif yang batas “fakta”-nya tidak tegas dan tidak perlu saling terjalin rapat seperti novel Pynchon. Cerita pendek, tulisan opini, dan copy produk adalah pengganda produktivitas yang bisa mengeluarkan 20 ide seperti prototipe dalam 1 menit.
    Namun posisi saat ini kira-kira baru sampai di situ. Bahasa alami dinaikkan ke ruang laten untuk membuat konsep yang sampai batas tertentu bisa dipisahkan, lalu dilakukan sesuatu yang mirip transformasi afin, kemudian diturunkan kembali.
    Sebagai komputer, ini luar biasa mengesankan, tetapi kalau ditanya apakah benar-benar bisa menggantikan peran lulusan Penn yang mahal, kemungkinan yang dibayar bukanlah wawasan strategi produk yang memukau, melainkan sesuatu yang lain.

    • Saya penasaran berapa lama lagi sampai AI menjadi mahir di bidang hukum. Tugas bahasa yang dikuasainya sekarang mirip pekerjaan seni. Ia memecahkan masalah dengan ruang solusi yang sangat besar dan tahan terhadap perubahan kecil.
      Misalnya, sedikit mengubah gambar manusia pohon yang marah kemungkinan besar tetap menjadi gambar manusia pohon marah yang bagus.
    • Sulit untuk setuju. LLM tidak bisa melakukan apa pun secara andal, betapapun terbatas domainnya.
      Output-nya tampak dapat diterima karena manusia menambal celahnya dengan otak manusia. Orang mengenali output sampah, menyelesaikan ambiguitas kecil, dan secara tidak sadar memperbaiki kesalahan fakta maupun logika yang sepele.
      Namun kita tidak akan langsung memasukkan hasil LLM ke program komputer lain. Dengan begitu, sebagian besar tugas pemrosesan bahasa alami tradisional tersisih.
    • Agar “sebagian besar hal yang dulu disebut orang sebagai pemrosesan bahasa alami kini telah tersapu” menjadi benar untuk sebagian besar penggunaan layanan produksi, LLM setidaknya harus 10 kali lebih cepat.
      Saya pada dasarnya setuju bahwa ia bisa melakukan tugas-tugas semacam ini dengan cukup baik, tetapi performanya masih kurang untuk dijalankan pada dataset berskala besar.
    • Kalau diminta membuat teks yang secara khusus diproses sebagai pemrosesan bahasa alami, hasilnya sangat bagus.
      Namun segera setelah itu ia mengatakan agar jangan menggunakannya apa adanya karena “tidak etis”.
  • Ini lebih banyak menunjukkan betapa tidak bergunanya konsultan BCG.

    • Pada LLM tampaknya ada padanan pepatah lama “media akurat dalam semua bidang kecuali bidang yang saya kuasai”. Output LLM juga tampak bagus dalam semua bidang kecuali bidang yang saya kuasai.
      Orang tanpa latar belakang menulis atau menyunting mengira LLM akan merevolusi bidang itu. Penulis dan editor sungguhan cukup melihat sekali output LLM untuk tahu bahwa waktu memperbaikinya mirip dengan menulis dari awal, sehingga nyaris tidak bernilai.
      Demikian pula, orang yang tidak bisa memprogram atau pemahamannya dangkal atas suatu topik, terutama manajer yang ingin terlihat teknis, melihat output LLM dan mengira itu bisa langsung di-deploy, tetapi programmer yang baik melihat terlalu banyak masalah besar dan kecil sehingga tidak layak diperbaiki dibanding menulis dari awal.
    • Sebagian besar konsultan manajemen memang tidak berguna, tetapi ada realitas yang harus diterima.
      Dalam tim berisi 20–30 engineer, biasanya hanya ada satu engineer yang “kenapa dia masih bersama kita?”—secara teknis hebat dan juga pandai berurusan dengan orang. Namun sebaik apa pun kepribadiannya, pekerjaan tetaplah pekerjaan, dan ia hanya memberi petunjuk tentang bagaimana manajemen seharusnya berjalan. Ia juga main video game, punya keluarga, dan punya kehidupan, jadi ia tidak tertarik pada arah perusahaan, manajemen, dan tanggung jawab yang tidak perlu. Selain itu, orang-orang di atas melihatnya hanya sebagai “engineer”, bukan “manajer”.
      Ketika engineer dan manajer lainnya juga bersikap “bukan masalah saya”, muncul kekosongan komunikasi yang aneh. Engineer yang bekerja dekat dengan produk enggan berbicara dengan manajer karena takut berujung “kalau kamu begitu paham, kamu saja yang kerjakan?”, dan manajer enggan berbicara dengan engineer karena takut berujung “kalau kamu begitu tertarik, kamu saja yang kerjakan?”.
      Ke jarak yang makin melebar antara manajer dan engineer inilah konsultan manajemen masuk. Berkat fleksibilitas yang diberikan manajemen puncak, konsultan manajemen bisa bolak-balik antara engineer dan manajer, berbicara dengan siapa saja, dan tidak terikat oleh “kalau begitu kamu saja yang kerjakan?”. Mereka menyerahkan laporan dan dalam sebulan membawa pulang gaji setahun seorang manajer atau engineer.
      Kalau dipikir serius, ada banyak hal yang perusahaan tahu harus dilakukan tetapi tidak dikatakan. Karena kalau dikatakan, pekerjaan bertambah dan risiko juga bertambah. Konsultan manajemen yang “baik” menemukan pekerjaan semacam itu—yang “tidak ingin dilakukan tetapi harus dilakukan”—melaporkannya ke manajemen puncak, lalu manajemen membuat sistem untuk menyuruh orang melakukannya. Kalau ada yang membutuhkan konsultan manajemen, boleh mempekerjakan saya. Saya akan memberi tahu 20 cara kenapa perusahaan Anda tidak bagus, dan 18 di antaranya akan dibuat oleh ChatGPT.
    • Saya setuju sampai batas tertentu. LLM terutama meningkatkan output pemrograman saya dalam penulisan JSDoc dan deskripsi PR. Hal-hal yang tidak terlalu ingin saya lakukan.
    • Studi ini hanya menunjukkan bahwa 40% pekerjaan konsultan BCG adalah noise tanpa nilai tambah nyata. Sepertinya klien sekarang harus meminta diskon 40%.
    • Setiap kali GPT melakukan sesuatu, berulangnya frasa “itu lebih banyak menunjukkan tentang [objek]” justru menunjukkan lebih banyak hal.
      Lucu bahwa komentar semacam ini bisa diprediksi di thread mana pun. Kalau terus memakai “itu lebih banyak menunjukkan tentang [sisipkan]”, ungkapannya sendiri kehilangan makna. Bukankah bisa mengatakan sesuatu yang lebih bermakna?
  • Tidak mengejutkan. GPT sangat bagus sampai terasa menakutkan, dan juga sangat cocok dengan pemrograman
    Saya meminta GPT-4 menulis kode lalu mencoba apakah berfungsi, tetapi jarang sekali saya langsung menyalin dan menempel kode itu apa adanya. Saya menulis ulang sendiri agar sesuai dengan konteks codebase. Meski begitu, saat tidak yakin harus melakukan apa, itu sangat menghemat waktu
    Ada kalanya saya tidak suka dengan sarannya, tetapi itu pun berguna. Sering kali ruang masalahnya menjadi lebih jelas di kepala

    • Kemarin saya memakai ChatGPT untuk kode untuk pertama kalinya
      Saya memberinya tugas yang cukup rumit, yang jawabannya tidak bisa saya temukan lewat Google dan saya pun tidak yakin apakah mungkin dilakukan. Persyaratannya: “Diberikan sebuah objek Python, berikan daftar fungsi yang menerima objek ini sebagai argumen. Kode yang ada tidak boleh diubah, hanya struktur objek yang boleh diubah”
      Awalnya ia memberi ide-ide yang kurang pas, seperti mengubah fungsi, membungkusnya dengan decorator, atau melihat pelacakan stack saat ini, tetapi setelah beberapa kali bolak-balik, ia mengusulkan solusi dengan mencegat tracer Python, dan itu benar-benar berhasil
      Hal yang mengejutkan adalah ia tampaknya tidak mungkin pernah melihat hal seperti ini dalam data latihannya, tetapi tetap mampu merangkai potongan-potongannya. Hampir mendekati level manusia. Saat saya tanya, ia juga dengan mudah menjelaskan keterbatasannya, yaitu bisa mengganggu debugger
    • Tulisan yang dipublikasikan ini bukan tentang tugas pemrograman, melainkan pembuatan teks untuk “konsultan strategi”
      Contoh di halaman 10 naskah aslinya seperti ini: mengusulkan 10 atau lebih ide sepatu baru yang menargetkan pasar atau olahraga yang terabaikan, melakukan segmentasi pasar industri sepatu berdasarkan pengguna, menyusun draf siaran pers untuk mempromosikan produk, dan menulis memo inspiratif kepada karyawan yang menjelaskan mengapa produk itu lebih unggul daripada produk pesaing
      Secara pribadi, saya melihat nilainya hampir tidak ada dalam praktik
    • Tindakan menjelaskan masalah kepada GPT-4 itu sendiri kadang sama membantu dengan jawabannya. Rasanya hampir seperti rubber duck debugging yang ditingkatkan
    • Ini hanya selangkah dari pemrograman gaya “coba ini-itu sampai berhasil”
      Bukan berarti Anda programmer seperti itu, tetapi ini jelas memungkinkan tipe programmer semacam itu
    • Benar-benar rubber duck yang pandai bicara: https://en.wikipedia.org/wiki/Rubber_duck_debugging
  • Sebagai mantan konsultan, pertanyaan yang jelas berikutnya muncul di benak saya. Bagaimana kalau konsultan dihilangkan sepenuhnya dan GPT-4 bekerja langsung untuk klien?
    Agar klien bisa menugaskan pekerjaan kepada konsultan, mereka harus menjelaskan kebutuhan, meninjau hasil, memberi umpan balik, dan ikut beberapa rapat
    Namun jika GPT-4 membuat konsultan jauh lebih baik, sepertinya ia juga bisa menggantikan pekerjaan mereka. Jika ditambah penurunan biaya komunikasi karena tidak perlu bekerja dengan kelompok eksternal, apa alasan klien tidak menghapus biaya konsultan eksternal dan beban pengelolaannya, lalu mengambil manfaatnya sendiri?
    Terutama jika klien sudah merupakan pakar domain dan hanya membutuhkan tenaga tambahan. Misalnya, seorang manajer merek pemasaran memahami produk dan pemasarannya dengan baik, tetapi mungkin bekerja dengan konsultan pemasaran karena membutuhkan lebih banyak sumber daya akibat keterbatasan staf internal
    Saya penasaran apakah BCG sudah benar-benar memikirkan konsekuensi dari keterlibatan mereka dalam studi ini. Jarak dari “membantu konsultan melayani klien dengan lebih baik” ke “membantu klien secara langsung dan menunjukkan bahwa konsultan tidak terlalu diperlukan” tampak sangat pendek
    Terutama jika klien mempekerjakan satu intern dan memberinya GPT-4

    • Perusahaan seperti BCG atau McKinsey pada dasarnya ada untuk menghindari tanggung jawab
      Dari sudut pandang CEO, mereka bisa dipanggil, dibayar mahal untuk membuat rencana dan strategi, lalu jika berhasil CEO mengambil pujian, dan jika gagal bisa berkata “kami bekerja erat dengan para pakar McKinsey. Jadi ini bukan tanggung jawab saya”
  • HN sangat buruk dalam membuat prediksi. Baru beberapa bulan lalu, kolom komentar penuh dengan orang yang percaya diri mengatakan LLM hanyalah burung beo stokastik dan tidak akan bisa mencapai apa pun
    “Saya tidak bisa menyingkirkan perasaan bahwa musim dingin AI berikutnya sudah di depan mata,” ya, tentu saja
    [0] https://news.ycombinator.com/item?id=23886325

    • Siapa yang pernah berargumen bahwa konsultan manajemen bukan burung beo stokastik?
    • Komentar itu juga mengatakan, “Jika tujuannya mencari cara mengganti spam content marketing secara hemat biaya, bagus. Mereka berhasil”
      Dan kalau membaca artikelnya, tingkat keluaran yang kita bicarakan hampir persis setara dengan itu. Hal-hal seperti 10 atau lebih ide sepatu baru yang menargetkan pasar atau olahraga yang terabaikan, segmentasi pasar industri sepatu, siaran pers untuk promosi produk, dan memo inspiratif untuk karyawan tentang mengapa produk itu lebih unggul daripada pesaing
      Selain itu, pada tugas kedua, kelompok non-LLM jauh lebih baik
    • Saya tidak yakin makalah ini membuktikan banyak hal. Mengulang-ulang siaran pers lebih mirip pekerjaan ala burung beo stokastik
    • Tidak apa-apa kalau buruk dalam memprediksi. Yang sulit ditoleransi adalah ketiadaan total kalibrasi ulang
      Jika Anda membuat prediksi yang sangat buruk, itu berarti model Anda tentang objek tersebut meleset dan perlu diperbaiki
      Namun jika Anda terus membuat prediksi tanpa memperbaiki model sama sekali, itu masalah besar
    • Komentar itu sepertinya akan masuk hall of fame HN seperti orang yang dulu bilang Dropbox bisa dengan mudah digantikan oleh sesuatu seperti rsync
  • Seiring waktu, banyak pekerjaan kantor akan dioptimalkan dengan layanan seperti GPT
    Saya cukup peka secara teknis untuk tahu bahwa banyak pekerjaan kantor saya yang bisa diulang dan bisa ditangani dengan skrip, tetapi tidak sampai mampu menulis skripnya sendiri. Berkat ChatGPT, saya bisa membuat skrip-skrip itu, dan butuh sekitar 15–20 jam agar semuanya bekerja dengan sempurna
    Saya hanya tahu sedikit sekali scripting Python dan sama sekali tidak tahu hal-hal seperti pandas atau xlswriter, tetapi saya bisa membuat sesuatu yang menghemat 20–25 jam per minggu
    Ada banyak orang yang jago pemrograman di HN, sehingga mereka tampaknya meremehkan dunia yang dibuka layanan seperti ChatGPT bagi non-programmer. Sebaliknya, ini juga bisa membuat orang yang tidak punya rasa ingin tahu belajar lebih sedikit. Dulu, kalau ingin menghentikan beberapa layanan snapd dengan skrip, saya akan mencari di Google dan merangkai caranya sendiri, tetapi sekarang saya bertanya ke ChatGPT dan mendapat skrip yang berfungsi dalam waktu kurang dari satu menit

    • Sepenuhnya setuju. Saya mulai dari “apakah X mungkin, bagaimana caranya” dan berkali-kali berhasil membuat proof of concept kasar untuk masalah yang bahkan kata kunci pencariannya pun tidak saya ketahui
  • Ada dua hal yang patut disoroti dari abstraknya
    Disebutkan “18 tugas konsultasi realistis yang berada dalam batas kemampuan AI”. Dengan kata lain, mereka sengaja memilih tugas yang bisa dilakukan GPT-4. Karena ada banyak tugas yang tidak bisa dilakukan GPT-4, saat mengatakan kinerjanya meningkat besar, konteksnya harus dibatasi pada tugas yang cocok untuk GPT-4
    Selain itu disebutkan “pelaku di bawah rata-rata meningkat 43% dibanding skor mereka sendiri, sedangkan pelaku di atas rata-rata meningkat 17%”. Padahal hanya tugas yang sangat cocok untuk GPT-4 yang dipilih, peningkatan pelaku di atas rata-rata hanya 17%. Jika peningkatan seperti ini terlihat secara umum, itu tetap mengesankan, tetapi menurut saya 17% jauh lebih kecil daripada yang ingin dijual sebagian orang

    • Pelaku di bawah rata-rata mungkin lebih mudah menerima keluaran GPT apa adanya. Karena kemampuan mereka untuk meninjau dan mengedit lebih rendah
      Pelaku di atas rata-rata kemungkinan besar lebih banyak membongkar dan mengubah keluaran GPT karena percaya pada kemampuan mereka sendiri. Jadi kelompok di bawah rata-rata bisa membuat hasil akhir lebih cepat, dan karena ujian ini memiliki batas waktu, kecepatan mungkin penting
      ChatGPT sangat kuat dalam menghasilkan uraian panjang, dan teks pemasaran serta pesan inspiratif pada dasarnya memang bertele-tele. Dengan kata lain, tugasnya seolah dibuat khusus untuk ChatGPT tanpa bantuan, sehingga pelaku berkinerja tinggi justru dirugikan
    • Anda meremehkannya. Keuntungan akan terakumulasi secara majemuk
      Peningkatan kecil dalam efisiensi menjadi keunggulan besar dalam pertumbuhan jangka panjang. 17% pun merupakan peningkatan yang luar biasa