1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Pelanggan di semua paket dapat mengizinkan atau memblokir traffic otomatis dengan membaginya menjadi Search·Agent·Training, sehingga memungkinkan pengaturan kebijakan yang lebih granular dibanding pemblokiran bot AI secara menyeluruh yang sudah ada
  • Kriteria klasifikasinya bukan apakah AI digunakan, melainkan tindakan dan tujuan penggunaan konten yang dilakukan di situs; untuk crawler multiguna, semua aturan terkait diterapkan, dan pemisahan crawler berdasarkan tujuan direkomendasikan
  • Mulai 15 September 2026, pada halaman yang menampilkan iklan untuk domain baru, Training dan Agent akan diblokir secara default sementara Search diizinkan; untuk crawler multiguna seperti Googlebot, Applebot, dan BingBot, aturan yang paling restriktif akan diterapkan
  • Di BotBase untuk Enterprise Bot Management, pengguna dapat mencari klasifikasi dan ID deteksi bot serta agen yang dikenal; Cloudflare juga memperkenalkan tingkat penggunaan konten immediate, reference, dan full, serta sinyal use di robots.txt
  • Verified tidak lagi berarti otomatis diizinkan; melalui kepercayaan transitif menggunakan header Forwarded dari RFC 7239, Cloudflare berupaya meneruskan operator dan cara penggunaan konten hingga melampaui lapisan perantara

Mengapa traffic AI perlu dikontrol berdasarkan tujuan penggunaan

  • Dahulu, crawling web adalah hubungan yang mengembalikan traffic dari pencarian sebagai imbalan atas pengumpulan konten situs, tetapi pelatihan AI menimbulkan masalah karena mengambil konten tanpa mengembalikan nilai kepada pemilik situs
  • Setahun lalu, Cloudflare meluncurkan opsi sekali klik Block AI Bots dan Pay-Per-Crawl marketplace
  • Pemilik konten ingin melindungi karya asli dan mendapatkan kompensasi, tetapi sulit memenuhi kebutuhan ini hanya dengan memblokir semua otomatisasi secara menyeluruh
  • Situs kecil bisa berada pada pilihan antara mengizinkan pelatihan AI demi mendapat eksposur pencarian, atau memblokir pelatihan dengan risiko kehilangan keterlihatan
    • Struktur ini menguntungkan penyedia pencarian lama yang menggunakan bot yang sama untuk pencarian dan pelatihan
    • Bagi pemain baru yang ingin mempersempit kesenjangan persaingan, muncul insentif untuk menghindari deteksi
  • Dengan munculnya layanan seperti Google Search yang memberikan jawaban langsung di halaman hasil, kriteria yang lebih penting bukan apakah bot tersebut AI, melainkan apa yang dilakukan, disimpan, dan didistribusikan ulang olehnya

Klasifikasi Search·Agent·Training

  • Cloudflare membagi use case berfokus AI yang dapat dikelola semua pelanggan menjadi tiga kategori
    • Search: mengumpulkan atau mengindeks konten terlebih dahulu untuk menjawab pertanyaan di kemudian hari, dengan pemilik situs dapat mengharapkan traffic rujukan atau kompensasi yang setara
    • Agent: melakukan tugas real-time atas nama manusia, termasuk bot pengumpul chat seperti ChatGPT-User dan agen browser seperti Gemini serta Claude yang mengoperasikan Chrome
    • Training: mengambil konten untuk melatih atau melakukan fine-tuning model, sehingga data terserap secara permanen ke dalam struktur berbasis AI dan digunakan untuk meningkatkan performa
  • Karena satu crawler dapat memiliki beberapa tujuan, Cloudflare melacak semua klasifikasi yang relevan secara bersamaan
  • Untuk operator yang melakukan pembangunan indeks pencarian, tugas agen, dan pelatihan model sekaligus, Cloudflare menyarankan pemisahan menjadi tiga crawler berdasarkan tujuan agar tujuan kunjungan dan hak akses dinyatakan dengan jelas
  • Tindakan otomatis seperti verifikasi iklan, pengambilan feed, dan transaksi agen juga diklasifikasikan secara terpisah, tetapi untuk Search·Agent·Training disediakan fungsi yang dapat dikelola langsung oleh semua pemilik situs

Kontrol untuk semua paket dan default baru

  • Preset Block AI Bots yang ada sebelumnya terutama memblokir bot bertujuan tunggal untuk pelatihan model, sedangkan pengaturan baru menyediakan kontrol per Search·Agent·Training hingga paket Free
  • Mulai 15 September 2026, Cloudflare menerapkan default berikut pada halaman yang menampilkan iklan untuk domain yang baru didaftarkan di Cloudflare
    • Training dan Agent diblokir secara default
    • Search diizinkan secara default
  • Iklan adalah sinyal monetisasi yang dirancang untuk dilihat oleh manusia ketika mengunjungi halaman, sehingga Training dan Agent yang dapat menghalangi perhatian manusia diblokir
  • Search diizinkan secara default karena paling mendekati perilaku yang mengarahkan pengunjung ke situs
  • Untuk crawler multiguna yang melakukan Search dan Training sekaligus, aturan yang paling restriktif akan diprioritaskan
    • Bagi pelanggan yang memilih memblokir Training, Googlebot, Applebot, dan BingBot juga akan diblokir
    • Ini berlaku untuk opsi pengelolaan traffic AI baru maupun layanan Block AI Bots yang sudah ada
  • Pelanggan yang sudah ada dapat menolak perubahan di Security settings sebelum 15 September agar pengaturan lama tetap berlaku untuk crawler Training yang juga melakukan Search

Visibilitas bot dan klasifikasi perilaku yang disediakan BotBase

  • BotBase yang ditambahkan ke Enterprise Bot Management adalah database yang dapat dicari untuk traffic otomatis yang dikenal, termasuk bot dan agen Verified
  • Di dashboard Cloudflare, pengguna dapat melihat daftar lengkap bot dan agen Verified beserta klasifikasi baru
    • Dapat memfilter traffic dari bot tertentu
    • Dapat menyalin ID deteksi untuk digunakan dalam aturan Security
    • Layar khusus dapat diakses dari Bot Management configuration card
  • Pada tahap awal, fokusnya adalah visibilitas, dan pada paruh akhir 2026 Cloudflare berencana memperluasnya menjadi pusat pengelolaan untuk mengontrol langsung konten otomatis yang dikenal di situs
  • BotBase memberi satu atau lebih kategori berdasarkan tindakan yang dapat dilakukan bot di situs
    • Search: crawling untuk eksposur di hasil pencarian
    • Agent: agen yang mengunjungi halaman berdasarkan instruksi manusia
    • Training: crawling untuk pelatihan model atau fine-tuning
    • Transact: melakukan pembayaran atas nama pengguna
    • Data Collection: pengumpulan harga, intelijen kompetitif, analitik pihak ketiga
    • Security Testing: pemindaian kerentanan dan penetration testing
    • SEO: crawling SEO, audit situs, pemeriksaan aksesibilitas
    • Ads Verification: verifikasi penempatan iklan dan deteksi penipuan iklan
    • Social / Link Preview: pratinjau tautan dari platform sosial dan aplikasi pesan
    • Feed Fetching: RSS reader, pengumpul podcast, bot feed berita
    • Monitoring & Operations: pemantauan uptime, webhook, pemeriksaan status

Tingkat penggunaan konten dan sinyal robots.txt

  • Cloudflare sedang mengembangkan fungsi untuk mengelola cara bot menyimpan dan menggunakan ulang konten yang dikumpulkan berdasarkan tingkat penggunaan konten (content use)
    • immediate: hanya berinteraksi dan tidak menyimpan atau menggunakan ulang
    • reference: default yang mengindeks, mengutip sebagian, dan menautkan ke sumber asli
    • full: dapat merangkum dan mereproduksi konten
  • Dengan menggabungkan klasifikasi bot dan tingkat penggunaan konten, pengguna dapat membuat kebijakan seperti “izinkan Search·SEO·Ads Verification tetapi hanya sampai reference
  • Akses dapat diputuskan pada tingkat kelompok perilaku tanpa menulis aturan untuk tiap bot
  • Cloudflare menguji sinyal use di robots.txt sebagai perluasan Content Signals
    • use=immediate
    • use=reference
    • use=full
  • Nilai penggunaan konten di robots.txt tidak menegakkan pemblokiran secara langsung, melainkan menyampaikan preferensi pemilik situs
  • Untuk pelanggan yang menggunakan search=yes,ai-train=no pada managed robots.txt yang sudah ada, use=reference akan ditambahkan
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
  • BotBase juga melacak cara setiap bot menggunakan konten, dan bot yang menyalahgunakan sinyal akan kehilangan status Verified sehingga tidak lagi diizinkan
  • Bot yang mereproduksi konten secara penuh saat ini tidak dapat memperoleh status Verified

Makna Verified yang berubah

  • Dahulu semua bot Verified diizinkan secara default, dan kriteria ini tercermin dalam Bot Fight Mode serta template aturan Enterprise Bot Management
  • Sekarang bot yang tidak terverifikasi tetap diblokir secara default, tetapi bot Verified pun tidak otomatis diizinkan
  • Verified berarti bot tersebut dapat diterima dalam kategori terkait, sedangkan akses aktual ditentukan oleh apakah kategori tersebut, seperti Search, diizinkan
  • Untuk mendapatkan status Verified, operator bot harus memenuhi dua syarat
    • Menampilkan identitasnya secara jujur
    • Tidak menyalahgunakan hak akses yang diperoleh berdasarkan kejujuran tersebut
  • Cloudflare juga sedang mengembangkan alat untuk operator bot agar mereka dapat mengelola apakah operatornya sudah tercermin dengan akurat dalam klasifikasi Cloudflare

Kepercayaan transitif melalui platform perantara

  • Otomatisasi atau agen tidak selalu dijalankan langsung oleh perusahaan yang membuatnya; satu platform pengembang dapat menjalankan permintaan dari ribuan operator, mulai dari perusahaan hingga pengembang individu
  • Hubungan yang mengalir dari pemilik situs → perusahaan pemilik bot → pengguna akhir didefinisikan sebagai kepercayaan transitif (transitive trust)
  • Cloudflare mengusulkan cara memasukkan informasi operator yang hilang selama proses proxy ke dalam request menggunakan header Forwarded dari RFC 7239
Forwarded: for="openai"
  • Tingkat penggunaan konten juga dapat diteruskan bersamaan
Forwarded: for="openai";use="reference"
  • Jika sebuah situs mengizinkan operator tertentu, kebijakan yang sama dapat dipertahankan untuk request yang masuk melalui beberapa lapisan perantara tepercaya; format detailnya dapat dilihat di dokumentasi autentikasi bot web
  • Karena domain web yang berada di belakang Cloudflare melebihi 20%, kehilangan status tepercaya dapat menjadi alat penahan yang nyata bagi operator
  • Jika traffic bot dan manusia bercampur, kepercayaan transitif hanya dapat diterapkan kepada pengguna yang memiliki kemampuan untuk mengungkapkan identitasnya
    • Sumber traffic kecil memerlukan perlindungan privasi
    • Perusahaan yang ingin menjaga komitmen privasi memerlukan komponen alternatif seperti private rate limiting

Status penerapan dan prinsip operasional

  • Opsi traffic AI baru saat ini tersedia untuk semua pelanggan yang sudah ada dan dapat diatur di zone Settings
  • Default dan skema klasifikasi baru ini bertujuan menciptakan struktur di mana pemilik situs dapat menentukan siapa yang menggunakan konten dan bagaimana penggunaannya, sementara operator otomatisasi memperoleh lebih banyak akses jika semakin transparan dalam menyatakan tujuannya
  • Kebijakan detail akan terus disesuaikan mengikuti perubahan web dan traffic otomatis, tetapi prinsip yang menempatkan pilihan dan kepercayaan kreator konten sebagai pusat akan tetap dipertahankan

1 komentar

 
GN⁺ 3 jam lalu
Opini Hacker News
  • Googlebot menggunakan infrastruktur crawler yang sama untuk indeks pencarian dan pelatihan Gemini, sehingga mulai 15 September akan terkena kebijakan “blokir pelatihan” Cloudflare
    Karena aturan yang paling ketat diterapkan terlebih dahulu, di situs pelanggan yang memblokir pelatihan, crawler serbaguna seperti Googlebot, Applebot, dan BingBot juga akan diblokir

    • Cara Google memaksa pemilik situs untuk menyetujui pelatihan AI atau keluar dari pencarian terasa predatoris, tidak adil, dan tampak ilegal
      Mengingat peran hukum antimonopoli adalah mencegah tindakan seperti ini oleh perusahaan monopoli pencarian, semoga regulator UE setidaknya turun tangan; semua catatan crawling Googlebot di log akses bisa menjadi dasar ganti rugi
    • Googlebot menghujani sistem pelanggan dengan permintaan acak hingga nyaris menyebabkan gangguan, baru kemudian diketahui bahwa itu juga digunakan untuk pelatihan AI
      Menjengkelkan karena bahkan sulit menemukan lewat pencarian cara yang benar untuk menolak penggunaan konten seperti ini oleh Google
    • Terasa seperti ancaman terhadap perusahaan yang menolak pencurian konten
    • Pengguna tetap memakai pencarian dalam bentuk apa pun, dan entah itu model bahasa besar atau mesin pencari tradisional, seseorang harus mengindeks halaman
  • Sikap Cloudflare yang secara default memblokir crawling untuk pelatihan dan agen pada halaman yang menampilkan iklan di domain baru, sambil tetap mengizinkan pencarian, terasa melelahkan karena seperti menjejakkan kaki di kedua sisi perlombaan senjata
    Di satu sisi mereka menyediakan teknologi untuk membuat agen dan produk AI, sementara di sisi lain mendorong kebijakan seperti ini, sehingga sulit untuk dengan mudah memakai perusahaan tersebut
    Juga mengejutkan melihat mereka secara positif menonjolkan kekuasaan untuk memberi atau mencabut “status tepercaya” berdasarkan lebih dari 20% domain web

    • Sulit dikatakan mereka menjejakkan kaki di kedua sisi. Setahu saya produk scraping Cloudflare juga dimaksudkan agar berjalan secara terkendali tanpa melumpuhkan sistem
    • Tampaknya mereka berusaha membuat jalan tengah: bukan mengizinkan crawling tanpa batas, bukan pula memblokir semuanya, melainkan menyediakan alat agar produsen dan konsumen dapat bertransaksi berdasarkan izin dan kompensasi
  • Harap pertimbangkan penerapan proof-of-work (PoW) seperti Anubis alih-alih fitur Cloudflare
    Makin sering situs yang dilindungi Cloudflare memblokir sepenuhnya bahkan tanpa CAPTCHA; meski satu situs tidak penting, proses pilihan seperti ini mengikis fondasi internet dan terasa suram

    • Proof-of-work seperti Anubis tidak efektif. Bot makin sering memakai browser headless untuk menyelesaikan CAPTCHA dan proof-of-work serta melewati hampir semua pemblokiran, sehingga makin sulit mencegah traffic yang tidak diinginkan mengetuk situs dan layanan
    • Saya harap Anubis tidak digunakan karena pada perangkat keras lama dan smartphone murah, akses ke situs bisa memakan waktu beberapa menit
    • Jika tidak menjelajah dengan string user-agent Googlebot, semestinya bukan pemblokiran total, melainkan paling banter muncul tantangan Turnstile, yang tidak jauh berbeda dari tantangan Anubis
      Jika benar-benar diblokir total, kemungkinan besar itu keputusan pihak situs yang mengatur agar semua VPN atau pengguna di luar negara tertentu diblokir, bukan Cloudflare itu sendiri
    • Daripada benar-benar membuang komputasi untuk proof-of-work, bukankah lebih baik menambang Monero saja?
    • Tautan GitHub bagi yang penasaran: https://github.com/techaroHQ/anubis
  • Mengkhawatirkan ketika kita makin sukarela menyerahkan siapa yang boleh mengakses situs kepada satu perusahaan yang makin dominan
    Jika secara refleks memblokir “bot” dan “AI”, maka bahkan agen AI yang bekerja atas nama pengguna pun tidak bisa mengakses, sehingga premis kebijakannya juga keliru

  • Saya tidak tahu hasil akhir apa yang diinginkan Cloudflare dan web. Anthropic, DeepMind, OpenAI, dan Google tampaknya tidak akan membayar biaya crawling; mereka lebih mungkin membuat perjanjian tertutup dengan penyedia diskursus utama seperti Reddit
    Fungsi membawa informasi baru ke dalam konteks akan terus ada, tetapi itu berbeda dari scraping membabi buta

    • Tidak ada yang tahu hasil akhirnya. Keseimbangan lama seputar pengumpulan konten oleh mesin pencari pun sudah tidak nyaman, tetapi pernyataan bahwa bot AI hanya mengambil tanpa mengembalikan apa pun bukan berlebihan; itulah situasi saat ini
      Jika Google berhasil mengarah ke model yang menjawab pertanyaan secara langsung dan hampir tidak mengirim pengguna ke situs sumber, nilai ekonomi untuk memublikasikan konten di web secara luas akan hilang. Jika dibiarkan, Google akan diblokir secara teknis dan hukum sehingga tidak mendapatkan konten, dan semua pihak rugi
      Dunia tempat semua orang bekerja gratis sementara Google dan mesin AI saja yang mengambil nilai, atau dunia tempat produksi konten berhenti total, tidak berkelanjutan; namun tetap ada kemungkinan pada akhirnya hampir semua konten menjadi berbayar
      Namun pembayaran mikro sejauh ini gagal total, dan jika tidak ada cara untuk menurunkan friksi secara memadai, sebagian besar konten bernilai akan terkunci, biaya penemuan dan akses meningkat, dan seluruh industri konten bisa menyusut tajam. Jika hanya pembayaran bernilai besar yang tersisa, web komersial akan jauh lebih kecil dan mungkin lebih berkualitas, tetapi harganya akan besar
    • Ada perasaan campur aduk ketika Cloudflare secara sepihak mengambil keputusan yang memengaruhi aliran traffic seluruh internet
      Terlepas dari peran kepemimpinannya, keputusan seperti ini harus melibatkan IETF secara langsung agar semua pemangku kepentingan dapat dipertimbangkan; jika tidak, internet bisa terfragmentasi
    • Cloudflare tampaknya ingin menjadi pemungut pajak universal internet yang menarik 1 sen untuk setiap akses halaman
      Perusahaan besar yang sudah ada mungkin justru menyambutnya, karena mereka bisa menanggung biaya itu sambil membangun hambatan finansial besar bagi pendatang baru
    • Pilihannya hanya membayar atau mati, dan Cloudflare akan dengan senang hati memungut tol. Apple juga sudah memungut semacam pajak ini, misalnya dengan menerima 20 miliar dolar per tahun dari Google
      Pelanggan Cloudflare pun, selama mendapat bagian lewat layanan gratis atau murah, kemungkinan tidak akan peduli bagaimana perusahaan itu memperlakukan perusahaan AI besar
  • Saya penasaran apakah ada pengaturan untuk hanya mengizinkan Google, OpenAI, Grok, Claude, dan Perplexity lalu memblokir bot lainnya
    Saat ini hanya Google yang benar-benar mengirim pengunjung, tetapi layanan AI besar lain juga mungkin mengirimkannya di masa depan
    “Blokir bot anonim” juga bisa menjadi alternatif. Setelah bot AI meningkat, kami mengalami kerugian besar akibat permintaan masif dari IP rumahan yang meniru manusia sungguhan, dan traffic ini hanya menimbulkan biaya tanpa pendapatan
    Saya juga penasaran apakah Amazon CloudFront punya fitur yang membantu hal ini

    • Google kini aktif bergerak agar tidak perlu mengirim pengunjung ke situs
  • Saya berterima kasih karena Cloudflare adalah salah satu dari sedikit platform yang memungkinkan situs web memilih bagaimana berhubungan dengan AI, bahkan menyediakan cara memonetisasi traffic AI

  • Saya penasaran apakah ada kabar baru tentang program penagihan per crawling

  • Setelah mencoba memblokir pelatihan AI, bot pencarian Google ikut terblokir dan traffic turun separuh, jadi saya tidak menyarankannya

  • Saya penasaran apakah ada orang yang benar-benar memakai fitur seperti ini. Saya juga ragu scraper akan membayar, dan sekalipun membayar, saya skeptis mereka akan membayar cukup agar sepadan