1 poin oleh GN⁺ 2024-04-07 | 2 komentar | Bagikan ke WhatsApp
  • SearXNG adalah mesin meta-pencarian yang menangani berbagai sumber pencarian, dan tidak melacak atau memprofilkan pengguna
  • Instalasi dilakukan melalui Installation guide resmi, dan penyesuaian detail diarahkan untuk merujuk ke Configuration guide
  • Panduan penggunaan tambahan terkait operasi dan administrasi dapat dilihat di area admin pada dokumentasi SearXNG
  • Sebagai kanal komunitas, tersedia ruang Matrix #searxng:matrix.org
  • Proyek ini dilisensikan di bawah GNU Affero General Public License yaitu AGPL-3.0

Peran SearXNG

  • SearXNG adalah metasearch engine
  • Pengguna tidak dilacak atau diprofilkan di SearXNG

Instalasi dan konfigurasi

Komunitas dan kontribusi

Lisensi

  • Proyek ini didistribusikan di bawah GNU Affero General Public License
  • Detail lisensi dapat dilihat di LICENSE

2 komentar

 
GN⁺ 2024-04-07
Komentar Hacker News
  • Jika ingin mencari hanya pada isi semua halaman di riwayat kunjungan browser atau hanya sebagian halaman yang dibookmark, lihat DownloadNet. Nama lamanya, dan mungkin akan dipakai lagi, adalah "DiskerNet"
    Terpasang ke browser untuk memberikan pengalaman penjelajahan yang diperluas, dan UI-nya sederhana seperti Google tahun 1997 tanpa CSS. Pencariannya juga belum menangani hal yang rumit, tetapi ke depannya mungkin bisa, dan saat ini pun sudah lumayan berguna
    https://github.com/dosyago/DownloadNet
    Selain itu, ini juga memungkinkan melihat semua konten yang pernah dikunjungi atau dibookmark bahkan dalam keadaan offline. Cocok untuk menyimpan sambil menjelajah seperti biasa di lingkungan yang perlu menghemat bandwidth satelit, seperti rig pengeboran minyak, kapal, atau pengangkutan kargo jarak jauh

    • Tidak kelihatan ada dokumentasi sama sekali, misalnya browser apa yang didukung
    • Saya kurang paham kenapa orang yang sedikit saja tertarik dengan topik tulisan ini ingin menjadi “arsiparis utama penjelajahan internetnya sendiri”
      Saya justru berharap tidak ada apa pun selain otak manusia saya yang menyimpan hal-hal terkait penjelajahan internet saya. Tentu ini hanya standar pribadi saya
      Tetapi saya tidak mengerti kenapa promosi seterbuka ini, yang bukan cuma melenceng dari topik, malah cocok dibahas di sini sebagai alat yang bertolak belakang dengan privasi pribadi sepenuhnya
    • Apa kelebihan ini dibanding YaCy?
  • Jadi teringat masa lalu. Sebelum Google, saya memakai alat meta-search untuk meningkatkan peluang menemukan jawaban yang layak di tengah hasil pencarian penuh spam dari AltaVista, HotBot, Lycos, dan semacamnya

    • Bukan cuma untuk menghindari spam, beberapa meta search engine, kalau tidak salah Dogpile, juga bisa mencari search engine khusus seperti White Pages atau Yellow Pages. Itu jauh sebelum Yelp muncul, jadi kita bisa menemukan daftar bisnis dan kontak yang sering tidak muncul di search engine web umum
      Juga bisa memasukkan hasil pencarian FTP, yang berguna pada masa ketika FTP anonim publik masih umum
    • Nostalgia sekali. Setelah beberapa dekade, sekarang ini seperti kembali lagi atas nama privasi digital
    • Saya suka Copernic. Itu adalah alat meta-search native Windows 9x
    • Northern Light juga lumayan
    • Ada juga Dogpile
  • Ini juga layak dicoba. Memang bukan Kagi, tetapi hasil pencariannya cukup bagus dan bisa di-host sendiri dengan Docker
    https://felladrin-minisearch.hf.space/

  • Bagus. Akan menyenangkan kalau ada cara untuk memblokir domain tertentu agar sama sekali tidak muncul di hasil pencarian
    Edit: sepertinya sudah ada issue yang dibuka
    https://github.com/searxng/searxng/issues/2351

    • Sebagai catatan, saya salah satu maintainer
      Maksud dari SearXNG adalah berjalan tanpa menyimpan state, tanpa sesi server, dan tetap berfungsi tanpa JavaScript
      Namun pendekatan ini membatasi beberapa fitur karena batas ukuran cookie. Bentuk penyimpanan browser lain memerlukan JavaScript
    • Google dulu punya fitur itu, tetapi dihentikan
      Sekarang pun masih bisa kalau setiap kali mencari Anda menambahkan syarat pengecualian secara manual, tetapi daftarnya bisa panjang dan sulit dibilang pengalaman pengguna yang baik
      Kagi punya fitur ini secara bawaan dan nyaman dipakai
      Anda juga bisa memakai ekstensi browser uBlacklist. Hanya saja dalam kasus saya, masalahnya semua jadi terasa lebih lambat
      Saya tidak yakin, tetapi sepertinya itu memfilter hasil nyata setelah pencarian selesai. Dua cara di atas membatasi agar hasil itu sejak awal tidak ikut dimasukkan
    • uBlacklist melakukan persis itu di Google dan beberapa search engine lain
      Saya memakainya di Firefox untuk menyaring sampah Pinterest dari hasil pencarian, dan tersedia juga untuk Chrome serta Safari
      https://github.com/iorate/ublacklist
    • Kagi punya fitur itu
  • Jika menjalankan ini di koneksi internet pribadi, ada risiko jadi tidak bisa memakai search engine

    • Itu hanya terjadi jika dibuka ke publik tanpa autentikasi dan kueri dirutekan melalui koneksi rumahan, dan itu bukan konfigurasi yang direkomendasikan
      Untuk penggunaan pribadi, cukup jalankan langsung di komputer sendiri atau akses lewat VPN. Kueri ke search engine hulu juga bisa dikirim lewat proxy atau VPN sesuai kebutuhan
      Sebagian bekerja baik juga lewat Tor, dan sebagian bisa dikirim lewat tunnel komersial atau buatan sendiri
    • Bagian ini tampaknya perlu penjelasan jauh lebih banyak daripada yang ada di thread ini
      Jika dijalankan secara lokal dan hanya dipakai sendiri, Anda tidak akan diblokir. Dari sudut pandang search engine tersebut, jumlah permintaannya akan terlihat hampir sama seperti jika dipakai langsung
      Kalaupun ada beberapa orang lagi di rumah yang memakainya, mestinya tetap tidak masalah
      Saya pernah menjalankan searx secara lokal selama sekitar 1–2 tahun dan tidak pernah ada masalah
    • Bisa dijelaskan lebih rinci?
  • Ada banyak instance searx yang di-host publik. Ada juga daftar instance publik online, dan jika mencari alat yang mengirim pencarian dari address bar browser ke instance acak setiap kali, Anda bisa memakai neocities: https://searx.neocities.org/changelog
    Saya memakainya terus. Kekurangannya adalah kadang-kadang mendapat instance yang sama sekali tidak memberi hasil atau sangat buruk. Belakangan ini hal seperti itu lebih jarang terjadi

  • SearXNG itu hebat, tetapi ada beberapa hal yang perlu diperhatikan
    Jika dijalankan pada mesin yang juga menyediakan NAT untuk banyak perangkat, ini membantu menghindari pemblokiran oleh search engine hulu seperti DuckDuckGo. Jika tidak bisa menjalankannya pada IP yang dipakai untuk keperluan lain, akan bagus jika ada fitur untuk mengirim akses ke search engine hulu tertentu lewat proxy terpisah. Masalah ini benar-benar umum
    Saya berharap ada mode pencarian literal 100% yang memastikan semua kata yang saya masukkan benar-benar harus muncul persis seperti itu dalam hasil. Mungkin semacam menambahkan "+" di depan tiap kata dan memberi tanda kutip pada tiap kata. Menjengkelkan ketika kata-kata terus diubah menjadi sesuatu yang jelas-jelas tidak saya inginkan hanya karena hasilnya dianggap terlalu sedikit
    Seperti juga disebut di tempat lain, saya ingin bisa secara eksplisit mengecualikan domain tertentu. Saya paham SearXNG ingin tidak menyimpan state, tetapi ini juga bisa diatur lewat URL terpisah atau pengaturan yang berlaku ke semua pencarian. Misalnya saat mencari manual PDF tertentu, saya sama sekali tidak ingin melihat situs seperti "manualslib.com"
    Akan bagus jika hal-hal seperti ini diperbaiki, tetapi selain itu, menjalankan SearXNG dan menyarankan orang-orang memakainya sebagai pengganti Google ternyata cukup berhasil

  • Semua orang mempromosikan Searx, tetapi secara pribadi saya suka presearch.com
    Saya tidak punya afiliasi apa pun dan tidak ada kepentingan finansial. Saya juga tidak tertarik pada model bisnis berbasis kripto mereka
    Sebenarnya saya merasa kurangnya penyaringan hasil ala Google atau Bing bukan karena sikap menjaga kebebasan berekspresi, melainkan karena kekurangan dana atau ada prioritas lain yang lebih penting bagi keberhasilan mereka. Mirip seperti masa awal internet, ketika tahap kebutuhan perusahaan lebih berfokus pada membuat sesuatu berjalan dulu, bukan pada hanya menampilkan sentimen yang bagus atau kata-kata yang dianggap benar
    Bagaimanapun, ketika saya mencari topik yang mungkin sangat difilter Google atau hal-hal yang sulit, saya melihat presearch untuk mendapatkan sudut pandang kedua. Akan bagus juga jika archive.org bisa melakukan hal serupa. archive.org punya data yang luar biasa banyak, tetapi pengindeksan dan kemudahan pencariannya kurang baik

  • Ini alat favorit saya untuk merata-ratakan hasil buruk dari berbagai search engine arus utama menjadi hasil yang lumayan bisa dipakai

  • Selama setahun terakhir saya menjalankan ini sebagai default di semua perangkat saya dan sangat puas. Hanya dua kali sempat rusak, dan setelah update langsung berfungsi baik lagi

 
GN⁺ 14 hari lalu
Pendapat di Hacker News
  • Saya pembuat asli Searx, tetapi tidak lagi terlibat dalam pengembangannya karena keterbatasan konsep metasearch. Proyek pencarian baru saya adalah https://github.com/asciimoo/hister (https://hister.org/)
    Hister adalah pengindeks khusus untuk situs web dan file lokal, dan secara otomatis menyimpan halaman yang dikunjungi yang dirender oleh browser
    Karena menyimpan isi halaman lengkap, pratinjau hasil secara offline dan penyediaan halaman penuh melalui MCP menjadi memungkinkan
    Contoh penggunaan MCP bisa dilihat di sini: https://hister.org/posts/give-your-ai-assistant-a-private-me...

    • Saya sedang mencari cara untuk memperkaya informasi yang berguna bagi LLM self-hosted dan alat agen. Alat metasearch seperti SearXNG mengurangi kemungkinan terkena deteksi bot saat mencari informasi, tetapi biasanya yang ingin dimasukkan ke dalam alat adalah informasi yang sudah pernah ditemukan, dibaca, atau dilihat
      Saya menyimpulkan bahwa konfigurasi ideal bagi saya adalah repositori konten self-hosted yang mengekstrak dan menyimpan isi serta metadata halaman web melalui mesin pencari dan ekstensi browser; kalau bisa, saya juga menginginkan berbagi konten secara federatif serta impor konten Creative Commons seperti Wikipedia dan Gutenberg
      Hister tampaknya hampir persis seperti yang saya inginkan, dan saya ingin mencoba audit kode serta deployment dalam beberapa minggu ke depan
    • Hister mendekati sesuatu yang sudah lama saya inginkan tetapi belum sempat saya buat. Sebagian besar hal yang saya lakukan dengan mesin pencari adalah mencari sesuatu yang pernah saya lihat sebelumnya, jadi kalau bisa menemukannya dengan cepat secara lokal, itu akan sangat bagus
    • Saya juga menggunakan semacam mesin pencari buatan sendiri
      Hanya mengunduh judul, deskripsi, thumbnail, dan field Open Graph umum, dan menurut saya indeksnya cukup ringan. Halaman yang sudah dirayapi ada 2 juta
      https://github.com/rumca-js/Internet-Places-Database
      Mendukung fitur tag dan voting
      Baru-baru ini saya juga merilis aplikasi F-Droid pertama
      https://github.com/rumca-js/OfflineWebSearch
      https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
    • Kelihatannya bagus, tetapi saya juga penasaran apakah Anda bisa menjelaskan lebih jauh apa saja keterbatasan konsep metasearch itu
    • Sekitar 20 tahun lalu, seorang teman membuat proxy lokal yang mengumpulkan semua traffic web dan menggunakannya seperti memori jangka panjang. Ada antarmuka web, sehingga ia bisa dengan cepat menemukan sesuatu yang dilihat sekitar sepuluh hari sebelumnya, atau algoritma tertentu yang terlintas di kepala tetapi namanya tidak diingat
      Selama bertahun-tahun saya mengumpulkan berbagai tautan terkait pekerjaan dan menggunakannya setiap hari, untuk menjawab pertanyaan acak dari teman atau kolega seolah-olah menarik kelinci dari topi. Misalnya, jika ada yang bertanya ide palet warna untuk grafik data, saya bisa langsung memberikan riset ilmiah terkait; begitu juga untuk algoritma yang kurang dikenal
      Seiring waktu koleksinya menjadi cukup besar sehingga mencari yang tepat menjadi sangat merepotkan, dan saya penasaran apakah proyek ini cocok untuk masalah saya
  • Ini terlihat seperti alat inti untuk menyediakan pencarian bagi model lokal
    Saya penasaran konfigurasi seperti apa yang digunakan orang lain untuk menyediakan fungsi ini
    Setelah model Gemma terkuantisasi dengan 24 miliar parameter keluar, pemanggilan alat berjalan dengan baik di 4070 Ti Super, dan berkat pemanggilan alat yang sukses, lingkungan lokal akhirnya terasa layak dipakai
    Sebagai catatan, ini bukan khusus untuk coding, melainkan dalam konteks umum

    • Ada mode JSON yang harus diaktifkan di pengaturan; setelah itu bisa berinteraksi lewat skrip Python sederhana, atau agen bisa menanganinya dengan curl dan jq
      Ada di bagian paling bawah halaman ini: https://docs.searxng.org/admin/settings/settings_search.html
    • Saya memakai TinySearch MCP. Namun jika memakai Unsloth Studio, sebagai gantinya ia memanggil HTML API DuckDuckGo, dan itu bekerja cukup baik
    • Saya juga penasaran seperti apa stack AI lokal lengkap yang mencakup pencarian web dan alat lain. Sepertinya SearX tidak memiliki server MCP bawaan, jadi misalnya tidak bisa dipanggil langsung dari llama-server
      Open WebUI memiliki integrasi dengan SearX dan penyedia lain, tetapi hasil yang saya dapatkan tidak terlalu mengesankan
    • Saya penasaran apakah Anda menjalankan model terkuantisasi. Seorang teman yang memiliki 4080 ingin mencoba eksperimen model lokal, dan karena kartu itu kira-kira mirip, saya akan senang jika Anda bisa menjelaskan konfigurasinya sedikit lebih detail
  • Saya sudah memakai SearXNG sebagai mesin pencari internet default selama lebih dari 5 tahun, dan juga menyiapkan alternatif seperti backend YaCy. Dengan konfigurasi ini, saya juga membuat pencarian dokumen internal atau aplikasi RAG, dan SearXNG juga mendukung hasil JSON
    Namun, ada kekurangan yang harus diterima demi privasi. Lebih lambat dan kualitas hasilnya lebih rendah dibanding pencarian lain, tetapi untuk sebagian besar kueri sudah cukup cepat dan cukup bagus
    Kadang diblokir oleh pencarian seperti DuckDuckGo atau Brave sehingga harus menyelesaikan CAPTCHA, dan ini bisa dihindari jika memakai API key
    Jika memakai backend sendiri, kita bisa memberi prioritas pada hasil, jadi misalnya jika kita sudah meng-crawl small web atau situs yang penting bagi kita, situs-situs itu akan muncul di bagian atas hasil pencarian

    • Saya juga sudah memakai SearXNG setiap hari selama lebih dari 5 tahun
      Saya penasaran apakah Anda menjalankan instance YaCy sendiri dengan “sangat cepat”, atau ada konfigurasi tertentu
      Dalam pengalaman saya, YaCy men-stream hasil secara perlahan selama sekitar 30 detik, jadi kurang cocok sebagai backend SearX
      Saya juga menyediakan file ZIM seperti Wikipedia, Wiktionary, Gutenberg, ArchWiki melalui kiwix-serve lokal, tetapi mesin pencari Kiwix [0] juga mengembalikan terlalu banyak hasil sehingga mengotori halaman hasil SearX, jadi tidak terlalu cocok sebagai backend
      Saya belum mencoba menghubungkan SearX ke instance Recoll lokal [1]. Recoll tidak mendukung indeks file ZIM, tetapi mungkin berguna untuk dokumen HTML arsip lain
      Pencarian sulit dibuat dengan benar, jadi kalau ada konfigurasi yang benar-benar berjalan baik, saya ingin tahu lebih banyak
      [0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
      [1] https://docs.searxng.org/dev/engines/online/recoll.html
  • Saya sudah memakai SearXNG selama beberapa tahun. Karena sensor jaringan GFW yang tidak manusiawi dan deteksi proxy oleh mesin pencari, saya tidak menjalankan instance sendiri dan bergantung pada daftar instance publik [1] serta libredirect [2]
    Layanan satu instance memang tidak terjamin, tetapi kita bisa beralih ke instance lain yang tersedia dalam waktu kurang dari 1 menit dengan biaya nyaris nol
    Sulit mengatakan bahwa SearXNG membantu keluar dari Google. Sebab, mesin metasearch memanggil mesin pencari lain seperti Google untuk mengumpulkan hasil
    Meski begitu, dengan memakai SearXNG, hal-hal seperti ringkasan AI bisa segera dihindari
    [1] https://searx.space
    [2] https://github.com/libredirect/browser_extension

    • Untuk memastikan instance publik berfungsi dengan baik belakangan ini, kita harus mencoba cukup banyak instance. SearXNG membutuhkan quality control yang lebih baik
      Sering kali perlu masuk ke pengaturan untuk menonaktifkan mesin pencari yang tidak berfungsi, atau memilih engine yang berjalan baik. Biasanya karena instance diblokir, jadi ada masalah reliabilitas
      Engine mana yang berfungsi berbeda-beda di tiap instance publik, jadi menyimpan hash pengaturan pun tidak selalu berhasil
      Akan bagus jika SearXNG otomatis menyesuaikan mesin pencari yang ditampilkan berdasarkan reliabilitas, atau menyediakan opsi semacam itu
  • Saya sudah menggunakannya sebagai engine default untuk semua pencarian dengan self-hosting selama beberapa tahun, dan sangat merekomendasikannya

    • Saya baru tahu harga Exa belakangan ini cukup mahal, jadi saya harus mencoba SearXNG. Terutama untuk kasus mengambil 30–40 sumber per pencarian; saya memakainya sebagai default lalu kaget ketika menerima tagihan
  • TinySearch membungkus SearXNG dan bekerja dengan baik untuk agent. Lebih baik daripada MCP SearXNG native, karena ia mengoptimalkan konteks sebelum mencapai agent sehingga tidak membuang token
    https://github.com/MarcellM01/TinySearch

    • Terakhir kali saya cek, SearXNG tidak punya server MCP bawaan
  • Jika dihubungkan ke Brave Search API, ia bekerja dengan baik, tetapi jika dipakai sebagai scraper, cukup tidak stabil. Google berhenti berfungsi sejak beberapa hari lalu

  • Saya membuat https://github.com/denysvitali/searxng-mcp untuk dipakai sebagai MCP bagi coding agent. Ia bekerja sangat baik sampai terkena rate limit dari provider, misalnya DuckDuckGo
    Untuk menjalankannya juga diperlukan server SearXNG, jadi belakangan saya beralih arah ke solusi standalone, yaitu https://github.com/denysvitali/search-mcp

    • Saya membuat sesuatu yang mirip ([1]) dan mungkin menarik. Mirip dengan proyek tersebut, tetapi ada perbedaan menarik: searxng dibundel di dalamnya, sehingga tidak perlu menjalankan atau mencari instance SearXNG terpisah
      [1]: https://github.com/nikvdp/searxng-ai-kit
  • Saya sudah cukup lama sangat menyukai SearXNG. Antipati saya terhadap Google makin besar, dan hebat rasanya bisa mencari sambil menghindari hal-hal seperti model AI kecil yang dipasang di PC tanpa persetujuan saya

  • Saya selalu menyukai tool ini, tetapi saya masih bimbang seberapa besar manfaatnya bagi privasi jika pencarian dikirim bukan ke satu perusahaan, melainkan ke 280 perusahaan