1 poin oleh GN⁺ 2024-01-29 | 1 komentar | Bagikan ke WhatsApp
  • Mulai Brave browser desktop v1.62, LLM default untuk asisten browser AI berfokus privasi Leo berubah menjadi Mixtral 8x7B
  • Mixtral 8x7B adalah LLM open-source yang dirilis Mistral AI pada Desember, dan diintegrasikan ke Leo karena kecepatan, performa, serta karakter model terbukanya selaras dengan arah produk Brave
  • Brave menjelaskan bahwa berdasarkan LMSYS Chatbot Arena Leaderboard, Mixtral 8x7B mengungguli ChatGPT 3.5, Claude Instant, Llama 2, dan lainnya, serta menunjukkan perbaikan dalam pengurangan halusinasi dan bias pada benchmark BBQ
  • Baik Leo gratis maupun Premium seharga $15 per bulan sama-sama menyediakan Mixtral 8x7B sebagai default, tetapi versi gratis memiliki batas penggunaan yang lebih ketat dan Premium menawarkan batas yang lebih tinggi
  • Leo memproses permintaan secara anonim melalui reverse proxy, tidak menyimpan percakapan atau menggunakannya untuk pelatihan model, dan bisa dipakai dari address bar atau sidebar tanpa aplikasi terpisah

Model default Leo berubah ke Mixtral 8x7B

  • Brave mengganti model bahasa besar default Leo menjadi Mixtral 8x7B bersama pembaruan browser desktop v1.62
  • Leo adalah asisten browser AI berfokus privasi dari Brave yang memungkinkan penggunaan fitur AI langsung di dalam browser
  • Selain pergantian model, pembaruan ini juga mencakup onboarding yang lebih jelas, kontrol konteks, format input dan respons, serta peningkatan UI secara keseluruhan

Alasan memilih Mixtral 8x7B

  • Mixtral 8x7B adalah LLM open-source yang dirilis Mistral AI pada Desember, dan penggunaannya cepat meningkat di komunitas developer karena kecepatan dan performanya
  • Berdasarkan LMSYS Chatbot Arena Leaderboard, performanya melampaui ChatGPT 3.5, Claude Instant, Llama 2, dan lainnya
  • Berdasarkan BBQ benchmark, model ini juga menunjukkan peningkatan dalam hal pengurangan halusinasi dan bias
  • Fitur utamanya meliputi:
    • Pemrosesan konteks yang lebih besar
    • Interaksi dalam bahasa Inggris, Prancis, Jerman, Italia, dan Spanyol
    • Pembuatan kode

Pemanfaatan Mixtral di dalam produk Brave

  • Brave sudah menggunakan Mixtral pada Code LLM, fitur untuk kueri terkait pemrograman di Brave Search
  • Performa dan karakter open-source Mixtral sejalan dengan dukungan Brave terhadap model terbuka dan komunitas open-source
  • CTO sekaligus co-founder Brave, Brian Bondy, menyatakan bahwa Leo telah diadopsi oleh puluhan ribu pengguna gratis dan pelanggan berbayar, dan ia mengharapkan adopsi yang lebih besar dengan kehadiran Mixtral
  • CEO Mistral AI Arthur Mensch menilai positif penggunaan Mixtral di CodeLLM milik Brave Search dan di Brave Leo

Pilihan model gratis dan Premium

  • Leo memungkinkan pengguna memilih beberapa model sesuai kebutuhan dan anggaran
  • Mixtral 8x7B disediakan sebagai LLM default baik untuk versi gratis maupun Premium
  • Kedua paket juga mendukung Claude Instant dari Anthropic dan Llama 2 13B dari Meta
  • Ketentuan penggunaan Leo gratis adalah sebagai berikut
    • Mixtral 8x7B dan Claude Instant memiliki batas penggunaan yang ketat
    • Llama 2 13B memiliki batas penggunaan yang lebih tinggi
    • Saat batas penggunaan Mixtral tercapai, pengguna bisa kembali ke pengalaman Leo sebelumnya dengan Llama 2 untuk terus memakai AI
  • Leo Premium berharga $15 per bulan dan menyediakan Mixtral 8x7B, Claude Instant, dan Llama 2 13B dengan batas penggunaan yang lebih tinggi

Cara kerja perlindungan privasi

  • Chat Leo dirancang dengan prinsip privat, anonim, dan aman
  • Chat tidak dicatat, tidak digunakan untuk pelatihan model, dan penggunaannya tidak memerlukan akun atau login
  • Mekanisme perlindungan privasinya meliputi:
    • Reverse proxy: semua permintaan diproksikan melalui server anonimisasi sehingga permintaan tidak bisa dikaitkan dengan alamat pengguna
    • Respons langsung dibuang: respons Leo dibuang segera setelah dibuat, dan percakapan tidak disimpan di server Brave
    • Tidak mengumpulkan pengenal: tidak mengumpulkan identifier seperti alamat IP yang dapat dihubungkan ke pengguna
    • Tidak ada penyimpanan oleh penyedia pihak ketiga: model AI atau penyedia model pihak ketiga tidak menyimpan data pribadi
    • Tidak perlu akun: Leo bisa digunakan tanpa membuat akun Brave
    • Token langganan yang tidak dapat ditautkan: saat berlangganan Leo Premium, langganan diverifikasi dengan token yang tidak dapat menghubungkan informasi pembelian dengan penggunaan produk

Cara menggunakan dan cakupan ketersediaan

  • Leo terintegrasi ke dalam browser dan dapat digunakan tanpa aplikasi atau ekstensi terpisah
  • Pengguna Brave desktop dapat mengetik pertanyaan di address bar lalu mengklik “Ask Leo”, atau membuka Leo dari Brave Sidebar
  • Fitur AI dapat diakses melalui sidebar berbentuk chat di samping halaman web atau melalui address bar
  • Dalam konteks halaman, Leo mendukung tugas berikut:
    • Ringkasan real-time untuk halaman web atau video
    • Tanya jawab tentang konten
    • Pembuatan konten baru
    • Terjemahan halaman
    • Analisis halaman
    • Menulis ulang kalimat
    • Bantuan penulisan kode
  • Leo telah tersedia untuk pengguna Brave desktop sejak November, dan versinya adalah 1.60
  • Leo untuk Android dan iOS akan segera tersedia

1 komentar

 
GN⁺ 2024-01-29
Komentar Hacker News
  • Untuk menjalankan Mixtral 8x7B secara lokal, bisa pakai llama.cpp, dan bersama library/antarmuka pendukung seperti text-generation-webui, bisa menggunakan https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
    Bahkan versi kuantisasi 2-bit yang paling kecil pun memerlukan RAM 20GB, dan bisa di-offload ke VRAM GPU 4090 yang lumayan
    Versi kuantisasi 4-bit adalah model terbesar yang nyaris muat di sistem 32GB dan memakai sekitar 29~31GB
    Versi 6-bit butuh 41GB, 8-bit butuh 52GB sehingga memerlukan sistem 64GB, dan untuk meng-offload model dengan presisi lebih tinggi ke VRAM diperlukan beberapa GPU dengan memori bersama
    Saya sudah mencoba model 7B dan 13B, tetapi model ini maupun model besar lainnya belum sempat saya uji

    • Jika ingin performa terkait kode yang lebih baik, bisa juga mencoba fine-tuning dolphin-mixtral: https://huggingface.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGU...
    • Daripada beberapa GPU, mungkin juga cukup dengan mesin Apple Silicon yang kuat
      Saya mencoba dolphin mixtral 4-bit di MacBook M3 dengan RAM 36GB, dan inferensinya sangat cepat
    • 2-bit cukup buruk sehingga sulit direkomendasikan untuk penggunaan serius
    • Saya lebih memilih koboldcpp daripada llama.cpp
      Lebih mudah menjalankan model yang lebih besar dari VRAM dengan membaginya antara GPU/CPU
    • Saat membicarakan kebutuhan memori, panjang sekuens juga harus diperhatikan
      Mixtral mendukung 32.000 token, jadi bagian ini bisa mengambil porsi yang cukup besar dari memori yang digunakan
  • Brave patut dipuji karena fitur ini dan fitur privasi lainnya
    Dengan metode token langganan yang tidak dapat ditautkan, saat berlangganan Leo Premium, token untuk memverifikasi langganan diterbitkan ketika menggunakan Leo, dan Brave tidak dapat menghubungkan informasi pembayaran dengan riwayat penggunaan produk
    Bahkan email yang dipakai untuk membuat akun juga tidak ditautkan dengan penggunaan Leo sehari-hari, jadi ini adalah pendekatan kredensial privat yang cukup unik

    • Sangat keren dan saya ingin mencoba menambahkannya ke aplikasi saya juga
      Saya penasaran apakah ada yang tahu persis bagaimana ini bekerja tanpa memakai foreign key
  • Sepertinya saya melewatkan pengumuman Leo yang pertama, tapi ini menarik, dan saya suka desain yang memperhatikan privasi
    Fakta bahwa riwayat obrolan tidak disimpan adalah bagian yang saya inginkan

  • Saya penasaran siapa penyedia API yang bagus untuk Mixtral
    Saya hanya tahu OctoAI, dan itu tampak oke, tetapi saya juga ingin tahu alternatifnya

    • Perusahaan pembuat modelnya juga menjalankan platformnya sendiri, dan model ini serta model lain bisa dipakai lewat API: https://console.mistral.ai/
    • Saya baru menemukan Groq, dan katanya mixtral 8x7B-32k menghasilkan 485.08 token/detik
      Saya tidak tahu harganya, tetapi sepertinya cukup kirim email ke api@groq.com
    • OpenRouter umumnya pilihan yang bagus, dan yang terbaik adalah mereka menyediakan API terpadu untuk semua LLM
      Harganya juga sama dengan harga penyedia masing-masing
      Hanya saja untuk model OpenAI/Anthropic mereka harus mengaktifkan pemfilteran input/output karena tuntutan dari masing-masing perusahaan
    • Ini memang layanan yang sudah ada, tetapi saya cukup puas memakai Anyscale Endpoints
      Sangat cepat dan dengan pengaturan default saja bisa menangani 10 pekerjaan sekaligus
      Together.ai juga terlihat oke dalam pengujian awal, tetapi saya belum mencobanya dalam skala besar
    • Saya sudah memakai API komersial Mistral dan API komersial AnyScale untuk mixtral-8-7b, dan keduanya mudah digunakan
      Saya juga menjalankan versi kuantisasi 3-bit dari mixtral-8-7b di sistem M2 Pro dengan memori 32GB, dan cukup cepat
      Bagus kalau ada beberapa pilihan
  • Selama seminggu terakhir saya menjalankan versi yang ada di poe dan chat.groq.com
    Jauh lebih baik daripada llama 70b

  • Menarik bahwa mereka membuat kueri LLM bisa dilakukan langsung dari bilah alamat
    Saya penasaran apakah nantinya mereka akan membuat heuristik untuk menentukan apakah kueri harus langsung dikirim ke LLM atau memakai penyedia pencarian default

  • Setelah memakai gpt4 lalu beralih ke mistral, rasanya seperti melihat layar Retina lalu kembali ke layar beresolusi rendah
    Saya terus berpikir, “tapi GPT4 bisa melakukan ini”

    • Saya penasaran apakah Anda sudah mencoba mixtral
  • Saya sedang menjalankan Mixtral secara lokal dengan ollama

  • Saya penasaran apakah ada ekstensi Chrome yang bagus untuk merangkum halaman dengan AI
    Saya sudah mencoba beberapa hasil teratas di Google Search, dan walau berfungsi dengan baik, semuanya terasa terlalu gemuk karena punya terlalu banyak fitur yang tidak perlu