1 poin oleh GN⁺ 3 jam lalu | 1 komentar | Bagikan ke WhatsApp
  • Echo mengombinasikan beberapa model bobot terbuka seperti GLM-5.2 dan Kimi K2.7 untuk tiap permintaan, menutupi keterbatasan pendekatan yang menyerahkan semua tugas ke satu model
  • Untuk setiap permintaan, Echo menentukan jumlah komputasi dan model yang dilibatkan, serta menyesuaikan cara menggabungkan hasil, sehingga prompt sederhana memakai lebih sedikit sumber daya inferensi
  • Dalam konfigurasi evaluasi pertama, Echo secara konsisten melampaui model individual terbaik di pool, dan mencapai hasil agregat yang mirip dengan Fable dengan biaya inferensi sekitar sepertiga
  • Meski model yang secara keseluruhan lebih lemah pun dapat berguna pada masalah atau kombinasi tertentu karena kemampuannya saling melengkapi, masih ada kasus ketika alokasi dan penggabungan diputuskan secara keliru
  • Antarmuka chat dan API yang kompatibel dengan OpenAI telah dibuka, dan pendekatan yang sama sedang diuji pada tugas coding serta agen, yang pengukuran kualitasnya lebih sulit

Pemilihan model dan penggabungan hasil

  • Dalam eksperimen awal, GLM-5.2, Kimi K2.7, dan lainnya dimasukkan ke evaluasi yang sama, lalu hasil diukur dengan asumsi bahwa untuk tiap soal sudah diketahui sebelumnya model mana yang berguna dan metode penggabungan output mana yang tepat
    • Sistem hipotetis ini menghasilkan kinerja yang jauh lebih tinggi daripada model individual mana pun yang termasuk dalam pool
    • Karena keputusan yang baik baru bisa diidentifikasi setelah melihat hasilnya, sistem ini tidak dapat digunakan untuk deployment nyata, dan Echo adalah upaya untuk memulihkan sebagian manfaat tersebut tanpa informasi sebelumnya
  • Berdasarkan karakteristik permintaan, Echo memilih jumlah komputasi yang diperlukan, model yang dilibatkan, dan cara menggabungkan hasil
    • Prompt sederhana dialokasikan inferensi yang relatif lebih sedikit
    • Pada masalah lain, beberapa model dikonfigurasi agar menangani bagian yang berbeda satu sama lain
  • Kemampuan model-model tersebut saling melengkapi, sehingga model yang performa keseluruhannya jelas lebih rendah pun bisa sangat berguna pada masalah atau kombinasi tertentu

Hasil evaluasi dan pengujian publik

  • Dalam konfigurasi evaluasi pertama, Echo mencatat performa yang secara konsisten lebih tinggi daripada model individual terbaik, dan mencapai hasil agregat yang kira-kira sama dengan Fable sebagai pembanding dengan biaya sekitar sepertiga
  • Pada sebagian permintaan, Echo salah memutuskan alokasi komputasi atau penggabungan model, dan saat ini kasus-kasus kegagalan tersebut sedang dianalisis
  • Untuk tugas coding dan agen, kualitas tiap keputusan jauh lebih sulit diukur, sehingga sedang diuji secara terpisah apakah pendekatan yang sama tetap berlaku
  • Untuk pengujian eksternal, tersedia antarmuka chat Echo dan API yang kompatibel dengan OpenAI
  • Video pengantar cara kerja serta metodologi evaluasi, hasil model individual, biaya, dan batasan saat ini telah dipublikasikan, dan mereka meminta masukan tentang kegagalan yang tidak biasa atau kasus alokasi sumber daya yang tidak intuitif

1 komentar

 
GN⁺ 3 jam lalu
Komentar Hacker News
  • Ini adalah dark pattern yang khas: menampilkan kolom input Message Echo yang terlihat seolah-olah bisa menerima respons, lalu mengarahkan pengguna ke halaman pendaftaran
    Saya langsung pergi karena tersandung sejak tindakan pertama yang diarahkan situs, dan tidak akan kembali lagi

    • Saya juga merasakan hal yang sama, dan sangat membenci dark pattern seperti ini sampai sekarang sama sekali tidak tertarik pada produk ini
    • Sedang kami hapus sekarang
    • Di sisi lain, jika permintaan diizinkan sebelum login, pembuatnya harus menanggung biaya kueri awal dan bisa terkena tagihan besar akibat penyalahgunaan
      Dari sudut pandang pembuat produk AI, ini juga pilihan yang bisa dipahami
  • Terima kasih kepada semua yang telah menggunakan Echo dan memberi masukan; justru karena alasan inilah kami meluncurkannya lebih awal
    Kami akan terus merilis evaluasi yang lebih akurat untuk menunjukkan jaraknya dengan SOTA terkini, termasuk benchmark coding dan agent yang lebih sulit, dan juga memperluas dashboard evaluasi publik. Masalah yang ditemukan pada UI dashboard evaluasi dan alur pendaftaran sudah diperbaiki di lingkungan produksi
    Mencoba Echo tidak memerlukan kartu kredit, dan setiap akun mendapat kredit gratis $10 yang bisa dipakai di API dan chat
    Lebih luas dari sekadar routing model sederhana, kami sedang mengeksplorasi cara mengalokasikan sumber daya inferensi secara efisien di antara model-model open-weight. Bukan hanya memutuskan model mana yang dipakai, tetapi juga berapa banyak komputasi yang diberikan pada suatu permintaan dan bagaimana hasil antara digabungkan
    Ensemble sendiri sudah dikenal sejak sebelum random forest, tetapi inti Echo adalah memodelkan dan memanfaatkannya tanpa membayar biaya keseluruhan ensemble untuk setiap permintaan. Meskipun secara konsep ada kemiripan dengan Fusion atau Fugu, arsitektur dan tujuan optimisasinya berbeda

    • Masukan kecil: create password mewajibkan karakter khusus, tetapi sandi bawaan yang dihasilkan Google Password Manager tidak memiliki karakter khusus
      Kombinasi alfanumerik dua digit tampaknya sudah cukup, tetapi idenya sendiri sangat bagus
    • Saya bertanya-tanya mengapa memakai dark pattern. Tadinya tertarik, sekarang sudah hilang
    • Saya baru mencoba mendaftar sekali tetapi sudah muncul error too many authentication attempts
    • Dark pattern itu harus dihapus
    • Terus menekankan open-weight tetapi sama sekali tidak mengungkap model apa yang digunakan
      Tanpa transparansi, saya tidak tahu keuntungan apa bagi pengguna akhir dari penggunaan model open-weight
  • Klaim "hasil setingkat Fable dengan sepertiga biaya" tampaknya tidak terlalu menarik bagi pengguna paket $200 per bulan yang sangat disubsidi
    Saya tidak tahu sampai kapan paket ini akan dipertahankan, tetapi selama itu masih ada, bahkan sepertiga harga API publik pun tidak terlalu menarik

    • Setelah menghabiskan kuota mingguan Fable di paket $200 per bulan, saya menjalankan rencana coding skala menengah dengan kredit promosi $200, dan $120 habis dalam 1 jam 15 menit
      Memang ada beberapa sub-agent yang berjalan bersamaan dan Claude lupa instruksi untuk memakai model murah sehingga beberapa instance Fable ikut berjalan, tetapi biaya per token tetap sulit ditanggung. $200 per bulan saja sudah mahal, tetapi $200 dalam semalam itu konyol
    • Pelanggan perusahaan yang memakainya untuk kerja tidak bisa memakai paket bersubsidi, jadi kemungkinan porsi paket seperti itu dalam total penggunaan hanya kecil
    • Paket ini mungkin akan dipertahankan sampai IPO, tetapi sepertinya tidak lama setelah itu
      Jika pengguna paket $200 per bulan memakai kredit API senilai $10.000, margin per pengguna menjadi -98% sehingga tidak membantu neraca laba rugi
    • Ceritanya berbeda jika tujuannya adalah menghindari batas pemakaian atau penangguhan akun saat melewati ambang batas
    • Menurut email yang saya terima hari ini dari Anthropic, Fable 5 akan beralih ke sistem kredit penggunaan mulai 20 Juli
      Tetap bisa digunakan, tetapi memerlukan kredit bayar sesuai pemakaian dan tidak dihitung dalam batas penggunaan paket langganan
  • Saya tidak akan terkejut jika dalam beberapa tahun ke depan konsep model terbaik menjadi sesuatu yang niche
    Dalam kebanyakan sistem produksi, pemenangnya bisa jadi adalah orchestrator yang tahu kapan memakai model murah, kapan beralih ke model kuat, dan kapan menggabungkan beberapa output

    • Saya penasaran apakah itu bukan ide di balik Gemini CLI
    • Ada sangat banyak cabang evolusi, tetapi pada akhirnya tampaknya akan mengerucut ke arah di mana model terbaik menjadi konsep yang niche
      Arus besarnya adalah model bawaan perangkat, dan model bahkan bisa masuk ke die chip sehingga chipset cukup diganti tiap beberapa tahun. Dalam lingkungan seperti itu, penyedia cloud besar akan dirugikan
  • Salah satu kesimpulan paling menarik adalah bahwa pemilihan model bisa lebih penting daripada ukuran model
    Industri selama ini fokus pada model yang lebih besar, tetapi jika permintaan dirutekan secara cerdas ke kombinasi model spesialis yang tepat, tampaknya perbaikan yang jauh lebih besar bisa didapat dengan biaya jauh lebih rendah
    Model yang lemah pun belum menjadi tidak berguna; masing-masing unggul di bidang berbeda, dan jika digabungkan dengan model lain nilainya bisa meningkat besar. Namun saya penasaran apakah ini juga berlaku untuk tugas coding dan agent di mana pemilihan model yang tepat jauh lebih sulit

    • Jika model-model kecil yang punya keahlian khusus di tiap tugas dan korelasi rendah diensambelkan dengan kuat, hasilnya bisa sangat menarik
      Tugas agent dan coding lebih kompleks karena tingkat granularitasnya. Harus diputuskan kapan dan bagaimana memakai tiap model, serta pada lapisan abstraksi mana—sesi, tujuan, tugas, giliran percakapan, atau tool call—dan ini sedang diteliti secara aktif
  • Saya benar-benar menemukan beberapa cacat pengalaman pengguna
    Thinking terus tampil sehingga terlihat seperti macet atau ada masalah jaringan, panel kiri tempat memasukkan prompt tidak bisa diperluas atau diubah ukurannya. Saat diminta membuat kode, output terus terputus lalu mulai lagi dari awal sehingga tidak bisa melanjutkan percakapan sebelumnya

  • Pendekatan ini tidak akan bekerja dengan baik jika kompleksitas masalah tidak bisa diketahui sebelumnya dan tidak ada jaminan percakapan berikutnya dikirim ke model yang sama
    Jika percakapan yang sama dikirim ke beberapa model secara round robin, cache akan rusak sehingga biayanya justru bisa lebih tinggi daripada sistem yang mempertimbangkan cache

  • Saya sudah cukup lama memakai Anthropic Opus 4.8 dan Fable 5, serta sempat menguji model OpenAI terbaru, tetapi semuanya menghasilkan terlalu banyak output yang tidak perlu
    Saya mulai mencoba model lain bukan karena harga, melainkan karena kualitas, dan di ranah pekerjaan saya GLM 5.2 jauh lebih unggul daripada Fable 5 dalam segala hal. Malah lebih mengejutkan jika ada kasus di mana model itu gagal menyelesaikan tugas dengan sukses
    Kimi K2.7 butuh instruksi yang sedikit lebih banyak, tetapi pengalaman memakainya lebih baik daripada Opus 4.8, sedangkan K3 belum sempat saya coba. Model OpenAI terbaru sangat buruk dalam kemampuan desain dan implementasi perangkat lunak
    Ini adalah penilaian yang terbatas pada ranah pekerjaan saya, yang banyak melibatkan analisis data, machine learning, dan rekayasa perangkat lunak

  • Tidak ada benchmark maupun informasi model yang digunakan, hanya video buatan AI dan halaman pendaftaran
    Ini mengingatkan saya pada lelucon arsitektur: “mengubah monolit menjadi microservices sehingga setiap gangguan terasa seperti misteri pembunuhan”

    • Evaluator publik tersedia di https://echo.tracerml.ai/eval/
      Saat ini mereka membuka 907 baris tersimpan dari 7 keluarga benchmark, dan Anda bisa melihat prompt, output, evaluasi, serta catatan biaya; katanya akan ditambah lagi
      Karena kebijakan routing per permintaan itu sendiri adalah produknya, mereka tidak membukanya, tetapi mereka bisa membuka sebagian daftar model open-weight yang dipakai, tanggal versi, rasio alokasi total, dan konfigurasi evaluasi selama tidak membocorkan rahasia per permintaan. Video baru juga sedang dibuat
    • Benchmark ada di https://echo.tracerml.ai/eval/
      Benchmark-nya memang tidak bagus, tapi setidaknya ada
    • Pada dasarnya ini tampak seperti upaya mereplikasi OpenRouter. OpenRouter adalah abstraksi infrastruktur yang cerdas dan bekerja cukup baik, dengan mengabstraksikan penyedia tertentu lewat failover, pengukuran penggunaan, switching otomatis, dan sebagainya
      Sangat disayangkan karena ini terlihat seperti upaya untuk berkata kepada investor, “OpenRouter sudah jadi unicorn, jadi saya juga bisa membuat sesuatu yang mirip dengan vibe coding,” alih-alih menyelesaikan masalah nyata
      Menyebutnya setingkat Fable juga terasa malas secara intelektual atau tidak jujur
    • Ini mengingatkan saya pada kalimat tenderlove: “microservices mengubah pemanggilan fungsi menjadi masalah komputasi terdistribusi
    • Setahu saya, aplikasi yang dilindungi login tidak diperbolehkan di Show HN
  • Saya jadi bertanya-tanya apakah ini membuat ulang Dogpile.com, yang dulu mengumpulkan hasil dari Ask Jeeves, AltaVista, dan Lycos. Waktu rasanya berputar

    • Ide yang bagus umumnya tetap bagus meskipun zaman dan alatnya berubah
    • Model ensemble juga selalu memberi performa terbaik di Kaggle
      Kami juga menerapkan pendekatan yang sama: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
    • Ini adalah pendekatan yang tidak memakai ukuran instance EC2 yang sama untuk semua pekerjaan di layanan
    • Anda bisa saja membuat roda segitiga, tetapi ada alasan mengapa roda itu bulat
    • Ini bisa dilihat sebagai Mixture of Models
      Produk gateway AI lain seperti OpenRouter, JusCode, dan Fireworks juga baru-baru ini merekomendasikan susunan serupa, jadi kemungkinan memang ada bagian yang berguna