- Nativ adalah aplikasi open-source berlisensi MIT yang mengunduh model AI terbuka dan menjalankannya di Apple Silicon Mac tanpa akun, langganan, atau cloud
- Menyediakan model dari Google, Cohere, Liquid AI, dan lainnya, merekomendasikan model yang cocok untuk hardware Mac, serta menghasilkan semua respons secara lokal
- Mendukung streaming, Markdown, penyorotan kode, dan input gambar dalam chat, serta memungkinkan pemantauan status performa seperti token per detik dan tekanan memori secara real-time
- Dioptimalkan untuk memori terpadu dan Metal pada seri M dengan MLX-VLM untuk menangani tugas bahasa, visi, video, kode, dan audio
- Server model lokal dapat dihubungkan dengan Pi, Codex, Claude Code, Hermes, dan OpenCode, serta seluruh kode aplikasi dan pemuat model juga dibuka
Menjalankan model lokal yang dioptimalkan untuk Mac
- Aplikasi macOS universal yang mendukung Apple Silicon M1 atau lebih baru, menjalankan model langsung di Mac tanpa cloud atau lapisan konversi tambahan
- Dari pustaka terkurasi, pengguna dapat memilih model terbuka dari Google, Cohere, dan Liquid AI, serta menerima rekomendasi model yang sesuai dengan hardware
- Antarmuka chat menyediakan fitur berikut
- Respons streaming dan metrik performa per pesan
- Markdown dan penyorotan sintaks kode
- Input gambar
- Melalui pengukuran performa real-time, pengguna dapat melihat token per detik, tekanan memori, kondisi panas, dan waktu hingga token pertama dihasilkan
- Berbasis MLX-VLM dan disetel untuk memori terpadu dan Metal pada seri M
- Mendukung chat LLM, pembuatan caption gambar, ringkasan video, pelengkapan otomatis kode, konversi suara, dan pembuatan audio
- Tidak memerlukan akun, kredit, atau langganan, dan tidak menjual data pengguna
Integrasi alat pengembang dan prinsip open-source
- Melalui satu endpoint lokal milik Nativ, agen coding yang sudah ada dapat dihubungkan ke model lokal yang berjalan di Mac
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Seluruh kode, termasuk aplikasi desktop, pemuat model, dan grafik pengukuran performa, dibuka untuk ditinjau, di-fork, dan menerima Pull Request
- Didistribusikan di bawah lisensi MIT tanpa roadmap ala VC, tanpa kelas enterprise, dan tanpa dark pattern yang mengubah prompt menjadi data pelatihan
- Pustaka model lengkap dapat dilihat di Hugging Face
1 komentar
Komentar Hacker News
Aplikasi berlisensi MIT ini dibuat oleh Prince Canuma, yang mengelola library populer MLX-VLM. MLX-VLM sudah lama digunakan sebagai dependensi untuk LM Studio dan lainnya karena dapat memberikan inferensi yang lebih cepat daripada llama.cpp di perangkat Apple
Ekosistem MLX memang lebih kecil daripada CUDA, tetapi sangat cepat mendukung model-model baru, khususnya model multimodal seperti visi, pengenalan suara, sintesis suara, dan pembuatan video. mlx-audio-swift juga layak dilihat, dan tidak akan mengejutkan bila model seperti ini diintegrasikan ke UI ini
Halaman landasnya mungkin menunjukkan jejak vibe coding, tetapi sebagian besar aplikasi ditulis dalam Swift, jadi stack inferensi ini juga tampak mudah dipindahkan ke iPad dan iPhone
blaizzydi domainnya. Pekerjaan MLX dari Prince Canuma memang secara konsisten berkualitas tinggimlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16untuk kloning suaraUntuk mendukung sampler terbaru, Anda bisa mulai melihat makalah 1, makalah 2, makalah 3
Istilah frontier tampaknya dipakai terlalu berlebihan. Saya kira itu berarti model kelas teratas seperti Fable saat ini, tetapi model seperti itu membutuhkan RAM besar dan GPU mahal sehingga sulit di-host sendiri
Ini cukup intuitif jika melihat grafik Artificial Analysis. Misalnya, tidak ada model yang secerdas DeepSeek V4 Pro namun lebih murah, jadi itu bisa dianggap model frontier. Solusi pada Pareto frontier adalah yang terbaik di kelasnya karena tidak bisa ditukar dengan alternatif yang lebih baik tanpa mengorbankan hal lain
Setiap kali memakai Gemma 4 12B, saya merasa model ini kecil, cerdas, dan efisien, tetapi energi industri AI justru sepenuhnya diarahkan ke arah yang salah. Jika dana riset difokuskan pada peningkatan model yang berjalan di sistem dengan memori terpadu 16GB, kemajuan penting bisa dicapai
Qwen 3.6 dan model fine-tuning 27B dari BottleCap juga bagus, tetapi performa mengejutkan dari model Gemma 4 kecil belum cukup dikenal. Meski situs ini memakai istilah frontier untuk Qwen 3.6 27B terasa kurang tepat, dari sisi performa itu bukan istilah yang sepenuhnya meleset
Mengejutkan karena beranda ini diperkenalkan seolah aplikasi yang sudah ada seperti LM Studio tidak eksis. Sekilas, tidak jelas apa bedanya, dan Open WebUI juga tidak disebut
Saya sudah beberapa minggu menjalankan DeepSeek V4 Flash secara lokal dengan Open WebUI dan DS4 di MacBook Pro
Sekarang frontier sudah menjadi kata yang terlalu sering disalahgunakan, seperti
load-bearingyang mungkin dikenal pengguna Claude Code. Tolong hentikan, apalagi aplikasi ini sebenarnya tidak bisa menjalankan model top-tier sesungguhnya secara lokal di MacSaya tidak suka frasa pemasaran seperti “mengapa kami open source sementara tidak ada yang lain”. Saya memakai oMLX yang open source, dan tampaknya sudah menyediakan semua fitur Nativ
Seharusnya mereka membandingkannya dengan baik terhadap produk kompetitor open source yang sudah ada, alih-alih menganggapnya tidak eksis
Penasaran model lokal kecil sebenarnya dipakai untuk apa. Memang sudah cukup mumpuni, tetapi masih sulit dipercaya untuk diberi pekerjaan nyata selain beberapa proyek mainan yang dibuat sekadar untuk iseng
Penasaran apakah benar-benar dipakai untuk agen coding, atau justru lebih sering untuk kegunaan lain
Sulit menulis dari nol kode yang memerlukan pengetahuan khusus, seperti mesin inferensi berperforma tinggi untuk GPU Blackwell, tetapi untuk PR umum yang menambahkan use case ke proyek yang sudah ada, levelnya mirip Sonnet. Tetap perlu konfigurasi yang tepat seperti pengaturan temperature dan top-p yang direkomendasikan, kuantisasi yang tidak berlebihan, serta konteks minimal 150 ribu token
Agen target memakai DeepSeek V4 Flash, dan model lokal terlalu lambat untuk dipakai sebagai agen chat, tetapi bekerja cukup baik untuk ekstraksi memori sehingga mengurangi penggunaan API di setiap giliran percakapan
--help, menulis Markdown, dan README. Kalau gagal, cukup kembalikan dengangit restoreatau tolak PR lalu serahkan lagi ke model yang lebih baikPenasaran apa kelebihannya dibanding LM Studio, dan apakah juga bisa menjalankan model MTP. Setahu saya model MTP berformat GGUF
Saya pernah mencoba MLX lewat Rapid MLX, tetapi Qwen terus tersendat dan mengulang hal yang sama. Setelah pindah ke llama.cpp, pembuatan token di MTP jadi lebih cepat dan modelnya juga lebih stabil
Penasaran hasil orang lain saat membandingkan MLX dan llama.cpp
Pada model yang saya uji, kadang performa GGUF di llama.cpp justru lebih baik. MTP di Gemma 4 tidak terlalu bernilai, tetapi pada Qwen 3.6 MoE ada perbedaan yang terukur, dan di hardware terbaru mungkin akan lebih berarti
Penasaran spesifikasi Mac kelas menengah yang cocok untuk kebutuhan ini. Saya sedang bimbang antara M5 Pro 64GB dan membeli M5 Air murah plus membayar biaya token cloud
Daripada menghabiskan 2.000~3.000 dolar tambahan untuk menjalankan model lokal yang performanya lebih rendah, uang itu bisa dipakai membeli cukup banyak token cloud
Penasaran kenapa tidak menjalankan DeepSeek V4 di atas ds4. Sepertinya hasilnya akan cukup bagus