Ini adalah pipeline untuk membuat short-form perkenalan anjing hanya dari rekaman ponsel. Masukkan beberapa video mentah dari ponsel dan satu paragraf permintaan berbahasa alami, lalu sekitar 4 menit kemudian akan keluar video vertikal 9:16 dengan subtitle dan narasi. Seluruh proses, dari deteksi hingga TTS, dirancang agar berjalan secara lokal di satu MacBook.
Tidak sulit memasukkan video ke LLM dan menghasilkan demo yang tampak meyakinkan. Sebagai gantinya, saya menetapkan tujuan untuk menjawab dua pertanyaan: apakah besok hasil yang sama bisa dibuat ulang, dan apakah hal yang dikarang AI tidak tercampur dengan hal yang ditetapkan manusia.
Struktur
- LLM hanya untuk interpretasi, eksekusinya deterministik. Gemma (lokal) hanya menangani penilaian semantik seperti nama gerakan, pemecahan permintaan editing, dan observasi adegan; sedangkan piksel, frame, dan timing seluruhnya ditangani Python/OpenCV/ffmpeg. Input yang sama menghasilkan output yang sama.
- Deteksi dan pelacakan ditangani YOLO11 + ByteTrack; re-identifikasi beberapa anjing ditangani embedding DINOv2 + anchor foto pemilik; penilaian bergerak/diam ditangani pengukuran residual ROI dengan kompensasi gerakan kamera. Sumbu yang secara struktural tidak bisa dilihat LLM, seperti motion dari satu still image, tidak diserahkan ke LLM.
- TTS disintesis secara lokal dengan Qwen3-TTS (mlx-audio) dan diperiksa melalui gate CER bolak-balik Whisper.
- Subtitle yang dikarang LLM dipecah menjadi klaim faktual lalu dibandingkan dengan catatan observasi video; jika tidak ada dasar, subtitle ditulis ulang. Subtitle yang ditulis langsung oleh pengguna tidak diperiksa.
Cara mengambil keputusan
- Semua perubahan model dan parameter diputuskan lewat penilaian golden set berlabel manual.
- Usulan perbaikan yang saya yakini pasti akan membuatnya lebih baik ternyata dua kali ditolak oleh penilaian golden set.
Angka
- 148 unit test, akurasi klasifikasi kelompok gerakan M4 sebesar 1,00
- Waktu pembuatan dipangkas dari 8 menit menjadi 4 menit untuk full lifecycle.
Batasan
Golden set berisi 5–9 video, satu domain, dan dikembangkan oleh satu orang. Ini ketelitian metodologi, bukan validasi skala.
Proses pengembangannya saya tulis berseri di blog.
Berlisensi MIT. Saya terbuka untuk diskusi tentang memindahkan metodologi ini ke domain lain atau pertanyaan mengenai tiap keputusan.
Belum ada komentar.