LenserFight: Platform lokal pertama untuk mengevaluasi agen AI dan prompt
LenserFight, oleh Conectlens, adalah platform terbuka untuk merancang dan menguji agen AI, prompt yang dapat digunakan kembali, dan alur kerja evaluasi. Ini berfungsi sebagai laboratorium AI yang memungkinkan tim untuk membuat "Lenses" yang memiliki versi, menjalankan alur kerja grafik asiklik terarah, dan mengadakan acara evaluasi yang menggabungkan penilaian rubrik dengan penilaian manusia. Alat ini mencakup server Model Context Protocol (MCP), opsi eksekusi model lokal, dan arena publik untuk log bersama. Pengguna target adalah pengembang AI, insinyur prompt, dan peneliti yang fokus pada evaluasi yang dapat direproduksi dan pengujian pribadi.
Tugas apa yang dapat Anda tentukan dan reproduksi di platform?
Platform ini memperlakukan tugas sebagai "Lens" formal, spesifikasi versi yang menggabungkan prompt, rubrik evaluasi, dan skema opsional untuk output terstruktur. Lenses berfungsi sebagai kasus uji yang dapat digunakan kembali sehingga tim dapat menjalankan instruksi identik di berbagai model dan mempertahankan versi untuk auditabilitas. Desain ini mendukung artefak evaluasi terstruktur daripada prompt ad-hoc, yang membantu saat membandingkan hasil di berbagai jalannya model atau mereplikasi eksperimen.
Bagaimana skor evaluasi diproduksi dan dibandingkan?
Peristiwa evaluasi menggunakan model penilaian ganda, memadukan penilaian rubrik otomatis dengan suara manusia yang dipimpin komunitas untuk menghasilkan papan peringkat publik dan peringkat gaya ELO. Kombinasi ini bertujuan untuk menyeimbangkan metrik rubrik objektif dengan penilaian manusia kualitatif. Keandalan tergantung pada desain rubrik dan pengambilan suara manusia, sehingga perbandingan hanya dapat direproduksi sebagaimana Lenses dan log eksekusi yang tercatat yang menyertai setiap jalannya.
Input dan lingkungan eksekusi apa yang didukung?
Server MCP mengekspos lebih dari tiga puluh alat untuk integrasi dengan klien Model Context Protocol, dan platform mendukung orkestrasi model lokal melalui Ollama, vLLM, dan llama.cpp. Klien berbasis web terintegrasi melalui OAuth 2.1 PKCE. Opsi-opsi tersebut memungkinkan tim menjalankan eksperimen yang terhubung ke cloud dan offline, memungkinkan pengujian berdampingan antara asisten lokal dan jarak jauh melalui satu titik akhir MCP.
Bagaimana platform ini cocok dalam alur kerja yang memperhatikan privasi?
Proyek ini mengadopsi sikap lokal-pertama, memungkinkan jalannya model offline untuk pengujian dan privasi data, sambil juga menawarkan arena komunitas publik untuk log dan walkthrough yang dibagikan. Basis kode bersifat open source di GitHub dan proyek ini berada dalam fase beta eksperimental, jadi organisasi harus merencanakan pengembangan aktif, moderasi komunitas dari Pertempuran, dan fase pengaturan teknis sebelum mengandalkannya untuk evaluasi formal.
Platform ini cocok untuk tim yang terampil secara teknis yang mencari perbandingan model yang dapat direproduksi dan dikendalikan secara lokal
Platform ini adalah opsi praktis bagi pengembang AI dan peneliti yang menerima overhead konfigurasi untuk mendapatkan artefak uji yang terverifikasi dan kontrol eksekusi lokal. Status beta eksperimentalnya dan model evaluasi yang didorong oleh komunitas berarti hasil memerlukan desain rubrik yang hati-hati dan moderasi agar dapat diandalkan. Bagi tim yang memprioritaskan pengukuran yang dapat direproduksi dan menjalankan model lokal, platform ini memberikan kerangka evaluasi yang jelas; bagi pengguna non-teknis, kompleksitas pengaturan dapat membatasi kegunaan langsung.