Gambar: The New StackAgen Coding Bisa Dievaluasi. Kita Hanya Perlu Mengevaluasi Hasil Kerjanya. - The New Stack
• The New Stack mengeksplorasi pergeseran dalam mengevaluasi agen coding AI yang bersifat non-deterministik, dengan argumen bahwa mereka harus dinilai berdasarkan output aktualnya daripada sebagai chatbot percakapan. • Metodologi yang diusulkan menggunakan kontrak yang dapat dieksekusi (executable contracts) dan lembar penilaian terperinci untuk mengukur keberhasilan fungsional dari kode yang dihasilkan oleh agen-agen ini. • Pendekatan ini penting karena benchmark LLM tradisional seringkali gagal menangkap apakah seorang agen benar-benar dapat menyelesaikan tugas rekayasa perangkat lunak yang kompleks dalam lingkungan dunia nyata.
thenewstack.io





