Gambar: The New StackAgen Coding Bisa Dievaluasi. Kita Hanya Perlu Mengevaluasi Hasil Kerjanya. - The New Stack
• The New Stack mengeksplorasi pergeseran dalam mengevaluasi agen coding AI yang bersifat non-deterministik, dengan argumen bahwa mereka harus dinilai berdasarkan output aktualnya daripada sebagai chatbot percakapan. • Metodologi yang diusulkan menggunakan kontrak yang dapat dieksekusi (executable contracts) dan lembar penilaian terperinci untuk mengukur keberhasilan fungsional dari kode yang dihasilkan oleh agen-agen ini. • Pendekatan ini penting karena benchmark LLM tradisional seringkali gagal menangkap apakah seorang agen benar-benar dapat menyelesaikan tugas rekayasa perangkat lunak yang kompleks dalam lingkungan dunia nyata.
thenewstack.io



![[The AI Show Episode 228]: Lebih Banyak Agen AI Nakal, Staf Lab AI Meminta Washington Mengatur Kecepatan Pengembangan, Pertarungan Berlanjut Mengenai Open Weights & OpenAI Pratinjau Astra](/_next/image?url=https%3A%2F%2Fpodcast.smarterx.ai%2Fhubfs%2Fep%2520228%2520blog%2520cover.png&w=1920&q=85)

