छवि: The New StackCoding agents का मूल्यांकन किया जा सकता है। हमें बस उनके काम का मूल्यांकन करना होगा। - The New Stack
• The New Stack गैर-नियतात्मक (non-deterministic) AI coding agents के मूल्यांकन में एक बदलाव की खोज करता है, यह तर्क देते हुए कि उन्हें संवादात्मक chatbots के बजाय उनके वास्तविक आउटपुट के आधार पर ग्रेड दिया जाना चाहिए। • प्रस्तावित कार्यप्रणाली इन agents द्वारा उत्पादित कोड की कार्यात्मक सफलता को मापने के लिए executable contracts और विस्तृत scorecards का उपयोग करती है। • यह दृष्टिकोण महत्वपूर्ण है क्योंकि पारंपरिक LLM benchmarks अक्सर यह पकड़ने में विफल रहते हैं कि क्या कोई agent वास्तव में वास्तविक दुनिया के वातावरण में एक जटिल सॉफ्टवेयर इंजीनियरिंग कार्य को हल कर सकता है।
thenewstack.io









