图片:The New Stack编码智能体是可以被评估的,我们只需要评估其产出的工作成果 - The New Stack
• The New Stack 探讨了评估非确定性 AI 编码智能体的一种转变,认为应该根据其实际输出而非将其作为对话聊天机器人来进行评级。 • 该提议的方法论利用可执行合约和详细的计分卡,来衡量这些智能体所生成代码的功能性成功率。 • 这一方法的意义在于,传统的 LLM 基准测试往往无法捕捉到智能体是否能够在真实环境中实际解决复杂的软件工程任务。
thenewstack.io









