画像:The New Stackコーディングエージェントの評価は可能である。評価すべきはその成果物だ - The New Stack
• The New Stackは、非決定論的なAIコーディングエージェントの評価方法の転換について考察し、それらを対話型チャットボットとしてではなく、実際の出力結果に基づいて採点すべきだと主張している。 • 提案された手法では、実行可能なコントラクト(契約)と詳細なスコアカードを活用し、エージェントが生成したコードの機能的な成功を測定する。 • 従来のLLMベンチマークでは、エージェントが現実世界の環境で複雑なソフトウェアエンジニアリングタスクを実際に解決できるかどうかを正確に把握できないことが多いため、このアプローチが重要となる。
thenewstack.io









