Imagem: The New StackAgentes de codificação podem ser avaliados. Só precisamos avaliar o trabalho. - The New Stack
• O The New Stack explora uma mudança na avaliação de agentes de codificação de IA não determinísticos, argumentando que eles devem ser graduados por sua entrega real, em vez de serem avaliados como chatbots conversacionais. • A metodologia proposta utiliza contratos executáveis e cartões de pontuação detalhados para medir o sucesso funcional do código produzido por esses agentes. • Essa abordagem é importante porque os benchmarks tradicionais de LLM frequentemente falham em capturar se um agente consegue realmente resolver uma tarefa complexa de engenharia de software em um ambiente do mundo real.
thenewstack.io





