Imagen: The New StackLos agentes de programación pueden evaluarse. Solo tenemos que evaluar el trabajo. - The New Stack
• The New Stack explora un cambio en la evaluación de los agentes de programación de IA no deterministas, argumentando que deberían calificarse por su resultado real en lugar de como chatbots conversacionales. • La metodología propuesta utiliza contratos ejecutables y tarjetas de puntuación detalladas para medir el éxito funcional del código producido por estos agentes. • Este enfoque es importante porque los benchmarks tradicionales de LLM a menudo no logran capturar si un agente puede realmente resolver una tarea compleja de ingeniería de software en un entorno del mundo real.
thenewstack.io









