Image : The New StackLes agents de codage peuvent être évalués. Il suffit d'évaluer le travail produit. - The New Stack
• The New Stack explore un changement dans l'évaluation des agents de codage IA non déterministes, affirmant qu'ils devraient être notés sur leur production réelle plutôt qu'en tant que chatbots conversationnels. • La méthodologie proposée utilise des contrats exécutables et des fiches de score détaillées pour mesurer le succès fonctionnel du code produit par ces agents. • Cette approche est cruciale car les benchmarks LLM traditionnels ne parviennent souvent pas à déterminer si un agent peut réellement résoudre une tâche d'ingénierie logicielle complexe dans un environnement réel.
thenewstack.io





