Image : The New StackLes agents de codage peuvent être évalués. Il suffit d'évaluer le travail produit. - The New Stack
• The New Stack explore un changement dans l'évaluation des agents de codage IA non déterministes, affirmant qu'ils devraient être notés sur leur production réelle plutôt qu'en tant que chatbots conversationnels. • La méthodologie proposée utilise des contrats exécutables et des fiches de score détaillées pour mesurer le succès fonctionnel du code produit par ces agents. • Cette approche est cruciale car les benchmarks LLM traditionnels ne parviennent souvent pas à déterminer si un agent peut réellement résoudre une tâche d'ingénierie logicielle complexe dans un environnement réel.
thenewstack.io



![[The AI Show Épisode 228] : Davantage d'agents IA incontrôlés, le personnel des laboratoires d'IA demande à Washington de ralentir le développement, poursuite de la bataille sur les poids ouverts et OpenAI présente Astra](/_next/image?url=https%3A%2F%2Fpodcast.smarterx.ai%2Fhubfs%2Fep%2520228%2520blog%2520cover.png&w=1920&q=85)

