Bild: The New StackCoding Agents können evaluiert werden. Wir müssen nur das Ergebnis bewerten. - The New Stack
• The New Stack untersucht einen Wandel in der Bewertung nicht-deterministischer KI-Coding-Agents und argumentiert, dass diese anhand ihres tatsächlichen Outputs und nicht als konversationelle Chatbots beurteilt werden sollten. • Die vorgeschlagene Methodik nutzt ausführbare Verträge und detaillierte Scorecards, um den funktionalen Erfolg des von diesen Agents erzeugten Codes zu messen. • Dieser Ansatz ist wichtig, da traditionelle LLM-Benchmarks oft nicht erfassen, ob ein Agent eine komplexe Software-Engineering-Aufgabe in einer realen Umgebung tatsächlich lösen kann.
thenewstack.io





