Bild: The New StackCoding Agents können evaluiert werden. Wir müssen nur das Ergebnis bewerten. - The New Stack
• The New Stack untersucht einen Wandel in der Bewertung nicht-deterministischer KI-Coding-Agents und argumentiert, dass diese anhand ihres tatsächlichen Outputs und nicht als konversationelle Chatbots beurteilt werden sollten. • Die vorgeschlagene Methodik nutzt ausführbare Verträge und detaillierte Scorecards, um den funktionalen Erfolg des von diesen Agents erzeugten Codes zu messen. • Dieser Ansatz ist wichtig, da traditionelle LLM-Benchmarks oft nicht erfassen, ob ein Agent eine komplexe Software-Engineering-Aufgabe in einer realen Umgebung tatsächlich lösen kann.
thenewstack.io



![[The AI Show Episode 228]: Mehr außer Kontrolle geratene KI-Agenten, Mitarbeiter von KI-Laboren fordern von Washington ein langsameres Entwicklungstempo, anhaltender Kampf um Open Weights & OpenAI präsentiert Astra](/_next/image?url=https%3A%2F%2Fpodcast.smarterx.ai%2Fhubfs%2Fep%2520228%2520blog%2520cover.png&w=1920&q=85)

