Afbeelding: The New StackCoding agents kunnen worden geëvalueerd. We moeten alleen het werk evalueren. - The New Stack
• The New Stack onderzoekt een verschuiving in het evalueren van non-deterministische AI coding agents en betoogt dat ze beoordeeld moeten worden op hun feitelijke output in plaats van als conversationele chatbots. • De voorgestelde methodologie maakt gebruik van uitvoerbare contracten en gedetailleerde scorekaarten om het functionele succes van de door deze agents geproduceerde code te meten. • Deze aanpak is belangrijk omdat traditionele LLM benchmarks er vaak niet in slagen vast te stellen of een agent daadwerkelijk een complexe software engineering-taak kan oplossen in een real-world omgeving.
thenewstack.io









