Afbeelding: The New StackCoding agents kunnen worden geëvalueerd. We moeten alleen het werk evalueren. - The New Stack
• The New Stack onderzoekt een verschuiving in het evalueren van non-deterministische AI coding agents en betoogt dat ze beoordeeld moeten worden op hun feitelijke output in plaats van als conversationele chatbots. • De voorgestelde methodologie maakt gebruik van uitvoerbare contracten en gedetailleerde scorekaarten om het functionele succes van de door deze agents geproduceerde code te meten. • Deze aanpak is belangrijk omdat traditionele LLM benchmarks er vaak niet in slagen vast te stellen of een agent daadwerkelijk een complexe software engineering-taak kan oplossen in een real-world omgeving.
thenewstack.io



![[The AI Show Aflevering 228]: Meer 'Rogue' AI-agents, AI-labpersoneel vraagt Washington om ontwikkeling te vertragen, voortdurende strijd over Open Weights & OpenAI toont Astra previews](/_next/image?url=https%3A%2F%2Fpodcast.smarterx.ai%2Fhubfs%2Fep%2520228%2520blog%2520cover.png&w=1920&q=85)

