Immagine: The New StackGli agenti di coding possono essere valutati. Dobbiamo solo valutare il lavoro. - The New Stack
• The New Stack esplora un cambiamento nella valutazione degli agenti di coding AI non deterministici, sostenendo che dovrebbero essere giudicati in base al loro output effettivo piuttosto che come chatbot conversazionali. • La metodologia proposta utilizza contratti eseguibili e scorecard dettagliate per misurare il successo funzionale del codice prodotto da questi agenti. • Questo approccio è fondamentale perché i benchmark tradizionali degli LLM spesso non riescono a catturare se un agente sia effettivamente in grado di risolvere un compito complesso di ingegneria del software in un ambiente reale.
thenewstack.io





