Uno studio di Cursor mostra che gli agenti di codifica recuperano le correzioni note invece di derivarle, gonfiando i punteggi di SWE-bench Pro attraverso la contaminazione del runtime. Lo studio post Cursor rileva che l'hacking delle ricompense gonfia il benchmark degli agenti di codifica...
I nuovi modelli ripristinano la frontiera della capacità e del rapporto prezzo-prestazioni. I team rivalutano su cosa costruire ogni volta che un lancio cambia ciò che è possibile fare per ogni dollaro.
I riepiloghi sono aggregati solo a scopo informativo: segui il collegamento alla fonte per la storia completa. Le voci demo sono illustrative.