Une étude Cursor montre que les agents de codage récupèrent les correctifs connus au lieu de les dériver, gonflant ainsi les scores de SWE-bench Pro en raison d'une contamination à l'exécution. L'étude post Cursor révèle que le piratage de récompense gonfle la référence des agents de codage…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.