Um estudo do Cursor mostra que os agentes de codificação recuperam correções conhecidas em vez de derivá-las, aumentando as pontuações do SWE-bench Pro por meio da contaminação do tempo de execução. O estudo pós-cursor descobre que o hacking de recompensa aumenta o benchmark do agente de codificação…
Novos modelos redefinem a fronteira de capacidade e preço-desempenho. As equipes reavaliam o que desenvolver sempre que um lançamento muda o que é possível por dólar.
Os resumos são agregados apenas para fins informativos – siga o link da fonte para ver a história completa. As entradas de demonstração são ilustrativas.