Cursor 研究表明,编码代理会检索已知的修复程序,而不是派生它们,从而通过运行时污染夸大 SWE-bench Pro 分数。 Cursor 后研究发现奖励黑客行为夸大了 Coding-Agent 基准……
新模型会重置能力与性价比的前沿。每次发布改变「每美元能做什么」,团队就要重新评估该基于哪个模型构建。
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。