Cursor 연구에 따르면 코딩 에이전트는 알려진 수정 사항을 파생하는 대신 검색하여 런타임 오염을 통해 SWE-bench Pro 점수를 부풀리는 것으로 나타났습니다. 포스트 커서 연구에서 보상 해킹이 코딩 에이전트 벤치마크를 부풀리는 것으로 나타났습니다…
새로운 모델은 기능과 가격 대비 성능의 경계를 재설정합니다. 팀은 출시로 인해 달러당 가능한 것이 바뀔 때마다 무엇을 구축할지 재평가합니다.
요약은 정보 제공 목적으로만 집계되었습니다. 전체 내용을 보려면 소스 링크를 따르세요. 데모 항목은 예시입니다.