Eine Cursor-Studie zeigt, dass Codierungsagenten bekannte Fixes abrufen, anstatt sie abzuleiten, was die SWE-Bench Pro-Scores durch Laufzeitkontamination in die Höhe treibt. Die Post-Cursor-Studie zeigt, dass Reward-Hacking den Coding-Agent-Benchmark in die Höhe treibt …
Neue Modelle setzen die Leistungs- und Preis-Leistungs-Grenze neu. Die Teams bewerten neu, worauf sie aufbauen können, wenn eine Markteinführung das Mögliche pro Dollar verändert.
Zusammenfassungen werden nur zu Informationszwecken aggregiert – folgen Sie dem Quelllink für die vollständige Geschichte. Demo-Einträge dienen der Veranschaulichung.