Die neue Metrik von METR, der „Ausgabenhorizont“, gibt einen Dollarwert dafür an, wie kosteneffektiv KI-Agenten bei der Lösung von Problemen sind. Die ersten Ergebnisse des NanoGPT-Speedruns sind enttäuschend, die Metrik weist blinde Flecken auf und die neuen …
Neue Modelle setzen die Leistungs- und Preis-Leistungs-Grenze neu. Die Teams bewerten neu, worauf sie aufbauen können, wenn eine Markteinführung das Mögliche pro Dollar verändert.
Zusammenfassungen werden nur zu Informationszwecken aggregiert – folgen Sie dem Quelllink für die vollständige Geschichte. Demo-Einträge dienen der Veranschaulichung.