Forscher der Princeton University haben den CEO-Bench entwickelt, einen Test, bei dem KI-Agenten 500 simulierte Tage lang ein fiktives Softwareunternehmen leiten müssen. Die meisten aktuellen Modelle gehen kaputt und eine einfache regelbasierte Heuristik ohne KI-Bea…
Neue Modelle setzen die Leistungs- und Preis-Leistungs-Grenze neu. Die Teams bewerten neu, worauf sie aufbauen können, wenn eine Markteinführung das Mögliche pro Dollar verändert.
Zusammenfassungen werden nur zu Informationszwecken aggregiert – folgen Sie dem Quelllink für die vollständige Geschichte. Demo-Einträge dienen der Veranschaulichung.