Des chercheurs de l'Université de Princeton ont créé CEO-Bench, un test dans lequel des agents d'IA doivent diriger une société de logiciels fictive pendant 500 jours simulés. La plupart des modèles actuels font faillite, et une simple heuristique basée sur des règles sans intelligence artificielle…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.