Les LLM agentiques échouent toujours de la même manière, car ils manquent de fonctionnalités spécifiques et réutilisables. TRACE de Stanford diagnostique ces lacunes à partir des propres trajectoires d'un agent, synthétise un environnement de formation vérifiable par capacité…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.