Même les meilleurs modèles d'IA échouent dans des tâches de travail réel, ne résolvant que 3 pour cent des tâches. L'article Nouveau benchmark révèle à quel point l'IA a du mal avec des tâches de travail réel a été publié d'abord sur The Decoder.
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.