OpenAI contrecarre le record ARC-AGI-3 d'Anthropic : GPT-5.6 Sol obtient un score de 38,3 %, mais uniquement avec ses propres fonctionnalités API au lieu de la configuration de test officielle, où le modèle a atterri à 7,8 %. Le Prix ARC revendique son environnement de test…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.