PerceptionBench de Moonshot AI teste dans quelle mesure les modèles d'IA multimodaux peuvent réellement « voir », indépendamment du raisonnement logique. Aucun modèle frontière n’atteint une précision de 60 %, et GPT-5.6 Sol est en tête de justesse. Beaucoup supposent…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.