OpenAI a examiné SWE-Bench Pro, un test largement utilisé pour mesurer les compétences en programmation des modèles d'IA, et a découvert qu'environ 30 % de ses tâches étaient interrompues. La société retire son approbation antérieure de l’indice de référence. Le un…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.