Prime Intellect a libéré prime-rl 0.6.0, un cadre open pour l'apprentissage par renforcement asynchrone sur des modèles Mixture-of-Experts de paramètres à trillion. Il a entraîné GLM-5 sur des tâches SWE jusqu'à une longueur de séquence de 131k, avec s…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.