NVIDIA a publié Nemotron 3 Ultra, un Mamba-Transformer hybride ouvert et mixte d'experts de 550 B au total (55 B actifs) pour les agents de longue durée. Il associe un contexte de 1 million de jetons à un débit d'inférence jusqu'à environ 6 fois supérieur à celui des concurrents.
L’approvisionnement informatique, l’énergie et la capacité du centre de données déterminent le coût de fonctionnement de l’IA. Les changements d’infrastructure apparaissent dans les coûts d’inférence des semaines plus tard.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.