Nvidia met sa puce d'inférence Groq 3 LPX en pleine production et rapporte 3 400 jetons par seconde sur Gemma 4 31B, quatre fois plus rapide que Cerebras. Mais les chiffres ne disent pas tout. Nvidia a besoin d’au moins…
L’approvisionnement informatique, l’énergie et la capacité du centre de données déterminent le coût de fonctionnement de l’IA. Les changements d’infrastructure apparaissent dans les coûts d’inférence des semaines plus tard.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.