Amazon SageMaker Inference propose désormais un routage prenant en compte le préfixe, une stratégie de routage qui envoie des requêtes partageant le même préfixe d'invite à la même instance afin que le cache KV reste chaud. Dans les benchmarks sur Llama 3.1 70B, cela réduit…
L’approvisionnement informatique, l’énergie et la capacité du centre de données déterminent le coût de fonctionnement de l’IA. Les changements d’infrastructure apparaissent dans les coûts d’inférence des semaines plus tard.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.