NVIDIA 发布了 Nemotron 3 Ultra,这是一个总计 550B(55B 活动)的开放式 Mixture-of-Experts 混合 Mamba-Transformer,适用于长时间运行的代理。它将 1M 令牌上下文配对,推理吞吐量比同类产品高出约 6 倍……
算力供给、能源与数据中心容量决定了 AI 运行的成本。基础设施的变化会在数周后体现在推理成本上。
本文提及的厂商与模型 —— 打开它们的页面与实时价格
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。