NVIDIA は、長期実行エージェント向けに合計 550B (アクティブ 55B) のオープン専門家混合ハイブリッド Mamba-Transformer である Nemotron 3 Ultra をリリースしました。 1M トークンのコンテキストと、競合製品よりも最大約 6 倍高い推論スループットを組み合わせます。
コンピューティングの供給、エネルギー、データセンターの容量によって、AI をいかに安価に実行できるかが決まります。インフラストラクチャの変化は数週間後に推論コストに現れます。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。