長期的なエージェントは、LLM サービスを入力の多いワークロードに変えています。プレフィルと 100 万トークンのコンテキストが繰り返されると、KV キャッシュが残り、HBM、SSD の容量、帯域幅に負担がかかります。 DeepSeek AI は最新リリースを構築しました…
コンピューティングの供給、エネルギー、データセンターの容量によって、AI をいかに安価に実行できるかが決まります。インフラストラクチャの変化は数週間後に推論コストに現れます。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。