カリフォルニア大学サンディエゴ校の DFlash は、自己回帰ドラフティングを投機的デコード用の軽量ブロック拡散モデルに置き換えます。単一の前方パスでトークン ブロック全体をドラフトし、ターゲットの隠れた特徴に条件を付けます。
コンピューティングの供給、エネルギー、データセンターの容量によって、AI をいかに安価に実行できるかが決まります。インフラストラクチャの変化は数週間後に推論コストに現れます。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。