このチュートリアルでは、llama.cpp の PrismML フォークを使用して 1 ビット Bonsai-27B 言語モデルをデプロイします。これは、モデルの Q1_0_g128 GGUF 量子化形式をデコードするために必要な特殊な CUDA カーネルを提供します。
オープンウェイトのリリースはクローズド価格に圧力をかけ、アクセスを拡大し、エコシステム全体の構築と購入の計算を変えます。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。