Kwai AI の SRPO フレームワークは、数学とコードにおいて DeepSeek-R1 のパフォーマンスに匹敵しながら、トレーニング後の LLM RL ステップを 90% 削減します。履歴リサンプリングを備えたこの 2 段階の RL アプローチは、GRPO の制限を克服します。 GRPOは10倍になれるのか…
新しいモデルは、機能と価格パフォーマンスの最前線をリセットします。チームは、ローンチによって 1 ドルあたりの可能性が変わるたびに、何を構築するかを再評価します。
この記事で言及されている企業とモデル - ページを開いて実際の価格を確認してください
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。