OpenAI は、防御側 LLM の母集団に対してセルフプレイ強化学習を使用して、内部専用の攻撃者モデルである GPT-Red をトレーニングしました。複製された間接プロンプト インジェクション アリーナで、人間のレッドチームを 84% 対 13% で破りました…
新しいモデルは、機能と価格パフォーマンスの最前線をリセットします。チームは、ローンチによって 1 ドルあたりの可能性が変わるたびに、何を構築するかを再評価します。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。