OpenAI는 다수의 방어자 LLM에 대한 자체 플레이 강화 학습을 사용하여 내부 전용 공격자 모델인 GPT-Red를 교육했습니다. 복제된 간접 프롬프트 주입 경기장에서 인간 레드 팀을 84%에서 13%로 이겼습니다.
새로운 모델은 기능과 가격 대비 성능의 경계를 재설정합니다. 팀은 출시로 인해 달러당 가능한 것이 바뀔 때마다 무엇을 구축할지 재평가합니다.
요약은 정보 제공 목적으로만 집계되었습니다. 전체 내용을 보려면 소스 링크를 따르세요. 데모 항목은 예시입니다.