Kwai AI의 SRPO 프레임워크는 수학 및 코드에서 DeepSeek-R1 성능을 일치시키면서 LLM RL 교육 후 단계를 90% 단축합니다. 히스토리 리샘플링을 사용하는 이 2단계 RL 접근 방식은 GRPO 제한 사항을 극복합니다. GRPO가 10배가 될 수 있나요…
새로운 모델은 기능과 가격 대비 성능의 경계를 재설정합니다. 팀은 출시로 인해 달러당 가능한 것이 바뀔 때마다 무엇을 구축할지 재평가합니다.
이 이야기에 언급된 회사 및 모델 — 페이지를 열고 실시간 가격을 확인하세요.
요약은 정보 제공 목적으로만 집계되었습니다. 전체 내용을 보려면 소스 링크를 따르세요. 데모 항목은 예시입니다.