El marco SRPO de Kwai AI reduce drásticamente los pasos posteriores a la capacitación de LLM RL en un 90 % y al mismo tiempo iguala el rendimiento de DeepSeek-R1 en matemáticas y código. Este enfoque de RL de dos etapas con remuestreo histórico supera las limitaciones de GRPO. ¿Puede GRPO ser 10x...?
Los nuevos modelos restablecen la frontera entre capacidad y precio-rendimiento. Los equipos reevalúan sobre qué construir cada vez que un lanzamiento cambia lo que es posible por dólar.
Empresas y modelos mencionados en esta historia: abra sus páginas y vea los precios en vivo
Los resúmenes se agregan únicamente con fines informativos; siga el enlace fuente para ver la historia completa. Las entradas de demostración son ilustrativas.