A estrutura SRPO da Kwai AI reduz as etapas de pós-treinamento do LLM RL em 90%, ao mesmo tempo que corresponde ao desempenho do DeepSeek-R1 em matemática e código. Esta abordagem RL em dois estágios com reamostragem de histórico supera as limitações do GRPO. O GRPO pode ser 10x…
Novos modelos redefinem a fronteira de capacidade e preço-desempenho. As equipes reavaliam o que desenvolver sempre que um lançamento muda o que é possível por dólar.
Empresas e modelos mencionados nesta história – abra suas páginas e preços ao vivo
Os resumos são agregados apenas para fins informativos – siga o link da fonte para ver a história completa. As entradas de demonstração são ilustrativas.