Le framework SRPO de Kwai AI réduit de 90 % les étapes post-formation LLM RL tout en correspondant aux performances de DeepSeek-R1 en mathématiques et en code. Cette approche RL en deux étapes avec rééchantillonnage de l'historique surmonte les limitations du GRPO. Le GRPO peut-il être 10x…
Les nouveaux modèles repoussent les limites des capacités et du rapport qualité-prix. Les équipes réévaluent les éléments sur lesquels s'appuyer chaque fois qu'un lancement modifie ce qui est possible par dollar.
Entreprises et modèles mentionnés dans cette histoire — ouvrez leurs pages et prix en direct
Les résumés sont regroupés à titre d’information uniquement – suivez le lien source pour l’histoire complète. Les entrées de démonstration sont illustratives.