Il framework SRPO di Kwai AI riduce i passaggi post-formazione LLM RL del 90% eguagliando le prestazioni di DeepSeek-R1 in matematica e codice. Questo approccio RL in due fasi con ricampionamento della cronologia supera le limitazioni del GRPO. Il GRPO può essere 10x...
I nuovi modelli ripristinano la frontiera della capacità e del rapporto prezzo-prestazioni. I team rivalutano su cosa costruire ogni volta che un lancio cambia ciò che è possibile fare per ogni dollaro.
Aziende e modelli menzionati in questa storia: apri le loro pagine e scopri i prezzi
I riepiloghi sono aggregati solo a scopo informativo: segui il collegamento alla fonte per la storia completa. Le voci demo sono illustrative.