Kerangka kerja SRPO Kwai AI memangkas langkah pasca-pelatihan LLM RL sebesar 90% sekaligus menyamai kinerja DeepSeek-R1 dalam matematika dan kode. Pendekatan RL dua tahap dengan pengambilan sampel ulang riwayat ini mengatasi keterbatasan GRPO. Apakah GRPO bisa 10x…
Model-model baru mengatur ulang batas kemampuan dan harga-kinerja. Tim mengevaluasi kembali apa yang harus dikembangkan setiap kali peluncuran mengubah apa yang mungkin dilakukan per dolar.
Perusahaan dan model yang disebutkan dalam cerita ini — buka halaman mereka dan harga langsung
Ringkasan dikumpulkan untuk informasi saja — ikuti tautan sumber untuk cerita selengkapnya. Entri demo bersifat ilustratif.