يعمل إطار عمل SRPO الخاص بـ Kwai AI على خفض خطوات ما بعد التدريب في LLM RL بنسبة 90% مع مطابقة أداء DeepSeek-R1 في الرياضيات والتعليمات البرمجية. يتغلب نهج RL المكون من مرحلتين مع إعادة تشكيل التاريخ على قيود GRPO. هل يمكن أن يكون GRPO 10x...
تعمل النماذج الجديدة على إعادة ضبط حدود القدرة والأداء والسعر. تقوم الفرق بإعادة تقييم ما يجب البناء عليه عندما يؤدي الإطلاق إلى تغيير ما هو ممكن لكل دولار.
الشركات والنماذج المذكورة في هذه القصة – افتح صفحاتها وأسعارها الحية
يتم تجميع الملخصات للحصول على معلومات فقط - اتبع رابط المصدر للحصول على القصة الكاملة. الإدخالات التجريبية توضيحية.