Khung SRPO của Kwai AI cắt giảm 90% các bước sau đào tạo LLM RL đồng thời phù hợp với hiệu suất DeepSeek-R1 trong toán học và mã. Cách tiếp cận RL hai giai đoạn này với việc lấy mẫu lại lịch sử sẽ khắc phục được các hạn chế của GRPO. GRPO có thể gấp 10 lần không?
Các mô hình mới thiết lập lại giới hạn về năng lực và hiệu suất giá cả. Các nhóm đánh giá lại những gì cần xây dựng bất cứ khi nào đợt ra mắt thay đổi số tiền có thể có trên mỗi đô la.
Các công ty và mô hình được đề cập trong câu chuyện này — hãy mở trang của họ và xem giá trực tiếp
Các bản tóm tắt chỉ được tổng hợp để cung cấp thông tin - hãy nhấp vào liên kết nguồn để xem toàn bộ câu chuyện. Các mục demo có tính minh họa.