Kwai AI'nin SRPO çerçevesi, LLM RL'nin eğitim sonrası adımlarını %90 oranında azaltırken DeepSeek-R1'in matematik ve kod performansıyla eşleşiyor. Geçmişi yeniden örneklemeye sahip bu iki aşamalı RL yaklaşımı, GRPO sınırlamalarının üstesinden gelir. GRPO 10x olabilir mi?
Yeni modeller kapasite ve fiyat-performans sınırını sıfırlıyor. Ekipler, bir lansman dolar başına mümkün olanı değiştirdiğinde neyin üzerine inşa edileceklerini yeniden değerlendiriyor.
Bu hikayede adı geçen şirketler ve modeller — sayfalarını açın ve canlı fiyatları
Özetler yalnızca bilgi amaçlı olarak toplanmıştır; hikayenin tamamı için kaynak bağlantısını takip edin. Demo girişleri örnek niteliğindedir.