في هذا المنشور، سأقدم خوارزمية التعلم المعزز (RL) بناءً على نموذج "بديل": فرق تسد. على عكس الطرق التقليدية، لا تعتمد هذه الخوارزمية على تعلم الفرق الزمني (TD) (...
تعمل النماذج الجديدة على إعادة ضبط حدود القدرة والأداء والسعر. تقوم الفرق بإعادة تقييم ما يجب البناء عليه عندما يؤدي الإطلاق إلى تغيير ما هو ممكن لكل دولار.
يتم تجميع الملخصات للحصول على معلومات فقط - اتبع رابط المصدر للحصول على القصة الكاملة. الإدخالات التجريبية توضيحية.