قامت OpenAI بمراجعة SWE-Bench Pro، وهو اختبار يستخدم على نطاق واسع لقياس مهارات البرمجة لنماذج الذكاء الاصطناعي، ووجدت أن ما يقرب من 30 بالمائة من مهامها معطلة. تقوم الشركة بسحب تأييدها السابق للمؤشر. ال…
تعمل النماذج الجديدة على إعادة ضبط حدود القدرة والأداء والسعر. تقوم الفرق بإعادة تقييم ما يجب البناء عليه عندما يؤدي الإطلاق إلى تغيير ما هو ممكن لكل دولار.
يتم تجميع الملخصات للحصول على معلومات فقط - اتبع رابط المصدر للحصول على القصة الكاملة. الإدخالات التجريبية توضيحية.