OpenAI đã đánh giá SWE-Bench Pro, một bài kiểm tra được sử dụng rộng rãi để đo lường kỹ năng lập trình của các mô hình AI và nhận thấy khoảng 30% nhiệm vụ của nó bị hỏng. Công ty đang rút lại sự chứng thực trước đó về điểm chuẩn. Cái…
Các mô hình mới thiết lập lại giới hạn về năng lực và hiệu suất giá cả. Các nhóm đánh giá lại những gì cần xây dựng bất cứ khi nào đợt ra mắt thay đổi số tiền có thể có trên mỗi đô la.
Các công ty và mô hình được đề cập trong câu chuyện này — hãy mở trang của họ và xem giá trực tiếp
Các bản tóm tắt chỉ được tổng hợp để cung cấp thông tin - hãy nhấp vào liên kết nguồn để xem toàn bộ câu chuyện. Các mục demo có tính minh họa.