OpenAI, yapay zeka modellerinin programlama becerilerini ölçmek için yaygın olarak kullanılan bir test olan SWE-Bench Pro'yu inceledi ve görevlerinin yaklaşık yüzde 30'unun bozuk olduğunu buldu. Şirket, kıyaslama için daha önce verdiği desteği geri çekiyor. Bir…
Yeni modeller kapasite ve fiyat-performans sınırını sıfırlıyor. Ekipler, bir lansman dolar başına mümkün olanı değiştirdiğinde neyin üzerine inşa edileceklerini yeniden değerlendiriyor.
Bu hikayede adı geçen şirketler ve modeller — sayfalarını açın ve canlı fiyatları
Özetler yalnızca bilgi amaçlı olarak toplanmıştır; hikayenin tamamı için kaynak bağlantısını takip edin. Demo girişleri örnek niteliğindedir.