Princeton Üniversitesi'ndeki araştırmacılar, yapay zeka ajanlarının 500 simüle edilmiş gün boyunca kurgusal bir yazılım şirketini yönetmesi gereken bir test olan CEO-Bench'i geliştirdi. Mevcut modellerin çoğu bozuluyor ve yapay zeka etkisi olmayan basit, kurala dayalı bir buluşsal yöntem…
Yeni modeller kapasite ve fiyat-performans sınırını sıfırlıyor. Ekipler, bir lansman dolar başına mümkün olanı değiştirdiğinde neyin üzerine inşa edileceklerini yeniden değerlendiriyor.
Özetler yalnızca bilgi amaçlı olarak toplanmıştır; hikayenin tamamı için kaynak bağlantısını takip edin. Demo girişleri örnek niteliğindedir.