Pesquisadores da Universidade de Princeton criaram o CEO-Bench, um teste em que agentes de IA precisam administrar uma empresa de software fictícia por 500 dias simulados. A maioria dos modelos atuais faliu e uma heurística simples baseada em regras sem recursos de IA…
Novos modelos redefinem a fronteira de capacidade e preço-desempenho. As equipes reavaliam o que desenvolver sempre que um lançamento muda o que é possível por dólar.
Os resumos são agregados apenas para fins informativos – siga o link da fonte para ver a história completa. As entradas de demonstração são ilustrativas.