I ricercatori dell’Università di Princeton hanno creato CEO-Bench, un test in cui gli agenti di intelligenza artificiale devono gestire una società di software fittizia per 500 giorni simulati. La maggior parte dei modelli attuali fallisce e una semplice euristica basata su regole senza AI bea...
I nuovi modelli ripristinano la frontiera della capacità e del rapporto prezzo-prestazioni. I team rivalutano su cosa costruire ogni volta che un lancio cambia ciò che è possibile fare per ogni dollaro.
I riepiloghi sono aggregati solo a scopo informativo: segui il collegamento alla fonte per la storia completa. Le voci demo sono illustrative.