Para peneliti di Universitas Princeton membuat CEO-Bench, sebuah tes di mana agen AI harus menjalankan perusahaan perangkat lunak fiktif selama 500 hari simulasi. Sebagian besar model saat ini bangkrut, dan heuristik berbasis aturan sederhana tanpa AI…
Model-model baru mengatur ulang batas kemampuan dan harga-kinerja. Tim mengevaluasi kembali apa yang harus dikembangkan setiap kali peluncuran mengubah apa yang mungkin dilakukan per dolar.
Ringkasan dikumpulkan untuk informasi saja — ikuti tautan sumber untuk cerita selengkapnya. Entri demo bersifat ilustratif.