普林斯顿大学的研究人员构建了 CEO-Bench,这是一项测试,人工智能代理必须运行一家虚构的软件公司 500 天的模拟时间。当前大多数模型都破产了,并且基于规则的简单启发式没有人工智能……
新模型会重置能力与性价比的前沿。每次发布改变「每美元能做什么」,团队就要重新评估该基于哪个模型构建。
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。