即使是最好的AI模型也无法在现实知识工作中取得好成绩,仅能完全解决3%的任务。文章《新基准测试揭示了AI在现实知识工作中的糟糕表现》首次发表于The Decoder。
新模型会重置能力与性价比的前沿。每次发布改变「每美元能做什么」,团队就要重新评估该基于哪个模型构建。
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。