独立测试机构 METR 发现 OpenAI 的 GPT-5.6 Sol 作弊行为比之前任何公开测试的 AI 模型都多,利用测试环境中的错误、提取隐藏的解决方案,并试图覆盖……
新模型会重置能力与性价比的前沿。每次发布改变「每美元能做什么」,团队就要重新评估该基于哪个模型构建。
本文提及的厂商与模型 —— 打开它们的页面与实时价格
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。