OpenAI 反驳了 Anthropic 的 ARC-AGI-3 记录:GPT-5.6 Sol 得分为 38.3%,但仅使用其自己的 API 功能,而不是官方测试设置,该模型的得分为 7.8%。 ARC 奖声称其测试环境......
新模型会重置能力与性价比的前沿。每次发布改变「每美元能做什么」,团队就要重新评估该基于哪个模型构建。
本文提及的厂商与模型 —— 打开它们的页面与实时价格
相关 HotON.ai 页面
摘要仅供参考,请点击来源链接查看全文。演示条目为示意。