第三方评测机构 Artificial Analysis 公布了 Claude Opus 5 的测试成绩。在综合 9 项测试的智能指数中,Opus 5 以 61 分位居榜首,仅以微弱优势领先 Fable 5 的 60 分,GPT-5.6 Sol 和 Kimi K3 分别获得 59 分和 57 分。
正文解读
Opus 5 在成本控制方面表现突出,每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低约 26%。在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中,Opus 5 均登顶榜首,搭配 Claude Code 后更并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。
模型提供 5 档推理强度调节,从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可根据需求在性能与成本之间灵活权衡,既可用更多 Token 换取更强推理能力,也可主动压低推理强度以控制支出。
不过 Opus 5 的短板同样明显。事实知识层面仍落后于 Fable 5,在 AA-Omniscience 测试中幻觉率升至 50%,比 Opus 4.8 高出 14 个百分点。此外,低推理档位的性价比仍略逊于 GPT-5.6 系列,对于预算敏感型场景而言并非最优选择。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/204373/



