Kimi K3逼近Fable5成本10倍

Kimi K3逼近Fable5成本10倍
核心摘要

Artificial Analysis 最新发布的 AA-Briefcase 评测榜单显示,Kimi K3 以 1543 Elo 得分位列第二,仅次于 Claude Fable 5 的 1574 分,同时超越了 GPT-5.6 Sol 的 1501 分以及 Claude Sonnet 5 和 Claude Opus 4.8。该评测模拟真实工作场景,要求模型从近 2000 份邮件、Slack 记录和公司文件中提取信息,并交付表格、演示文稿和界面原型,共涵盖 4 个长期项目和 91 项保密任务。

正文解读

K3 在客观要求通过率上为 51%,落后于 Fable 5 的 56%,但在分析质量得分上以 1754 领先对手的 1744。其主要短板在于成品展示环节,表现低于 GPT-5.6 Sol 和 Opus 4.8,显示出在生成可直接交付的最终成果方面仍有改进空间。这一差异反映出不同模型在复杂任务链中能力的侧重。

性能提升伴随着显著的成本增长。K3 每项任务平均花费 10.57 美元,约为其前代 Kimi K2.6 的 10 倍。它平均执行 83 轮交互,输出 12 万 Token,耗时 56.4 分钟,完成同类任务的时间约为 Fable 5 的 2.5 倍。这种高消耗意味着实际部署时需权衡效率与经济性。

原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/203500/

(0)
上一篇 1天前
下一篇 1天前

相关推荐