Arena Agent 榜最新数据显示,Kimi K3 以 9.62% 的综合净提升位列第四,排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。该榜单基于真实用户任务和工具调用记录进行评测,K3 目前已积累 8344 次测试会话。
正文解读
Arena 将所有参评模型均匀混合,构建出一个虚拟平均基准,再逐一评估替换为 K3 后各项指标的改善幅度,最终取五项净提升的平均值得出综合评分。这一机制使得排名能够直观反映模型在实际应用中的相对表现。
分项来看,K3 在用户确认成功指标上净提升 14.42%,位列第一;在表扬多于投诉指标上提升 20.62%,排名第三。这两项数据表明,K3 在让用户获得满意结果方面表现出较强能力,用户体验的正向反馈较为突出。
不过,K3 并非没有短板。其纠错执行排名第 14,Bash 报错恢复排名第 17,说明模型在任务中途修正错误和应对命令行报错恢复方面仍有明显不足。这意味着 K3 在复杂多步任务中的稳定性还有待加强。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/203103/



