据动察 Beating 监测,AI 推理平台 Fireworks 采用同一套 Agent 脚手架对 Kimi K3 和 Fable 5 进行了对比测试,涵盖代码修复、长程终端操作、算法、多语言编程和法律五类任务。结果显示两者总体接近平手,但擅长方向各有侧重:K3 在安全、密码学和长时间终端操作上表现更强,Fable 5 则更擅长多语言编程、网页和数据可视化。
正文解读
Fireworks 还进行了一次“上帝视角路由”模拟实验,即在每项任务中同时运行两个模型,事后再挑选出正确且更便宜的答案。这种组合策略的准确率达到 93%,高于任何单一模型。其中 K3 承担了 72% 至 96% 的任务,Fable 5 仅处理少数长尾难题。在成本方面,K3 在五类任务中均具备优势,其中长终端任务的价格最多比 Fable 5 便宜约 50 倍。
需要指出的是,93% 的准确率仅是上帝视角下的模拟结果,并非 Fireworks 已经实际部署的路由成效。该测试更多揭示了不同模型在各自擅长的场景下可发挥互补价值,尤其在成本敏感的长尾任务上,K3 的经济性优势十分显著。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/203545/



