据动察 Beating 监测,专注编程 Agent 的 Poolside 公司近日开源了 MoE 架构代码模型 Laguna S 2.1。该模型总参数 1180 亿,每次推理仅激活 80 亿参数,支持 100 万 Token 上下文,量化后可在单台 NVIDIA DGX Spark 上运行。
正文解读
从自测结果来看,Laguna S 2.1 在 Terminal-Bench 2.1 基准上取得 70.2% 的成绩,高于 DeepSeek-V4-Pro-Max 的 64.0%,后者总参数达 1.6 万亿、激活参数 490 亿。在 SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 等编程评测中,Laguna S 2.1 同样领先于 DeepSeek 的对应版本。
不过,Laguna S 2.1 与月之暗面 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 上得分 88.3%,DeepSWE 得分 69%,而 Laguna S 2.1 在这两项上的得分分别为 70.2% 和 40.4%。需要指出的是,这些分数并非在同一环境下复现——Poolside 使用的是自家 Agent 框架,竞品数据取自公开最高成绩。
Laguna S 2.1 的核心特点在于,用更少的激活参数将长程编程能力压缩到本地单机可运行的程度。这种做法降低了编程 Agent 对云端算力的依赖,为开发者自部署提供了更现实的选择。
随着 MoE 架构在编程领域进一步普及,模型大小与单机可用性之间的权衡将成为竞争焦点。但开源模型的评测分数受 Agent 框架、测试环境等因素影响较大,横向对比时需保持谨慎。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/203868/



