AI资讯 / 产业

产业 / 媒体

小型开源编码模型,性能超越大模型

The Decoder

Poolside 发布了 Laguna S 2.1,这是其三个月内的第三款编码模型。该模型采用混合专家架构,拥有 1180 亿总参数,但每个 token 仅激活 80 亿参数。与依赖原始规模不同,Poolside 专注于改善模型在长时间代理会话中的行为,包括更频繁的验证、不轻易放弃、以及修正失败方法。在 Terminal-Bench 2.1 基准测试中,Laguna S 2.1 以 70.2% 的得分超越了多个更大的开源模型,包括 DeepSeek-V4-Pro-Max 和 Nemotron 3 Ultra。该模型还独立解决了自 1975 年以来未解决的 Erdos 问题 #397,成本仅为 0.088 美元。Laguna S 2.1 已通过 Apache 2.0 许可证在 Hugging Face 上开源。

Poolside 发布了 Laguna S 2.1,这是其三个月内的第三款编码模型。该模型采用混合专家架构,拥有 1180 亿总参数,但每个 token 仅激活 80 亿参数。与依赖原始规模不同,Poolside 专注于改善模型在长时间代理会话中的行为,包括更频繁的验证、不轻易放弃、以及修正失败方法。公司表示,之前的 Laguna 模型有时会在仅部分通过测试套件后停止,或在距离成功仅两步之遥时放弃。

在 Terminal-Bench 2.1 基准测试中,Laguna S 2.1 以 70.2% 的得分超越了多个更大的开源模型,包括 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra 和 Thinking Machines Lab 的首款模型。在 DeepSWE 基准测试中,该模型得分 40.4%,而一些参数超过一万亿的开源模型得分低于 10%。思考模式对性能有显著影响:没有思考模式时,Terminal-Bench 得分降至 60.4%,DeepSWE 得分降至 16.5%。

Poolside 通过三个记录在案的试验运行支持其性能主张。在一个试验中,Laguna S 2.1 在 50 分钟内从空文件夹构建了一个可渲染 HTML 和 CSS 的工作浏览器引擎。在另一个试验中,该模型在沙盒环境中独立发现了自 1975 年以来未解决的 Erdos 问题 #397 的证明,成本仅为 0.088 美元。Poolside 表示,这一结果是独立重新发现,因为模型的训练数据截止于 2025 年 11 月,而 GPT-5.2 Pro 在 2026 年 1 月才解决该问题。

性能提升主要来自扩展和后期训练,而非新的预训练数据。代理训练阶段覆盖了 409,000 个环境,包括 83,000 个终端任务和 168,000 个软件工程工作流。最大单一来源是约 17,000 个代码仓库中的约 38,000 个真实提交。Poolside 还构建了新的沙盒系统,可选择性地阻止网络访问以遏制奖励黑客行为。训练于 2026 年 5 月 22 日开始,使用 4,096 块 Nvidia H200 GPU,不到九周后即发布。

Laguna S 2.1 已通过 OpenMDW 1.1 许可证在 Hugging Face 上开源,允许任何人使用、修改和重新分发模型权重,包括用于商业目的。Baseten、Vercel AI Gateway 和 OpenRouter 提供托管访问。OpenRouter 提供免费端点(256K 上下文窗口)和付费端点(支持完整的一百万 token 上下文窗口)。Poolside 表示,该模型也可以在单个 Nvidia DGX Spark 上本地运行。免费演示聊天可在 chat.poolside.ai 上使用,无需登录。

要点

  • Laguna S 2.1 通过训练模型在长时间代理会话中持续验证和修正,而非依赖原始规模,实现了超越更大模型的性能。
  • 该模型在 Terminal-Bench 2.1 和 DeepSWE 等基准测试中超越了多个更大的开源模型,包括 DeepSeek-V4-Pro-Max。
  • Laguna S 2.1 独立解决了自 1975 年以来未解决的 Erdos 问题 #397,成本仅为 0.088 美元。
  • 性能提升主要来自扩展和后期训练,覆盖 409,000 个环境,包括终端任务和软件工程工作流。
  • 该模型已通过 OpenMDW 1.1 许可证开源,可在 Hugging Face 上获取,并支持本地运行和托管服务。
查看原始来源

原始标题:Poolside's Laguna S 2.1 is a small open-weight coding model that punches well above its size

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。