Poolside发布开源智能体编码模型Laguna S 2.1
Poolside公司正式发布1180亿参数开源Agentic编码模型Laguna S 2.1,采用MoE架构(每token激活约80亿参数),支持100万token上下文,在SWE-Bench多语言基准测试中以78.5%准确率登顶公开模型榜首。模型权重已开放下载,可在单台NVIDIA DGX Spark上部署运行。
开源Agentic编码模型正式发布
Poolside公司宣布推出Laguna S 2.1——一款专为智能体式编程(agentic coding)设计的1180亿参数开源大模型。该模型采用混合专家(Mixture-of-Experts, MoE)架构,单次推理仅激活约80亿参数(占总参数6.8%),但全部1180亿参数常驻内存,实现高效率与强能力的平衡。模型支持高达100万token的上下文长度,涵盖“思考模式”(thinking mode)与“无思考模式”(no-thinking mode)两种推理路径。
模型权重已在Hugging Face平台公开,采用OpenMDW-1.1许可证。官方提供BF16、FP8、INT4及NVFP4四种精度版本,并同步发布GGUF与MLX格式转换模型,以及DFlash草案模型。从预训练启动到正式发布仅耗时不足九周:2026年5月22日,训练在4096块NVIDIA H200 GPU集群上启动;这也是Poolside首个在强化学习阶段全程采用FP8精度训练的模型。
性能表现:小身量、大能效
Laguna S 2.1在多项长周期编码基准测试中展现出显著超越参数规模的性能。在Terminal-Bench 2.1(启用思考模式)中取得70.2%准确率,位居Poolside官方编译的公开模型排行榜首位,仅次于部分闭源或超大规模模型;在SWE-Bench Multilingual基准上达到78.5%,为当前所有已公布结果中的最高分。
尤为突出的是DeepSWE v1.1测试:Laguna S 2.1得分40.4%,而参数量约为其6倍的DeepSeek-V4-Pro-Max仅得9.0%。这印证了其“以小博大”的技术路径——虽未挑战Claude Fable 5、Kimi K3等闭源前沿模型的综合统治力,但在同等开放性前提下,Laguna S 2.1确立了新的效能标杆。
两种思考模式与真实任务验证
Laguna S 2.1默认启用“max”思考模式,允许模型自主分配测试时计算资源(暂不开放用户可调的低/中/高努力等级)。该模式将Terminal-Bench 2.1得分从60.4%提升至70.2%,DeepSWE得分从16.5%跃升至40.4%;代价是推理token消耗增加——DeepSWE任务在思考模式下平均使用约24.9万completion tokens,远高于无思考模式下的9.9万。
Poolside团队公开三段未经剪辑的真实运行轨迹,展现模型持续数小时、数十万token的连贯推理能力:
- 在空文件夹中独立构建可运行的HTML/CSS浏览器引擎,全程181步、50分钟,零人工干预,并通过headless Chromium自动验证输出;
- 自主优化Poolside自研的智能体运行框架(agent harness),使执行速度提升5.2%,内存分配降低71%,将O(n²)字符串拼接重构为缓冲区操作;
- 在无Python环境的Perl沙箱中,耗时68分钟离线重推Erdős问题#397——该成果为独立再发现(knowledge cutoff为2025年11月,而GPT-5.2 Pro于2026年1月才解决同一问题)。
实际部署可行性明确
部署门槛清晰可控:按4-bit量化(NVFP4或INT4),模型权重仅需约59GB,可轻松运行于单台NVIDIA DGX Spark(128GB统一内存);FP8精度下约118GB,仍适配单Spark或单块H200;BF16则需约236GB,需双Spark互联或数据中心级多GPU节点。Poolside联合NVIDIA深度优化TRT-LLM推理栈,在Blackwell架构上实现NVFP4精度下对单DGX Spark的端到端支持,模型已于发布当日投入可用。
> 编者观点:Laguna S 2.1的突破不在参数堆砌,而在MoE稀疏激活、FP8训练与轻量部署的工程闭环——为中国AI初创团队提供了一条兼顾开源合规、推理成本与实际编码能力的务实路径。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(MarkTechPost) →