Laguna-S-2.1多框架部署指南:vLLM/SGLang/llama.cpp支持

Poolside于7月21日正式开源新一代智能编码代理模型Laguna S 2.1,该模型采用118B总参数量、约8B激活参数的MoE架构,原生支持100万token上下文长度与交错思考机制,采用OpenMDW-1.1开源协议。在SWE-Bench Multilingual等多项Agent编码权威基准中,这款模型凭借极小的激活参数规模,实现了对参数量数倍于己的竞品的全面超越,同时展示了从零构建渲染引擎、独立推导Erdős数学问题等顶尖实战能力。
实战能力展示
官方在技术博客中公开了三段完整的Agent运行轨迹,所有任务均在同一次会话中完成,全程无需人工干预。
从零构建浏览器渲染引擎:在单次时长50分钟、共181步的会话中,模型从空文件夹出发,使用原生JavaScript依次完成了HTML解析器、CSS级联、页面布局与最终渲染四个核心模块的开发。由于模型本身不具备视觉感知能力,它主动调用headless Chromium,将渲染结果读取到canvas画布中,通过数值化比对截图的方式完成了视觉层面的验证。
自主优化自研Agent Harness:模型通过自动化迭代循环,对自身使用的Harness进行了20次优化尝试,最终将Harness的运行耗时降低5.19%,内存分配量减少71.1%。它精准定位到流式Token累积过程中的O(n²)字符串拼接问题,以及trajectory物化阶段的过度分配与冗余拷贝问题,并通过buffer缓存、记忆化技术、预分配slice切片的方式完成了针对性优化。
独立推导Erdős数学问题#397:Laguna S 2.1仅用68分钟就找到了该问题的确定性解。在沙箱环境未预装Python的情况下,模型主动选用Perl语言完成数论计算,通过暴力精确因式分解、模式分析推导出一族闭式无穷解族,并给出了完整的数学证明。尽管这一结果属于重发现而非首次解决,但该模型推导的解族采用八个线性增长的指标,与此前公开的六指标解族结构完全不同,证明这是一次全新的独立推导,而非基于训练数据记忆的复刻。
基准测试性能
在SWE-Bench Multilingual测试中,Laguna S 2.1取得78.5%的准确率,分别比参数量2.5倍的竞品高出2.7个百分点,比参数量13.5倍的竞品高出2.3个百分点;在DeepSWE基准上,模型拿下40.4%的得分,与另一款竞品的9.0%相比优势显著。
Terminal-Bench 2.1涵盖大量高质量的长期终端交互任务,要求Agent模型通过命令行与环境完成交互。在该基准测试中,Laguna S 2.1以70.2%的准确率位列第11名。
本地部署与推理方案
Laguna S 2.1的BF16格式权重分为46个分片,总大小约235GB,官方推荐的vLLM与SGLang启动命令均采用tensor parallel size=4的配置。模型同时提供FP8、NVFP4、INT4、GGUF四种量化格式,以及配套的DFlash投机解码Draft模型。在智能编码场景中,建议开启thinking模式,以完整保留推理过程到消息历史中。
模型下载
modelscope download --model poolside/Laguna-S-2.1 --local_dir ./Laguna-S-2.1
vLLM部署
vllm serve \--model poolside/Laguna-S-2.1 \--tensor-parallel-size 4 \--tool-call-parser poolside_v1 \--reasoning-parser poolside_v1 \--enable-auto-tool-choice \--served-model-name laguna \--default-chat-template-kwargs '{"enable_thinking": true}'
如需启用DFlash投机解码,可追加以下参数:
--speculative-config '{"model":"poolside/Laguna-S-2.1-DFlash","num_speculative_tokens":7,"method":"dflash"}'
SGLang部署
python -m sglang.launch_server \--model-path poolside/Laguna-S-2.1 \--tp-size 4 \--reasoning-parser poolside_v1 \--tool-call-parser poolside_v1 \--trust-remote-code
TRT-LLM部署
注意该部署方式的参数与vLLM不同,reasoning parser名为laguna:
trtllm-serve poolside/Laguna-S-2.1 --trust-remote-code \--tool_parser poolside_v1 --reasoning_parser laguna
llama.cpp / GGUF部署
GGUF版本仓库为poolside/Laguna-S-2.1-GGUF:
git clone --branch laguna https://github.com/poolsideai/llama.cppcd llama.cpp && cmake -B build && cmake --build build -j./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000
官方资源链接:

