文章摘要
Spark-X2.5系列含1.7B、4B两种参数规模的智能体模型已正式开源,该模型采用混合注意力架构,原生支持1M token长上下文,针对代码开发、工具调用及智能体工作流专项优化,综合性能达到同尺寸模型顶尖水平,兼容多硬件与主流推理框架,官方提供多版本模型与多种部署方案。

Spark-X2.5系列智能体模型已正式开源,目前推出4B与1.7B两种参数规模的版本。该模型采用混合注意力架构,原生支持最长1M token的上下文窗口,可覆盖200余种语言,并针对代码开发、工具调用以及智能体工作流进行了专项后训练。所有规格的模型均提供发布版、基础版与GGUF版三种形态,分别适配直接推理、继续训练与本地运行的不同需求。

01

核心技术亮点

高效架构与原生长上下文支持:模型采用混合注意力设计,每一层搭配全量注意力与三层滑动窗口注意力组合,有效降低了传统长上下文模型的高额计算开销,无需额外优化即可原生支持1M token的上下文窗口长度。

强化代码与智能体任务能力:该系列模型深度适配Claude Code、Hermes、Codex、OpenClaw等主流开发脚手架,在智能体工作流、日常代码编写、数学推理以及指令遵循等任务上的综合表现达到同尺寸模型的顶尖水平。

广泛的硬件与框架兼容能力:支持英伟达、华为、海光、后摩等多种主流硬件平台,兼容vLLM、SGLang、llama.cpp、MLX等行业主流推理框架,可以快速在Ollama、LM Studio等工具上完成部署,同时支持LLaMA-Factory等微调工具进行定制化训练。在多款硬件平台上,Spark-X2.5的TTFT、TPOT等推理性能指标都优于同尺寸的其他模型,具备出色的落地运行效率。

国产化训练与优化:模型基于国产算力平台完成全流程训练,采用大规模强化学习与MOPD等先进后训练算法,显著提升了模型在深度推理、代码开发、智能体交互以及指令跟随等场景的表现效果。

02

架构设计细节

在通用智能体任务场景中,平衡模型效果、推理速度与缓存占用一直是制约模型落地的核心难题。Spark-X2.5通过整合成熟的注意力技术,采用滑窗注意力与全注意力混合的双层结构,充分融合两种注意力机制的技术优势,规避了单一结构的性能短板,实现了模型效果、推理运行效率与KV缓存占用尺寸的优质平衡,大幅提升了模型在实际落地场景中的适配性与可用性。

Spark-X2.5 混合架构与模型规格

03

模型训练与优化流程

Spark-X2.5使用约20万亿token的多样化数据集完成预训练,覆盖网页、书籍、学术文献、代码、百科等多类知识内容。训练过程中重点关注数据质量、领域覆盖范围以及不同类型数据的采样比例,通过大量配比实验优化了数学、逻辑推理、代码等高价值领域数据的占比,让模型在获得广泛通用知识的同时,进一步强化了复杂推理、代码理解与生成等核心能力。

为了提升长上下文处理能力,模型还使用了千亿token的长上下文专项数据集进行训练,最长训练序列长度达到1M token。

在后训练阶段,模型首先在精心筛选的高质量SFT数据上完成监督微调,让模型具备指令理解、结构化输出与任务完成能力,为后续的强化学习提供稳定的初始化基础。随后面向数学推理、编程、智能体工具调用、指令遵循等多个专业领域开展大规模强化学习,分别训练具备领域专长的教师RL模型。

通过多教师在线策略蒸馏技术,利用学生模型在线生成的轨迹构建针对不同能力的训练信号,将多个教师模型的优势整合到统一的发布模型中,让Spark-X2.5获得了更全面、均衡的综合能力。

Spark-X2.5 监督微调、领域专家训练与多教师在线策略蒸馏流程

04

实测性能表现

官方针对智能体、代码、数学、通用与知识任务,对Spark-X2.5-4B与Spark-X2.5-1.7B两个版本进行了全面评测。其中4B版本在多项指标中取得了最高分,1.7B版本则以更小的参数规模覆盖了相同的任务类型。

完整评测结果如下:

Spark-X2.5 完整性能评测表

单元格中的“*”表示来自开源模型的公开报告结果,“-”表示该项分数暂不可用。

所有评测均在思考模式下进行。Spark-X2.5 的推荐采样参数为:temperature=1.0、top_p=0.95、top_k=-1。

Gaokao 2026 由2026年高考数学的五套试卷组成(全国卷I、全国卷II、北京卷、上海卷、天津卷),满分为150分。

05

快速部署与运行指南

Spark-X2.5官方提供了5种部署与运行方式:SGLang、vLLM、MLX、Ollama与LM Studio。其中SGLang与vLLM适合启动OpenAI兼容的API服务;MLX支持Apple Silicon、Linux CPU与CUDA环境;Ollama和LM Studio使用GGUF模型,需要配合适配版的llama.cpp使用。推荐采样参数为temperature=1.0、top_p=0.95、top_k=-1。

模型下载

可以通过官方CLI工具下载4B或1.7B版本的发布版模型:

modelscope download --model XHToken/Spark-X2.5-4B --local_dir ./Spark-X2.5-4B
modelscope download --model XHToken/Spark-X2.5-1.7B --local_dir ./Spark-X2.5-1.7B

SGLang

安装SGLang

使用适配Spark-X2.5运行时的预构建镜像:

docker pull lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1

启动推理服务

以下命令指定单GPU,并启动OpenAI兼容的API服务,最大上下文长度设置为1,048,576 token;实际部署时应根据显存容量调整context-length参数。

服务端命令

docker run -it \
  --gpus "device=0" \
  --ipc=host \
  -p 30000:30000 \
  -v "$MODEL_PATH":/root/Spark-X2.5-4B \
  lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1 \
  python -m sglang.launch_server \
    --model-path /root/Spark-X2.5-4B \
    --served-model-name spark2.5 \
    --tool-call-parser spark25 \
    --reasoning-parser qwen3 \
    --tp-size 1 \
    --mem-fraction-static 0.8 \
    --context-length 1048576 \
    --chat-template /root/Spark-X2.5-4B/chat_template.jinja \
    --host 0.0.0.0 \
    --port 30000

客户端调用

聊天模板与qwen3 reasoning parser默认启用思考模式。如需对单次请求关闭思考,可设置chat_template_kwargs:{"enable_thinking": false}。推荐采样参数为temperature=1.0、top_p=0.95、top_k=-1。

curl -s http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spark2.5",
    "messages": [
      {
        "role": "user",
        "content": "安徽的省会在哪里?"
      }
    ],
    "max_tokens": 131072,
    "temperature": 1,
    "top_k": -1,
    "top_p": 0.95,
    "repetition_penalty": 1,
    "presence_penalty": 0,
    "frequency_penalty": 0
  }'

vLLM

安装步骤

pip install uv
uv venv ~/spark2_5
source ~/spark2_5/bin/activate
git clone https://github.com/XHToken/Spark-plugin.git
cd ./Spark-plugin
uv pip install .

服务端启动命令

vllm serve "./Spark-X2.5-4B" \
  --port "30000" \
  --trust-remote-code \
  --served-model-name spark25 \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.7 \
  --enable-prefix-caching \
  --chat-template Spark-X2.5-4B/chat_template.jinja

客户端调用

curl -s http://127.0.0.1:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spark25",
    "messages": [{"role": "user", "content": "安徽省的省会是什么?"}],
    "temperature": 1.0,
    "top_k": -1,
    "top_p": 0.95
  }'

MLX

安装步骤

git clone https://github.com/XHToken/Spark-MLX-LLM.git
cd Spark-MLX-LLM
python3 -m venv .venv
source .venv/bin/activate

Apple silicon

python -m pip install -e .

Linux cpu

python -m pip install -e ‘.[cpu]’

Linux with cuda12

python -m pip install -e ‘.[cuda12]’

Linux with cuda13

python -m pip install -e ‘.[cuda13]’

运行Spark-X2.5

spark-mlx-generate \
  --device gpu \
  --dtype bfloat16 \
  --model XHToken/Spark-X2.5-1.7B \
  --prompt "请用三句话介绍合肥。" \
  --max-tokens 512 \
  --temp 0

Ollama(GGUF)

编译步骤

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8

创建并运行模型

printf 'FROM /absolute/path/to/your.gguf\n' > ./Modelfile.spark
./ollama serve
./ollama create Spark-X2.5-1.7B -f ./Modelfile.spark
./ollama run Spark-X2.5-1.7B

LM Studio(GGUF)

编译适配版模型

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8

配置LM Studio

  • 关闭LM Studio,将编译产物复制到<LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/目录。
  • 将llama.cpp-spark的构建产物复制到<selected-runtime>目录并替换对应文件。
  • 将GGUF文件放入<LM_STUDIO_HOME>/models/<org>/<name>/目录。

示例(macOS):

./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-<version>/

运行方式

  • LM Studio图形界面:在My Models中选择Spark-X2.5模型,点击Load后新建对话。
  • lms命令行:
# Replace `<model>` with a model listed by `lms ls`
lms load <model>
lms chat <model>
以上内容不代表本平台立场,仅供读者参考