魔搭Ornith-1.5-35B-A3B模型下载及部署方法汇总

Ornith AI团队近期开源了Ornith-1.5系列大语言模型,该系列凭借创新的端到端自改进训练范式,实现了性能与效率的双重突破。其中35B MoE版本仅需激活30亿参数,就在编码与智能体相关的基准测试中超越了同级稠密模型,展现出优异的实际应用价值。
多规格性能表现
本次开源的Ornith-1.5包含三个核心版本,覆盖从移动端到旗舰部署的全场景需求:397B MoE旗舰版、每token仅激活30亿参数的35B-A3B轻量化版本,以及支持移动端量化的9B稠密版,所有模型均采用MIT开源协议。
旗舰版397B模型在Terminal-Bench 2.1测试中取得了86.1的得分,接近顶级模型Claude Opus 4.8的85.0分,展现出媲美顶尖闭源模型的能力。
35B-A3B轻量化版本在全部编码与智能体基准测试中,同时超越了稠密架构的Gemma-4-31B和同参数量级的Qwen3.6-35B-A3B。相较于前代Ornith-1.0-35B-A3B,该版本在SWE-bench Pro任务上从50.4提升至59.6,提升幅度达9.2个百分点;NL2Repo任务从34.6提升至46.2,提升11.6个百分点。在DeepSWE和Frontier-Bench等高难度基准测试中,35B级别模型中仅Ornith-1.5实现了非零得分。
9B稠密版本则在多项任务中表现突出,甚至匹配或超越了参数量大数倍的Gemma-4-31B模型,为轻量化部署场景提供了优秀的选择。
核心训练逻辑:自主闭环的自我改进
Ornith-1.5在前代版本的基础上进行了扩展,将自我改进闭环从“脚手架与轨迹优化”升级为“任务生成、脚手架构建和解题轨迹”的联合优化。整个训练过程不再依赖人工整理的固定任务和手工设计的评测环境,而是通过自主迭代实现能力提升。
每个训练周期包含三个核心阶段:
任务提出
系统基于当前环境或代码库、任务类型的高层指令,以及模型过往的解题历史,生成难度递进的全新任务。这些任务会超出模型当前已解决的范围,从而暴露能力短板,持续推进训练的前沿边界。
脚手架生成
针对每个生成的任务,模型会自动构建或优化专属的任务脚手架,包括解决该问题所需的指令、工具调用规则、解题步骤分解策略和执行流程编排。
解题轨迹生成
基于任务和脚手架,模型生成完整的解题轨迹。该轨迹的奖励信号会回传给前三个阶段,让系统不仅学会优化解题方法,还能生成更有价值的训练任务和更高效的评测脚手架。
通过反复迭代这三个阶段,系统形成了完整的自我改进循环:更强的模型可以生成更难、更有信息量的任务;更完善的脚手架可以更好地激发模型能力;更高质量的解题轨迹则提供更有效的学习信号。整个过程无需依赖静态的训练分布或手工设计的智能体方案,持续在推理、编码和智能体任务上实现能力提升。
三个阶段分别由独立的奖励函数驱动:任务奖励要求生成的问题具备可验证性、合适的前沿难度(目标成功率约20%)和非冗余性;脚手架奖励衡量其与任务的对齐度、判分保真度和抗作弊能力;轨迹奖励则基于任务是否完成。三组奖励通过GRPO算法实现联合优化。
本地部署与使用指南
Ornith-1.5系列模型针对本地部署做了充分优化,支持多种硬件环境和部署方式:
35B-A3B版本总参数量约35B(MoE架构),bf16格式权重约70GB,推荐使用2张80GB显卡进行部署。官方同时提供FP8、NVFP4、GGUF以及MLX格式的量化版本,9B和397B规格也覆盖了GGUF、FP8、NVFP4等多种量化格式,适配不同的硬件需求。
当前该系列模型已支持通过vLLM、SGLang、Transformers、Ollama、llama.cpp和MLX等主流工具进行部署。推荐的推理参数为:temperature=0.6、top_p=0.95、top_k=20;复现基准测试时建议使用temperature=1.0。模型原生支持256K上下文长度,通过YaRN缩放(factor=4.0)可扩展至约1M token。
模型下载命令
model download --model ornith-ai/Ornith-1.5-35B-A3B --local_dir ./ornith-ai/Ornith-1.5-35B-A3B
vLLM部署示例
需要vLLM版本≥0.19.1:
vllm serve ornith-ai/Ornith-1.5-35B-A3B \
--served-model-name Ornith-1.5-35B-A3B \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 \
--max-model-len 262144 \
--gpu-memory-utilization 0.90 \
--enable-prefix-caching \
--enable-auto-tool-choice --tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--trust-remote-code
SGLang部署示例
需要SGLang版本≥0.5.9:
python -m sglang.launch_server \
--model-path ornith-ai/Ornith-1.5-35B-A3B \
--served-model-name Ornith-1.5-35B-A3B \
--host 0.0.0.0 --port 8000 \
--tp 2 \
--context-length 262144 \
--mem-fraction-static 0.85 \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3
Ollama / llama.cpp部署示例
先下载GGUF量化版本,再通过llama-server加载:
model download --model ornith-ai/Ornith-1.5-35B-A3B-GGUF --local_dir ./Ornith-1.5-35B-A3B-GGUF
llama-server --model ./Ornith-1.5-35B-A3B-GGUF/Ornith-1.5-35B-A3B-Q4_K_M.gguf
–port 8000 -c 262144
Ollama也可以通过Modelfile指向本地GGUF文件进行使用。
MLX部署(Apple Silicon)
先下载MLX量化版本,再通过mlx-lm启动服务:
model download --model ornith-ai/Ornith-1.5-35B-A3B-MLX-4bit --local_dir ./Ornith-1.5-35B-A3B-MLX-4bit
pip install mlx-lm
mlx_lm.server --model ./Ornith-1.5-35B-A3B-MLX-4bit --port 8000
也可以在Python中直接调用生成:
from mlx_lm import load, generate
model, tokenizer = load(“./Ornith-1.5-35B-A3B-MLX-4bit”)
response = generate(model, tokenizer, prompt=“Hello”, max_tokens=256)
OpenAI兼容API调用
服务启动后可通过标准OpenAI SDK直接访问,推理过程的思考内容会在reasoning_content字段返回:
from openai import OpenAI
client = OpenAI(
base_url=“http://localhost:8000/v1”,
api_key=“EMPTY”,
)
response = client.chat.completions.create(
model=“Ornith-1.5-35B-A3B”,
messages=[
{“role”: “user”, “content”: “Write a one-line Python lambda that squares a number.”}
],
temperature=0.6,
top_p=0.95,
max_tokens=1024,
)
message = response.choices[0].message
print(“reasoning:”, getattr(message, “reasoning_content”, None))
print(“answer:”, message.content)
该服务兼容OpenAI API格式,可以直接对接OpenCode、Hermes Agent、OpenClaw等终端编码工具,只需将OPENAI_BASE_URL指向本地部署的端点即可。

