Inkling模型部署指南:vLLM与SGLang适配方案

由前OpenAI首席技术官Mira Murati于2025年创办的Thinking Machines Lab,此前曾推出模型微调平台Tinker,如今正式推出其首款开源多模态基础模型Inkling。这款模型总参数量达9750亿,每轮推理仅激活410亿参数,基于45万亿个文本、图像、音频和视频Token进行预训练,支持百万级Token的上下文窗口与可控推理预算,原生覆盖文本、图像、音频三种模态的输入与处理,在推理、代码生成、工具调用、指令遵循等核心评测中的整体表现接近GLM 5.2、Kimi K2.6、DeepSeek V4 Pro等主流开源模型,定位偏向可定制的多模态基础模型。
模型核心能力
Inkling具备全面的多模态与智能体相关能力,涵盖代码生成、工具调用、视觉推理、音频理解以及长任务执行等场景。官方展示案例中,它可以一键生成求职申请Web应用,并通过浏览器工具自动读取用户资料、完成表单填写;还能根据完整提示生成9页内容详实的《Breakfast Around the World》美食旅行杂志,覆盖巴黎、东京、伊斯坦布尔、墨西哥城、香港和哥本哈根六大城市,通过网络检索验证饮食文化、城市信息与配图细节,最终输出格式统一、信息准确的成品内容。此外,它还能根据代码审查反馈连续迭代40轮,完成包含服务端、客户端、机器人与测试用例的多人贪吃蛇游戏开发。
模型架构与训练细节
Inkling是仅支持解码的混合专家模型,核心设计包含多项创新组件:
相对注意力机制
区别于常见的RoPE位置编码方式,Inkling采用相对注意力机制编码位置信息,每个注意力层会在计算过程中直接学习位置信息。除标准的键-查询-值三元组外,还增加了额外的投影层,生成每个标记、每个注意力头的相对特征R,结合键向量与查询向量的距离信息融入注意力计算模块。
混合注意力机制
解码器层在全局注意力与滑动窗口注意力之间交替使用:全局注意力可覆盖全部上下文信息,滑动窗口注意力仅关注固定上下文窗口,两者比例约为5:1,既提升了计算效率,最后一层还会通过全局注意力构建丰富的特征表示。
短时卷积
模型在隐藏状态上采用短时1D卷积SConv操作,读取当前标记与前序若干隐藏状态,滑动窗口大小由参数W控制,帮助实现局部注意力机制,同时让注意力与MoE模块摆脱局部表示的约束。
带共享专家的MoE设计
模型路由器会对分配到的6名专家与2名始终活跃的共享专家进行评估,选出排名靠前的k名专家参与计算。不同于多数多模态模型为每种模态配备独立编码器的方案,Inkling的多模态处理单元结构更为简洁:图像数据通过图像嵌入单元处理,音频数据转换为梅尔频谱后送入音频嵌入单元,视频输入还会额外加入时间维度信息,将相邻图像元素组合为局部块后送入hMLP模型,最终所有嵌入结果叠加形成统一的多模态输入。
部署与推理
Inkling基于Transformer架构,兼容SGLang、vLLM等主流推理引擎。其中BF16版本的显存需求约为2TB,NVFP4版本约为600GB,通常需要多GPU或多节点部署,以下以面向NVIDIA Blackwell GPU的NVFP4权重与8卡张量并行为例进行说明。
模型下载
modelscope download \
--model thinkingmachines/Inkling-NVFP4 \
--local_dir ./Inkling-NVFP4
vLLM部署
uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
git clone https://github.com/vllm-project/vllm.git
cd vllm
uv pip install --editable . --torch-backend=auto
启动vLLM服务:
export VLLM_USE_V2_MODEL_RUNNER=1
export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
vllm serve ./Inkling-NVFP4 \
--tokenizer-mode inkling \
--reasoning-parser inkling \
--tool-call-parser inkling \
--enable-auto-tool-choice \
--tensor-parallel-size 8 \
--speculative-config '{"method":"mtp","num_speculative_tokens":8}' \
--kernel-config.enable_flashinfer_autotune=False \
--trust-remote-code
SGLang部署
git clone https://github.com/sgl-project/sglang
cd sglang
pip3 install pip --upgrade
pip3 install "transformers>=5.6.0"
pip3 install -e "python"
启动SGLang服务:
export SGLANG_ENABLE_UNIFIED_RADIX_TREE=1
python3 -m sglang.launch_server \
--model-path ./Inkling-NVFP4 \
--tp 8 \
--quantization modelopt_fp4 \
--attention-backend fa4 \
--page-size 128 \
--fp4-gemm-backend flashinfer_trtllm \
--moe-runner-backend flashinfer_trtllm_routed \
--enable-torch-symm-mem \
--mamba-radix-cache-strategy extra_buffer \
--mem-fraction-static 0.85 \
--swa-full-tokens-ratio 0.1 \
--mamba-full-memory-ratio 0.1 \
--enable-multimodal \
--reasoning-parser inkling \
--tool-call-parser inkling \
--host 0.0.0.0 \
--port 30000
附录:模型得分
模型的官方评测得分可通过官方技术博客查阅获取详细信息。


