文章摘要
2025 年 Thinking Machines Lab 推出开源多模态基础模型 Inkling,总参数量 9750 亿。它具备多模态与智能体能力,采用多项创新架构设计。该模型兼容 SGLang、vLLM 等推理引擎,文中给出面向 NVIDIA GPU 的部署步骤及命令示例。

由前OpenAI首席技术官Mira Murati于2025年创办的Thinking Machines Lab,此前曾推出模型微调平台Tinker,如今正式推出其首款开源多模态基础模型Inkling。这款模型总参数量达9750亿,每轮推理仅激活410亿参数,基于45万亿个文本、图像、音频和视频Token进行预训练,支持百万级Token的上下文窗口与可控推理预算,原生覆盖文本、图像、音频三种模态的输入与处理,在推理、代码生成、工具调用、指令遵循等核心评测中的整体表现接近GLM 5.2、Kimi K2.6、DeepSeek V4 Pro等主流开源模型,定位偏向可定制的多模态基础模型。

模型核心能力

Inkling具备全面的多模态与智能体相关能力,涵盖代码生成、工具调用、视觉推理、音频理解以及长任务执行等场景。官方展示案例中,它可以一键生成求职申请Web应用,并通过浏览器工具自动读取用户资料、完成表单填写;还能根据完整提示生成9页内容详实的《Breakfast Around the World》美食旅行杂志,覆盖巴黎、东京、伊斯坦布尔、墨西哥城、香港和哥本哈根六大城市,通过网络检索验证饮食文化、城市信息与配图细节,最终输出格式统一、信息准确的成品内容。此外,它还能根据代码审查反馈连续迭代40轮,完成包含服务端、客户端、机器人与测试用例的多人贪吃蛇游戏开发。

模型架构与训练细节

Inkling是仅支持解码的混合专家模型,核心设计包含多项创新组件:

相对注意力机制

区别于常见的RoPE位置编码方式,Inkling采用相对注意力机制编码位置信息,每个注意力层会在计算过程中直接学习位置信息。除标准的键-查询-值三元组外,还增加了额外的投影层,生成每个标记、每个注意力头的相对特征R,结合键向量与查询向量的距离信息融入注意力计算模块。

混合注意力机制

解码器层在全局注意力与滑动窗口注意力之间交替使用:全局注意力可覆盖全部上下文信息,滑动窗口注意力仅关注固定上下文窗口,两者比例约为5:1,既提升了计算效率,最后一层还会通过全局注意力构建丰富的特征表示。

短时卷积

模型在隐藏状态上采用短时1D卷积SConv操作,读取当前标记与前序若干隐藏状态,滑动窗口大小由参数W控制,帮助实现局部注意力机制,同时让注意力与MoE模块摆脱局部表示的约束。

带共享专家的MoE设计

模型路由器会对分配到的6名专家与2名始终活跃的共享专家进行评估,选出排名靠前的k名专家参与计算。不同于多数多模态模型为每种模态配备独立编码器的方案,Inkling的多模态处理单元结构更为简洁:图像数据通过图像嵌入单元处理,音频数据转换为梅尔频谱后送入音频嵌入单元,视频输入还会额外加入时间维度信息,将相邻图像元素组合为局部块后送入hMLP模型,最终所有嵌入结果叠加形成统一的多模态输入。

部署与推理

Inkling基于Transformer架构,兼容SGLang、vLLM等主流推理引擎。其中BF16版本的显存需求约为2TB,NVFP4版本约为600GB,通常需要多GPU或多节点部署,以下以面向NVIDIA Blackwell GPU的NVFP4权重与8卡张量并行为例进行说明。

模型下载

modelscope download \
  --model thinkingmachines/Inkling-NVFP4 \
  --local_dir ./Inkling-NVFP4

vLLM部署

uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
git clone https://github.com/vllm-project/vllm.git
cd vllm
uv pip install --editable . --torch-backend=auto

启动vLLM服务:

export VLLM_USE_V2_MODEL_RUNNER=1
export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
vllm serve ./Inkling-NVFP4 \
  --tokenizer-mode inkling \
  --reasoning-parser inkling \
  --tool-call-parser inkling \
  --enable-auto-tool-choice \
  --tensor-parallel-size 8 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":8}' \
  --kernel-config.enable_flashinfer_autotune=False \
  --trust-remote-code

SGLang部署

git clone https://github.com/sgl-project/sglang
cd sglang
pip3 install pip --upgrade
pip3 install "transformers>=5.6.0"
pip3 install -e "python"

启动SGLang服务:

export SGLANG_ENABLE_UNIFIED_RADIX_TREE=1
python3 -m sglang.launch_server \
  --model-path ./Inkling-NVFP4 \
  --tp 8 \
  --quantization modelopt_fp4 \
  --attention-backend fa4 \
  --page-size 128 \
  --fp4-gemm-backend flashinfer_trtllm \
  --moe-runner-backend flashinfer_trtllm_routed \
  --enable-torch-symm-mem \
  --mamba-radix-cache-strategy extra_buffer \
  --mem-fraction-static 0.85 \
  --swa-full-tokens-ratio 0.1 \
  --mamba-full-memory-ratio 0.1 \
  --enable-multimodal \
  --reasoning-parser inkling \
  --tool-call-parser inkling \
  --host 0.0.0.0 \
  --port 30000

附录:模型得分

模型的官方评测得分可通过官方技术博客查阅获取详细信息。

以上内容不代表本平台立场,仅供读者参考