文章摘要
近期腾讯混元团队正式开源总参数量770B的新一代旗舰MoE模型Hy4 preview,该模型单token仅激活49B参数,支持最长1M上下文,采用Apache 2.0开源协议。它针对软件工程、办公分析、游戏开发、科研等真实生产力场景优化,内部盲测表现优于部分同类模型,在多个科研领域取得突破,官方提供下载体验入口与本地部署调用指南。

近期,腾讯混元团队正式开源新一代旗舰MoE模型Hy4 preview,这款模型总参数量达770B,每token仅激活49B,支持最长1M的上下文长度,采用Apache 2.0开源协议,在软件工程、办公分析、游戏开发与科学研究等多类真实生产力场景中展现出卓越的综合表现。

获取与体验入口

模型提供BF16与FP8两个版本供开发者下载使用:

你可以通过官方体验平台快速上手模型:https://aistudio.tencent.com/

更多技术细节可查阅官方技术博客:https://hy.tencent.com/research/hy4-preview

专为真实生产力场景优化的核心能力

Hy4 preview通过与腾讯内部软件工程、游戏、金融、安全等领域的顶尖专家共建高质量训练数据,在各类实际业务场景中实现了显著能力提升:

  • 软件工程领域:强化了长程开发任务的理解、规划、调试与验证能力,同时进一步提升了前端开发的视觉审美与交互质量优化能力
  • 办公分析场景:大幅提升复杂办公环境理解与金融分析能力,重点优化了数据分析、跨文件协作流程,可以完成从信息处理到文档、表格与演示文稿交付的全链路任务
  • 游戏开发方向:支持根据一句自然语言需求直接生成可玩游戏原型,能够熟练调用主流游戏引擎,开发者可通过多轮交互持续完善复杂游戏项目
  • 科学研究场景:显著提升了复杂科研问题的理解、推理与求解能力,在AI研发、分子动力学模拟、凝聚态物理、基础数学等多个细分场景中均实现了长足进步

同时,Hy4 preview与CodeBuddy、WorkBuddy等内部产品深度协同,进一步优化了真实生产力场景下的用户体验。腾讯混元团队组织163名内部专家开展了203个工程任务的盲测,结果显示Hy4 preview的平均得分为2.99/4.00,略优于GLM-5.3的2.92/4.00(胜率46.8%、平局12.8%、负率40.4%)与Kimi K3的2.94/4.00(胜率51.2%、平局7.9%、负率40.9%)。

典型落地案例展示

通过MCP接入Unreal 5引擎,仅通过自然语言对话即可从零搭建射击游戏Demo,涵盖环境美术搭建、玩法逻辑设计与关卡布局构建全流程

在Unity引擎中通过对话式交互从零制作第三人称企鹅冒险游戏Demo,完成场景环境美术搭建、移动战斗与任务追踪玩法设计,以及主菜单、加载页、关卡场景的完整流程搭建

基于Three.js实现参数化程序化建模,通过Canvas程序生成IBL与纹理,配合per-model取景覆盖,快速生成面向桌面端的全视口可交互古建筑数字卷宗网站

生成原生WebGL滚动驱动的横向互动漫画页面,Hy4 preview能够稳定维持多章节角色的画风与叙事连续性,同时精准编排分镜空间、镜头节奏与移动端性能优化

在企业财务费用稽核场景中,模型可从72份业务文件中自动判断发票合规性,并从3份现行规章制度中定位有效规则,完成发票报销申请的严格审核

搭建金融世界沙盒工具,直观展示模型在金融研究、产业链理解、因果推演与估值分析方面的能力,可清晰呈现宏观事件如何传导至行业供需、产业链、核心企业与行业价值分配的完整路径

科研场景的深度突破

自主优化推理基础设施

Hy4 preview能够自主分析推理系统的性能瓶颈,围绕算子融合、通信优化等方向开展多轮迭代优化,最终实现端到端吞吐相较基线版本提升31.8%,且在不同上下文长度与并发度下均能保持稳定的性能增益,验证了其自主定位瓶颈并持续优化推理基础设施的能力。

小模型后训练任务协调能力

Hy4 preview可以像专业研究者一样管理多个Codex Session开展实验,并根据实验结果持续调整探索方向。在小模型后训练任务中,该模型作为协调者同步优化多个评测目标,在8项核心评测指标上均优于Codex独立探索的表现,体现了其在复杂研发任务中判断方向、组织实验与持续迭代的综合能力。

机器学习力场分子动力学模拟

配合Hyra工具,Hy4 preview在机器学习力场分子动力学模拟场景中取得显著进步:32512原子磷脂双分子层SO3LR模型在高度优化的JAX实现基础上进一步提速2.0倍,达到54.9ms/step的处理速度,单张高端GPU即可支持30万原子的模拟任务,为新材料筛选、药物分子研究与复杂生命体系模拟打开了更大的计算空间。

低温量子输运器件设计

针对凝聚态物理中的低温量子输运器件设计需求,Hy4 preview自主完成了量子散射求解器构建、五势垒结构的稳健优化与独立含时演化验证,将高能阻带平均泄漏率从基线版本的48.2%降至4.8%。同时,模型自动生成了封装完整求解流程、支持参数调优与重新求解的交互式模拟器,完整实现了从多阶段科学计算、结果验证到可探索成果交付的全流程。

经典几何难题突破

配合Hyra工具,Hy4 preview在百年经典几何难题——三维Blaschke-Lebesgue问题上取得重大突破,将体积下界从0.380799推进至0.41104,相较于Meissner四面体猜想给出的0.41986,该成果让这一猜想距离最终证明仅剩下2%的差距。相关完整证明文档可查阅:官方证明链接

本地部署与调用指南

生产环境推荐使用vLLM或SGLang进行部署,官方提供了对应的部署配置文件:

模型下载

可以通过以下命令快速下载模型:

modelscope download --model Tencent-Hunyuan/Hy4-preview --local_dir Tencent-Hunyuan/Hy4-preview

vLLM部署方式

使用官方预构建镜像进行部署:

docker run --gpus all \
  -p 8000:8000 \
  --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:hy4-preview Tencent-Hunyuan/Hy4-preview \
  --tensor-parallel-size 8 \
  --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
  --attention-backend FLASHMLA_SPARSE \
  --tool-call-parser hy_v4 \
  --reasoning-parser hy_v4 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy4-preview

SGLang部署方式

使用支持x86与Arm多架构的官方预构建镜像:

docker pull lmsysorg/sglang:hy4-preview
docker run --gpus all --ipc=host -p 8000:8000 lmsysorg/sglang:hy4-preview \
  python3 -m sglang.launch_server \
  --model Tencent-Hunyuan/Hy4-preview \
  --tp-size 8 \
  --reasoning-parser auto \
  --tool-call-parser auto \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --port 8000 \
  --served-model-name hy4-preview

OpenAI兼容接口调用

服务启动后,可以通过OpenAI兼容接口调用模型:

from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
  model="hy4-preview",
  messages=[
    {"role": "user", "content": "Hello! Can you briefly introduce yourself?"},
  ],
  temperature=0.9,
  top_p=1.0,
)
print(response.choices[0].message.content)
以上内容不代表本平台立场,仅供读者参考