文章摘要
魔搭社区本周完成更新,共上新近5000件AI资源,包含4037个模型、732个专业数据集、165个创新应用及7篇技术文章,覆盖多个人工智能技术赛道。本次重磅上线多家机构的多款旗舰AI模型,新增多领域数据集与可直接体验的创新应用,为开发者提供丰富开源工具与学习资源。

本期开源模型社区迎来全面更新:共计上线4037个全新模型、732个专业数据集、165个实用创新应用,同时发布7篇深度技术文章,覆盖大语言模型、多模态模型、视觉任务编码器、语音生成工具等多个AI技术赛道,为开发者提供丰富的开源工具与学习资源。

重磅新增模型

GLM-5.3系列模型

智谱AI连续发布GLM-5.3系列两款旗舰模型。GLM-5.3主打超强能力,通过极限后训练技术在编码和网络安全基准测试中达到开源模型顶尖水平,已在真实代码库中发现2436个安全漏洞;GLM-5.3-Flash则是效率旗舰,作为GLM-5系列首个原生多模态模型,采用320B/18B激活架构,仅需1/10的部署成本就能在编码和智能体任务上接近Claude Opus 4.8的表现。

两款模型均使用IndexShare、SAO与slime后训练技术栈,在正式发布前,匿名版本ox-alpha就已经登顶相关平台的用量榜,全部流量运行于国产AI芯片。

模型合集地址:https://community.ai-model.org/collections/ZhipuAI/GLM-53

部署示例代码
# GLM-5.3-Flash(已可用)
modelscope download --model ZhipuAI/GLM-5.3-Flash --local_dir ./ZhipuAI/GLM-5.3-Flash

GLM-5.3(明日开源后可用)

modelscope download --model ZhipuAI/GLM-5.3 --local_dir ./ZhipuAI/GLM-5.3


SGLang部署代码

sglang serve 
–model-path ZhipuAI/GLM-5.3-Flash
–tp-size 4
–ep-size 4
–dsa-prefill-backend trtllm
–dsa-decode-backend trtllm
–kv-cache-dtype fp8_e4m3
–moe-runner-backend deep_gemm
–disable-shared-experts-fusion
–speculative-algorithm NEXTN
–speculative-num-steps 5
–speculative-eagle-topk 1
–speculative-num-draft-tokens 6
–speculative-adaptive
–reasoning-parser glm45
–tool-call-parser glm47
–host 0.0.0.0
–port 30000

<div>
  <h4>Qwen3.8-Flash-Next</h4>
  <p>通义千问开源的Qwen3.8-Flash-Next,作为预览Qwen4架构的多模态MoE模型,主模型参数量125B,搭配51B N-gram Embedding,每Token仅激活6B参数,原生支持262K上下文窗口,可通过YaRN技术扩展至1M。新架构针对Attention、Residual、Embedding与优化模块进行了全面升级,训练成本仅为Qwen3.7-Plus的1/9,在代码与办公场景中表现更优。Base版本在14项基准测试中的8项取得最佳结果,兼顾模型能力、响应速度与推理成本。</p>
  <p>模型地址:https://community.ai-model.org/models/Qwen/Qwen3.8-Flash-Next</p>
  <p>开发者可通过SGLang、vLLM、TokenSpeed、Unsloth等推理框架部署该模型。</p>
</div>

<div>
  <h4>Hy4 Preview</h4>
  <p>腾讯混元开源的新一代MoE旗舰模型,主干网络总参数量770B,每Token激活49B参数,支持1M上下文窗口,同时提供BF16与FP8两种权重格式。模型共计78层,除首层采用稠密FFN外,其余77层均使用MoE结构,每层配置256个路由专家与1个共享专家,每Token激活Top-8路由专家。</p>
  <p>该模型针对长程软件工程、办公数据分析、游戏开发与科学研究场景进行了强化,能够处理跨文件信息并生成文档、表格、演示文稿等交付物。官方评测显示,其在GPQA Diamond、SWE-bench Pro和SWE-bench Multilingual上分别取得92.3、65.7和82.9的分数,在内部工程任务盲测中表现略高于同类旗舰模型。目前模型已支持vLLM、SGLang部署,并开放微调与量化工具链。</p>
  <p>模型合集地址:https://community.ai-model.org/collections/Tencent-Hunyuan/Hy4-preview</p>
</div>

<div>
  <h4>WeMM-Embedding</h4>
  <p>腾讯微信视觉团队开源的基于Qwen3.5构建的通用多模态Embedding模型,提供2B、4B和9B三个版本,能够将文本、图像、视频、视觉文档及交错多模态输入编码到统一向量空间,输出结果经过L2归一化处理。其中9B版本在MMEB-v2上取得80.6的总分,截至2026年8月24日位列官方榜单第一,已应用于微信多个内部业务场景的推荐与检索任务。</p>
  <p>模型下载与使用代码可从社区平台获取,官方推荐使用transformers==5.2.0版本进行推理复现。</p>
</div>

新增专业数据集

  • PV-A:面向物理视觉理解与推理的数据集,通过视觉场景中的物体、空间关系与物理规律,评估多模态模型对真实世界物理知识的理解和推理能力。
  • CTW1500:自然场景弯曲文本检测经典数据集,包含1500张图像,采用文本行级的14点多边形标注,适合训练和评测模型对弯曲、多方向及不规则形状文字的检测能力。
  • MiniMax-H3-Self-Generated-Dataset:面向MiniMax-H3训练/微调构建的自生成音视频数据集,可用于文生音视频等任务的数据训练与实验。
  • Mental Timeline Atlas:收集约8.4万次空间点击的全球心理时间线数据集,用于研究不同语言、书写方向和人群的时间空间感知习惯。

所有数据集均可在社区平台下载使用。

创新应用上线

  • ABot-Recon 在线三维重建:高德CV Lab开源的万帧级流式3D重建模型,仅需连续12帧局部上下文即可从单目RGB视频持续重建长序列3D场景,在H100显卡上达到24.45 FPS的处理速度。
  • FireRedTTS3:统一语音生成与编辑模型,支持24种语言、21种中文方言的零样本声音克隆,可通过自然语言完成声音设计以及语音参数编辑。
  • TIPSv2 Feature Explorer:空间感知视觉-语言编码器,通过强化局部Patch与文本的细粒度对齐,提升多类视觉任务的空间理解能力,已在9类任务、20个数据集上验证有效性。

三款应用均可在社区平台直接体验试用。

社区精选技术文章

  • 微信团队开源WeMM-Embedding多模态向量模型,9B版本登顶榜单
  • Loopit开源Zing-0.5实时互动世界模型,实现高性能低推理成本
  • GLM-5.3系列正式开源,Flash版本已开放下载
  • 基于昇腾芯片构建可扩展的大模型强化学习后训练体系
  • Qwen3.8-Flash-Next发布,预览全新Qwen4架构特性
  • 轻量化LoRA训练工具上线,24GB显存即可训练超大规模模型
  • FireRedTTS3开源,实现多语言零样本语音克隆与编辑

👇点击关注开源模型社区公众号获取更多技术信息~

以上内容不代表本平台立场,仅供读者参考