7月开源模型汇总:Kimi K3领跑,具身智能与多模态爆发

7月开源模型赛道亮点突出:Kimi K3凭借出色的综合表现成为国产开源模型的标杆,具身智能相关模型密集发布,多模态、智能体工具等领域的数十款新模型集中开源,为行业带来了丰富的技术选择。
本月的开源模型汇总已经是持续更新的一年多的内容,为了方便更多开发者查阅和补充,相关内容同步更新到了GitHub仓库中,大家可以通过下方链接访问完整的汇总列表。
https://github.com/liucongg/awesome-open-llms
六月开源模型回顾
如果说六月的开源市场中GLM5.2凭借出色的表现一骑绝尘,那么七月的最大亮点则属于Kimi-K3,这款模型目前已经成为国产开源模型的标杆之一,不过其较高的部署成本和相对较慢的推理速度也是不容忽视的问题。
本月,英伟达相关负责人公开呼吁推动大模型开源,而英伟达本身也开源了多款自研模型。除此之外,本月开源的值得关注的模型还包括BOSS直聘的Nanbeige4.2-3B、Poolside的Laguna S 2.1以及美团的LongCat-2.0,不过不少开发者期待的Qwen3.8并未在七月开源,预计将推迟到八月发布。
值得注意的是,本月具身智能相关的开源模型数量明显增多,这一信号或许预示着行业在实体机器人和智能交互领域的布局正在加速。
七月开源模型详细汇总
具身智能与机器人相关模型
7月7日,阿里达摩院开源了用于机器人操作的RynnWorld-4D 4D具身世界模型,该模型可以根据单张参考图像和文本提示,生成同步的RGB、深度图和光流视频,为机器人的视觉交互提供了有力的支持。
7月9日,蚂蚁灵波连续开源了两款具身智能相关模型:LingBot-Video和LingBot-World 2.0。其中LingBot-Video采用DiT+MoE的架构,基于7万小时的具身数据训练,在RBench基准测试中取得了0.620的高分;LingBot-World 2.0则在初代版本的基础上,支持更多的动作与事件类型,可以稳定输出720p/60fps的高清实时交互画面。
7月14日,上海人工智能实验室开源了Agents-A1 4B级别具身智能模型,通过三阶段训练范式扩展了异构Agent的能力,擅长长视野搜索、工程开发、科学研究、指令遵循和工具调用等任务,该实验室在6月26日还开源了35B-A3B版本的同类模型。
7月15日,腾讯开源了Hy-Embodied-VLM-1.0视觉模型,面向物理世界的具身智能体开发;同日还发布了Hy-Embodied-RxBrain-1.0,这是一款面向具身认知的统一多模态基础模型。
7月15日,小米开源自回归世界基础模型Xiaomi-Robotics-U0,参数量为380亿,覆盖具身场景生成、具身迁移、具身视频生成以及通用图文生成四大核心任务方向。
7月19日,昆仑万维开源了交互世界模型Matrix-Game 3.5,通过引入Patch Memory技术实现了可控制摄像机视角的720p视频生成;同日面壁智能也开源了面向机器人操作的VLA模型MiniCPM-RobotManip。
7月20日,英伟达开源了全模态世界模型Cosmos3-Edge,支持结合文本、图像、视频和动作轨迹等多种输入,生成动态高质量的视频、图像、音频以及动作指令。
通用大模型与技术优化模型
6月30日,华为开源了openPangu-2.0-Flash模型,总参数量920亿,激活参数60亿,支持512K上下文窗口,训练数据约34万亿Tokens,集成了MLA、mHC、MTP、Muon等多项优化技术。
7月1日,英伟达开源了Nemotron-Labs-TwoTower扩散语言模型,参数量为30B-A3B,采用双塔结构来分别处理上下文和去噪任务。
7月2日,Mistral AI开源了Leanstral-1.5数学形式化证明模型,专为Lean 4设计,总参数量1190亿,激活参数60亿,在miniF2F形式数学基准测试的验证集和测试集上均实现了100%的完成率。
7月6日,美团开源了LongCat-2.0模型,总参数量1.6T,平均激活参数480亿,延续了零计算专家的架构,并提出了LSA稀疏注意力机制,新增了N-gram Embedding模块来优化文本表示能力。
7月6日,腾讯开源了混元Hy3正式版本,总参数量2950亿,激活参数210亿,支持256K上下文窗口,整体尺寸与DeepSeek-V4 Flash相当,但实测效果更优,能力表现接近GLM5.1。
7月16日,英伟达开源了Nemotron 3 Embed向量系列模型,提供1B和8B两种参数量版本,支持32K上下文窗口和34种语言的检索任务。
7月17日,上海人工智能实验室开源了Intern-S2-Preview-397B模型,在分子设计、材料结构生成等核心科学任务上的表现追平了此前的万亿参数级别模型。
7月21日,Poolside开源了Laguna S 2.1模型,总参数量1180亿,激活参数80亿,支持1M长度的上下文窗口,专为智能体编程和长周期任务设计。
7月22日,BOSS直聘开源了Nanbeige4.2-3B模型,该模型在代码智能体、办公智能体、复杂工具调用以及通用推理任务上表现出色。
7月22日,MindLab Research开源了Macaron-V1-Venti和Macaron-V1-Tall两款模型,分别基于GLM-5.2和Qwen3.6-35B-A3B进行后训练得到。
7月22日,韩国Upstage开源了Solar Open 2模型,总参数量2500亿,激活参数150亿,支持英语、韩语和日语三种多语言场景。
7月27日,Kimi开源了2.8T参数量的原生多模态模型K3,采用了Kimi Delta Attention、Attention Residuals、Stable LatentMoE等多项技术,目前是国产开源模型中的标杆产品,不过推理速度相对较慢。
7月29日,SKT开源了A.X K2模型,总参数量6880亿,激活参数330亿,采用原生FP8训练技术,优化了模型的部署和推理效率。
多模态、音频、视觉与工具模型
7月6日,快手开源了KAT-Coder-V2.5-Dev模型,基于Qwen3.6-35B-A3B进行后训练得到,优化了代码相关的处理能力。
7月6日,英伟达开源了Nemotron-Labs-Audex-30B-A3B统一音频文本大语言模型,在音频任务上表现出色,同时保留了纯文本LLM的强大推理、长上下文处理和智能体能力。
7月7日,蚂蚁灵波开源了LingBot-Depth 2.0空间感知模型,训练数据从300万扩充至1.5亿,在室内大面积深度缺失场景下的RMSE从0.132降低至0.062;同日还开源了LingBot-Vision视觉基座模型,提供Small、Base、Large和Giant四种尺寸,可用于密集特征可视化、图像特征提取以及主干网络初始化等场景。
7月7日,腾讯开源了HunyuanOCR-1.5模型,参数量10亿,在OmniDocBench榜单上获得了94.74分的成绩。
7月8日,商汤科技开源了SenseNova-Vision-7B-MoT统一多模态大模型,将异构的视觉感知任务重新表述为文本生成、图像生成或混合文本-图像生成的统一任务形式。
7月8日,微软开源了GUI模型GELab-Zero-4B-preview-Sico-Evolution,基于阶跃版本的GELab-Zero-4B-preview进行训练得到。
7月8日,腾讯开源了两款智能体技能检索模型:R3-embedding-0.6b和R3-Rerank-0.6B,分别用于召回和重排任务。
7月9日,OpenMoss开源了MOSS-Transcribe-Diarize 0.9B端到端音频理解模型,支持50多种语言的转录和说话人分离,可单次处理长达90分钟的音频,还支持通过自定义热词提示来处理领域特定术语。
7月11日,Kyutai与Mirelo开源了MuScriptor多乐器自动音乐转录模型,可将任意混音录音精准转换为多轨MIDI文件,提供small、medium、large三种不同参数量的版本。
7月13日,阿里通义万相开源了Wan-Dancer-14B音乐转舞蹈视频生成模型,可根据音乐生成长时间、高质量且富有节奏感的舞蹈视频。
7月14日,OpenMoss开源了MOSS-VL-Realtime实时流式视觉理解模型,参数量110亿,采用基于交叉注意力的视觉-语言架构,将视觉编码和语言推理进行了解耦。
7月14日,金山办公开源了MonkeyOCRv2模型,在文档解析、文档理解、文本识别、公式识别、文本检测、文档篡改检测以及重叠文本分割等多个任务上都有出色的表现。
7月15日,PrismML开源了Bonsai 27B模型,基于Qwen3.6-27B训练得到,还提供了1-bit量化版本,可在手机等移动设备上运行。
7月15日,阿里开源了OvisOCR2端到端OCR模型,基于Qwen3.5-0.8B模型训练得到,在OmniDocBench v1.6榜单上获得了96.58分的成绩。
7月15日,Thinking Machines Lab开源了原生多模态模型Inkling,总参数量9750亿,激活参数4100亿,训练数据总量达到4.5万亿Tokens。
7月17日,中国气象局开源了风和大模型,基于GLM-4.5-Air开发,使用了5000万tokens的气象语料和49万条指令数据进行微调。
7月17日,南京大学开源了VideoChat3视频理解模型,参数量40亿,可处理从细微运动到长达一小时的叙事视频,支持精确的时间定位和在线主动响应。
7月21日,百度Paddle开源了HPD-Parsing分层并行文档解析模型,基于InternVL3.5-1B训练,引入了分层并行解码和渐进式多Token预测技术,解决了长文档的解码瓶颈问题。
7月22日,微软开源了Mage-Flow图像模型,参数量40亿,支持基于文本的图像生成和基于指令的图像编辑任务。
7月23日,微软开源了Fara1.5-27B多模态浏览器操作模型,可通过屏幕截图观察浏览器页面,帮助用户发起结构化的工具调用,包括点击、输入、滚动、访问URL、网页搜索等,以端到端的方式完成各类任务。
7月24日,Swiss AI Initiative开源了Apertus 1.5多模态大模型,提供8B和70B两种参数量版本。
7月26日,微软开源了Mage-VL多模态模型,基于Qwen3-4B训练得到。
7月26日,一位个人开发者开源了Inflect-Micro-v2语音合成模型,参数量仅9.36M,以极低的参数量实现了高质量的语音合成效果。

