8月11日四大AI模型发布:Agent、音视频、视频描述及图表工具

8月12日公开的多款AI工具覆盖了智能体开发、音视频生成、多模态理解和图表生成四大方向,涵盖从本地轻量化部署到高性能云端运行的全场景方案,以下是各项目的详细介绍。
本次更新的核心项目包括:用于智能体高频执行的专用模型、轻量化本地混合推理工具、新一代音视频生成管线、多参考图视频描述模型,以及图表生成Agent技能。
专用Agent执行模型:NVIDIA Nemotron 3.5 Lightning
这款模型于8月11日正式开放,采用Mamba-2、混合专家模型(MoE)与部分注意力层交错的混合架构,整体参数量为30B,每处理一个Token仅激活约3B参数。它的定位并非替代大型规划模型,而是专注于承担长时智能体中占比最高的高频执行步骤,包括工具调用、结果校验和子任务执行,最高支持1M上下文长度。
模型内置多Token预测功能,并配套DSpark、DFlash等推测解码方案,项目方测试数据显示,其输出速度最高可达同级模型的4倍,在相近准确率下可将智能体任务完成时间缩短约30%。
该模型提供NVFP4格式的权重,支持通过vLLM、TensorRT-LLM和SGLang进行部署,官方给出的单GPU运行方案包括DGX Spark与H100,同时也适配RTX 5090、H200、GB200和Ampere系列显卡。
权重采用OpenMDW-1.1协议,并非Apache-2.0开源协议。相关团队同时开放了部分训练数据、评测配方和智能体强化学习数据,但完整训练语料中仍包含需要审批的数据、供应商数据及未公开内容。
上手门槛
在线使用:门槛低,相关平台提供Chat入口,普通账号即可登录
开发接入:门槛低,多个公开平台已开放接入,且提供免费额度
自行部署:门槛中等,30B MoE的NVFP4权重已公开,支持上述部署框架,官方提供单GPU运行方案
相关资源:模型权重、在线体验入口与官方说明文档可通过公开技术社区获取。
轻量化本地混合推理模型:Ling-3.0-tiny
蚂蚁百灵于8月11日推出Ling-3.0-tiny,模型总参数量为7.9B,每Token仅激活1.3B参数,采用KDA与MLA按3:1的比例交替堆叠的架构,在128个路由专家中激活8个专家与1个共享专家。该模型支持开关式思考模式,适配通用智能体、代码开发、数学与科学推理等场景。
官方同时提供BF16、FP8和INT4三种精度的权重版本,其中FP8版本在M4 Pro MacBook设备上可达到86—90 token/s的生成速度,8K上下文场景下峰值内存占用约8.34GiB;在DGX Spark设备上则可达到100—105 token/s。需要注意的是,本地短上下文的测试数据并不代表256K长上下文也能以相同资源运行。
部署方面,SGLang已提供专用镜像支持,vLLM需要使用inclusionAI的适配分支;Apple Silicon设备的Ollama部署路径目前仍依赖未正式发布的功能和本地源码构建,尚未实现一键支持。该模型采用MIT开源许可证。
上手门槛
开发接入:门槛低,公开平台提供OpenAI兼容的API接口,注册获取API Key后即可调用
自行部署:门槛较低,三种精度的权重均已发布,短上下文本地部署已在M4 Pro设备上验证完成,256K长上下文则需要更高显存支持
相关资源:模型权重与API入口可通过公开技术社区获取。
音视频生成与多模态理解工具
首先是新一代音视频生成模型LTX-2.5,该版本于8月11日发布并被设为当前推荐版本。新版本升级了扩散视频解码器,引入原生多镜头生成能力,可在单次输出中保持角色、场景、灯光、画面风格和声音的连续性;同时加入了面向物理AI的预训练检查点,以及空间和时间细化、HDR、配音与口型匹配等功能流程。
该模型的核心Transformer为22B DiT,同时需要定制Gemma 4 12B文本编码器、视频和音频VAE、vocoder、连接器及超分组件。官方Quick Start所需的组件下载量约66GiB;Diffusers仓库的蒸馏路径下载量约72GB,包含完整Transformer的完整版本则约110GB。官方未给出统一的最低显存要求,低显存环境可通过FP8量化、CPU卸载或磁盘卸载来运行。
LTX-2.5支持本地推理、LoRA微调与完整模型微调,同时提供托管的体验入口。权重采用专用社区许可协议:年收入低于1000万美元的实体可免费商用,超过该门槛则需要签署商业协议,转移或分发微调后的成果也可能需要付费许可。
上手门槛
在线使用:门槛低,官方体验平台可直接使用,仅需账号登录
自行部署:门槛较高,需要同时加载22B DiT、12B文本编码器和音视频相关组件,低显存环境需使用FP8量化或CPU/磁盘卸载
相关资源:项目地址、模型权重与在线体验入口可通过公开代码托管平台获取。
另一款多模态理解工具是RefCaptioner,这是基于Qwen3-VL-8B-Instruct的多参考图视频描述模型。其核心功能是根据输入的视频与按顺序排列的参考图,生成英文描述文本,并将<Image_n>标签绑定到对应视觉短语之后,若参考图与视频内容无关,模型会主动省略该标签,而非强制绑定全部参考图。
当前发布的是已合并权重的8.77B BF16 checkpoint,仓库存储大小约17.6GB,无需额外加载PEFT Adapter。官方提供了确定性推理脚本,默认按2 FPS抽取视频帧,支持最长18K Token的输入。多卡并行仅用于整套评测样本的并行处理,并非单次推理的硬性要求。
该模型更适合多参考视频理解、素材匹配和局部视觉归因等研究场景,不支持人物身份核验、敏感属性判断或素材权属证明等任务。其生成结果依赖抽帧策略,短暂发生的事件可能在采样间隔中被遗漏,且当前输出语言和格式主要面向英文研究任务。模型采用Apache-2.0开源协议。
上手门槛
自行部署:门槛较低,8.77B BF16合并权重已公开,官方提供了推理脚本,多图和视频输入会增加显存占用
相关资源:模型地址与论文地址可通过公开技术社区获取。
图表生成Agent技能:diagram-design
diagram-design并非独立的画图应用,而是一套Agent Skill工具。它可以根据自然语言指令选择架构图、流程图、时序图、ER图、甘特图、象限图等图表类型,生成无需额外构建步骤的自包含HTML+SVG文件,并通过低信息密度、单一强调色和规则网格来约束视觉输出效果。
该项目于8月11日新增了draw.io导入与语义重绘支持,可解析原始XML、压缩Base64、PNG内嵌数据和SVG content属性,随后可根据输出尺寸、细节级别以及三类目标受众重新绘制图表。工具会保留组件、关系、分组和流向,但不会原样复制原始图表的坐标、配色、字体和杂乱连线。
基础的HTML/SVG输出仅需要兼容Agent Skills的编程Agent和现代浏览器即可运行,PNG导出则需要安装相关工具。该工具支持多个主流编程智能体平台,采用MIT开源协议。首次使用默认样式时,用户可选择品牌适配、手动设计或继续使用默认设计。
上手门槛
开发接入:门槛较低,主流平台提供安装命令,基础HTML/SVG输出无额外服务依赖,仅PNG导出需要额外工具支持
相关资源:项目地址可通过公开代码托管平台获取。

