文章摘要
9月初AI领域集中发布多款覆盖通用大模型、自动驾驶、多模态检索、本地推理调度、音视频生成方向的新模型与工具,核心产品为OpenAI推出的GPT-6 Astra,该闭源模型支持百万级上下文窗口,目前仅向特定企业客户开放,已公布定价规则。此外还有开源全场景大模型K2 Horizon等多款新品,各产品均明确了许可证与部署门槛。

近期AI领域多款新工具与模型集中发布,覆盖前沿通用大模型、自动驾驶专用基座、本地推理调度工具、多模态检索及音视频生成等多个方向,以下是详细汇总:

一、前沿通用大模型

OpenAI在9月3日正式推出GPT-6 Astra大模型,其模型标识为gpt-6-astra。这款模型支持文本与图片输入、文本输出,上下文窗口可达105万Token,最大输出Token数为128000,同时提供五个档位的推理强度供选择。用户可通过Responses API和Chat Completions接口调用该模型,支持流式传输、函数调用、结构化输出,以及网页搜索、文件检索、代码解释、托管Shell、计算机操作、技能调用和MCP等多种工具。其定价标准为每百万输入Token收费10美元,缓存输入每百万1美元,缓存写入12.5美元,输出每百万50美元;当单次请求输入超过272K Token时,将采用更高的费率标准。需要注意的是,GPT-6 Astra属于闭源服务,并未开放模型权重,当前仅向Trusted Access Program的企业客户开放,相关付费套餐和普通API访问权限将在后续数日分批推出,尚未对所有用户全面开放。

另一款开源大模型矩阵K2 Horizon推出,一次性开放了从0.9B到375B-A23B共六个不同参数量的版本,覆盖从端侧设备到本地工作站再到企业级服务的全场景需求。其中36B-A4B版本采用了Mixture-of-Value Attention和稀疏MoE架构,每个Token仅激活约40亿参数;375B-A23B版本则每个Token激活约230亿参数。本次开源不仅提供了最终的模型权重,还包括训练代码、模型配置、数据混合方案、细粒度日志、评测结果以及中间检查点;对于无法直接重新分发的数据,也提供了构建方法与配方。六个版本的模型均支持量化处理,并且在发布首日就获得了主流推理框架的适配支持,可运行在多种硬件平台上。K2 Horizon的模型与代码采用Apache-2.0许可证,而数据集则遵循各自的许可证协议,并非全部训练数据都采用该协议。部分训练基础设施和Agent强化学习代码官方仍标注为“即将发布”,具体的材料完整性建议以开源仓库的实际文件为准。

上手门槛

自行部署(0.9B—7B):门槛较低,提供量化版本并支持本地运行路径

自行部署(32B / 36B-A4B):需要高内存工作站或高显存GPU,门槛中等

自行部署(375B-A23B):完整权重规模巨大,需专业多卡服务器或集群,门槛极高

二、多模态检索工具

NeoMME是一款多模态检索工具,提供260M和800M两个参数量的多语言多模态编码器。与传统方案不同的是,它并未使用独立的视觉塔或因果语言解码器,而是将文本Token与32×32的图像Patch输入同一个双向Transformer进行统一编码。两个版本的模型均支持16384Token的上下文窗口和动态图片分辨率,可以直接处理包含排版、表格和图像信息的复杂文档页面。

其Retriever版本可以在一次前向计算中同时输出单向量Dense表示和128维的Late-interaction表示,用户可以先通过近似最近邻算法召回相关页面,再利用细粒度的图文匹配进行重排。根据项目方的测试数据,260M版本在单张专业显卡、2048×2048输入和预处理Tensor的条件下,处理速度可达约51页/秒;Late-interaction索引可以从平均每页约1.5MB压缩至约6KB/页,同时保留超过95%的基线检索指标。

需要注意的是,NeoMME属于编码器而非生成式视觉语言模型,基础编码器仅会输出上下文表征,无法直接完成文档问答任务,进行文档检索需要使用Retriever版本,生成最终答案仍需要连接外部的视觉语言模型。所有的模型Checkpoint均采用Apache-2.0许可证,官方还提供了可直接体验的视觉文档检索Demo。

上手门槛

在线使用:门槛较低,可通过公开平台直接体验视觉文档检索

自行部署:门槛较低,260M、800M权重均已开放,需使用较新版本的相关工具库

三、自动驾驶专用模型

Qwen-Drive-1.0-4B是一款自动驾驶专用模型,由Qwen团队联合华中科技大学推出,基于Qwen3.5-4B视觉语言模型架构开发,并外挂了BEV Perception Head与Planning Expert模块。其中BEV感知头可以同时完成3D目标检测、语义占用预测和BEV地图分割,规划专家则可以根据共享的视觉语言表征生成自车的未来行驶轨迹,原有的LLM Decoder则继续处理通用视觉问答和驾驶场景的视觉问答任务。

该模型的文件包包含多个核心模块,总体量较大。其规划输出为未来5秒、10Hz频率、共50个点的行驶轨迹;不同的规划模块有各自的适用场景,官方建议配合特定推理模式使用。官方建议使用24GB以上显存的设备运行该模型,项目仓库提供了完整的推理代码、多个Demo场景和感知样例。该项目采用Apache-2.0许可证,但需要注意的是,它目前仅作为自动驾驶研究基座和离线评测工具使用,不能直接等同于经过量产安全验证的车载系统。

上手门槛

自行部署:建议24GB以上显存,需安装相关依赖库,感知模式包含专用算子,门槛中等

四、本地推理调度工具

NVIDIA推出的Personal AI Router并非全新的推理引擎,而是位于Agent与本地推理服务之间的路由调度层。它可以向应用程序暴露兼容现有生态的接口,然后根据节点的在线状态、推理引擎、目标模型是否存在、当前任务量以及GPU利用率,将每个推理请求分配给符合条件的设备执行。

PAIR提供了多平台的安装包,可以混合连接多种不同的硬件设备。节点可以通过自动发现机制查找,也可以手动按IP地址添加;用户确认配对后,节点之间的通信将使用加密协议进行保护。需要明确的是,PAIR并不会合并多台机器的显存,也不会拆分模型或将一个请求跨多个节点执行,它主要提升的是多个独立推理请求的并发处理能力。NVIDIA在特定演示中显示,多设备集群完成任务的时间远短于单台设备,官方同时说明,实际表现取决于任务并行度、模型类型、硬件配置和网络状况。

上手门槛

自行部署:需至少两台同一局域网设备,每个节点仍需独立安装推理引擎并具备加载目标模型的内存,门槛中等

五、音视频生成模型

DreamX-Creator 1.0是一款音视频生成模型,在9月3日开放了完整的权重和推理代码。其核心是一个7B参数量的原生音视频生成器,音频流和视频流会先分别进行处理,再通过跨模态注意力机制进行双向的信息交换,有效减少了音画不同步的问题。

在生成阶段之后,专用的细化模块将生成的视频画面提升至2K分辨率;该细化模块也可以单独处理外部视频,原有的音频会保持不变。模型包中还包括多个辅助组件和依赖模块。官方提供了多种部署选项,但并未给出统一的最低显存要求。完整的模型权重体积较大,各个组件需要分别进行配置。该项目采用Apache-2.0许可证,优化版本和加速模型仍在后续开发计划中。

上手门槛

自行部署:需配置多个模型组件,官方提供多种部署路径,门槛中等

以上内容不代表本平台立场,仅供读者参考