8月AI模型与工具更新汇总:Qwen3.8、Grok4.6等上手指南

8月13日的AI工具更新覆盖三大核心领域:顶级大模型与云端API服务、常驻式智能代理工具,以及语音合成与生成系统。其中既有头部厂商开放的超大参数旗舰模型权重,也有云端服务的新版本迭代,开源工具则重点优化了多智能体协作、代码执行能力和高并发语音服务的稳定性。
顶级大模型与云端API服务
★ Qwen3.8-2.4T-A95B
这款模型是Qwen首次公开的Max级旗舰权重,总参数规模达2.446T,每Token激活约95B,采用512个路由专家架构。原生支持262144Token的上下文长度,通过专业推理框架可扩展至约1010000Token。
截至8月13日,该模型已在Hugging Face平台公开,开放的权重版本仅支持文本输入,且思考模式无法关闭,但可通过low、medium、xhigh三个档位调节推理强度。云端版Qwen3.8-Max则额外提供视觉输入、非思考模式、官方工具和托管扩缩容能力,与开源权重版存在明显差异。
BF16格式的权重包实际占用约4.89TB,分为213个safetensors格式的权重分片。目前已有SGLang、vLLM和TokenSpeed提供部署路径,但部署仍需多机多卡环境和专业的推理运维能力。该模型采用Qwen3.8-Max自定义许可证:普通用户可自由使用、修改、部署和分发;月活或月收入达到特定标准的商业产品需显著展示模型名称,年收入超过5000万美元的MaaS、AI编程或办公助手业务则需另行取得官方授权。
上手门槛
开发接入:🟢 低|通过QwenCloud提供的兼容OpenAI、Responses与Anthropic的接口,注册获取API Key后即可调用
自行部署:🔴 极高|BF16权重约4.89TB,需要多机多卡、模型切分与专业推理运维支持
★ DeepSeek-V4-Pro-0813
该版本通过兼容OpenAI与Anthropic的API提供服务,支持1M上下文长度、最大384K输出长度,且思考模式可自由切换。
DeepSeek的官方API文档已将稳定模型名deepseek-v4-pro对应的服务版本更新为DeepSeek-V4-Pro-0813。现有应用无需修改模型名称即可调用新版本,但这意味着生产环境会随稳定别名自动升级,对结果可复现性有要求的团队需要重新进行提示词调试、工具调用测试和回归验证。
官方文档列出的核心能力包括1M上下文窗口、最大384K的输出长度、默认开启但可关闭的思考模式,以及JSON输出、工具调用、Responses API、Anthropic API和对话前缀续写功能。FIM补全功能仅在非思考模式下支持。
当前的定价标准为:缓存命中输入每百万Token 0.025元,缓存未命中输入每百万Token 3元,输出每百万Token 6元,并发限制为500。官方同时提示近期计划整体上调API定价。需要注意的是,本次更新仅针对托管API正式版,截至核验时,对应的新权重、训练代码和技术报告尚未同步公开。
上手门槛
开发接入:🟢 低|兼容OpenAI与Anthropic API,沿用稳定模型名deepseek-v4-pro,注册获取API Key后即可调用
API文档:https://api-docs.deepseek.com/
模型定价:https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
★ Grok 4.6
xAI在8月12日发布的这款模型,核心升级方向并非扩大参数规模,而是强化智能代理的持续工作能力。官方表示,该模型优化了代码库分析、学术研究、工具调用、Web应用开发和CAD设计等多步任务的执行效果,并在较长的执行轨迹中增加了自测与校验环节。
API模型名为grok-4.6,支持文本和图像输入、文本输出,提供500K的上下文窗口,以及low、medium、high、xhigh四档推理强度档位。通过Responses API和Chat Completions均可调用函数、网页搜索、X搜索和代码执行功能,知识截止时间为2026年2月1日。
计费标准为:上下文长度不足200K时,每百万Token输入收费2美元、缓存输入0.5美元、输出6美元;当上下文达到200K及以上时,整次请求按输入4美元、缓存1美元、输出12美元计费。目前Grok 4.6已接入xAI API、Grok Build、Cursor及多家模型网关,但尚未开放模型权重或训练代码。
常驻式智能代理工具
★ Grok Bot
xAI在8月11日开放了Grok Bot的早期测试版,这款产品并非传统的单次对话助手,而是一组搭载云端计算机的常驻智能代理。用户可以让Bot登录CRM、邮箱、客服系统和内部业务工具,跨网页与桌面应用完成销售、运营、招聘、报销和缺陷复现等任务,即使关闭本地电脑,云端的任务仍可继续运行。
多个Grok Bot可以并行工作并互相传递上下文,还可以记录用户完成的流程并保存为可重复执行的Routine。目前产品提供桌面端和iOS入口,Windows和Apple Silicon macOS已有安装包可供下载,企业用户仍需加入等待名单才能使用。
Grok Bot属于闭源托管产品,未公开本地自部署或离线运行的方案。由于需要登录真实的业务系统并在云端保留工作上下文,账号授权、最小权限原则、审批节点和敏感数据安全策略是企业实际采用前需要重点考虑的事项。
★ Lime v1.126.0
这款工具可以在独立的V8进程中运行智能代理生成的JavaScript代码,并统一管理异步任务、等待和取消的生命周期。
Lime在8月12日发布了v1.126.0版本,完成了Code Mode的桌面主链开发,将代理生成的JavaScript代码放到独立的code-mode-host进程中的V8 isolate中执行,并补充了异步cell、共享状态、通知、等待、终止和取消等机制。
该设计将模型的编排代码与桌面应用的主进程分离,同时为OpenAI Responses增加了custom tools的能力门禁,在工具参数类型、JSON Schema和流式传输出现异常时采用fail closed策略。需要注意的是,V8 isolate仅隔离编排JavaScript代码,代理调用文件、终端、MCP和外部工具时仍会执行真实操作,不能将其等同于完整的操作系统沙箱。
Lime本身不提供模型服务,用户需要自行配置模型提供商和凭证。项目代码采用GPLv3许可证,提供Windows、macOS Intel和Apple Silicon的安装包;Linux桌面版暂停发布,但在Release页面仍提供命令行压缩包。
上手门槛
自行部署:🟢 较低|Windows与macOS提供安装包,需自行配置模型提供商与凭证
项目地址:https://github.com/limecloud/lime
版本说明:https://github.com/limecloud/lime/releases/tag/v1.126.0
★ CowAgent 2.1.6
该工具可以让主智能代理并行委派带有隔离上下文的子任务,并补充了自定义代理、记忆检索和断线恢复的工程能力。
CowAgent在8月12日发布了2.1.6版本,主代理现在可以将独立任务交给多个子代理并行执行,内置通用型和探索型两种子代理类型,用户也可以在工作区使用Markdown定义系统提示词和工具集。子代理使用独立的上下文,减少了主对话的Token占用。
新版本还新增了按模型保存的reasoning effort、Claude thinking展示、可插拔向量检索后端和SSE断线重连功能。在安全方面,为无人值守的自进化写入增加了校验、回滚和工作区级串行控制,并修复了Skill路径验证及两项依赖拒绝服务漏洞。
项目采用MIT许可证,提供macOS、Windows桌面客户端以及Docker和脚本部署路径,用户需要自行配置模型服务。CowAgent支持读写文件、运行终端、控制浏览器、安装Skills并调用MCP,官方明确提醒仅可在可信环境中部署,桌面安装便捷并不代表默认具备强沙箱能力。
上手门槛
自行部署:🟢 较低|提供桌面客户端和Docker,单机可运行,需自行配置模型提供商
项目地址:https://github.com/zhayujie/CowAgent
版本说明:https://github.com/zhayujie/CowAgent/releases/tag/2.1.6
语音合成与生成工具
★ dots.tts
这是一套基于约2B参数的连续自回归模型的语音系统,可实现48kHz语音合成、零样本声音克隆、语音编辑和流式服务,且无需使用离散音频Token。
dots.tts在8月新增了单步、两步和STTS检查点,并在8月12日更新了文档,补充了SGLang Omni对MeanFlow、两步sCM、STTS、SOAR和Base权重的服务说明。
开发者可以通过普通文本生成语音,或通过参考音频实现零样本声音克隆,也可以使用dots.tts.edit完成语音的替换、插入、删除、情绪调整、音高、语速和停顿等局部编辑。最新的STTS权重约2.20B参数,仓库存储约5.16GB,支持48kHz音频和中英文、粤语等多语言输入。
SGLang Omni可以通过兼容OpenAI的/v1/audio/speech接口提供连续批处理、流式PCM和CUDA Graph解码功能。官方在单张H100的测试中,MeanFlow在并发16时达到4.76请求/秒;但当前STTS服务要求请求开始时就拥有完整的文本或Token序列,无法向正在进行的请求持续追加Token。代码和公开权重均采用Apache-2.0许可证,声音克隆功能仍需增加授权、标注和防冒用措施。
上手门槛
在线使用:🟢 低|Hugging Face提供TTS与语音编辑的Playground
自行部署:🟢 较低|2.20B BF16权重约5.16GB,CLI和Python API可直接运行,高并发服务需额外配置SGLang Omni
项目地址:https://github.com/studio-dots-ai/dots.tts

