8月AI新工具爆发:DeepSeek/Arcee/Google等5大项目全解析

8月14日最新的AI工具更新覆盖了多个领域:包括旗舰大语言模型、智能体执行框架、多模态理解工具以及任务调度系统,其中智谱发布了全新的GLM-5.3模型,DeepSeek同步开放了V4 Pro的正式权重与配套的Agent开发框架。
🔹 旗舰大语言模型与API服务
★ GLM-5.3
智谱在8月14日正式推出GLM-5.3文本旗舰模型,该模型基于GLM-5.2基座开发,通过更大规模的长程任务训练、更丰富的场景适配以及更长周期的后训练实现了能力升级。它支持1M上下文长度,最大可输出128K Token,还可以对接外部MCP工具与数据源,适配长程代码库处理、智能体任务以及网络安全审查等场景。
官方评测数据显示,Terminal-Bench 3.0得分从GLM-5.2的4.6提升至28.3,DeepSWE v1.1得分从46.2提升至66.9,CyberGym得分达到83.5%,这些测试均基于300K至1M的长上下文环境,不能直接等同于普通对话场景的表现。
目前GLM-5.3已接入GLM Coding Plan与ZCode平台,但国内的API接口尚未正式上线。模型支持low、high、max三档思考强度调节,默认推荐档位与编程场景推荐档位均为max。完整模型权重将在完成安全评估与加固后的两周内开放,在正式发布许可证与权重页面前,暂不支持直接下载或商用。
上手门槛
在线使用:🟢 低|可通过ZCode、AutoClaw在线使用
开发接入:🟢 较低|当前仅可通过coding plan接入|标准API即将开放
★ Gemini 3.7 Flash
Google在8月13日正式发布Gemini 3.7 Flash模型,模型ID为gemini-3.7-flash。新版本重点优化了软件工程、网页开发、复杂文档处理以及业务自动化能力,同时强化了遇到阻碍时的意图澄清、多步规划和工具调用规范性。
该模型支持文本、图像、视频、音频和PDF输入,输出文本格式内容,输入上限为1,048,576 Token,最大输出长度可达65,536 Token。API层面支持low、medium、high三档思考强度,同时支持函数调用、代码执行、Google搜索、文件检索、URL上下文分析、结构化输出以及预览版Computer Use功能,但不支持minimal思考档位、Live API以及图像/音频生成能力。
收费标准方面,截至2026年12月31日,标准付费层每百万Token输入费用为0.75美元,缓存输入为0.075美元,输出为3.75美元;2027年1月1日起将分别调整为1.5美元、0.15美元和7.5美元。目前该模型已接入Gemini API、Google AI Studio、Antigravity、Gemini Enterprise和Spark平台,但暂未开放模型权重或离线部署包。
上手门槛
开发接入:🟢 低|Gemini API与Google AI Studio已正式开放|注册后获取API Key|搜索等部分工具另行计费
★ DeepSeek-V4-Pro-0813
DeepSeek在Hugging Face平台开放了DeepSeek-V4-Pro-0813正式版模型权重、推理代码与消息编码示例。该模型沿用V4 Pro的MoE架构,总参数规模为1.6T,每Token激活约49B参数,支持1M上下文长度,同时提供low、high、max三档思考强度调节。
正式版本新增了DSpark推测解码功能,目标模型与草稿模型共享同一检查点,无需额外加载独立的Draft Model。官方同时提供了vLLM和SGLang的启动参数配置,代码Agent评测采用DeepSeek Harness极简模式与max思考档位。需要注意的是,该模型未附带标准Jinja Chat Template,需要使用仓库中的encoding脚本完成消息编码与输出解析。
Hugging Face仓库包含约1.65T参数、66个权重分片,实际存储容量约1.78TB,混合使用INT8、FP8、BF16等多种精度格式。官方vLLM示例运行在单节点4×GB300显卡环境,同时启用了数据并行、专家并行和FP8 KV Cache优化。仓库与模型权重采用MIT许可证,但普通工作站无法承担完整部署需求,需要专业的多卡并行运维环境。
上手门槛
自行部署:🔴 极高|权重仓库约1.78TB|官方示例使用单节点4×GB300|需专家并行、缓存优化和专业运维
🔹 智能体执行与开发框架
★ DeepSeek Harness
DeepSeek在8月13日开放了DeepSeek Harness开发者预览版,该框架基于Cordis插件系统构建,核心设计理念是“一切皆插件”,所有组件包括模型接入、工具集、技能模块、会话管理、存储系统、循环调度、沙箱环境以及UI界面都可以通过配置进行组合或替换,而非固化在固定内核中。
项目提供了标准、PTC、极简和创造四种预设模式:PTC模式允许模型编写TypeScript程序,在单次代码执行中组合多步工具调用;极简模式仅保留持久Shell和文本编辑工具,适合模型评测场景;创造模式则允许检查运行时环境并测试新插件。
安装时只需先部署Node.js环境,通过一条npx命令即可启动本地Web UI,默认监听地址为127.0.0.1:3080。该项目采用MIT许可证,但官方提示当前仍处于快速迭代阶段,后续可能出现兼容性破坏更新,不建议直接将预览版作为稳定生产底座使用。
上手门槛
自行部署:🟢 较低|npx一条命令启动本地Web UI|需自行配置模型Provider与凭证
★ Arcee nac v0.1.1
Arcee AI在8月13日开放了nac工具,并发布了修复安装器的v0.1.1版本。该工具面向实验任务、模型训练、基础设施管理以及大型原型开发等长周期工作,采用Orchestrator、Thread、Worker和Episode四层架构:编排器负责任务拆分与派发,但无法直接修改文件或执行命令;实际操作由临时Worker完成。
Worker执行完成后会丢弃完整的执行上下文,仅将执行结果、关键文件与后续状态信息写入Episode;同一个Thread可以通过多个Episode持续积累状态,不同线程还可以并行运行。这种设计适合持续数小时甚至数天的长周期任务,但对于单次对话即可解决的小型改动,额外的编排流程反而会增加成本。
项目提供本地Dashboard、HTTP API、MCP和onboarding Skill,支持Arcee登录、ChatGPT Codex OAuth或兼容模型API。v0.1.1版本目前仅提供Apple Silicon和Linux x86_64架构的二进制文件,暂未支持Windows系统。需要注意的是,Worker执行失败不会触发事务回滚,运行环境可能已被修改但最终Episode尚未提交,长周期任务仍需配合版本控制与人工验收。
上手门槛
自行部署:🟢 较低|提供安装脚本和独立二进制|需配置模型登录或API Key|目前支持Apple Silicon与Linux x86_64
★ Google ADK Python v2.7.0
Google在8月13日发布了ADK Python v2.7.0版本,共包含212项更新。本次更新的重点是修复智能体与模型之间的内容交互正确性,让模型可以主动声明自身能力,框架不再仅通过模型名称推断是否支持结构化输出与工具组合。
工具响应现在可以直接携带图片、文件引用与其他媒体资源,同时兼容Gemini、Anthropic、LiteLLM、Apigee与OCI等多种适配器。Gemini多轮对话历史会保留thought signatures、服务端工具调用片段与并行函数调用的全部结果,减少长任务中因上下文结构丢失导致的重复调用或状态断裂问题。
新版本还新增了根LlmAgent的原生Task Mode、Jinja2指令模板以及评估结果CSV导出功能。本次更新有一项明确的破坏性变更:pyarrow依赖从gcp extra移至bigquery-analytics extra,使用BigQueryAgentAnalyticsPlugin的项目如果仅升级原有依赖,可能会出现依赖缺失问题。该项目采用Apache-2.0许可证。
上手门槛
开发接入:🟢 较低|pip安装Python SDK|需编写Agent与工具代码并配置模型凭证|升级现有项目应回归历史、评估和依赖行为
🔹 多模态理解模型
★ dots3-note preview
小红书dots studio近期开放了dots3-note preview,这是dots3家族首个开放权重的模型,也是当前家族中最轻量的版本。该模型总参数规模为280B,每Token激活约16B参数,包含7B的MoE视觉编码器与800M的音频编码器,支持文本、图像、视频和音频输入,输出文本格式内容。
该模型适配通用推理、代码开发、工具调用、长程智能体、文档与图表分析以及音视频理解等场景,思考模式可以根据请求开启或关闭;视频输入如果携带音轨,会同时处理音频内容。Hugging Face平台目前提供BF16和FP8格式的权重,模型权重、仓库文档与配套资产均采用Apache-2.0许可证。
官方推荐在单个8 GPU节点上运行FP8版本,SGLang示例使用8卡数据并行、张量并行与专家并行配置,vLLM示例使用8张H100显卡。Transformers与SGLang的原生支持仍在合并中,需要使用指定PR或专用镜像;vLLM支持已进入main分支,但稳定版本尚未覆盖。需要注意的是,即使仅激活16B参数,也需要加载约280B规模的完整权重,无法仅通过激活参数估算显存需求。
上手门槛
自行部署:🔴 极高|官方FP8路径使用单节点8×H100|需多卡并行和专用框架版本|512K上下文还会增加缓存成本
★ LiquidAI LFM2.5-VL-3B
Liquid AI发布的LFM2.5-VL-3B是一款约3.1B参数、支持32K上下文的轻量视觉语言模型。该模型在前代基础上重点提升了屏幕与UI理解、OCR、目标定位、多图理解以及函数调用能力,适合端侧界面智能体、文档处理与视觉工具链场景。
官方测试数据显示,在约3GB内存的端侧配置中,该模型在Apple M5 Max上可达到228 token/s的处理速度,在AMD Ryzen AI Max+ 395上达到116 token/s,在Galaxy S26 Ultra上达到20 token/s。该模型可通过Transformers、llama.cpp、MLX、vLLM、SGLang和ONNX运行,同时提供浏览器内执行的WebGPU Demo。
该模型属于直接回答型模型,不以长链推理为目标,官方不建议用于视觉网页设计、复杂蓝图问答或其他长上下文高强度推理场景,OCR布局标注仍处于实验阶段。模型权重采用LFM Open License 1.0:年收入低于1000万美元的实体可按协议商用,达到或超过该门槛时需要另行获取商业许可。
上手门槛
在线使用:🟢 低|WebGPU Demo可在浏览器本地运行|无需上传图片到远程模型服务
自行部署:🟢 低|3.1B模型已有GGUF、MLX和ONNX路径|约3GB端侧内存配置已获官方验证

