AI模型新进展:编程、轻量、部署与机器人控制全场景覆盖

8月4日更新的一批AI工具覆盖智能体记忆管理、语音识别、编程模型、轻量基础模型、本地推理部署及机器人控制领域,以下是各项目详情:
🧠 智能体记忆管理
★ Agent记忆工具2.0
该工具可将智能体的对话、任务经验、文档和代码结构沉淀为团队可复用的记忆资产。正式发布版本提供四类核心记忆资产:Chat Memory用于保存跨会话偏好、事实和历史决策;Skill可从已验证任务中提炼带执行步骤和校验规则的SOP;Wiki将文档转化为结构化知识网络;CodeGraph索引代码仓库中的文件、符号、调用关系和影响路径,辅助编程智能体完成代码修改前的影响分析。
面向团队的Memory Hub可按Team、Agent、Owner、版本和可见性管理资产,并为不同智能体配置专属记忆加载配置。Memory Proxy兼容两大主流智能体协议,可在每轮请求中注入匹配的长期记忆、Skill、Wiki和代码信息。
🎙️ 语音识别
★ Qwen-Audio-3.0-ASR-Flash
该系列模型可将实时语音或最长12小时的录音转为文字,通过上下文、热词和文本整理提升专业内容可用性。其重点强化了上下文一致性、领域术语识别、自定义热词和结构化转写能力,还支持Speech Polishing功能,可将口语内容整理为更接近正式书面语的结构化文本。
官方内部测试显示,新模型的医学术语召回率为95.36%,工业术语召回率为93.24%。系列提供三个版本:实时流式识别版本通过WebSocket接收连续音频;异步文件转写版本最长支持12小时、2GB音频并支持说话人分离;普通非实时版本支持最长5分钟、2GB音频。
三个版本均支持热词和Prompt Context,开发者可提供行业背景、企业名称、产品名或专业词表,提升医学、工业、金融、教育等场景的识别效果。模型覆盖约30种语言,扩展了粤语、吴语、闽语、客家话、赣语、湘语、晋语等中文方言及地域口音。
上手门槛
开发接入:🟢 低|通过云服务平台提供API、Python/Java SDK、WebSocket和HTTP接口|有免费额度
官方说明:
https://help.aliyun.com/zh/model-studio/qwen-audio-3-0-asr-flash
💻 编程模型
★ VeriLoop Coder-E1
这是面向编程智能体的27B参数模型,基于Qwen3.6-27B开发,可配合工具调用、证据验证、失败回滚和不确定性判断流程使用。
官方公开BF16格式模型权重,以及ToolSpec、Uncertainty、Rollback和Evidence Binding四类Surface Host PEFT适配器,分别用于约束工具参数与调用格式、输出不确定性信号、处理失败后的回滚修复,以及让代码修改和结论绑定对应证据,主要面向代码仓库理解、补丁生成、调试、重构和编程智能体研究。公开权重可通过Transformers、vLLM或SGLang运行,但四类适配器需使用项目提供的专用加载工具。
上手门槛
自行部署:🟡 中|27B模型|支持vLLM、SGLang|建议使用多GPU或量化版本
模型地址:
https://huggingface.co/tsinghua-sigs-robot-lab/veriloop-coder-e1
🧪 轻量基础模型
★ BarunLM-35M
这是一款仅3507万参数的Decoder-only基础语言模型,可在普通电脑上运行,适合小模型架构、训练和推理实验。
该模型使用约57亿Token完成预训练,采用计算成本较低的局部注意力并周期性插入全局注意力,兼顾推理效率和长距离信息交换。在ARC、BoolQ、HellaSwag、PIQA等十项任务中,其表现优于GPT-2 125M、LFM2.5-230M-Base等更大模型。
该模型为未经指令微调的英语基础模型,上下文长度为2048,事实记忆和对话能力有限,不适合作为通用聊天助手,更适合研究小模型架构、训练配方、蒸馏、微调和端侧推理。其FP32权重体积约为140MB,无需依赖Ollama或vLLM即可直接运行。
🛠️ 模型部署
★ DwarfStar
这是针对超大开源模型优化的原生推理引擎,目前主要支持DeepSeek V4 Flash,同时覆盖GLM 5.2,可在超高内存设备上运行DeepSeek V4 Pro。与通用GGUF启动器不同,其集成了模型加载、Prompt模板、工具调用、KV状态、HTTP服务和编程智能体功能。
本次更新为CUDA后端新增原生MXFP4推理路径,运行时可保留DeepSeek官方发布的MXFP4路由专家权重,无需重新量化。Blackwell架构GPU可在批量专家计算中使用原生FP4指令和FP4激活,其他CUDA设备则使用Q8激活。
MXFP4 GGUF文件约156GB,Q2版本面向96GB/128GB内存设备,Q4版本建议至少256GB内存。用户可通过CUDA多卡、Mac多机张量并行或SSD Streaming在模型无法完全装入内存时运行。
🤖 机器人控制
★ TurboVLA
这是轻量级视觉-语言-动作模型,区别于传统先将视觉信息交给大语言模型理解再生成动作的路线,该模型分别编码视觉画面和语言指令,通过轻量级双向交互模块融合信息,再由动作解码器直接预测连续动作序列,降低机器人策略推理的延迟和显存占用。
在LIBERO仿真基准上,该0.2B参数模型平均任务成功率达97.7%;在RTX 4090上,单次推理延迟为31.2ms,显存占用约0.9GB。目前官方已开放训练、评测代码,以及四个LIBERO任务套件和RoboTwin 2.0 Clean 50任务的模型权重。


