2026年AI开源核心项目全解析:多模态模型与智能工具

近期开源AI领域推出多款全新项目,覆盖智能体开发、机器人操作、多模态模型与工作流工具等多个关键方向,以下为各项目的详细解读:
🛠️ 开发工具与运行框架
① deer-workflow
deer-workflow是一款开源的动态工作流运行时工具,用于搭建可观测、可复用的智能体执行图谱。它采用代码优先的图工程实现思路,通过TypeScript定义合法的执行路径,由编码型智能体负责每个节点内的语义处理工作。该项目是DeerFlow 3.0的前导项目,内部代号为DeerWork。它将控制流、执行阶段、输入参数与失败处理逻辑都以可审查的TypeScript代码形式呈现,智能体模块支持灵活替换,默认搭载Codex CLI且内置Claude Code工具,执行过程可观测,同时支持交互式终端界面与JSONL事件流,非常适合构建自动化流水线任务。
② AG Kit
AG Kit是面向Google Antigravity运行时的智能体工程套件,为开发者提供了一套完整的智能体开发基础设施。项目通过.agents/工作区契约,集成了规则与技能发现、20种专家角色定义与智能路由、工作流编排、持久化上下文记忆、MCP配置指导以及原生安全钩子等多项核心功能。其最突出的特性是内置了PreToolUse安全门控机制,可以精准拦截根文件系统删除、磁盘格式化等高风险命令,同时不会影响正常的项目清理操作。
🏆 核心基座模型
① Kimi-K3
Kimi-K3是一款开源多模态智能体模型,总参数量达2.8万亿,激活参数规模为1040亿,是全球首个开源的三万亿参数级智能体模型。该模型采用全新的Kimi Delta Attention与注意力残差架构,原生支持文本、图像与视频的多模态理解,同时搭载了100万token的超长上下文窗口,在长周期编程、深度知识协作以及复杂逻辑推理场景中表现突出。
② Fara1.5
Fara1.5是一款专为浏览器操作设计的多模态计算机使用智能体,由相关团队开发。它无需访问网页的DOM结构或可访问性树,仅通过页面截图就能识别界面元素,并生成包含点击、输入、滚动等操作的结构化工具调用指令,替代用户完成网页任务。该模型基于Qwen3.5-27B进行监督微调,训练数据由多智能体流程合成,官方推荐搭配相关工具使用,以实现端到端的网页任务自动化流程。
③ LLaDA2.2-flash
LLaDA2.2-flash属于LLaDA2系列,是一款专为智能体场景设计的扩散语言模型。它创新性地将Levenshtein编辑机制引入扩散语言建模流程,通过DELETE和INSERT操作控制令牌生成,是该系列首次面向智能体应用的尝试。模型采用混合专家架构,非嵌入参数量达1000亿,上下文长度支持128K,核心能力涵盖长上下文工具调用、多轮交互以及高精度错误纠正,能够高效处理复杂的智能体任务。
④ τ₀-VLA
τ₀-VLA是一款面向长周期精细操作的分层机器人基础模型。其架构分为高低两层:高层策略借助记忆增强机制生成子任务,当需要额外推理时,会通过世界模型驱动的测试时计算来搜索备选方案,实现灵活的任务规划;低层则是通用执行策略,负责在不同机器人本体上完成选定的子任务,该低层策略融合了视觉-语言模型主干网络与基于条件流匹配训练的混合专家动作专家。模型在统一的40维状态/动作空间下,使用超过4万小时的异构真实世界机器人数据,通过多模态协同训练方法完成训练,展现出极强的泛化能力,项目同时开放了模型权重、源代码与示例数据集。


