文章摘要
当下生成式AI在长程多模态创作中存在瓶颈,JarvisHub作为面向该创作的开源智能体运行底座应运而生。它将可编辑画布作为工作区等,具备画布原生项目状态等技术亮点。其交互流程为观察—行动—验证—回写,设计五类工具。通过三个案例验证核心价值,还为创作智能体研究提供三条发展路径,搭建多模态创作运行基础设施。

当下生成式AI的单点生成能力已经愈发强大,但当任务从单次出图变成跨数小时、多媒介的完整项目时,真正的瓶颈不再是生成能力本身,而是如何记住整个项目的上下文、理解不同素材之间的关联、沿着用户确认的方向持续推进,并且在出错时只修改需要调整的部分,而非全盘重来。

JarvisHub的核心思路,是将可编辑画布同时作为用户的工作区、智能体的外部记忆、行动空间以及共享的项目状态存储库。智能体不再仅仅依赖聊天记录来猜测上下文,而是可以直接“查看”画布上的所有内容,包括提示词、参考素材、候选版本、生成结果、依赖关系、失败记录以及用户反馈,再基于这些信息进行规划、调用工具并将结果写回画布。简单来说,JarvisHub并不是又一个单点生成工具,而是一套面向长程多模态创作的开源智能体运行底座。

研究背景与动机

真实的创作过程从来不是“输入提示词——得到成品”的简单直线。创作者通常需要先收集参考资料、确定风格或角色、规划页面与镜头,再生成多个候选版本、对比筛选、局部修改、吸收用户反馈,最后将散落的中间结果整合成最终交付物。提示词、草稿、失败的尝试、版本分支以及用户反馈,都不是创作中的边角料,而是构成项目不断演化的完整状态。

当前主流的创作方案都存在各自的痛点:

  • 单点Prompt-to-Output工具:擅长快速生成单个素材,但往往会隐藏或丢弃中间的决策过程、替代方案和修订历史,当任务周期拉长后,很难稳定继承之前的工作内容和决策逻辑。
  • 聊天式创作智能体:可以按步骤调用工具,但主要的上下文依赖线性的聊天记录,当涉及空间布局、素材引用、版本分支和局部编辑目标较多时,聊天记录很难完整表达当前项目的真实状态。
  • 节点式工作流:步骤更加透明,但通常需要人工预先搭建固定的管线,它描述的是“程序如何运行”,而不是一个智能体可以持续读取、扩展、修订和验证的可编辑项目状态。

目前商业产品已经显现出从“生成单个资产”转向“协助完成完整项目”的趋势,但闭源的架构让研究者难以进一步观察智能体如何表示上下文、选择工具、利用反馈、修复失败,以及如何在长流程中维持创作的一致性。JarvisHub正是瞄准了这个尚未被充分探索的中间层。

在JarvisHub的设计中,画布不再仅仅是展示素材的UI界面,而是用户和智能体共同使用的项目对象。每一张参考图、每一段视频、每个网页预览、每一版幻灯片都可以拥有稳定的地址,并通过“引用”“版本沿袭”“生成依赖”“分组”或“工作流延续”等关系连接起来。用户选择的版本、否决的内容、某个结果的来源素材,都可以保留在同一张画布中。

技术核心亮点

画布原生项目状态:将创作过程转化为可编辑图谱

JarvisHub将项目表示为一张“带类型的多模态资产图”。其中的节点既保存图片、视频、音频、UI、文本等具体内容,也携带位置信息、可编辑输入、生成输出、来源信息、执行诊断和运行状态;节点之间的边则描述参考关系、版本关系、生成依赖、分组关系或流程延续关系。这个设计具备三个核心优势:

  • 可寻址:智能体可以明确指向“第三版网页预览”或“用户已选中的第二个镜头”,不需要依赖模糊的对话指代。
  • 可复用:参考素材、草稿、被否决的候选方案或中间结果,都可以在后续的生成和编辑步骤中再次作为输入使用。
  • 可检查:用户和智能体都可以追溯某个结果受到哪些材料的影响、沿用了哪个版本,以及哪些下游内容会受到一次修改的波及。

三层核心架构:状态、协议与运行时各司其职

JarvisHub的核心由三层紧密协作的模块组成:

  • Canvas State:负责保存素材、版本信息、依赖关系和用户的选择;
  • Protocol Bridge:负责权限管理、能力清单、动作校验和写入控制;
  • Agent Runtime:负责观察画布状态、规划动作、编排工具,并将可验证的结果重新合并回画布。

在这三层架构之下,轨迹记录、评估器、人类编辑和检查点模块,为反馈、恢复和后续分析提供了完整的证据支持。

协议约束的画布操作:避免智能体任意修改内容

长流程的创作要保证可靠性,关键不仅在于让智能体可以调用更多工具,还在于让每一次修改都显式、合法且可恢复。JarvisHub会为每一轮交互提供Capability Manifest,列出当前可用的节点类型、变更操作、工具和资产句柄,限定本轮允许执行的动作。只有能够被编码为受检工具调用、画布变更、评估请求、澄清请求或用户回复的行为,才会真正应用到项目中。

这意味着画布的变化不再隐藏在模型内部:智能体新建了什么、更新了什么、调用了哪个工具、得到了什么观察、为什么进入下一步,都可以通过协议桥写入轨迹,权限和状态边界也因此更加清晰。

反馈驱动的局部修复:从全盘重做转向精准调整

反馈可以来自用户或者评估子智能体。用户可以选择候选版本、否决不合适的结果、修改提示词、调整风格或指出局部缺陷;系统在完成创作时,也可以调用子智能体检查内容的一致性、缺失的证据、视觉质量和任务约束。反馈的作用不仅仅是给中间结果简单打分,而是决定下一次的状态转移:可以沿用已接受的节点继续创作、局部修复失败的节点、向用户澄清需求,或者在证据不足时暂停流程。

方法详解

一轮交互的完整流程:观察—行动—验证—回写

每一轮交互都始于用户的请求。智能体运行时首先读取共享画布,理解当前的素材、依赖关系、版本信息和整体状态;随后在能力清单和执行授权的范围内选择合适的动作,调用相应的工具并获取工具的观察结果;经过协议桥的验证后,将结果、状态和证据写回画布;最后用户在同一张画布中进行检查、选择、编辑或反馈,进入下一轮交互。

五类工具覆盖全流程创作与恢复

JarvisHub设计了五类工具,覆盖从创作到修复的全流程:

  • Canvas Tools:用于读取、创建、更新、连接、分组、选择和分支节点,并维护资产句柄和运行状态。
  • Generation Tools:负责图像、视频、音频和组合媒体的生成工作。
  • Native Tools:用于连接浏览器、文件系统、代码环境、搜索工具、文档和演示文稿等外部执行环境,并返回可检查的产物。
  • Recovery Tools:提供结构化反馈、验证、检查点和局部修复功能。
  • MCP Tools:允许外部服务在统一的约束体系下接入系统。

Skills、Memory与Subagents:组织长任务的能力体系

工具决定了智能体“能做什么”,而Skills、Memory和Subagents则帮助运行时决定“怎样把事情做完”。Skills封装了故事板制作、参考图引导生成、设计还原网页、视频提示词生成或演示文稿构建等可复用的流程;Memory会保留用户的偏好、已有的选择和跨轮次的知识;Subagents可以在工作流出现分支时,并行处理相对独立的子任务,再由主智能体选择合适的结果并合并回项目图。

完整的创作轨迹记录

JarvisHub记录的不仅仅是最终的作品,还包括每一轮的用户请求、执行前的画布状态、可用的能力、授权范围、选定的动作、工具的观察结果、反馈信息、修复决策和更新后的画布。通过这些记录,研究者可以清晰地看到智能体是否忽略了参考素材、丢失了用户已经接受的选择、覆盖了有用的版本,或者在本应进行局部修复时错误地进行了全局重生成。

对于开放式的创作任务来说,这一点尤为重要:多个最终结果可能都“看起来不错”,但创作过程可能脆弱且不可复现;反过来,一个暂时不完美的结果也可能保留了高价值的中间素材和可恢复的决策。因此,评价的对象也从单个成品扩展到了整条创作轨迹。

实验与案例验证

JarvisHub通过三个典型的创作案例验证了其核心价值:

叙事媒体生成:维持跨镜头创作一致性
当系统接到“制作一部关于牛仔机器人僵尸拾荒者的短剧”的任务后,会在画布中展示任务简报、故事规划、视觉参考、镜头候选、依赖关系和生成进度。最终生成的关键帧保持了反复出现的机器人牛仔形象、海边场景和叙事动作线索,展示了长流程中角色身份、风格和跨镜头连续性的管理方式。

交互式网页开发:统一设计与开发上下文
当任务要求创建一个轻盈的、符合Awwwards风格、带有丰富动画效果的个人摄影网站时,画布会同时跟踪设计参考、布局草案、实现产物、页面预览和修订状态,让智能体不必在“视觉方向”和“代码进度”之间反复丢失上下文。最终生成的页面在排版、图片摆放、页面结构和整体视觉方向上都保持了一致。

演示文稿生成:维持跨页视觉与知识结构
当任务是制作一份“斯坦福课程风格”的机器学习决策树PPT时,画布会记录课程内容、生成的图示、幻灯片草稿、依赖关系、PowerPoint预览和修改进度。最终的演示文稿在主题组织、图示风格、强调色和跨页布局上都保持了一致,证明系统可以将内容筛选、叙事编排、视觉合成和页面级检查整合成连贯的长流程创作。

三个案例共同验证了JarvisHub的核心能力:开放的创作目标可以被拆分为可观察的项目状态,参考素材和候选方案可以被持续复用,工具的执行可以返回可检查的证据,用户的反馈可以决定下一次的局部更新,最终作品和完整的生产过程都可以被同时保留下来。

研究价值与未来方向

JarvisHub为未来的创作智能体研究提供了三条具体的发展路径:

  • 构建Project-State Benchmark:任务不再仅仅提供提示词和目标答案,还会提供初始画布、参考材料、可用工具、约束条件、反馈事件和预期的检查点。
  • 结合质量与过程指标评估:将最终作品的质量和过程指标结合起来,评估上下文保持、工具选择、依赖正确性、反馈遵循和修复成功率。
  • 沉淀创作数据形成训练飞轮:每次运行都可以沉淀结构化的状态、动作、观察、反馈和修复数据,为后续智能体的训练提供高质量的训练素材。

结语与展望

生成式AI的下一阶段,核心在于能否在不断变化的项目中持续工作:理解当前的项目状态、承接用户的选择、调度合适的工具、保留完整的过程证据,并在错误发生后进行恢复。JarvisHub将这个问题落地到了一张用户和智能体都可以读写的画布上。

当提示词、参考素材、候选版本、依赖关系、反馈信息和检查点都成为可寻址的项目对象时,创作智能体才有机会从“一次性生成器”转变为可协作、可观察、可纠偏的长期创作伙伴。对于研究者来说,JarvisHub也提供了一个开放的入口:不再仅仅研究最终作品的好坏,更可以研究智能体是如何一步步完成作品创作的。

从聊天框到共享画布,从单次调用到长程协作,JarvisHub试图搭建的正是多模态创作智能体走向真实生产所缺少的那层运行基础设施。

以上内容不代表本平台立场,仅供读者参考