文章摘要
多模态生成技术虽降低创作门槛,但专业创作需多环节,当前主流创作辅助工具存在局限。JarvisHub由多所顶尖高校联合推出,是面向长周期多模态创作的智能代理工作台。它有原生画布式项目状态管理等四大技术亮点,经三类任务验证效果良好,核心价值在于转向过程评测等,未来需补充量化评测,解决创作决策等问题。

如今多模态生成技术已经取得了长足进步,仅凭一句自然语言指令,就能快速生成图片、视频、网页、演示文稿等多种形式的内容,从表面上看,创作的门槛似乎被大幅降低了。

但真正的专业创作,绝非简单的「输入指令-获取结果」流程就能完成。以短视频创作为例,需要经过故事框架搭建、角色形象设计、镜头脚本规划、视觉参考收集、候选画面生成、片段剪辑、配音配乐等多个环节;开发一个网站则需要梳理视觉风格、设计页面结构、规划交互逻辑、编写代码、预览调试并进行多轮优化;制作一套演示文稿同样需要筛选核心内容、组织叙事逻辑、统一版式风格、生成可视化图表并确保跨页面的视觉一致性。

这些创作过程中产生的中间素材绝非可有可无的副产品,它们共同构成了持续动态变化的项目状态:哪些素材已经被正式采用、哪些版本被淘汰、某张设计图来自哪一组参考、某个镜头是否完成、用户最新提出的反馈会影响哪个环节。智能创作代理(Agent)要顺利推进项目,就必须能够清晰读取并有效维护这套完整的项目状态。

现有创作系统的核心局限

当前主流的创作辅助工具主要存在三类核心局限:

1. 单步Prompt-to-Output工具:这类工具能够快速生成单个素材,但往往会隐藏或丢弃中间尝试的过程、失败的版本以及素材间的依赖关系,当下一轮创作开始时,创作者不得不重新完整交代上下文信息。

2. 聊天式智能代理:这类代理支持连续对话和工具调用,但主要的上下文依赖于线性的聊天记录,当素材数量增多时,空间布局、版本分支和资源引用关系很难在对话中清晰表达。

3. 节点式工作流工具:这类工具的执行步骤清晰可见,但通常需要人工预先搭建固定的流程框架,节点描述的更多是「如何运行」,而非能够让智能代理持续读取、修改和扩展的完整创作项目状态。

与这些传统创作系统不同,JarvisHub旨在为智能代理打造一个能够长期读写、支持用户随时检查、且支持失败后恢复的创作工作空间,它由多所全球顶尖高校联合推出,用户的一句需求仅仅是创作的起点。

项目地址:https://www.jarvishub.site/

演示视频:https://youtu.be/rHUQ5YgjGLw

论文链接:https://github.com/LYL1015/JarvisHub/blob/main/docs/paper/jarvishub_paper.pdf

代码仓库:https://github.com/LYL1015/JarvisHub

在JarvisHub中,智能代理会围绕同一个项目整理参考素材、生成候选结果、维护版本迭代、检查最终产出,逐步完成图片、视频、网页和演示文稿等多模态交付物。它并非一款用完即走的内容生成工具,而是一套面向长周期多模态创作的原生画布式智能代理工作台,画布在这里不仅是展示最终素材的界面,更是用户与智能代理共享的完整项目状态空间。

在JarvisHub中,提示词、参考图片、候选结果、版本关系、编辑记录、依赖链路和用户反馈都会以可寻址的画布节点与连接形式保存下来。智能代理可以读取当前画布状态,判断接下来需要执行的操作,调用合适的工具完成任务,再将生成的结果写回同一张画布。用户看到的,正是智能代理正在操作的完整项目状态,画布不仅是界面,更是智能代理的外部记忆、行动空间和共享工作台。

技术核心亮点

1. 原生画布式项目状态管理

JarvisHub将创作项目表示为一个可编辑的多模态资产图,每个提示词、参考图、视频片段、网页预览或PPT页面都是带有唯一稳定ID的节点;素材之间的引用关系、版本继承、生成依赖、分组逻辑和流程延续,则通过不同类型的边进行连接。这种结构让智能代理能够精准指向具体素材,无需依赖「刚才那张图」这类模糊描述,中间生成的结果也可以直接作为后续创作的输入,用户还可以随时追溯某个最终成果使用了哪些参考素材、经过了哪些处理步骤。

2. 协议桥接的可控修改机制

在长周期创作任务中,如果智能代理可以随意修改项目状态,很可能会覆盖有效版本、误删依赖关系,或是在信息不足的情况下贸然推进。为此,JarvisHub在智能代理与画布之间设置了Protocol Bridge模块。每一轮创作开始时,Bridge会向代理告知当前项目允许使用的节点类型、操作类型、可用工具和素材句柄,并据此生成本轮的执行授权。只有符合当前任务需求、存在于能力清单中、获得本轮授权且能通过协议校验的操作才会被执行,代理的每一次动作都不会隐藏在自然语言生成中,创建的节点、更新的字段、建立的依赖关系、工具返回的结果都会成为可被检查的状态变更记录。

3. 统一调度的智能代理运行时

JarvisHub的Runtime模块负责将用户的创作目标转化为具体的执行动作,它会先观察当前画布状态,结合当前权限范围选择下一步操作,调用相应的能力模块,最终将生成的结果提交回画布。该模块整合了多类能力:工具家族覆盖画布操作、多模态素材生成、本地文件与代码处理、结果验证修复,以及遵循统一协议的MCP扩展;技能模块封装了分镜设计、参考图生成、设计转网页、视频提示词编写、演示文稿构建等可复用的创作流程;记忆模块会保留用户偏好、已确认的决策和创作过程经验,避免长周期任务中出现风格漂移;子代理模块可以并行处理独立的子任务,再由主代理选择最优结果进行合并。

4. 反馈驱动的迭代优化机制

在JarvisHub中,用户反馈不再仅仅是最终的评分。用户的选择、拒绝、局部修改,以及系统评估器发现的缺陷,都会直接影响智能代理的下一步动作:可以选择沿用已有结果、对失败节点进行局部修复、请求用户澄清信息,或是在信息不足时暂停任务。系统还会记录完整的创作轨迹,包括用户初始请求、执行前的画布状态、能力清单、授权范围、代理动作、工具返回结果、反馈信号、修复决策和更新后的项目状态,这使得分析的对象不再局限于最终成品,还包括整个创作过程。

系统架构与运行逻辑

JarvisHub的整体架构分为三层核心组件,形成闭环的创作工作流:

• Canvas State(画布状态层):负责保存多模态资产、依赖关系、版本选择和用户的所有决策。

• Protocol Bridge(协议桥接层):管理项目身份与上下文、能力清单、执行授权和状态变更验证,确保所有操作的可控性和可追溯性。

• Agent Runtime(代理运行时层):负责观察画布状态、进行推理决策、路由技能调用、编排工具执行和合并结果。

三层组件围绕同一张画布协同工作:画布向代理提供当前完整的项目状态,Bridge限制并验证可执行的操作,Runtime完成工具调用,新生成的素材和更新后的状态最终返回画布。此外,所有组件下方都会统一记录创作轨迹、评估信号、人工编辑和检查点,为后续分析提供完整的数据支撑。

画布如何表示持续演化的项目

在形式化定义中,JarvisHub将第t轮的项目状态表示为Ct = (Gt, Xt, Mt, Ut, Lt)。其中Gt是带有类型标注的资产图,Xt保存可编辑的内容和素材本体,Mt记录素材来源、执行元数据和运行状态,Ut记录用户的选择、修改和反馈,Lt保存节点的位置与分组布局。每个画布节点不仅包含输入和输出内容,还保留了稳定标识、节点类型、位置信息、来源记录和运行状态,系统可以据此区分「计划中」「运行中」「已完成」「已选中」「失败」「尚未验证」等不同状态的素材,并据此规划后续的创作步骤。

智能代理的完整执行流程

一轮完整的智能代理执行流程从用户的创作请求开始:首先,Runtime模块观察共享画布的当前状态,在当前能力清单和执行授权的约束下选择合适的动作;随后调用技能、记忆模块、工具或子代理完成任务;工具返回的结果经过Protocol Bridge的验证后,提交到共享画布进行更新。用户可以直接检查画布上的新生成结果,选择满意的候选、调整局部内容或提出新的反馈。下一轮创作开始时,智能代理读取的不再是压缩后的聊天摘要,而是已经更新的完整项目状态,从而能够沿着现有进度继续推进创作。

从全局重做转向局部恢复

在复杂的创作任务中,局部的失败并不意味着整个项目都需要推倒重来。JarvisHub显式保存了项目状态和素材间的依赖关系,系统可以精准定位失败的节点,并根据用户反馈进行局部修复。例如,当某个视频镜头生成失败时,智能代理可以保留已经确认的角色参考、场景设计和其他完成的镜头,仅重新生成出错的片段;当网页交互出现问题时,也可以沿用已有的视觉风格和页面结构,仅修改对应的代码和预览节点。这种基于项目状态的局部恢复机制,能够显著减少长周期创作中的重复工作,提升创作效率。

实际创作效果验证

论文选取了三类具有代表性的长周期创作任务来检验JarvisHub的能力,分别考验跨镜头一致性、设计与代码协同、跨页面内容与视觉统一:

1. 叙事媒体生成:从故事设定到连续镜头

第一个任务是围绕「牛仔机器人僵尸拾荒者」的设定创作一段短剧。画布会同时保存任务描述、故事规划、视觉参考、镜头候选、依赖关系和生成进度。智能代理可以沿用已经确定的角色和场景设计来制作后续镜头,无需每次都重新描述人物外观。最终生成的关键帧中,角色、环境和动作线索在多个镜头间保持了良好的连续性,镜头背后的规划逻辑和素材关系也被完整保留,用户可以随时回到中间节点进行调整。

2. 交互式网页开发:统一管理设计与实现

第二个任务是创建一个具有Awwwards级视觉风格和丰富动画效果的个人摄影网站。传统的聊天式智能代理通常会将参考图、代码和预览分散在不同的消息或工具页面中,而JarvisHub则将视觉参考、布局草稿、实现代码、渲染预览和修改状态全部放在同一张画布中管理。最终生成的网站在字体、图片排版、页面结构和整体视觉风格上保持高度统一,智能代理不仅可以生成代码,还能检查渲染结果,并根据预览内容继续进行优化修改。

3. 演示文稿生成:跨页风格与叙事统一

第三个任务是围绕机器学习中的决策树主题,制作一套具有斯坦福大学课程风格的演示文稿。创作流程从内容结构规划开始,随后依次进行图示生成、页面组织、PPT制作和多页预览检查。最终生成的多页演示文稿在版式、图示风格、强调色和内容层级上保持高度一致,JarvisHub更关注整套文稿的逐步构建过程,而非单独生成某一页内容。

JarvisHub的核心价值

1. 从结果评测转向过程评测

对于创作任务而言,仅通过最终成品来评判智能代理的能力是不够全面的。一个看似优秀的成品,背后的创作过程可能非常脆弱且无法复现;而一个尚未完美的结果,也可能保留了大量可复用的中间资产和正确的决策逻辑。有了完整的创作轨迹记录,研究者可以进一步评估智能代理的上下文保持能力、工具选择准确性、依赖关系正确性、反馈遵循度和修复成功率。未来的智能创作代理评测基准,不再仅仅局限于初始指令和目标答案,还可以同时提供初始画布、参考材料、约束条件、反馈事件和检查点。

2. 为智能创作代理提供可积累的数据飞轮

每一次JarvisHub的运行都会留下结构化的画布状态、代理动作、工具返回结果、用户反馈和修复决策。在经过用户授权、匿名化处理、版权过滤和质量控制后,这些创作轨迹有望成为训练下一代智能创作代理的重要数据来源。模型不仅可以学习「最终应该生成什么内容」,还可以学习如何规划创作流程、何时调用合适的工具、如何维护多模态项目状态、何时进行局部修复,以及如何根据人类反馈持续推进创作任务。

3. 开放的研究基础设施而非封闭产品

近期市面上的商业产品已经展现出智能代理辅助创作的趋势,但封闭的架构让研究者难以了解其内部如何表示项目状态、检查操作合法性、调度工具和恢复失败任务。JarvisHub的目标并非打造一个仅展示最终结果的封闭创作产品,而是开放这些核心机制,为长周期智能创作代理的研究提供通用的基础设施。

结语与未来展望

JarvisHub将创作画布从静态的展示界面,转变为智能代理共享的项目状态空间。通过Canvas State、Protocol Bridge和Agent Runtime三大核心模块,JarvisHub将多模态素材、版本依赖、工具调用、用户反馈和失败恢复机制整合到统一的工作空间中,让智能代理能够持续推进创作任务,并让整个创作过程可检查、可干预。

该项目的核心贡献包括:

• 原生画布式状态表示:将提示词、参考素材、生成结果、版本信息、依赖关系和用户反馈组织为可编辑的多模态资产图。

• 协议约束的代理执行:通过能力清单、执行授权和状态验证,确保每一次画布修改都是显式、可追踪和可恢复的。

• 面向长周期创作的运行时:统一编排画布操作、素材生成、本地执行、修复工具和MCP扩展,结合技能、记忆和子代理模块推进复杂创作项目。

• 过程级轨迹记录:为后续的智能代理评测、过程评估和轨迹训练提供结构化的完整数据。

未来,JarvisHub还需要补充更系统的量化评测,进一步研究创作决策的语义正确性、跨模型工具协作和轨迹数据治理等问题。它所指向的核心问题已经非常明确:随着生成模型能力的不断增强,智能创作代理不仅需要能够生成内容,更需要能够在共享、可编辑、可恢复的项目状态中持续稳定地工作。

以上内容不代表本平台立场,仅供读者参考