破解创作半成品难题 智能体作品构造研究综述发布

我们常会遇到各类创作或开发的半成品困境:科研海报的文案排版协调却出现文字溢出页面的问题,网站首屏视觉效果出色但交互按钮无响应,单看都没问题的视频镜头拼接后丢失人物逻辑与叙事节奏,刚修复完一个代码模块又出现其他功能的回归错误。
完整交付的作品中,各项要求彼此关联制约,很多问题往往要等到渲染、播放或实际运行后才会暴露。修复这类问题需要精准定位故障点、进行局部调整,并验证修改不会影响其他模块;而选择整体重做则会覆盖已经完成的内容,造成额外的工作量。
近期,由香港科技大学(广州)、浙江大学、中国科学技术大学、清华大学、香港大学、悉尼大学及中山大学的研究者组成的团队,针对作品持续构造方向展开了系统性综述,梳理了截至2026年8月20日的259项相关研究工作,涵盖230个原型系统与29个评测基准。
相关研究的公开资源包括:
论文链接:https://arxiv.org/abs/2608.28122
项目主页:https://agentic-creation.github.io/
GitHub开源项目:https://github.com/GeminiLight/awesome-agentic-artifact-creation
从单向生成到持续创作范式
传统的AI生成系统大多遵循单向的工作路径:接收用户指令、生成最终结果后便结束任务。这种模式在任务规模较小、结果易于验证的场景下效果不错,但对于完整的交付作品来说,系统需要持续保留并动态修改作品的状态,才能适配不断调整的需求。
以科研海报为例,文案、图表与版式需要彼此配合协调;软件仓库中的代码、测试脚本与配套文档必须保持同步一致;长视频的人物设定、叙事逻辑与时间线也不能各自独立。任何一处的修改都可能让之前的验证结果失效:文案扩充会挤占版面空间,数据更新会带动图表与结论的调整,接口改动则会让测试用例与说明文档同步过期。
该综述将智能体式作品持续创作(Agentic Artifact Creation)定义为一种闭环的持续构造流程:系统会维护一个动态更新的可交付作品状态,并根据中间生成结果自主决定下一步的生成内容、修改位置,或是在验证达标后停止创作。
智能体式AI创作的核心架构
研究团队将整个创作构造过程拆解为三个核心功能角色:
作品表示:负责保存当前作品的完整状态,同时决定系统可进行修改的粒度。它可以是一份结构化文档、场景设计图、可执行代码,或是带有图层、节点与依赖关系的结构化数据。如果系统只能获取最终的静态截图,很多细节问题将难以定位;而文本块、页面组件、场景对象这类可精准定位的结构,则支持对作品进行局部修复与调整。
构造策略:负责决策下一步的行动方向。它会结合任务要求、当前作品状态与已获取的反馈结果,选择继续生成内容、修改特定位置、调用外部工具、请求人工干预,或是在验证证据充足时终止创作流程。
运行时验证:用于观察行动带来的实际结果。文本内容需要核对引用准确性,网页需要完成渲染与交互测试,代码需要编译并运行测试用例,音视频内容则需要完整播放验证。验证得到的结果会直接作为下一步决策的依据。
三个角色通过循环协作完成创作修复,典型的修复流程为:明确完成标准 → 保留可定位的作品状态 → 验证当前结果 → 诊断问题根源 → 由构造策略选择对应动作 → 执行局部修改 → 重新进行验证。
这种架构模式能够支撑三项核心能力:
- 组合性:作品可以被拆分为边界清晰的多个模块,通过明确的接口实现衔接。文案、图表与版式可以分别制作,需要时还能替换内容或调整顺序,组合后再统一验证兼容性。
- 可追溯性:系统会完整记录任务要求、执行动作、作品状态变更与观察结果之间的关联关系。当最终结果出现问题时,可以快速追溯到相关的任务要求、修改操作与验证证据,同时清晰说明每一次决策的形成逻辑。
- 可修订性:验证结果能够精准指向受影响的作品部分,构造策略可以据此选择合适的修改范围。完成修改后,系统会重新检查相关依赖模块,尽可能保留已经通过验证的内容。
六大类交付作品的创作特点
研究团队以最终交付的作品类型为核心,将现有相关工作划分为六大类别:文本类、二维视觉类、音频类、视频类、空间作品类,以及软件、网站、游戏与模拟程序等行为型作品。
不同类型的作品有着差异化的创作与验证难点:
文本与二维视觉作品通常可以通过静态方式完成检查,句子、段落、图层与图形标记也较容易定位。其核心难点在于长距离的内容一致性:修改前文的一项事实数据,可能需要同步更新后文的论证逻辑、配套图表与引用内容。
音频与视频作品需要沿时间序列进行整体验证。单个片段单独看可能没有问题,但整合到完整序列后可能破坏整体节奏。视频创作还需要同时处理画面、声音、字幕与镜头之间的联动关系,反馈结果通常需要等到完整播放或渲染后才能获取。
空间作品需要维护几何结构、语义部件与物理约束条件,比如3D场景的碰撞检测、空间布局合理性等。行为型作品的合格与否取决于代码、应用程序或模拟程序在交互过程中的响应表现。交互执行路径越长,获取一组有代表性的验证结果的成本越高,也越难将故障精准追溯到具体的作品状态节点。
整体而言,不同作品的创作难度主要取决于三个变量:决策之间的关联紧密程度、错误暴露的时机,以及系统能否在保留已有成果的前提下完成局部修复。
多智能体协作的协调成本
将复杂创作任务拆分为多个子任务,能够降低单一步骤的执行难度,但同时也会增加跨模块的协调成本。
比如一个智能体负责修改文案内容,另一个负责调整页面版式,第三个负责核查事实准确性。当文案内容扩充后,负责版式的智能体是否能够及时感知到版面已经失效?当事实核查更新了一组数据,图表与结论是否能够同步完成更新?即便每个智能体都完成了自身的局部任务,最终的整体结果仍可能出现冲突。
多智能体系统的核心难点在于共享作品状态、依赖关系与统一的完成标准。拆分的粒度越细,协调冲突、处理不一致性与重新组装整体作品的成本就越高。对于规模较小、易于验证的任务,单个能够稳定调用工具的智能体反而会是更合适的选择。共享的作品表示能够让各个智能体的分工落地到同一个可检查、可修改的交付物上,同时维持局部结果之间的一致性。
单一总分难以指导精准修复
不少现有的生成系统会将整体评估收敛为一个单一的总分值。这类总分适合用于不同结果的横向比较,但很难直接指导修复工作:它通常不会说明问题出现的具体位置、引发问题的原因,也无法给出可执行的修复方案。
同时,诊断的粒度需要与编辑的粒度相匹配。如果检查器发现整体叙事逻辑不连贯,但系统只能重写整篇文章;如果评估器发现视觉层级存在问题,但编辑接口只能重新生成整张图片,那么即便反馈信息足够准确,也很难转化为可执行的修复动作。
该综述将评估对象划分为三个层级:
最终作品层:验证任务要求是否被满足、内容是否保持一致、作品在真实场景中能否完成预定用途。
构造轨迹层:评估错误发现的时机是否足够早、修复是否为局部修改、已经通过验证的内容是否被保留,以及整个创作过程消耗的时间、模型调用次数与人工监督成本。
智能体系统层:验证同一任务重复运行的结果是否稳定、更换任务起点后系统是否仍能正常工作、用户能否修改目标并保留对系统的控制、系统更新后是否出现功能回归问题。
当生成模型与评价模型来自相近的模型家族时,两者可能会共享知识盲区、审美偏好与判断偏差,单纯增加评价模型的数量并不能保证评价证据的独立性。
不同的证据渠道包括来源对照、结构化状态数据、渲染结果、运行行为、创作历史与用户反馈结果;而评价方式则包括规则检查、专用模型评估、大语言模型评审与人工评审。一次具体的评价信号来自证据渠道与评价方式的组合,评估报告需要清晰说明每一种信号能够支持的结论,同时保留存在冲突的评价结果。
智能体创作的四项核心设计原则
1. 将保留要求融入作品状态:需要将必须满足的任务要求写入作品状态中,让完成标准与具体的页面、段落、镜头、对象或测试用例建立关联,便于快速判断一次修改会影响哪些既定承诺。
2. 清晰划分控制边界:系统的执行能力与决策权限是两个独立的概念。创意取舍、事实确认、对外发布与高后果操作需要不同级别的授权,仅凭模型的置信度不能替代正式的权限审批。
3. 让反馈直接指向可执行动作:反馈信息需要建立起证据、诊断结果与可执行修复动作之间的关联,笼统的整体评价或单一总分很难直接融入创作循环流程。
4. 修改后重新验证受影响状态:任何修改都会让旧的验证证据失效,系统需要根据修改的影响范围选择性地重新进行验证,同时将验证结果与作品版本同步更新。
采用这种创作循环模式会增加作品表示、验证与协调的成本,因此在落地前需要确认中间观察能够有效改善后续决策,且修改操作能够保留已经通过验证的成果。
智能体创作的六大未来发展方向
1. 全局一致性维护:要求系统在拆分作品为多个模块后,仍能重新整合为完整的交付物。当角色设定、设计规范或接口发生变化时,其影响可能会贯穿整个作品,系统需要显式维护这些跨模块的依赖关系。
2. 精准故障修复:要求系统能够精准定位失败的根源,仅修改受影响的作品部分。检测异常、定位原因与完成修复是三种不同的能力,不能用单一的最终成功率来替代。
3. 系统自进化能力:关注跨任务的经验留存与复用。单次作品修改只会改变当前的创作结果,而新的创作策略、工具调用方式或记忆库需要经过独立验证、版本管理与回滚测试后,才能成为可复用的系统能力。
4. 持续个性化创作:需要区分用户的稳定偏好、项目承诺、临时选择与不确定推断。每条创作记录都需要标明状态、适用范围与版本号,并允许用户检查、纠正或撤回相关内容,同一个项目中的偏好不应自动迁移到其他项目中。
5. 明确人类决策权限:需要将人类的决策权限落实到具体的行动中,明确谁可以批准修改、批准的触发条件是什么,以及系统获得的权限等级。系统的能力边界与授权边界必须明确区分。
6. 开放式成果的可靠评估:需要承认同一任务可能存在多个优质答案。评估协议需要记录哪些标准是初始就固定的,哪些偏好是在查看中间结果后才形成的,以及由谁来解释这些评估标准的变化。
259项研究的分类全景
本次综述共收录259项相关工作,其中包含230个原型系统与29个评测基准。其中251项工作可以归入上述六大作品类别,剩余8项则属于跨多种交付物的应用工作流系统。
研究团队将应用场景与评估方式作为独立的分类维度,避免将作品类型、应用场景与评估方式混为一谈。主要的应用场景包括创意生产、品牌传播、教育支持、专业工作、科学研究与工程设计,不同的应用场景对作品的验收要求也各不相同。
作品类别回答的是“最终交付什么”,而应用场景则关注“作品用于什么目标、由谁来验收”。主要的验收依据从创作者与受众的主观体验,逐步延伸到品牌规范、学习成果、决策有效性、科学证据,以及测试与物理有效性。
配套的开源Awesome项目支持按照作品类型与应用场景进行浏览,覆盖代码智能体、自动化设计、科学写作、视频制作、3D场景、游戏与模拟等多个方向。在阅读相关研究时,可以对比不同系统保存的作品状态、使用的验证证据、故障定位方式与修复后的重验范围。
结语
交付作品的整体质量取决于多个关键因素:任务要求能否被持续满足、修改能否精准定位到具体位置、故障后能否完成有效修复,以及系统能否提供充足的验证证据。
复杂的多智能体系统适用于那些中间观察能够改变后续行动、已完成的内容可以被保留、系统有明确的停止与交接条件的任务。单纯的迭代次数并不能证明系统具备这些核心能力。
全面的评估需要同时覆盖三个层级:最终作品是否达标、创作轨迹是否高效、智能体系统是否可靠且可控。

