文章摘要
本文对更新后的Doubao Seed-2.1-pro 0915多模态AI开发模型开展实测,该版本升级聚焦代码开发、智能代理执行、多模态交互三大方向。测试覆盖网页开发、游戏制作、视频生产、影视分析等多类场景,验证其在视觉落地开发、长周期任务推进、多文件同步等方面能力提升显著,目前已开放调用。

这款多模态AI开发模型迎来了0915版本的重磅更新,核心能力实现全面进化。据官方说明,此次升级重点覆盖了代码开发、智能代理执行与多模态交互三大方向,尤其是在视觉理解融入开发流程、长周期任务连贯执行方面的表现有了显著提升。这恰好契合了近期的多项任务需求:模型能否在读取图片、视频素材后完成实际开发,复杂多步骤任务能否自主连贯推进不敷衍,调用工具后能否更高效地执行任务,这些都是关注的重点。

三维电子展馆项目

我们首先测试了三维电子展馆开发项目:一位用户需要将展厅平面图、展品资料转化为可在线游览的3D网页,实现鼠标拖拽浏览、点击查看展品详情与灯光效果。我们上传了展厅草图、27件展品的编号总览与配套介绍文档作为输入,要求模型完成完整的网页开发。

以下是详细提示词:

滑动查看完整提示词

↕️

请根据附件中的展厅平面草图、27件作品编号总览,以及配套作品资料,制作三维电子展馆。用户应能在浏览器中用鼠标连续参观,看到每幅作品和对应简介。
配套文件夹包含作品图片、展位与作品对照、逐件展签与布光、空间布局和单展位布光示意。使用既有的01至27编号与三个展区关系,保持平面图、作品、展签和场景一致。总览图用于辨认和核对,挂墙时使用配套的单件图片。
按以下顺序执行:
1. 先阅读平面图与作品总览,梳理三个展区、入口出口、隔墙、通道、展位和建议动线。再核对配套表格和坐标文件,标明图片与文字之间是否有矛盾。不得跳过看图,直接另建一套展厅。
2. 建立展位清单。逐一匹配编号、作品图片、名称、作者、年代、简介、馆藏页面与布光信息。需要补充或核实的资料从对应馆方页面查找,不另换一批作品。没有可靠资料的字段如实标记。
3. 先确认空间与参观方案,再开发。保留平面图中的总体尺度、分区和作品顺序,考虑入口导览、观众行走、转向、观看距离与返回入口。若为可用性调整布局,明确调整理由并同步更新平面图和对照表。
4. 搭建可运行的空间原型。支持鼠标拖动转向、滚轮向前后移动,点击作品打开名称与简介;提供操作提示、复位和展区快捷跳转。控制墙体碰撞、移动速度、镜头高度和转向幅度,让第一次使用的人也能顺利参观。
5. 把27件作品图像真正挂入对应展位。保持原始画幅比例与完整内容,避免拉伸、裁掉作品或把整张总览图当成一幅画。立体藏品以原有照片挂墙呈现,不要求凭照片编造其完整三维结构。
6. 按配套布光信息设置数字展厅光照。使作品清楚、展签可读,避免过曝、反光与严重偏色;检查不同展区的整体氛围。若渲染工具无法直接使用某项灯光单位,记录转换或视觉校准方式,不宣称等同于实体展馆照明验证。
7. 制作作品详情卡,包含名称、作者或年代、简短介绍与来源入口。信息较长时合理展开,关闭后保留原参观位置。所有信息按作品编号绑定,不能因排序变化串错展签。
8. 按01至27实际逐站检查图片、位置、比例、灯光、文字与点击行为。完整走通入口、三个展区和出口,修复穿墙、卡住、图像缺失、作品不可达及文字遮挡。检查不同窗口尺寸下的表现。
9. 交付可运行展馆、源码、启动说明、最终平面图、作品与展位对照、必要的调整记录和实际验收结果。整个过程使用同一套作品编号,资料与场景同步。
验收:两张参考图和作品资料能在实际场景中逐项对应;27件作品全部入展;鼠标参观与作品详情真实可用;布光和比例经过检查;每件作品的图片、简介与来源匹配。

模型在前端还原、设计补充与后续修改方面都表现出色。这个项目对多模态编码能力要求较高,需要将平面图的空间关系、展品图片比例、文档中的编号对应到网页的具体布局与交互中。模型的图文信息提取、元素定位与前端还原能力都很出色,从通道到展位的浏览流程流畅,所有展品与介绍都按照平面图的序号排列,灯光效果也准确对应。对于馆方页面未注明作者的展品,模型也如实标注,没有随意编造信息,同时保留了可跳转的来源链接,方便后续溯源核对。

大型游戏策划与开发项目

接下来我们验证了模型处理超长周期复杂任务的能力:我们提出打造一款以毛绒小动物经营兵器铺为核心的游戏,涵盖种植采集、武器合成、野外冒险与店铺经营的完整循环,武器结合农作物与自然材料,兼具古代兵器形态与可爱荒诞的风格。

模型首先完成了世界观与策划文档,再将策划、数值、开发验收、阶段汇报分别整理为不同格式的文件,并确保所有内容保持一致,之后推进原型开发。以下是详细提示词:

滑动查看完整提示词

↕️

请从零策划并制作《毛茸茸兵器库》。这是一个以毛茸茸小动物、兵器制作、种植经营和野外冒险为核心的原创游戏项目。游戏中的经营据点是一家兵器铺。请继承下述创作方向,先完成整个游戏的世界观与策划,再推进原型、美术、开发与验收。所有素材由你自行生成或查找,我只提供文字要求。
一、创作初衷与整体体验
我想把一个真正有趣的游戏想法从零做成可以玩的东西,同时观察你能否持续推进复杂任务、使用工具解决问题,并让游戏与Office策划资料保持一致。
游戏要有毛茸茸小动物的可爱、笨拙和喜剧感,也要有研究武器组合、经营自己的小店、外出冒险后带着收获回家的满足感。重点放在“玩武器”:不同武器应改变玩家的操作和战斗体验,经营与种植为这些武器提供材料、用途和成长动力。
可以借鉴相关作品的趣味和探索感,但角色、美术、地图、界面、叙事和具体玩法必须形成自己的表达。保留经营、种植与冒险的结合,不照搬现成游戏,也不要为了规避相似性而删去原本的趣味。
二、世界观与故事的大方向
这是一个由毛茸茸小动物生活的幻想世界。玩家扮演经营兵器铺的小动物,身边有可以种植的土地、制作兵器的工坊,以及能外出探索、采集和战斗的野外区域。
这个世界里的农作物和自然材料可以参与兵器制作。武器既有古代兵器的形态与动作启发,也带着日常食物和手工作品的荒诞感。菜地、工坊和野外之间要有合理联系:种植提供材料,冒险带回新资源,制作带来新玩法,经营所得推动店铺和角色成长。
整体故事轻松、有幽默感,允许小动物笨拙、失误和闹出笑话。冲突要服务于经营与冒险,不要把它扩写成沉重宏大的战争故事。
在这些方向内补全世界的名称、地理与生活规则、玩家的身世与开店原因、主要人物关系、问题的起因、冒险目标和阶段性结局。上述细节尚未确定,由你创作并在策划中明确,不把自行补写的内容称为用户已经确定的设定。
三、必须保留的核心玩法
围绕“种植与采集→收获材料→合成兵器→装备与试用→外出打怪→带回奖励→经营和升级→解锁新的制作可能”形成完整循环,并支持保存和继续进度。
种植的农作物要实际进入配方,采集与打怪所得要实际支持制作和升级。兵器铺需要有合理的订单、出售或其他经营方式,让生产选择与收入发生联系。外出冒险要能检验不同武器的用途,成长要给玩家继续种植、制作和探索的理由。
武器的趣味来自实际效果和使用代价。例如南瓜锤能击退敌人,同时把自己弹起来;萝卜长枪可以冲刺,但转向有代价;爆米花弩发射会弹跳的弹丸。把这些作为代表性设计纳入策划,具体参数、配方和表现由你平衡。避免只换造型或名称,实际攻击方式完全相同。
古代兵器的丰富形态可以作为继续拓展的灵感。新武器应有清楚的攻击方式、反馈、适用场景及副作用,副作用要让人觉得好玩,同时保持可理解、可操作。
四、美术与视听方向
采用短毛绒玩偶与手工微缩工坊的整体风格。角色有柔软、圆润、像玩偶一样的质感,兵器、农作物、建筑和场景形成统一的手工世界。整体可爱、温暖、带一点荒诞感,避免逼真血腥表现。
优先采用固定斜俯视镜头,让玩家清楚看到动物动作、菜地、工坊和战斗反馈。通过动作、音效、材质与适度的物理表现传达武器的力度和笑点。保证操作清楚,避免复杂物理效果破坏可玩性。
角色、怪物、道具、界面和场景需要先有统一的设计规范,再批量制作素材。画面精细度与玩法完成度分别评价。
五、AI在项目中的作用
使用AI辅助世界观与剧情创作、角色和道具设计、武器外观、效果构思、素材制作与代码开发。需要调用外部生成工具时记录工具和实际贡献,不将第三方生成质量全部归为被测模型的能力。
“AI设计武器效果”需要最终落实为游戏中真实可执行、可测试的规则。开发阶段可以用AI提出配方、技能和副作用,再实现到代码里。首版无需接入玩家在游戏里任意输入一句话就生成新技能的系统;将这种想法作为后续扩展单独规划,说明需要的约束与成本。
所有素材由你自行生成或寻找。可参考相关素材平台,具体素材自行选择并核对使用条件。不要要求我提供个人照片、工作资料或预制素材。生成工具不可用时,用合适的原创程序图形或简化模型推进,并说明视觉限制。
六、按常规游戏制作流程执行
第一步:完成故事大全景与世界观文档。
写清世界运行规则、玩家身份、开店动机、主要矛盾、故事起承转合和阶段性结局,解释动物、农作物、兵器铺与野外冒险之间的关系。让读者能理解这是怎样一个世界,以及玩家为什么愿意留在这里。
从此阶段开始建立并维护Office文档,完整保存设定。不要先写游戏代码再补故事。
第二步:完成角色、道具、场景和故事细节设定。
在世界观基础上,设计主角、重要顾客或伙伴、怪物等角色,说明性格、动机、关系、外观和剧情作用。整理作物、材料、武器和经营设施,明确用途、来源与关联。设计店铺、菜地和野外之间的空间关系,以及承担引导和成长作用的事件、任务、对话与阶段目标。
此时完成美术方向、角色与道具规范及关键场景设想。数量由完整构想与首版范围共同决定,不为凑清单制造无用内容。
第三步:完成可交付的游戏策划与Office资料。
写清操作、核心循环、种植与收获、背包、配方与制作、装备、战斗、订单与收入、奖励、升级、失败恢复、存档和新手引导。明确资源如何产出与消耗,武器之间如何形成选择,玩家如何感知成长。
建立以下相互关联的可编辑文件:
《世界观与游戏策划.docx》:保存完整故事、角色关系、玩法、流程、美术规范和首版范围。
《游戏主数据.xlsx》:保存角色、作物、材料、武器配方、伤害、冷却、副作用、奖励和升级费用等实际采用的数据,用稳定标识关联游戏配置。
《开发与验收.xlsx》:保存工作依赖、阶段计划、完成状态、缺陷和实际验证证据。通过验证后才能标记通过。
《项目说明与阶段汇报.pptx》:开发前说明世界观、玩法、风格和制作计划,开发中持续加入实际成果,最终说明真实完成度与问题。
检查各文件的名称、关系、数值与版本一致,确认核心玩法没有缺口,再进入原型阶段。无法生成规定格式时,提供可编辑替代文件并准确说明差异。
第四步:确定首版范围和技术方案。
保留完整游戏规划,同时将首版控制在可以玩通的小体量。此前的原型方向是一名可操作角色、一块菜地、一座锻造炉、一张野外地图、两类怪物,以及南瓜锤、萝卜长枪、爆米花弩等代表性武器,并串联背包、经营、奖励、升级和存档。
以此作为首版基线,根据技术可行性调整具体规模并记录理由。首版采用单人体验,联机、开放世界、付费系统和游戏内任意生成技能放入后续规划。自主选择适合当前环境的引擎或技术,不为了技术展示增加无关复杂度。
第五步:制作并验证玩法原型。
完成策划后,先用占位素材制作移动、南瓜锤和敌人的小样,实际验证攻击、击退、自身弹跳及受击反馈。通过后接入种植、收获、背包、合成、装备、冒险、经营、升级和保存,玩通核心循环。
检查趣味与操作是否成立。发现设计问题先修正规则,同步更新策划和数据,再扩大制作。不要把编译成功或静态页面当作原型通过。
第六步:制作正式素材并完成开发。
按既定美术规范自主寻找或生成素材,完成角色、场景、武器、界面、动作、音效与特效。按系统依赖逐步实现并整合,每个阶段保留可运行版本,实际检查后再继续。
三种代表性武器应产生真实差异,种植和冒险所得应真正支持制作、经营与成长。效果图中出现但未实现的功能不能计入完成项。运行失败时检查日志、画面与真实状态,修复后再验证。
第七步:持续同步策划,并执行一次跨文件变更检查。
需求、名称、规则、配方、数值或范围变更后,同步更新受影响的游戏配置、界面、文档、表格和演示文稿。建立明确的数据维护方式,避免互相矛盾的多份手工记录。
首版完成后,对一件已实现武器的配方和冷却作一次受控调整。可以采用此前讨论的测试:南瓜锤配方中的南瓜数量增加1,冷却增加0.5秒。先保留修改前版本,再检查并更新所有实际受影响的位置。
运行游戏验证材料扣除和冷却确实变化;检查表格公式和文件内容;打开或渲染文档、表格与演示文稿,检查可读性和排版。保存变更清单与证据。
第八步:完成试玩、修复与交付。
从新玩家视角实际跑通种植、收获、制作、装备、打怪、返回、经营、升级、保存和重新进入。重点检查材料不足、重复点击、死亡或失败恢复、背包变化、奖励结算、冷却与读档。
修复影响核心体验的问题并再次验证,核对所有Office资料与最终游戏一致。自主推进常规阶段,遇到真正无法继续的工具或权限问题时,说明具体阻塞及已完成部分。
交付可运行游戏、源码、启动与操作说明、完整Office资料、素材及使用条件记录、试玩截图或录屏、验收记录和已知问题。记录模型、工具环境、实际耗时、人工介入次数和外部工具贡献,明确完成、失败与尚未验证的内容。
七、最终验收
世界观、人物、道具和故事形成连贯设定,经营与冒险在其中有合理位置。
策划与Office资料在开发前建立,之后随项目持续维护。
玩家能够玩通完整循环,三种代表性武器有实际不同的效果和代价,毛茸茸动物与荒诞兵器的趣味得到保留。
资源扣除、奖励、成长与存档行为正确,配方和冷却变更在游戏及相关文件中一致。
交付物能够打开和运行,所有通过结论有真实检查证据;视觉质量、游戏完成度、Agent持续执行能力和Office一致性分别记录。
八、两项大任务与统一项目文件夹
本案例包含两个必须同时交付的大任务:A,完成游戏策划与可运行游戏;B,从策划阶段开始维护与游戏一致的资料和报告三件套。两项工作共同构成一次完整交付,不能只完成其中一项。
建立一个名为“毛茸茸兵器库”的项目总文件夹,将游戏工程、运行版本、素材、全部策划资料、表格、报告和验证记录归入其中。可以设置清楚的子文件夹,在根目录提供总览与文件索引,说明每份文件的用途、当前版本和启动或查看方式。既有文件名称保持一致,避免另起多个相互矛盾的版本。
必须包含前文全部交付物:《世界观与游戏策划.docx》《游戏主数据.xlsx》《开发与验收.xlsx》《项目说明与阶段汇报.pptx》,以及源码、启动与操作说明、素材来源、试玩记录、变更清单和已知问题。另增加《游戏项目摘要.docx》《三件套一致性核验.xlsx》,保留数据同步所用脚本、配置或可复用流程。
九、报告三件套的制作与同源同步
将原先报告三件套的做法落到游戏项目中,不引入无关行业报告。三件套由《游戏主数据.xlsx》《项目说明与阶段汇报.pptx》和《游戏项目摘要.docx》组成;完整策划文档与开发验收表继续维护。
1. 开发前,整理游戏中实际需要的关键数据组,覆盖配方与材料、武器效果、经济与成长、制作范围和阶段计划。用《游戏主数据.xlsx》作为相关数值的统一来源,区分策划假设、公式计算和实际测试数据。涉及计算的内容使用公式,注明单位、版本和依据,不伪造用户测试与经营业绩。
2. 用同一来源生成约12至15页的项目演示文稿及一页项目摘要。演示文稿包含目录、故事与玩法、角色与美术方向、数值与经济图表、制作计划及当前状态,并具备一致的页脚与日期。开发前使用已完成策划内容,开发后加入真实游戏截图、验证结果和已知问题。摘要与演示文稿都能回溯到主表或策划中的对应位置。
3. 建立数据字段到游戏配置、界面、策划正文、摘要、演示文稿文字及图表的对应关系。可以用自动引用或可重复执行的更新流程实现,不要求不同Office软件之间天然实时联动,但必须实际完成一次端到端同步。
4. 使用前文的武器配方与冷却变更执行一致性测试,沿同一来源更新所有依赖。若演示文稿或摘要尚未提及被修改指标,在首版报告中纳入该指标和相关图表,再进行测试。检查派生计算、图表标签、正文、摘要与游戏行为;目录、页码、版本和页脚日期也应与最终版本相符。
5. 在当前交付版本中检查与目标字段有关的旧值残留。历史快照和明确标记的变更前后对照允许保留旧值,无关字段中的相同数字不能误删。列出修改前值、修改后值、涉及文件和核验结果。
6. 重新计算表格公式并打开检查;将演示文稿逐页导出预览并回读,核对图表与主表数据、目录页码、文字溢出、遮挡和排版;检查Word摘要与完整策划。把逐页和逐文件核验写入《三件套一致性核验.xlsx》,修复后再次核验。
7. 最终在同一个项目文件夹交付全部可编辑文件和一致性证据。分别汇报游戏是否可玩、策划是否完整、三件套是否同源、改数是否同步、文件是否通过实际查看。只完成游戏画面不能代替资料同步验收。

模型生成的结果包含了完整的世界观与玩法文档,游戏主数据表包含20个子表,覆盖角色、作物、武器配方到订单和升级费用;开发与验收表则包含6个子表,分别管理验收用例、缺陷台账和验证证据。阶段汇报文件达到15页PPT,在项目过程中,模型可以通过对话完成所有本地文档的增删修改与同步,当某个设定发生变更时,相关的策划、数值与汇报文件都能保持全局一致,待完成的工作也能清晰分类整理。

目前该项目仍在推进中,我们调用了相关工具进一步优化效果,待完成后将分享完整内容。在开发过程中,模型可以结合视觉理解与代码能力排查问题并自主纠错,大幅提升了复杂项目的推进效率。

3D视频预演制作

在3D视频制作场景中,我们测试了模型生成预演视频的能力:此前发现直接用视频生成工具很难保证角色走位与镜头运动的一致性,经常出现修改一次后走位就出现偏差的情况。因此尝试让模型在专业3D工具中生成白模预演,固定动作顺序、空间布局与运镜节奏,再基于预演生成最终视频。

我们希望参考经典马戏风格作品,制作一段包含两人弹跳动作与复杂运镜的视频,具体时间轴为:0-4秒进场环顾,4-9秒男主角弹跳翻腾,9-14秒女主角弹跳翻腾,14-20秒双人齐弹齐翻+升起拉远。以下是详细提示词:

滑动查看完整提示词

↕️

【素材映射】
@白模参考视频:运镜、景别、双人走位、弹跳/翻腾/落地节奏的唯一时间轴依据,必须严格跟随,禁止自行改运镜路径。
@男演员四视图:马戏男演员外观锁定(瘦高成年男性),面孔、发型、服装、鞋履以四视图为准。
@女演员四视图:马戏女演员外观锁定(成年女性),面孔、发型、服装、鞋履以四视图为准。
@马戏场景:马戏之王气质马戏棚空镜,金红帷幕、舞台追光、金色尘雾、两侧高台、绳索秋千、中央大型圆形弹跳床。
【一句话概述】
马戏之王风格空中马戏短片,双人杂技弹跳翻腾,电影感写实,20秒,16:9,720P,严格跟随白模参考视频的镜头与动作节奏。
【全局设定】
将白模几何角色真实化为真人马戏演员:白模红球=男演员,白模蓝柱=女演员。服装不要做成纯红/纯蓝紧身衣,以四视图为准。两人始终同框。
场景只能是马戏棚+弹跳床+高台,禁止现代城市、禁止额外观众抢戏。
动作:助跑、弹跳床弹起、空中干净空翻(转体在腾空最高段完成),落地只缓冲,不穿地、不沉地板、落地后不补拧。
运镜保留白模中的变化:极端仰拍、大广角建立、荷兰角跟拍、环绕翻腾、英雄特写、升起拉远收尾。
写实电影质感,舞台追光,金色尘雾。可生成环境音与低频马戏弦乐;无字幕,无水印。
【时间轴】
严格对齐@白模参考视频时间节奏(约20秒):进场→男演员高台/弹跳翻腾→女演员高台/弹跳翻腾→双人齐弹齐翻→特写与升起拉远收束。
【全局收束】
面孔与服装锁定四视图;镜头与走位锁定白模参考视频;禁止穿模、禁止沉地板、禁止单人长时间出画、禁止忽略参考视频自由运镜。

在白模视频生成过程中,模型可以自动查看视频内容并发现问题、自行纠正,将视觉理解融入实际操作流程:它需要结合画面中的角色位置、遮挡关系和动作衔接判断问题,再调用工具修改场景,让视觉判断推动下一步操作。3D空间构图、场景布局和运镜速度都可以在白模阶段固定,逐帧检查效果后再交给最终视频生成工具。模型负责组织预演并调用工具,后续我们再基于预演视频生成最终画面,这比单纯在提示词中描述镜头效果要高效可靠得多。

科普视频生成

我们还测试了科普视频的全流程制作能力:此前在新闻中看到中国空间站的失重实验,航天员拧湿毛巾时水没有滴落,我们希望基于这个实验制作一条易懂的科普短片。

我们要求模型从权威平台检索实验资料、制定短片方案、准备素材,完成旁白、分镜、配音与剪辑合成,最终产出完整的科普视频。以下是详细提示词:

滑动查看完整提示词

↕️

请围绕近期中国空间站“拧湿毛巾时,水没有像地面上一样滴落”的实验,制作一条普通人能看懂的科普短片。以附件实验视频为起点,核实事实,规划短片并完成实际制作。需要的补充图解、文案和配音由你准备。
资料从央视网、央视频、中国载人航天工程网和新华网查找。只给出网站范围,具体报道、素材与制作工具由你选择。
按以下顺序执行:
1. 先确认事件。核实近期中国空间站实验的发生日期、视频发布日期、原始发布方与画面内容,区分旧视频重新传播和新实验,不把其他国家或其他年份的演示混用为同一次事件。找不到对应近期视频时如实说明,并继续完成能够独立推进的部分。
2. 在看过视频并理解可靠解释之后制定短片方案。确定面向谁、需要解答的核心问题、叙事顺序、适合的时长和表现方式。讲清观察到的现象与背后的原因,避免把微重力环境说成完全不存在引力。
3. 检查素材是否适合当前用途,再准备视频、图解、配音和其他必要材料。原片的使用条件不明确时,用原创图解或动画呈现原理,并标注为示意;保持真实实验来源可查,不把生成画面当作现场录像。
4. 先完成旁白、分镜和字幕文稿,检查每个镜头承担的解释任务、所依赖的事实和实际可获得的素材。文稿成立且材料可用后,再进入剪辑与合成。
5. 使用可用工具完成实际制作。画面、配音、字幕和解释要同步;文字可读,叙事连贯,引用与原创示意的身份明确。根据表达需要确定成片规格,不为增加效果而堆叠无关素材。
6. 每次生成、剪辑或导出后等待真实结果,检查返回文件。出现失败、空文件、素材缺失或工具不可用时,说明具体问题并采用可行替代方案。不要把任务已提交、脚本已写好或导出命令已运行等同于成片完成。
7. 播放最终文件,检查画面、字幕、音频、科学解释和片尾来源。修复黑屏、错字、声画不同步与事实错误,再回看修复结果。
8. 交付可播放成片、文稿、字幕、可编辑工程或制作文件、来源与使用条件记录,以及实际验证结果。未能完成的视频环节应明确列出,已有文件照常交付。

模型的执行流程涵盖了从资料核对到脚本分镜,再到调用素材生成、配音与剪辑合成的全流程。原本我们只要求静态配图,为了让内容更生动,我们让模型将静态素材转化为动态效果,最终完成了完整的科普视频。

影视内容拉片分析

最后我们测试了影视内容的拉片分析能力:我们提供了一部导演的广告作品,要求模型完成全片拉片,包括截取带时间码的关键帧、逐镜记录起止时间、转场、景别、动作、运镜与叙事作用等细节。

我们给出的详细提示词如下:

滑动查看完整提示词

↕️

请对该视频完成全片拉片,整理成逐镜头可核查的影像分析档案。重点测评视频时间线理解、镜头识别、构图与叙事分析,以及依据画面重建图片和视频提示词的能力。
使用本文所附电影作为统一分析素材,直接分析原片。
按以下顺序执行:
1. 检查素材并制定方案。确认附件可以播放,核对实际时长、音轨可用性和分析范围。完整观看原片,确定分析方法与交付结构。片名、简介、字幕和既有影评只能辅助,不能替代观看;先独立记录画面,再使用外部资料核对背景。
2. 建立完整时间线。先概括全片结构,再切分所有镜头,包含片头与片尾并标记其类型。记录镜头编号、开始时间、结束时间、时长和转场。镜头内摇移、人物进出、变焦或字幕变化不能自动算作切镜;叠化边界不确定时保留过渡区间,说明计时口径,避免重计、漏段和负时长。受工具限制时分段分析,再按原片时间合并并复核段落交界。
3. 逐镜头提取证据。记录主体、环境、人物位置、可见动作与动作发展、摄影机运动、景别及其变化、构图、光线、色彩和景深。每个镜头至少保留一张带时间码的真实关键帧;涉及连续动作或运镜时补充起止帧及必要中间帧,不能凭单帧判断运动方向。
4. 分析镜头的作用。结合前后镜头解释这个景别如何交代空间、突出信息、表现人物关系或情绪,以及人物调度、构图、色彩和剪辑如何推动叙事。每条解释指向具体时间与可见证据,避免反复套用“营造氛围”等空泛句子。将画面事实与创作意图推测分开。焦距、器材和导演真实意图无法直接确认时标为未知或推测。
5. 识别画面文字与声音信息。整理实际可辨认的标题、字幕、招牌等,记录原文、时间、位置及不确定字符;翻译与原文分列。口播转写与画面文字分别记录,不把自动字幕当作OCR证据。声音分析以实际读取音轨为前提,未处理音频时明确说明,不能猜测对白或配乐。
6. 为每个叙事镜头反推两类完整中文提示词。图片提示词对应代表帧,包含主体、服装、环境、机位、景别、构图、光线、色彩与材质;视频提示词对应连续镜头,包含起始状态、动作顺序、镜头运动、节奏与结束状态。使用具体视觉描述,不只写导演名字或“电影感”。同一角色与场景的描述保持一致,每条自包含,不用“同上”省略。统一标注“基于画面重建的提示词”,不宣称获得创作者原始提示词。片头片尾等非叙事条目可以标记不适用并说明理由。
7. 制作可下载的.xlsx表格。至少包含完整拉片表、图片提示词、视频提示词、全片分析、画面文字五张工作表。完整表一行一镜头,包含上述字段、关键帧、证据和不确定项;缩略图真实嵌入并与时间码对应。设置冻结表头、筛选、自动换行和合理列宽,提示词全文不得截断。另交付带时间索引的分析报告、关键帧联系表和结构化JSON;可用工具支持时提供点击时间码回看原片的索引页。
8. 回看与验收。复查镜头边界、连续运镜、遮挡、小字和段落交界,核对时长合计及覆盖范围。实际打开导出表格,检查图片、字段、提示词全文与原片对应关系。修正后记录问题和仍待确认的内容;模型自检不能冒充独立人工准确率。最终将来源、素材规格、完整结果与核验记录归入同一任务文件夹。
验收:全片覆盖范围清楚,时间线完整;每项分析可回到原片核对;景别、构图、氛围及叙事作用有具体依据;两类提示词对应各自镜头;观察、推测和未知明确区分;Excel可下载并正常打开。

模型最终生成了包含6个子表的Excel文件,覆盖22个镜头与106张关键帧,所有分析都能对应到原片的具体画面,包括区分人物移动与摄影机移动、准确识别镜头切换、基于画面给出叙事作用的分析,后续可以直接复用这些拉片结果。

测试小结

通过多轮测试可以发现,此次升级后的模型在多个核心能力上都有了显著提升:

一是视觉理解与实际开发、代理执行的结合更加紧密,能够准确将视觉素材转化为可落地的开发内容;二是对复杂代码仓库的结构、模块关系和跨文件问题的理解能力更强,从需求理解、代码修改到运行验证的端到端开发能力得到增强;三是支持多步骤任务的连贯推进与持续修改,能够在多个文件之间保持内容一致,完成大型项目的全流程管理。

目前该模型已在多个平台开放调用,针对需要视觉输入与多步骤执行的任务,体验提升尤为显著。如果您也在使用该版本模型进行多模态开发或长周期任务,欢迎交流分享。

以上就是本次测试的全部内容,感谢阅读。

以上内容不代表本平台立场,仅供读者参考