11个分镜实测:AI视频模型MV创作能力对比

作为一名热爱音乐与AI技术的创作者,我一直尝试用AI工具打造专属的音乐可视化作品。最近我基于相关平台开发了歌词生成工具,通过开通会员获取了更优质的模型支持,打造了一首带有欧洲中世纪哥特风格的歌曲,主题围绕吸血鬼与狼人展开。
有了歌曲之后,我觉得仅靠音频稍显单薄——当下AI创作已经覆盖了小说、视频等多个领域,自然也想要用AI生成配套的MV,甚至后续还考虑将其拓展为AI漫剧,这也是创作者对优质内容的自然追求。
制作MV首先需要挑选合适的视频生成模型。考虑到预算有限,我没有选择功能更强但成本更高的高端模型,尽管该模型的指令遵循性、长叙事能力和真人质感都有显著提升,且其API已正式上线。近期一款轻量化模型推出了降价活动,720P分辨率的生成价格降至0.6元每秒,有消息称其表现接近高端版本,部分性能甚至优于另一款主流模型,因此我决定用这款模型进行本次MV制作,并与另一款主流模型做对比测试。
我开发了一个自动化流程工具,支持双端输出,分别接入了两款模型的API,同时调用了专业生图模型。尽管我拥有相关会员,但为了让工具运行更流畅,还是直接调用了官方API,后续再尝试使用其他工具。这个工具可以通过输入歌词自动生成分镜图片,确认分镜无误后,结合图片与歌词生成视频提示词,调用模型API生成最终视频。不过为了本次对比测试,我选择手动分步进行测试。
我通过工具生成了11张分镜图片对应11个场景,接下来将分别用两款模型对这些分镜进行测试对比。
第一组测试:画面一致性与基础补全能力
第一个分镜测试的是简单提示词下的视频补全能力,重点观察人物面部与定妆照的一致性,以及道具银币的稳定性。我为两个模型输入了相同的分镜图片和钱币参考图,最终生成的视频都实现了推镜头并最终定格在人物近景,发型和服装都保持得不错,且带有粒子特效。
不过两者的妆容表现有差异:轻量化模型全程保留了分镜中的人物妆容,实现了银币在手中翻转,镜头始终围绕人物主体;而另一款模型生成的视频在镜头拉近后妆容出现变化,人物一致性稍差。在镜头收尾上,另一款模型通过背景虚化突出银币,轻量化模型则在最后几十帧加入渐变效果,将镜头切换到手持银币的人物近景,同时展示银币和面部特写,更具叙事感。
视频参数方面,轻量化模型生成的1280×720P视频码率为4833kbps,耗时166.9秒;另一款模型默认生成1344×768P视频,码率1424kbps,耗时329.9秒,当然该模型也支持1280P分辨率,不过价格会更高。本次测试中轻量化模型使用默认720P,另一款模型使用默认768P以保证对比公平,后续测试均遵循此参数设置,且两个模型都支持免费输入歌曲音频文件。
第二组测试:人物与道具稳定性
第二个分镜测试人物和道具的稳定性,这类测试和第十个分镜有相似之处。我为两个模型输入了相同的提示词,搭配分镜图、妆容参考和银币参考图。最终生成的视频都保持了不错的角色和道具一致性:另一款模型严格按照指令生成内容,让人物手持银币从走廊一端走向另一端,墙壁图腾同步点亮,但遗憾的是丢失了开头一帧,人物直接进入行走状态;轻量化模型虽然有时不会完全遵循指令,但这种灵活调整反而带来了独特的故事感,同时也完整展示了银币和妆容细节,整体表现稳定。
点击右下角放大看全尺寸视频
第三组测试:物理真实感表现
第三个分镜聚焦两个模型的物理真实感,包括金属反光、手指皮肤质感等细节。我为两个模型输入了相同提示词搭配参考图。两者都很好地还原了金属币面的纹理和光泽,手指皮肤也表现得精致真实,尽管提示词设定的厚涂二次元风格最终呈现出了真人皮肤质感。
两者的表现各有特色:轻量化模型的镜头先是跟随人物摩挲银币再拉远,最终定格在分镜图,人物最后手持银币望向天空,充满叙事感,但中间的银币翻转使用了特效,若能通过真实动作完成会更自然;另一款模型的视频中,主角全程用手指摩挲银币,对面有一张表情僵硬的脸作为背景,还通过蒙太奇手法在银币后方加入月亮外景,更偏向写实风格,但整体氛围偏冷峻。
点击右下角放大看全尺寸视频
第四组测试:长镜头与人物表情
第四个分镜测试长镜头表现力和人物表情自然度,我要求两个模型生成带有旋转运镜的视频。轻量化模型生成的视频保持了90度旋转,由于使用了三张不同角度的参考图,运镜出现了轻微卡顿,带有剪辑感,但整体一致性极佳,人物表情也保持稳定;另一款模型仅使用了单张分镜图,旋转运镜更加流畅,但它将指令理解为360度旋转,镜头转到侧面时人脸出现轻微变形,整体一致性尚可。
在服装方面,由于分镜图中服装为深色看不清细节,两个模型都自行进行了补全,整体画质和光效都较为柔和。
点击右下角放大看全尺寸视频
第五组测试:舞蹈动作与节奏同步
第五个分镜设计了复杂的舞蹈动作,让吸血鬼角色完成一段动感舞蹈,测试物理真实感和动作与音乐节奏的同步性。轻量化模型生成的视频更具舞动感,人物动作贴合舞蹈节奏,脚下的光点符合物理规律,360度旋转运镜让镜头更具节奏感和感染力,但美中不足的是手中的银币在舞蹈中消失了;另一款模型生成的视频中人物更像是在摆姿势,动作略显僵硬但造型帅气,不过完全没有跟上音乐鼓点,光电特效符合物理规律,同样使用了旋转运镜,整体带有电影质感。
点击右下角放大看全尺寸视频
第六组测试:视频文字表现
第六个分镜测试视频中的文字表现,我要求两个模型在视频中加入一句歌词,观察中文字的显示效果、歌词与音频的时间轴对齐情况,以及角色一致性是否会因文字出现而受影响。两个视频都成功生成了字幕,但都没有在正确的时间点与歌词人声对齐:另一款模型的字幕在第一句歌词出现时就显示,轻量化模型的字幕则在第二句和声时出现,文字清晰度尚可但略显模糊,轻量化模型生成的歌词中还出现了错别字。
两个视频都使用了推镜头最终定格在吸血鬼面部特写,相比分镜图中的人脸,妆容都出现了不同程度的变化,这应该是因为本次测试仅使用了分镜图,没有使用定妆照作为参考。
点击右下角放大看全尺寸视频
第七组测试:长指令执行与双角色稳定性
第七个分镜需要生成双角色视频,我使用了两张分镜图和一段较长的结构化提示词,要求生成动作细节更丰富的画面。两个视频都基本遵循了指令,按照时间节点从中景推近到头部特写。
另一款模型的镜头推进过程不够流畅,在视频播放到1/3时突然切换为全景镜头,还加入了燃烧的蜡烛画面,随后又切回头部特写,带有强烈的剪辑感,应该是严格按照提示词的时间节点强制执行导致的;轻量化模型的镜头过渡则更加自然。两个视频都实现了电闪雷鸣效果,但都保留了月亮背景,仿佛只有头顶有一片云,两个模型的逻辑一致。
冷风吹动的效果也都完成了,另一款模型的寒气从窗口沿地面吹拂,细节表现更好,还加入了窗外下雨的细节,但天空同时出现月亮,略显违和。最后狼人的发狠动作,轻量化模型和另一款模型分别呈现了狰狞流口水和张大嘴巴两种效果,各有特点。整体来看,两个模型都很好地完成了结构化指令,双角色在运镜中保持稳定,侧面妆容变化不大。
点击右下角放大看全尺寸视频
第八组测试:不同分辨率视频质量对比
第八个分镜对比轻量化模型的720P视频和另一款模型的2K视频质量差异。另一款模型生成的2K视频细节更丰富,画面更细腻,比如背景中持续飘动的云和闪电,人物进入中景后头发开始飘动;有意思的是,月光出现的时机恰好贴合歌词内容,不知是巧合还是参考了音频节奏,不过运镜时存在轻微抖动。
轻量化模型生成的720P视频背景基本静止,只有一只蝙蝠缓慢飞行,主角头发在进入近景后才开始飘动,画面的云层、光影和建筑细节更锐利,但镜头过渡自然,不输于另一款模型的流畅度。
点击右下角放大看全尺寸视频
第九组测试:连续叙事能力
第九个分镜是吸血鬼与狼人的对峙场景,重点测试连续叙事能力和动作逻辑合理性,同时考察人物一致性。我仅输入了一张基础图片和多张人物参考图。两个视频都保持了不错的妆容和服装一致性,但动作设计差异明显:
另一款模型生成的视频中,两个角色始终保持对峙状态,搭配旋转运镜,人物位置稳定没有错乱,月亮等背景景物变化不大,场景一致性保持良好;轻量化模型生成的视频则为两个角色加入了大量动作,对峙过程中人物位置不断移动,镜头采用左右移动和拉远视角,最终推到两人的面部特写,人物和场景一致性都很稳定。
不过轻量化模型的视频存在两处动作跳转:一开始人物左手持剑,走了几步后变为右手持剑;在角色对峙转动位置时,狼人和吸血鬼的背影重合后突然交换了位置,继续转动后位置才恢复正常,不过这属于小瑕疵,后期剪辑很容易修复。整体来看,15秒的视频中,轻量化模型的对峙叙事更加连贯,没有明显断裂,完整展示了两人的动作和情绪,最后加入面部特写,动作逻辑基本合理,整体表现优于另一款模型。
点击右下角放大看全尺寸视频
第十组测试:道具一致性表现
第十个分镜设计了银币的多角度展示,呼应第一部分的道具测试,通过近景和特写展示银币细节。两个视频都保持了人物和道具的一致性,完美还原了金币的金属质感,图案完全符合参考图,完整展示了银币细节,多角度的道具一致性表现出色。
两者的差异在于:轻量化模型更注重道具的展示动作,额外加入了一次银币旋转;另一款模型则更强调细节,最后几十帧给出了超大特写。不过另一款模型的视频开头出现了一个物理错误:人物左手拿着银币,却在右手变出了金币,不符合现实逻辑。
对于抛到空中的银币,轻量化模型的镜头跟随银币从上方移动到放大特写,过渡自然合理;另一款模型则更像剪辑式的突然切到银币特写,这种自然的道具展示和镜头过渡非常适合电商商品展示场景。
点击右下角放大看全尺寸视频
第十一组测试:多模态与动作迁移能力
第十一个分镜测试多模态输入和动作迁移能力,我同时输入了图片、舞蹈视频和歌曲片段,要求人物跟随舞蹈视频跳舞。在工具中调用API时,运镜参考视频无法正常输入,因此我分别在不同平台调用两个模型生成视频。
轻量化模型生成的视频中,人物舞动动作基本遵循原舞蹈视频,完成了动作迁移,没有加入过于复杂的运镜,人物一致性保持良好;另一款模型则完全自主发挥,没有按照原舞蹈视频生成动作,而是加入了大量运镜配合舞蹈,动作流畅丝滑,整体带有电竞镜头感。如果需要尽可能保留输入的舞蹈动作,轻量化模型会是更合适的选择。
点击右下角放大看全尺寸视频
将11个分镜视频合成后,就得到了使用轻量化模型生成的半成品MV。接下来聊聊本次测试的成本:轻量化模型的720P版本定价0.6元每秒,本次15秒的分镜视频每个约8-9元,另一款模型的768P版本每个约7-8元,但轻量化模型的抽卡成功率更高,整体总成本更低。
本次从调试API到合成完整MV,共消耗约578万token,总成本约180元,其中部分花费用于前期模型测试和分镜修正,实际抽卡成本更低,整体150-160元即可完成一个MV制作,性价比尚可。
当下视频模型的定价并不便宜,不少朋友询问是否需要本地部署。起步级的本地部署需要专业显卡和大内存配置,当前硬件成本动辄过万,还需要搭建各类开发环境并拉取本地模型,如果自己不熟悉技术,还需要支付部署和调试费用,甚至学习成本。
相比之下,直接调用API会更加划算,无需考虑设备配置,使用普通笔记本就能完成创作,如果配合相关平台的打折月付会员,还能进一步降低成本。配合客户端工具可以实现开箱即用,搭配各类自动化技能还能实现视频批量生成。我开发的自动化工具已经可以自动生成两个模型的双端视频,不过目前还需要人工审核分镜图片,避免使用不合格分镜生成废片造成浪费。
本次关于两个模型的评测就到这里,完整的MV完成后,大家可以在相关平台观看。

