文章摘要
近期AI大模型Opus 5.5持续保持高话题度,行业从业者围绕它展开深度讨论,拆解其刷屏原因:该模型可自主完成视频、动画、绘图、代码等多领域高质量创作,具备自主审美与判断能力,一体化创作能力远超多数传统创作工具。业内还探讨了其认知能力、对创作行业的影响等议题,目前国内已有企业跟进相关技术研发。

近期,一款AI大模型的讨论热度持续居高不下,即便同期有其他头部模型推出重要更新,它依然保持着极高的话题度,这就是Opus 5.5。中秋期间,多位行业从业者围绕这款模型展开了深度对谈,拆解其刷屏背后的核心原因。

刷屏内容的三大类型

Opus 5.5的刷屏内容大致可以分为三类。其一为品牌宣传片类作品:整个视频由模型通过代码逐行生成,画面中堆叠了丰富的视觉材质,笔触带有蜡笔的粗粝质感,画面噪点被处理成类似纸张的纹理效果,仅凭肉眼很难区分它是代码生成还是专业视频模型创作的作品。其二是像素动画创作:这类内容的核心难点在于让角色技能与场景产生真实的物理互动,比如法师释放技能攻击稻草人时,技能落地的瞬间屏幕会同步产生震动,像素化的打击效果手感接近优质游戏模组的表现;还有3D像素版的三国题材游戏演示,像素颗粒比经典沙盒游戏更细腻,赵云从空中跃下砸击地面时,周围的怪物会被直接清空,整体打击感十足。其三是模型直接操作绘图工具完成创作的过程:有从业者展示了模型通过系统自带绘图工具,逐笔还原一幅人物肖像的全过程,对比其他同期更新的模型,这款模型生成的作品风格更接近专业街头艺术家的水准,这类“根据参考图从头创作并录制全程”的内容在海外社交平台上热度颇高。

有从业者用这款模型制作了宣传片和游戏结算动画,不了解的人很难想象这完全是通过代码自主完成的。这类视频的产出质量已经达到了八九十分的水平,完全可以承接高价商业订单,虽然距离顶尖的专业特效作品还有一定差距,此前这类视频的报价最高可达十万元一条。

具备自主审美能力的专业创作者

有从业者分享了用模型完成中秋主题小猫短视频的经历:仅提供脚本和背景音乐,模型会自主选择贴纸风格,从头制作出带有完整剧情、转场流畅的成品,且一次通过无需反复修改。按照常规真人团队的制作流程,这类作品至少需要两到三天才能完成。

在音乐创作层面,这款模型的表现同样亮眼:它能精准实现动作、转场与音乐卡点的对齐,甚至片头打字的音效都能完美匹配节拍器的BPM。与传统的流水线式先制作视频再匹配音频的方式不同,模型在构思之初就已经完成了整体的成片规划。有从业者用2023年AI写代码的阶段来类比早期的AI视频创作:当时的AI剪辑对动效、文案和节奏的理解都非常简陋,更像是刚学会基础剪辑软件的实习生,只能生硬模仿成熟作品,更换主题后就会显得违和,只能完成基础的操作,无法理解创作背后的逻辑。而现在的模型已经具备了自主的判断能力,可以合理组织各类创作元素,形成完整的作品,不再是只会照搬模板的初级操作工。

是否具备世界模型的认知能力?

有从业者提出,模型在打击感、视频创作和绘图控制上的出色表现,说明它已经具备了对现实世界、空间关系和物理规律的深度理解,这或许就是所谓的“世界模型”。不过也有不同看法:对世界的理解并非智能的专属标志,比如青少年和动物都能理解世界,但无法基于理解进行创造性的产出,而这款模型更像是一位经过长期训练的专业创作者,可以将认知转化为动态的创作成果。

还有从业者判断,如果这款模型能达到另一款主流模型的动效还原水准,甚至在部分领域实现超越,那么后续追赶的难度会大幅提升。因为另一款模型需要配合大语言模型才能完成工作,而这款模型是一体化的解决方案,可以一次性输出完整成果。现在已经可以确认,纯代码生成的视频作品完全可以超越专业视频模型,这在半年前还是难以想象的事情。

这款模型的出现相当于为剪辑师划定了新的能力边界,不过也有观点认为它的影响远不止于此:它直接冲击了各类智能创作工具、视频技能插件的市场空间。比如近期有一款基于HTML和音效的解说视频创作工具,而这款模型仅用一句话就能生成效果远超它的作品。当前AI创作领域呈现出两条不同的发展路径:一类以工具类产品为代表,功能不断叠加,复杂度越来越高,近期也推出了带智能功能的新版本;另一类则以智能模型为核心,不断强化创作能力,其能力增长的速度远超工具类产品的功能迭代速度。

这款模型的创作逻辑也很特别,它直接从底层技术库出发,使用各类互联网基础设施工具完成创作,无需经过上层封装的界面或软件,完全遵循第一性原理进行搭建。

全能型的专业助手

这款模型的智能还体现在具备自主判断力。有从业者提到,在为RSS阅读器添加导出功能时,模型在完成基础需求后,主动提出可以将按钮改成已完成状态,避免用户不清楚操作进度。早期的大模型更像是按指令执行的工具,只会生硬完成用户给出的步骤,甚至会因为外行的需求而出现偏差,而现在的模型更像是一位经验丰富的熟练员工,可以主动指出用户需求中的不足,并给出更合理的解决方案,也就是大家口中的“老板最爱的全能员工”。

现在的提示词创作逻辑也发生了变化:过去需要详细引导、约定规则、设置严格限制,而现在只需要清晰表达“想要做什么”,至于具体的实现方式,已经无需用户操心。有从业者认为,这类可程序化、模板化的技能是优质的训练素材,将聊天记录、技能本身和最终成果结合起来,可以形成标准化的训练数据,让模型能够完整内化各类创作能力,无论是视频、图像还是音频创作,都可以被纳入这套标准化的训练体系中。

行业前沿的企业一直在寻找模型尚未覆盖的能力领域,通过补充新的数据来提升整体智能。比如代码能力已经基本成熟后,头部企业开始布局3D创作,而另一类企业则专注于物理、视觉和材质领域的突破,每一次新领域的突破都会推动整体智能水平的提升。与人类相比,这款模型的优势在于整合了各类专属能力:人类需要依靠团队协作才能完成多领域的创作,而单个模型就可以打通编程、多模态理解、音乐、视频和图像创作等多个环节,相当于集齐了多项绝学。人类曾经被认为独有的跨领域关联创新能力,在这款模型身上也得到了体现:如果模型在各个领域都具备顶尖能力,那么它的创新潜力甚至会超过人类。

有从业者也提出了对国内AI行业的思考:海外前沿企业总能精准找到自身能力的边界并进行突破,而国内厂商往往更倾向于稳妥的发展路线,明明知道某些方向可以拓展边界、提升传播度,却没有主动尝试。国内在这方面做得较好的案例是某款视频创作工具,它打破了传统视频模型比拼物理还原度和真实度的思路,转而比拼智能创作能力,仅用一句话就能将15秒的内容拆分为8个镜头组成完整故事,将知名视频模型启发的方向做到了极致。

能力边界拓展后,人类的角色变化

随着模型能力的边界不断拓展,创作者的角色也在发生变化:专业的代码编写已经不再是内卷的核心,现在模型还具备了设计和宣发能力,留给人类的核心能力或许只剩下人际沟通。不过也有担忧:现在的从业者还掌握着视频制作和代码编写的技能,未来的新人可能只需要一句话就能让模型完成所有创作。而且AI本身已经是黑盒系统,企业在推动可解释性研究的同时,也正在将互联网上可数据化的内容都转化为黑盒,这可能会加剧行业的信息不对称。

也有观点持更乐观的态度:过去几十年的互联网和移动互联网发展让从业者疲惫不堪,这一轮AI技术或许可以将人类从重复劳动中解放出来,未来人们只需要负责提出需求即可。有从业者对内容行业的未来判断较为激进:未来数字内容创作的从业者数量会大幅减少,全球可能只需要两万名顶尖创作者就能满足大部分需求,因为只有他们才能跟上AI的整合和思维能力。毕竟用户更倾向于观看顶尖的内容,资源会不断向头部集中,最终可能只会有万分之一的创作者借助AI完成几乎所有的内容供给,剩下的人则只需要作为消费者即可。

模型自主迭代的可能性探讨

有从业者形容使用该系列模型的体验:仿佛面对一位能力超凡的存在,使用时会小心翼翼,生怕出现失误导致模型无法正常使用,每次成功完成任务都会感到惊艳。用户对模型的忠诚度并不高,哪个模型的表现更好就会切换到哪个平台,就在不久前,另一系列模型还被捧为行业标杆,可见行业的变化速度之快。

有从业者认为,海外头部企业可能同时掌握多款前沿模型,并且会将优秀的版本隐藏半年到一年的时间,所以他们对行业的判断往往基于外界看不到的最新成果,比如他们在四五个月前就已经开始使用这款模型了。还有从业者回忆,去年年底到今年年初,有一批行业创作者加入了相关企业,当时大家猜测他们看到的可能是模型自主迭代的速度,也就是所谓的自我迭代能力。

本次对谈围绕这款模型展开了多维度的讨论,同时还提及了近期海外爆火的另一款创作工具,据悉国内相关企业已经开始跟进相关技术的研发,预计在近期完成相关版本的推出。

以上内容不代表本平台立场,仅供读者参考