文章摘要
阿里硬核少年技术节5.0博见社活动设北京工业场和杭州学术场。北京场聚焦产业落地,如群核科技分享虚拟片场实践;杭州场探讨智能体发展,认为当前类似电灯泡,完整系统未建成。两场活动各有侧重又形成闭环,展现出AI局部成果与系统建设的现状。

如今,AI技术正在从单一的内容生成,迈向更完整的虚拟世界构建,影视创作领域已经出现了极具代表性的实践:线下的影视基地被完整扫描重建,搬到线上成为可直接使用的虚拟片场。

这一案例来自阿里旗下硬核少年技术节5.0的博见社活动,该活动首次设置了两场平行对话,分别落地在北京和杭州两座城市,聚焦AI产业的不同侧面。

北京工业场的主题为“AI下一站:从生成内容到构建世界”,邀请了多家企业分享产业落地的实践;杭州学术场则联合CCF人工智能与模式识别专业委员会,邀请了来自清华大学、南京大学、上海交通大学等多所高校和科研机构的学者,围绕“从生成式AI到智能体进化”展开深度探讨。

两场活动的讨论呈现出鲜明的差异:北京场展示了AI已经在具体行业中落地的成果,而杭州场则对智能体的未来发展提出了更具批判性的思考,甚至有嘉宾将当前的Agent类比为刚被发明的电灯泡——确实比过去的技术更先进,但真正的电力革命,也就是完整的智能体系统,还远未到来。

在杭州学术场的正式讨论开始前,南京大学教授高阳在致辞中提到,从早期的逻辑智能体、强化学习智能体到如今的大模型智能体,AI正在将过去的哲学设想逐步转化为工程现实,但智能体在底层能力、工程框架、可靠性与安全性等方面仍有大量未解决的问题,此次博见社的活动正是为了让学术前沿与产业真实问题相遇,共同探索智能体的下一步发展方向。

与会嘉宾首先围绕“Agent究竟发展到哪一步了”这一问题展开讨论,并没有形成统一的答案,因为不同的观察维度会带来完全不同的判断。

从应用能力来看,天津大学教授郝建业认为,代码智能体(Coding Agent)已经很难被划入初期阶段,这类智能体已经能够承接大量过去由程序员完成的具体工作,这种替代并非仅存在于演示视频中,而是已经在真实业务场景中逐步发生。不过如果从底层技术视角来看,郝建业的判断则更为谨慎:当前Agent的能力提升仍然高度依赖基座模型,而诸如MAS、Loop Engineering等智能体架构的相关理念,学术界其实早已研究多年,只是在强基座模型出现后,这些过去无法发挥性能的技术路线才获得了大规模应用的机会。

如果将视角转向具身智能,Agent的发展进度则要滞后许多。机器人进入真实世界后,需要同时处理视觉、空间、物体、动作以及环境中的各种突发变化,实验室中完成的流畅演示,与在工厂、家庭等真实场景中长期稳定工作,完全是两个难度等级。而真正能够像人和动物一样,在开放世界中不断学习、自主发现问题并设置目标的Agent,甚至被嘉宾判断为处于比初期更早的阶段,这类Agent目前缺乏成熟的理论和方法,在持续学习过程中还会遇到灾难性遗忘、模型可塑性不足等问题,即模型可能学会新技能的同时遗忘旧能力,也未必能够无限吸收新的经验。

综合来看,Agent并没有统一的发展进度条:在代码、检索等数字空间中,它已经能够完成相当复杂的工作;但进入现实世界后,稳定性和泛化能力就成为了核心难题;而面向开放世界的持续自主学习,很多最基础的问题都还没有得到解决。

在发展阶段之外,现场的第二个争论更加尖锐:从生成式AI走到Agent,究竟是量变还是质变?

多数嘉宾的判断偏向量变,他们认为当前Agent能够执行更长的任务,主要得益于基座模型能力增强、上下文窗口扩大、工具调用更加稳定以及Harness框架的持续优化,Agent的能力确实在提升,但底层技术范式并没有发生明显变化。真正的质变,应该发生在Agent能够突破基座模型原有能力上限之后,嘉宾们为此给出了清晰的标准:Agent需要能够判断自己的结果是否正确,发现问题后主动修正,并将任务执行过程中产生的经验沉淀下来,形成自我进化,只有跨过这一步,Agent才算从依赖人类数据和预设流程,走向真正的自主学习。

不过山东大学教授韩忠义从产品形态的角度给出了不同的观察:过去的生成式AI主要负责回答问题,而Agent已经开始规划任务、调用工具,甚至直接替人完成工作,从“告诉你该怎么做”到“它自己动手去做”,无论底层技术是否发生范式变化,用户感受到的产品形态确实已经发生了改变。上海人工智能实验室的青年研究员张航帆则将两种观点结合起来,他认为技术进步通常是逐步积累的,很难在某个精确时间点突然发生指数级跃迁,但当一项能力的成功率跨过临界点时,用户的体验会发生突然的改变。比如一项任务过去执行一百次只能成功一次,现在一百次只失败五次,从技术演进角度看这是持续的量变,但从用户角度看,它已经从“不可用”变成了“可以放心交给它做”,这当然可以被理解为质变。

顺着这一逻辑,现场的第三个问题自然浮现:Agent真正获得自我进化能力,到底还缺什么?杭州场的四场主题报告从不同角度拼凑出了答案。

郝建业关注的是工具调用、长期任务、记忆和安全:工具让Agent从聊天框进入真实环境,记忆让它能够将一次任务中的经验带到下一次任务,而安全性则决定了Agent能否进入生产系统,承担真正有风险的工作。在他看来,Agent的价值并不只体现在单次生成能力上,更重要的是能否持续调用工具、沉淀经验,并在安全边界内完成长时间协作。

上海交通大学人工智能学院副教授温颖则将问题放在了持续强化学习的框架下:人工提供的高质量数据总会遇到上限,模型要继续进步,就需要形成“生成—评估—训练”的循环,也就是自己产生新的经验,再从中筛选有效部分用于下一轮更新。不过大语言环境与传统强化学习有明显区别,传统强化学习通常将策略、环境和评价信号分开处理,而在大语言模型中,同一套参数可能同时参与行动、推理和评价,策略、环境模型和验证器彼此耦合,任何一处更新都可能影响其他环节,训练也更容易产生波动。

清华大学智能产业研究院副研究员周浩则将大规模Agent系统所需的能力归纳为三项:第一是低时延基座模型,支撑高频搜索、决策和执行;第二是自演化强化学习,让Agent可以根据反馈持续优化;第三是可学习的长程记忆,让它在跨上下文、跨任务时维持状态,形成长期协作。

张航帆关注的则是Agent领域越来越频繁出现的Harness框架,通俗来说,Harness是一套围绕大模型搭建的任务执行框架,负责理解目标、拆解任务、管理上下文、调用工具,并根据环境反馈调整后续动作。如果将基座模型比作聪明的大脑,那么Harness更像是负责组织工作的执行系统,没有这套系统,Agent可能知道很多,但很难稳定完成一项持续数小时甚至数天的复杂任务。而张航帆进一步研究的Self-Harness,则希望Agent能够自动诊断和优化自己的运行框架,也就是说未来Agent不仅要完成任务,还要学会改进自己完成任务的方式。

综合来看,杭州学术场真正关心的已经超出了“Agent能不能干活”,它还要知道自己干得对不对,哪里出了问题;一次任务结束后,哪些经验值得保留,哪些能力需要更新;更进一步,它要能够将执行过程中产生的反馈转化为下一轮的能力增长。这正是嘉宾们所说的“电灯泡”背后,尚未完全建成的电网——点亮一盏灯并不等于电力革命已经完成,长期稳定供电、将电力接入无数生产和生活场景,需要的是一整套完整的系统。

如果说杭州学术场讨论的是Agent距离最终形态还缺少哪些底层能力,那么北京工业场关心的则是现有能力如何率先进入真实生产场景,这里的问题要具体得多,比如一段视频能否按时交付、人物会不会突然变脸、商品颜色会不会出现偏差、AI生成的内容最终是否有用户愿意买单等等。

虎鲸文娱集团CTO杜颜龙首先从文娱的本质展开分享,他认为小说用文字构建世界,影视用镜头构建世界,游戏用代码构建世界,演唱会则用现场构建世界,不同的媒介最终都指向同一个目标:让观众相信这个世界、进入这个世界,并在其中产生情绪和共鸣。过去一百多年,影视行业通过一整套工业流水线构建虚拟世界,始终在追求解决成本、周期和品质三个核心问题,AI的出现让这套构建世界的方式迎来了系统性重写,而AI的价值最终也要落到这三个核心问题上。

杜颜龙提到,成本和周期自然是首先被提及的话题,但影视行业真正难啃的骨头仍然是品质,降本增效并不是最终目的,在越来越多的观看场景中用极致的视听语言讲好一个故事,才是行业的真正目标。一条Prompt生成几秒钟的惊艳画面,和完成一部真正能让观众坐下来观看的影视作品,中间还隔着编剧、美术、导演、拍摄、剪辑和声音设计等大量专业环节。古装人物的对白需要符合时代语感,服装造型需要考虑人物身份、地域和场合,画面需要有构图、材质和光影,镜头运动还要服务于故事节奏。AI不仅要能够生成内容,还要理解什么样的故事成立、什么样的画面高级,以及什么样的镜头能够让观众进入剧情,杜颜龙因此将影视品质拆分为三类审美:编剧审美、美术审美和导演审美。

基于这一判断,虎鲸文娱给出了三个面向未来的观点:首先,AI不会取代真人,真人演员、导演和创作者依旧会参与影视内容生产,AI更可能与他们形成新的协作关系,无论是在生产过程还是内容交付上,人和AI的协作模式都值得深入研究;其次,AI一定会重写影视生产流程,仅靠一个通用模型、一句话生成影视精品,在可预见的未来仍然不现实,真正的产业落地需要完整的模型、工具和生产技术栈,并将其接入已有的影视生产流程;最后,当内容供给因AI大幅增加后,精品内容会变得更加稀缺,届时真正有价值的不再是“能不能生成内容”,而是“什么值得被生成”。

这种价值转移的趋势,在美图公司技术副总裁刘洛麒的分享中也有类似体现。刘洛麒首先提出了一个现实问题:尽管模型能力已经很强,但从一款强模型到普通用户低门槛使用,中间仍然存在巨大的产品鸿沟。过去开发软件通常围绕功能展开,功能越做越多,入口、菜单和参数也随之增加,用户需要自行判断该使用什么工具、如何组合这些工具。而Agent出现后,这套逻辑开始发生改变,越来越多的功能被隐藏在Agent背后,用户只需要表达目标,系统就会负责理解意图、拆解任务,并决定调用哪些模型和工具。刘洛麒将这种变化总结为:从功能堆叠走向智能决策,从交付功能走向交付成果。

不过美图很快发现,单个Agent仍然难以完成复杂任务,因为真实的创作通常包含多个目标,每个目标都有自己的上下文,将所有事情交给同一个Agent很容易顾此失彼。于是美图开始将软件从单个Agent升级为Agent Teams,让不同的Agent分别处理策划、设计、修图、调色和执行等环节,再通过协作完成整体任务。以美图设计室为例,用户真正需要的并不只是一张好看的商品图,从商业角度来看,这张图还需要符合目标用户的偏好,适应不同平台的尺寸要求,投放后还需要观察是否能够带来付费和增长。因此美图设计室组织了4个专业Agent和70个Skill,从市场分析、内容生成、视觉创作一直做到投放分析,最终交付一套可以直接使用的商业物料。这也意味着,AI产品的价值正在从“做出内容”进一步向“解决问题”转移,一张图是否好看只是最基础的一关,它能否被用户直接使用、能否进入业务流程、最终能否带来收入,才决定这项AI能力是否具有真正的价值。

回到开头提到的虚拟横店片场案例,这正是北京工业场中群核科技分享的实践。群核科技AI业务线高级总监龙天泽指出,当前的视频生成模型主要在二维像素层面进行学习,虽然可以不断逼近三维世界,但很难真正理解空间结构。比如将一张房间图片交给模型,让它补出另外几个视角,每张图片单独看可能都很逼真,但如果放在一起对照,门窗、家具以及墙面的位置经常会出现互相矛盾的情况。这类问题在几秒钟的短视频中或许并不明显,但一旦进入十几分钟甚至更长的影视内容,人物、道具和场景就很容易出现穿帮,难以进入严肃的生产流程。

群核科技给出的解决方案是,在生成视频之前先建立一个明确的3D空间,将人物、道具、场地和摄像机的位置先在三维环境中固定下来,再将关键画面交给视频模型完成最终生成。龙天泽将这套分工概括为:视频模型负责审美和语言控制,3D模型负责一致性。这套思路还有一个形象的总结:“一次搭建,全篇复用”。一间客厅、一座宫殿或者一条街道,在3D空间中搭建完成后,就可以被不同镜头反复调用,人物和摄像机也能够在其中自由调整,而不需要每生成一个镜头就重新生成一次。横店线下片场被扫描、重建并搬到线上,正是这一思路的延伸。

走到这一步,AI视频的竞争重点也发生了变化,过去大家关注的是单个镜头是否足够惊艳,现在则需要考察人物和场景能否在长视频中保持一致、镜头能否精确控制,以及整条生产链的效率是否足够高。为了解决效率问题,群核科技还将3D片场与视频Harness框架结合起来,3D片场负责提高一致性和品质,视频Harness则通过关键帧和预览流程,降低长视频制作中的重复生成成本。

北京工业场的三场主题分享其实已经连成了一条清晰的脉络:虎鲸文娱讨论的是AI如何进入影视工业流程并理解专业审美,美图讨论的是软件如何从提供工具走向直接交付成果,群核科技则进一步将一次性的内容生成推进到可复用、可控制的空间构建。在随后的工业场圆桌讨论中,嘉宾们进一步探讨了“生成内容”和“构建世界”之间的区别:杜颜龙认为生成内容更像一次单向交付,而构建世界意味着资产可以不断沉淀,人与内容之间也会产生持续互动;龙天泽则将构建世界理解为对现实世界的仿真,它可以成为短剧、游戏甚至机器人训练的前置流程;刘洛麒则强调,虚拟世界应当具备因果规律、物理规律和可交互性,只有理解并维持这些规律,AI才真正从生成单个样本,走向构建一套完整的系统。

与此同时,工业落地还必须面对创意与精准之间的选择:节日滤镜、娱乐玩法可以容忍一定的偏差,用户更在意是否好玩;但在电商领域,商品的颜色、材质和款式一旦出现偏差,生成的图片就无法使用。流水线式生产更在意成本和效率,而精品内容则需要大量人工参与和精细控制,同一种AI能力应用在不同场景中,验收标准可能完全不同。因此,当高质量内容越来越容易生成后,价值会继续向上转移,对用户的理解、对创意的判断,以及将内容分发给合适人群的能力,都会变得更加重要。

现在再回头看开头提到的两场活动的“冲突”,其实就不难理解了。北京工业场展示的是AI已经在具体行业中能够做到的事情,而杭州学术场追问的则是这些局部能力何时才能连接起来,形成一个真正能够自主运转和持续进化的系统。两场讨论的重点不同,但却指向了同一个闭环:执行、验证、反馈、更新。

在学术场中,Agent执行完任务后需要判断结果是否正确,发现错误后进行修正,再将有效经验写入记忆、技能或者模型参数,逐步形成持续学习的能力;而在工业场中,AI生成的内容同样需要接受验证,一段视频要经过审美和逻辑检查,虚拟片场要保证人物与空间一致,商品图要准确还原材质和颜色,内容投入市场后还要继续观察是否能够带来业务价值。杭州场想要解决的是“能力如何不断增长”,北京场关心的则是“结果能否稳定交付”。因此,横店片场已经被搬到线上,与Agent仍处于电灯泡时代,这两种说法完全可以同时成立。

工业界正在具体场景中补齐流程、数据、空间和行业规则,让一盏盏“灯”先亮起来;而学术界则继续研究记忆、验证、Harness、强化学习和自主进化,试图搭建能够连接这些“灯”的完整电网。

博见社只是硬核少年技术节5.0的一部分。7月20日,这场横跨阿里巴巴ATH事业群和淘天集团的年度技术活动在杭州和北京两地同步启动,持续了一周时间。开幕式上,淘天集团集中发布了AIGX技术体系的四项成果,包括拍立淘全模态实时Agent、全场景AI创作工作台if Studio、Coupella智惠引擎和Agentic推荐系统Dream。除此之外,技术市集集中展示了30余项AIGX技术成果,AI Hackathon首次设置了业务创新和灵感脑洞双赛道,吸引了百余支团队参加,Whoisspy趣味赛则将Agent放进桌游,让人类与AI直接同场对战。

从首届技术展示,到后来引入AI Hackathon、模型挑战,再到如今将学术场和工业场放在同一场技术节中,硬核少年技术节已经连续举办到第五届。而这一次,最有意思的恰恰是北京和杭州两地并没有给出整齐划一的答案:有人已经将横店片场扫描进电脑,展示了AI当前能够将事情推进到的程度;也有人提醒大家,电灯泡才刚刚亮起来,背后的完整电网还远没有建成。这大概也是AI当下最真实的状态:局部已经足够科幻,但完整的系统仍处于早期阶段。

以上内容不代表本平台立场,仅供读者参考