文章摘要
2026 年 7 月下旬,某技术节在杭州、北京举办,规模创新高。活动中“大厂操盘手”人机对战,AI 短期交易占优却输给人类长期布局。还发布四项 AIGX 技术成果,开发者脑洞大开,学术与工业场探讨 Agent 发展与应用,AI 正从工具迈向伙伴。

一场别开生面的人机博弈正在大屏前展开:两名人类玩家与两名AI智能体正沉浸在一款类大富翁的交易桌游中。这款游戏要求玩家在四轮博弈里争夺工位、部署业务,通过报价交易资产,最终以总资产定胜负。现金储备固然重要,但同类业务在相邻工位连成片区后,收益会持续叠加,这才是拉开差距的核心变量。

前三个季度的局势波澜不惊,直到第三季度末,一句脱口而出的报价打破了平衡。「10万?成交。」人类玩家修业原本只想出价2.5万元收购一块工位,却误将数字输成了10万,交易瞬间生效,他的现金大幅缩水;对面的AI玩家金奇则借此将现金推至37万元,暂时登顶榜首。

此时场上局势看似明朗:只剩最后一个季度,金奇手握最大现金优势。但胜负从来不只看短期现金。另一位人类玩家魏青在前三个季度里一直保留关键工位,逐步将同类业务部署在相邻位置,按照规则,业务连片后收益会显著提升,且每季度结算时持续累积。

到了第四季度,金奇为了扩大资产,用大量现金收购了修业的工位和业务卡,自身现金随之大幅减少;而魏青则沿着此前的布局完成最后建设,将多个业务板块连片。最终结算时刻,大屏上的排名重新跳动——魏青反超,人类阵营获胜;第三季度还以37万现金领先的金奇,最终跌到了第四名。短期交易占优的AI,终究输给了更具前瞻性的长期布局。

这场牌局来自某年度技术节开幕式上的「大厂操盘手」人机对战现场。2026年7月下旬,该技术节在杭州、北京两地举办,作为横跨多个事业群的年度技术活动,本届规模创下历年新高。

本次人机对战背后的WhoisSpy.ai,是一个支持实时对战和开放扩展的AI多智能体平台,用于评估大模型在社交推理、谈判和策略博弈中的实际表现。本届赛事共有177个Agent参赛,累计对局超过1万局。从往年的「谁是卧底」「狼人杀」到今年的「大厂操盘手」,赛事的博弈复杂度逐年提升。

这次活动也折射出当下AI Agent的发展缩影:它们已经能够读懂局面、评估资产、主动发起交易,也能完成规则明确的多步任务;但面对需要统筹长期收益、对手行为和临场变化的复杂环境,AI还有不少需要打磨的地方。

人机对决之外,五天的活动还涵盖了博见社、Open Day、AIGO小酒馆、技术市集和AI Hackathon等多个板块,覆盖学术与产业交流、技术成果发布、项目路演及创新实践。活动试图将前沿技术、开发者创意与业务落地连接起来,并推动优秀项目持续孵化。围绕Agent方向,活动还发布了AIGX技术体系的四项成果,并提出一个核心命题:AI正在从工具走向伙伴。

本次发布的四项核心技术成果

本次发布的四项成果分别是拍立淘全模态实时Agent、全场景AI创作工作台if Studio、Coupella智惠引擎和Agentic推荐系统Dream,分别对应全模态感知AIGI、内容生产AIGC、因果推断AIGU和意图理解AIGR,将落地搜索、创作、营销和推荐四大场景。这些成果共同指向一个变化:AI不再只是提供单次结果,而是开始进入业务流程,持续参与理解、决策和执行。

拍立淘:边看边搜的全模态交互

过去使用拍立淘,用户通常需要先确定商品,再上传清晰图片搜索同款,得先明确自己在找什么。而新发布的拍立淘全模态实时Agent让交互更「在线」:用户打开摄像头后,系统可以同时处理视频、画面、语音和文字信息,在镜头移动中不仅识别物体,还会结合上下文判断用户正在关注什么、想了解什么,以及下一步可能需要什么。

用户不必先拍照再退出当前场景搜索,系统可以边看边理解、边理解边检索,将「看见」「看懂」「搜到」和后续决策串联起来。AI面对的不再是一个已经定义清楚的搜索请求,而是一段连续、动态的现场信息,需要在交互中逐步理解用户意图,而非等待用户把问题说完整。

if Studio:全流程智能创作工作台

对企业创作而言,生成内容往往只是开始——图片还要抠图、改字、调整版式,视频需要剪辑,素材还可能被组合成页面或网站。新发布的if Studio智能体工作台正是针对这一全流程需求打造的:它集成了设计、视频和建站三类专家Agent,并接入HappyHorse 1.1视频模型、AI抠图和图像编辑等工具。

用户提出需求后,系统可以拆解任务,让不同Agent接力完成素材处理、内容生成和页面搭建。过去这些环节分散在不同工具中,需要人工反复传递素材;现在不同Agent可以围绕同一个任务协同工作。生成能力解决的是「能不能做出来」,而企业更关心的是能否继续修改、衔接下一环节,并按要求稳定交付。

Coupella:算清营销补贴的真实价值

在营销活动中,补贴发出后成交上涨,并不一定意味着创造了新增价值——有些用户本来就会购买,有些增长可能只是透支未来需求。Coupella智惠引擎及其生成式因果推断大模型,正是为了算清这笔账而开发的。

系统通过反事实预估、长期价值评估和增量挤占建模,比较「发红包」与「不发红包」的结果,判断补贴是否带来长期收益,以及增长是否只是从其他商品、渠道或时段转移而来。简单来说,它不仅统计红包发出后发生了什么,还要判断补贴是否值得、增长是否真实,以及红包应该发给谁、发多少。根据活动披露的数据,Coupella自上一年双11规模化上线以来,已覆盖数十万商家,AI红包转化率提升81%,头部品牌的AI引导成交额超过8000万元。

Dream:千人千时千面的智能推荐

传统推荐系统已经能够实现「千人千面」,但同一个人在不同时间、不同场景中的目标也会发生变化:早上通勤时用户可能只是快速浏览信息,晚上打开购物平台则可能进入明确的购物状态,临近节日时用户可能正在为他人挑选礼物,当前选择与自身长期兴趣并不完全一致。

新发布的Agentic推荐系统Dream正是针对这种动态变化设计的。传统推荐流程通常分别优化点击率、停留时长和成交率等局部目标,而Dream则增加了意图控制层:先根据用户当前的行为和上下文判断访问目的,再将任务路由给不同的专家Agent。用户随手浏览时,系统提供更多探索性内容;购买意图明确后,则转向商品匹配和决策辅助,实现从「千人千面」到「千人千时千面」的升级——不仅区分不同的人,也识别同一个人在不同时刻的需求。目前,仅在手淘首页「猜你喜欢」场景中,Dream就已带动浏览量、成交金额等指标提升。

开发者的脑洞与落地实践

除了硬核的技术发布,AI Hackathon和技术市集的画风则轻松不少。开发者们的话题从模型能力延伸到家庭、养老、消费、情绪和职场,开始畅想AI除了提高效率,还能解决哪些真实而细小的问题。

本届AI Hackathon 4.0首次设置业务创新和灵感脑洞两条赛道,共收到115个高质量作品,其中24个项目进入路演。相比单纯展示Demo,今年的项目更重视真实需求、商业价值和用户体验。业务赛道一等奖由全员实习生组成的「告五人组」获得,他们开发了一款面向平台的适老化家庭决策Agent:子女可以通过口述或拍照提交家庭环境,系统识别空间风险、生成改造方案,并匹配平台真实商品。项目还设计了两套视图:子女可以看到风险位置、改造预算和改善评分,长辈则能看到改造后的空间效果;数字人Agent「安安」负责全程沟通,降低长辈对「适老化」和「变老」标签的抵触。

其他项目也将目光投向家庭生活:《住在我家的贾维斯》希望AI不只控制设备,还能理解家中正在发生什么;「妈,别下单」则瞄准直播购物中的冲动消费,在用户付款前提醒一句:这件东西真的需要吗?从这些项目中可以看到几条共同趋势:超过三分之一的团队关注家庭、养老、视障辅助和职场心理健康;多个项目尝试解决上下文丢失和多智能体协作问题;电商项目也开始从商品搜索走向场景化决策。相关负责人表示,今年作品最显著的变化是完成度大幅提升,许多项目已接近产品级水平。AI工具的普及正在降低技术实现门槛,使创意本身成为核心竞争力。

技术市集的「技术漂流瓶」环节更是变成了开发者的整活现场。有人把漂流瓶写成一篇论文:《一种基于漂流瓶弹幕排名机制的自我实现方法》,称通过预埋高质量内容可以长期占据排名栏,实验结果在技术节场景中达到SOTA,翻译过来就是「怎样让自己的漂流瓶一直排在前面」。还有人借用经典论文标题,写下《Your Attention Is All My Need》,把研究对象从注意力机制换成了人的注意力。

更有梗的开发者干脆把自己写成了一个Python类:

class Me:
    age = 28
    height = 178
    salary = "还行"
    girlfriend = None  # TODO: 招募中,接受 PR

年龄、身高、收入都成了类的属性,感情状态则是一项尚未完成的开发任务,「接受PR」的意思是项目长期开放,欢迎提交。论文标题、模型术语、代码注释、开源协作流程,在这里统统变成了社交语言。技术人没有放弃自己的表达方式,只是把它从代码仓库搬到了漂流瓶里,这种一本正经的幽默,让技术节多了不少鲜活的烟火气。

行业前沿讨论:Agent的现在与未来

能力逐渐形成,应用也开始进入日常生活。本次技术节进一步追问了两个问题:智能体究竟发展到了什么阶段?模型能力又该如何进入企业流程,持续稳定地工作?博见社杭州学术场和北京工业场,分别从理论与生产两个方向展开讨论。

杭州学术场:Agent的发展阶段

如今,能调用工具、自动写代码或规划多步任务的系统都可能被称为Agent,但它们显然不在同一个发展阶段。与会嘉宾给出的判断相对谨慎:智能体整体处于从初期向中期过渡的阶段,部分领域可能接近中期,但不同方向的发展并不均衡。

比如Coding Agent的环境、接口和反馈机制较成熟,更容易形成执行闭环;具身智能仍要面对识别误差、动作失败和环境变化等问题;能够自主学习、积累经验并持续进化的智能体,则仍缺少完整的理论支撑。会调用工具,不等于能够长期独立运行。

讨论中也存在一个分歧:从生成式AI到智能体,究竟是量变还是质变?一种观点认为,底层仍依赖基座模型和人类反馈,并未发生根本变化;另一种观点则认为,从「生成回答」转向「完成任务」,已经构成应用范式的变化。与会嘉宾进一步将差距拆解为几项基础能力:低时延模型支撑高频决策,Harness负责理解目标、拆解任务和调用工具,长期记忆用于保存跨任务状态,持续学习则将执行反馈重新带回能力更新。只有这些环节形成闭环,Agent才可能从一次性完成任务,走向可复用、可改进的长期协作。无论如何,智能体仍要解决目标设定、结果验证、失败修正、经验沉淀和长期审计等问题。它正在从回答者转向执行者,但距离独立负责仍有一段距离。

北京工业场:Agent进入真实生产流程

如果说杭州讨论的是理论边界,那么北京工业场关注的则是AI进入真实生产流程。讨论的关键词从「生成内容」走向「构建世界」。

在影视和视觉创作中,单次生成并不能满足生产要求——人物、场景、商品材质和颜色需要在不同镜头或不同版本中保持一致,生成结果还要支持修改、复用和交付。比如群核科技将部分线下片场扫描并重建为3D影视基地,先在三维空间中确定人物、道具和摄像机的位置,再由视频模型完成内容生成。3D空间负责一致性,视频模型负责画面表达,使场景可以在多个镜头中重复使用。

这类系统不会每做一个镜头都从头生成,而是先把场景、人物和机位搭好,后续再围绕这些已有内容不断调整和扩展。同一套资产可以反复用于不同镜头,既能让前后画面更连贯,也省去了重复生成和反复返工。美图则尝试通过Agent Teams处理复杂创作任务,由不同Agent分别承担分析、设计、生成和效果评估。用户提供目标,系统负责拆解任务、调用工具并组织协作。

在实际制作中,不同Agent各自负责策划、生成、修改或分析,并保留对应的任务信息。这样一来,复杂工作不必全压在一个系统里,各个环节也更容易衔接。最后产出的不只是几张图片,还包括可以继续用于投放、运营和效果评估的完整内容。这些实践说明,Agent进入生产后,关注点不再只是能否生成内容,还包括结果是否准确、流程是否可控,以及能否接入后续业务环节。

结语:AI正在成为怎样的伙伴

回到开头的问题:所谓「伙伴」,究竟需要具备什么能力?又要经过怎样的现实检验?本次技术节给出的答案可以概括为三个层次:AI要从工具走向伙伴,首先要具备理解、决策和执行任务的能力;然后要走出对话框,进入人的生活、生产流程和社会关系;最后还要经受理论与现实的双重检验,证明自己不仅能够完成任务,还能持续、稳定、可控地参与协作。

所谓伙伴,不用替人完成一切,也不必保证每一次都能获胜,而是在环境发生变化时理解变化,在任务推进过程中持续协作,在结果出现偏差时接受修正,并在必要时把控制权交还给人。AI已经开始从提供答案的工具,转向参与行动的协作者。接下来,它需要在更多真实场景中证明:自己不仅能完成任务,也能稳定、可控地与人协作。

以上内容不代表本平台立场,仅供读者参考