文章摘要
2026年欧洲计算机视觉顶会ECCV上,中国钛动科技牵头举办了本届唯一由中企牵头的智能体商业方向研讨会MARS2,配套举办多模态AI挑战赛,基于其真实商业场景构建的数据集,明确了当前多模态AI的能力边界,给出模型优化与商业落地方向。钛动已跑通多模态AI营销商业闭环,此次活动搭建了产学研对接平台,推动多模态AI落地真实商业场景。

每当AI技术迎来新的突破节点,国际顶级学术会议往往会率先释放出清晰的方向信号。2026年9月8日至12日,欧洲计算机视觉顶会ECCV在瑞典马尔默举办,这场汇聚了谷歌、Meta、苹果、亚马逊等全球科技巨头的盛会中,一个贴近真实商业的命题成为了全场焦点:智能体商业(Agentic Commerce)。

在这场原本以计算机视觉研究为核心的顶会上,来自全球顶尖高校的学者们开始聚焦一个看似跨界的话题:如何让AI真正参与到商业活动中。其中最受关注的,当属由中国科技公司钛动科技牵头举办的MARS2 Workshop。这场研讨会不仅座无虚席,配套的挑战赛也吸引了64支全球团队参赛,累计提交超过1060份方案,10万美元的奖金池让这场学术竞赛的热度拉满。

MARS2的全称为《大模型时代的多模态推理与慢思考:迈向System 2及以上》,其核心议题直指当前AI发展的关键拐点:当AI智能体逐渐渗透到消费者发现、比较、购买的完整交易链路中,多模态AI能否真正理解商业内容的意图,并据此优化商业决策?作为本届ECCV唯一由中国企业牵头的智能体商业方向研讨会,MARS2的学术号召力从嘉宾阵容中可见一斑。

本次研讨会邀请到了四位顶尖学者:牛津大学教授Yarin Gal,作为现代贝叶斯深度学习的代表人物,长期关注AI输出结果的可靠性;MIT媒体实验室与电子工程与计算机科学系助理教授Paul Pu Liang,专注于多感官智能研究,探索文字、语音、视频等跨模态信息的融合理解方式;伦敦玛丽女王大学的Shanxin Yuan主攻数字人与运动智能,林雪平大学的Fahad Shahbaz Khan则深耕视觉识别、视觉语言模型与多模态理解领域。这样的豪华阵容,足以证明这场研讨会的学术分量。

四位嘉宾的分享共同指向了多模态AI的进化方向:不再局限于“识别视频内容、生成简单描述”,而是能够在复杂动态的跨模态信息中提取证据、梳理逻辑、理解意图,并将判断转化为可落地的商业行动。这一思路也正是MARS2多模态AI挑战赛的设计底层逻辑——这场竞赛的核心问题正是:AI能否看懂营销视频?

具体来看,挑战赛要求AI完成三层能力的验证:首先完整理解整条广告视频的内容,其次精准定位视频中的关键节点,最后读懂视频背后的营销意图。这三层能力分别对应了挑战赛设置的三个赛道,所有参赛团队都需要基于M-CAR数据集完成答题。

M-CAR是基于钛动科技真实商业场景构建的高质量数据集,包含3108支覆盖30多种语言的广告视频,36.5小时的总时长被精细拆分为18198个语义片段,平均每7秒就有一个独立的语义单元。参赛选手需要在本地运行模型完成答题,再将结果上传至EvalAI平台进行统一评分与排名,而且本次竞赛还有严格的模型限制:MAC和MDC赛道的模型参数不得超过140亿,VTG赛道不得超过80亿,且只能使用开源权重,彻底杜绝了依靠巨型闭源模型刷分的可能。

经过激烈角逐,竞赛结果展现出了多模态AI当前的能力边界:MAC赛道(整体内容理解)的最高分达到86.67,而VTG(关键节点定位)和MDC(营销意图拆解)的最高分仅为62.27和63.53,两个赛道的冠军成绩比MAC低了20多分。这意味着,看懂广告的大致内容只是第一步,在长视频中精准定位关键节点、拆解深层营销意图,仍是多模态AI需要攻克的难点。

不同类型的模型也展现出了明显的能力分化:作为对照基线的商用模型在三个赛道中表现较为均衡,通用模型与任务专用模型则各有优劣,其中任务专用模型在VTG赛道的表现尤为突出,印证了“术业有专攻”的道理。最终,来自中科大、南开、中山等高校的学者,以及字节跳动、京东、小红书等企业的团队参赛,字节跳动背景的The Boys团队拿下了MAC和MDC两个赛道的冠军,VTG赛道的冠军则由Ya PTers获得,The Boys同时还拿下了一个亚军,展现出了极强的技术实力。

这场挑战赛不仅决出了优胜团队,更给学术界和产业界带来了三个关键启示。

第一,它清晰划清了当前多模态AI的能力边界。现有模型已经可以较好地理解广告的大致内容,但当需要跨多个语义片段梳理时序关系、追溯前因后果并做出商业判断时,性能会出现明显下滑,这正是从System 1的快速感知到System 2的深度推理之间的差距。直白来说,AI已经学会“看”广告,但距离真正理解商业逻辑、参与商业决策还有一段距离。

第二,它给出了一条性价比更高的模型优化路线。很多人提到提升模型能力时,第一反应是增加参数量,但本次竞赛的消融实验给出了反常识的结果:有团队通过为模型构建跨模态的“音频证据时间线”,将人声、音乐等音频信号的发生时间与画面逐一对齐,直接将VTG赛道的定位精度提升了16.7分;而将参数量从40亿扩展到80亿,反而带来了0.2分的性能下降。这一结果提示产业界,在算力有限的情况下,与其急于更换更大的模型,不如先让模型充分整合全模态信息、对齐不同来源的内容。

第三,它提供了一套清晰的商业落地思路。三个赛道的冠军方案都采用了Proposer-Critic双模型验证、从粗到细的两阶段定位,以及根据视频时长灵活分配模型处理信息量的策略,核心逻辑可以概括为“让AI拿着证据回答问题”。比如当需要AI判断广告如何传递产品核心卖点时,系统不会直接让模型看完视频后给出结论,而是先快速扫描视频构建带时间戳的镜头级证据表征,由主模型生成初步答案,再交由另一个模型独立验证证据的一致性,抑制无依据的幻觉输出;视频越长、问题越复杂,系统还会分配更多的处理资源,确保模型有足够的信息完成推理。竞赛技术报告将这套思路总结为“证据链工程”,这也启发业界:模型的参数固然重要,但在商业场景中,信息的组织方式、跨模态对齐的精度、推理链路的可靠性,同样决定了AI能否真正落地应用。

竞赛结束后,赛事设计、评测结果和优胜方案都被整理成技术报告,相关评测基准与代码也将向全球研究社区开放。钛动科技CTO Tracy Chen博士表示,MARS2的成功举办验证了一个判断:AI智能体正在从概念走向真实商业场景,而营销领域正是少数既需要复杂智能、又能快速验证效果的赛道之一。钛动科技品牌公关VP张羽雪也在闭幕致辞中提到,这场研讨会展现了前沿技术如何解决真实商业难题,这也是钛动在国际顶会组织研讨、举办挑战赛的核心目的。

那么,为什么钛动科技能够将智能体商业的核心关切带进ECCV?事实上,MARS2所要解决的“AI能否看懂商业视频并理解营销意图”的问题,钛动已经在真实业务中探索了近十年。这家从2017年开始服务企业出海的科技公司,覆盖了全球200多个国家和地区,服务超过10万家品牌,累计管理超过4亿条广告策略与1400万个SPU,在长期的业务实践中积累了从“看懂”到“理解”的多模态能力,MARS2正是其长期业务积累与多模态AI布局的自然延伸。

钛动的业务每天都在处理复杂的多模态场景:一条几十秒的广告视频中,画面、文案、音乐、产品细节和人物情绪共同影响着用户的决策,而不同国家、不同文化背景的用户对同一广告的反馈也可能截然不同。近十年来,钛动反复打磨这些场景,沉淀了大量基于真实商业反馈的营销知识,这些经验最终转化为了自研的跨境营销多模态模型——钛极(Tec-Chi)。

钛极的性能已经得到了市场的验证:今年1月,钛极问答推理模型Tec-Chi-Think-1.0-32B以85.82分登顶广告营销专业大模型测评榜SuperCLUE-Mkt;半年后,钛极的内容理解模型Tec-Chi-VL-1.0-27B又在SuperCLUE-AdsVU出海营销视频理解测评中以86.43分获得总榜第二,与阿里巴巴的千问Qwen3.7-Max-20260608并列亚军。在营销这一专业领域,钛极大模型已经稳居全球前列。

但技术最终需要落地才能体现价值。钛动推出的营销多智能体平台Navos正是将钛极的能力转化为商业价值的载体:如果说钛极大模型负责“看懂”和“想明白”,那么Navos就是将这些能力整合进商业流程的执行者,它将分散在不同模型、工具和业务流程中的能力整合到统一入口,根据企业目标调用不同的专业智能体,将AI真正融入市场洞察、内容生产、广告投放和效果优化等全链路营销环节。

有人认为这只是常见的“大模型+智能体平台”的打法,但真正拉开差距的是结果。商业市场的评判标准从来都是实际的收益:今年7月,钛动成为ChatGPT Ads全球首批官方技术合作伙伴,在首批广告主定向邀请测试中,某出海品牌在钛动AI技术团队的优化下,营销成本显著下降,ROI提升至原来的2.5倍。单个案例或许只是单点突破,但钛动的整体业务数据更能说明问题:2025年前三季度,其AI营销解决方案收入达到1.16亿美元,同比增长68.5%,占公司总收入的89.5%,同期净收入留存率达到132.5%,这意味着老客户不仅留存率高,还在持续增加投入。

钛动一直强调的“有用的AI”,本质上是一套完整的闭环:真实业务提出问题,数据和用户反馈进入模型训练,智能体将模型能力融入工作流,最终用商业结果验证技术的价值。从数据到模型,再到应用和可验证的商业价值,这条路径钛动已经在产业中跑通,而MARS2正是将这套已经在商业战场验证过的技术闭环开放给全球研究者,让产业问题进入学术研究,再让研究成果回馈产业。

回顾钛动在ECCV牵头举办MARS2的过程,不难发现科技公司在国际顶会中的角色已经发生了悄然变化。过去科技公司更多是派研究员参会、发表论文,以“参与者”的身份融入学术圈;而现在,越来越多垂直赛道的头部企业开始直接成为“议程设置者”,从过去的“交卷人”变成“出题人”。

这样的趋势并非个例:2025年的CVPR上,Embodied AI Workshop的组织者名单中就出现了英伟达、Meta、苹果、微软、Adobe、亚马逊等大厂的身影;同年的自动驾驶研讨会也继续举办Waymo Open Dataset Challenge,将真实道路上的自动驾驶问题直接摆在全球研究者面前。当AI越来越贴近真实世界,最棘手的问题往往最先出现在产业一线,企业迫切需要解决方案,而研究者也需要真实的场景来验证新技术,两者的需求一拍即合,让Workshop成为了产学研对接的重要平台,钛动牵头MARS2正是走在了这条路上。

2025年前三季度的数据显示,钛动总营收约1.30亿美元,同比增长74.5%,其中AI营销解决方案占比89.5%,净利润达到5568万美元,且连续三年保持超过82%的毛利率,账上现金储备超过4.4亿美元。这份商业成绩背后,是复杂的多模态业务现场:不同市场、文化、用户群体,加上画面、声音、文案和营销目标的交织,每一个环节都对多模态AI提出了极高的要求。钛动将这些问题搬进MARS2,通过出题邀请全球顶尖研究者提供新思路,再将优质方案回馈产业,同时为全球AI人才搭建了对接产业一线的桥梁,真正扮演了智能体商业方向的“产学研连接器”。

从更宏观的视角来看,MARS2所指向的,正是多模态AI未来的核心发展方向:回归真实商业场景。过去的多模态AI比拼的是识别图片、理解视频的能力,而未来的竞争将聚焦于在多元语言、文化和商业目标交织的环境中,真正解决实际问题的能力。顶会讨论的议题往往预示着技术的下一步走向,这一次,AI的进化方向已经清晰地指向了真实商业世界,而钛动科技已经提前一步,将这道题摆上了全球学术与产业的桌面。

完整报告:
https://openreview.net/forum?id=60wA5w8i5L
开源地址:
https://mars2workshop.github.io/eccv2026/

以上内容不代表本平台立场,仅供读者参考