云栖大会:数据与评测共筑AI智能新高度

随着人工智能加速向Agentic AI与全栈应用落地演进,行业的关注焦点已经从单一的模型能力比拼,转向支撑智能持续进化的数据基础设施与评测体系。9月23日上午,一场聚焦数据与评测的专业分论坛在杭州举办,全球AI领域的科学家、行业领袖以及生态建设者齐聚一堂,共同探讨如何通过高质量的数据构建与前沿的评测技术,推动模型、推理服务以及智能体应用实现持续迭代升级。
构建数据与评测的闭环进化体系
相关负责人指出,率先建立起数据飞轮的主体,将更有可能掌握下一阶段AI竞争的主动权。这一飞轮由“模型到数据”与“数据到模型”两个相互咬合的半环构成:数据引擎持续提供高质量的训练素材,结合真实业务回流的数据与评测信号完成锚定迭代,强化学习与推理环节进一步放大对高质量数据的需求,并通过可验证的奖励机制加速闭环运转,最终推动数据与模型实现螺旋式上升,沉淀长期的竞争壁垒。
启动专家数据生态计划,拓展专业场景能力边界
随着头部通用模型的能力逐渐趋同,AI行业的竞争开始转向复杂的专业场景。相关负责人表示,私有、长尾以及高价值的数据很难通过公开爬取的方式获得;而模型的自我改进能力越强,就越需要外部可验证的真实信号,避免出现合成数据坍缩与奖励欺骗的问题。
真正稀缺的并非更多的“标准答案”,而是专家在工作中形成的假设、证伪、纠偏以及回溯的认知轨迹。这类数据应当从会诊、架构设计、专业分析等真实的工作流中沉淀下来。针对这一需求,官方公布了三项落地行动:面向全球医学、先进制造、金融合规三大深水区,开放1万个专家协同席位;加入开源生态,共同建设数据集与评测集;打通线下、孤岛与碎片化的数据壁垒,让更多稀缺的人类认知能够进入AI训练链路,借助专业智慧拓展模型的能力边界。
升级评测体系,打造可持续运营的公共能力
当有了持续供给的数据之后,如何准确判断模型是否真正实现了能力提升?相关负责人指出,传统的基准测试可能存在出错、被污染或者饱和的问题。一套优质的评测基准应当具备准确、稳定、诚实的特点,评测工作需要走向真实的任务交付场景,综合考量模型的表现、任务耗时、成本以及用户体验;而评分体系则需要具备可验证、可复现的特性,结合自动验证、智能体裁判以及人工复核的多重方式。
基于这一理念,SKYEVAL晓天衡宇评测社区已经逐步形成了覆盖评测集、裁判模型、榜单、竞技场与社区的完整生态,并面向海外正式上线,推动评测从静态的榜单评选转向可持续运营的公共能力。
搭建具身智能数据底座,连接物理世界与AI
当智能体进入物理世界之后,数据需要应对的是更为复杂的真实环境。相关负责人提出,机器人要走向真实的生产场景,就需要建立统一、可复用、可评测的数据基础设施。
围绕这一目标,Roboflywheel构建了仿真、评测、数据配方和数据集社区四层底座,并向高校、厂商与开发者发出生态共建邀请。通过连接分散的开放资源,推动标准、工具与验证体系协同完善,加速具身智能的能力从局部突破走向稳定收敛。
全球生态视角下的多维思考
分论坛现场,多位海内外嘉宾从不同维度展开了讨论,涵盖智能体评测、科学数据以及人类经验等多个方面,进一步探讨了AI持续进化所需的方法、基础设施与价值边界。
为多样性与独创力保留空间
来自艺术领域的嘉宾提出,在当前的AI训练中,当生成的内容持续回流到训练数据中时,数据分布的“尾部”可能会被逐渐抹除,而真正的突破往往来自于偏离均值的经验。因此,数据与评测体系不能只奖励一致性与可预测性,更应当为多样性和独创力保留空间。真正决定AI发展方向的,是人如何设定目标、参数、评价标准,并对最终的结果负责。这为数据与评测体系补充了审美层面的尺度。
让评测结果反哺训练过程
有行业专家认为,当前AI的开发能力已经超过了评测能力。一套优质的评测基准,需要同时具备可信的测量仪器与研究议程的双重身份。
进入智能体阶段之后,下一代的评测基准需要沿着环境复杂度、自主时程以及输出复杂度三条轴线展开。评测的终点不仅仅是给出分数,更应当将模型的失败转化为训练任务与奖励信号,成为驱动智能体持续进化的数据引擎。
建设科学数据基座,支撑AGI发展
针对科学数据存在的孤岛、格式混杂、更新滞后以及接入困难等问题,相关团队分享了将传统资源库升级为可解析、可调度、可验证的“数据工厂”的实践。
团队构建了科学数据基座Sciverse,涵盖Sci-Base、Sci-Align和Sci-Evo三层演进式体系。其中,Sci-Base已经汇聚了超过4.7亿条元信息、3亿篇文献、7000万项专利以及1亿册图书;基座依托MinerU工具将各类文献转化为结构化数据,通过化学专用管线加工垂域数据,为科学大模型与智能体提供强有力的数据支撑。
海量的数据如同繁星,为AI模型提供了广度与可能性;而科学严谨的评测则如同灯塔,持续识别能力缺口、校准前进的方向。二者还需要稳定运转的生产机制,让模型的进步能够在真实场景中得到验证。当高质量的数据能够持续生长、可信的评测能够不断校准方向、稀缺的专业智慧能够被理解和传递,AI才能从“拥有能力”进一步走向“可靠地创造价值”。

