AI研究报告的量化评测:信息量与隐喻率

近期在社区看到一篇关于如何量化评估AI代理生成的研究报告质量的讨论,其中提到用「隐喻率」作为衡量标准——也就是通过模型使用比喻手法的频率来判断报告的易读程度。比如某款主流大模型的生成内容虽然逻辑严谨,但读者往往需要反复阅读才能理解,核心原因就是其过度使用比喻,表达过于晦涩。
和参与相关评测工作的从业者交流后了解到,他们所在的团队正在搭建一套针对AI生成研究报告的评测基准体系,隐喻率指标正是在这个过程中被提出的。我们都知道,相比代码编写这类有明确校验标准的工作,多数专业场景很难建立统一的可验证评测规则。因此这类工作的核心思路是,从难以量化的复杂任务中,提取能够反映用户核心体验的信号,以此客观评价模型的生成结果。
在相关工具的使用场景中,深度研究撰写报告是非常基础的用户需求。要实现有效的质量监控,就需要构建可落地的指标来反馈模型迭代。从本质来看,一份优质的研究报告需要兼顾两个核心维度:一是报告包含的信息是否精准足量,二是信息的组织方式是否便于用户快速理解。基于这两个维度,团队推出了两个关键评测指标:「信息量」与「隐喻率」,这两个指标都遵循两个核心原则:一是能够有效反映模型的具体特征,通过分数高低帮助定位产品问题;二是可以量化实现,支持大规模自动化评测,保证结果稳定可靠。
信息量指标
2025年以来,不少AI研究工具都在追求“写得更长”,以此给用户带来价值感充足的体验。但这种优化思路其实存在误导:用户使用AI工具完成调研、撰写报告的核心需求,是高效获取足量的相关信息,而非单纯追求文本长度。一份充满有效信息的报告未必比充斥废话的文本更长,后者反而会严重损害用户体验。
基于这一认知,团队构建了「信息量」指标,通过大模型抽取报告中事实点与数据点的数量来衡量报告的信息价值。我们可以通过两个同主题的报告示例来直观理解这个指标:
「2001年,苹果发布了iPod,采用东芝1.8英寸微型硬盘提供5GB容量,配合Click Wheel点按轮和FireWire高速接口,以「1000首歌装进口袋」重新定义了便携音乐播放器。2003年,iTunes Store上线,以每首0.99美元的单曲模式解决了盗版泛滥的行业痛点。」
这段文本可以被提取出7个明确的事实点:iPod于2001年发布、搭载东芝1.8英寸微型硬盘、容量为5GB、配备Click Wheel点按轮、支持FireWire高速接口、iTunes Store于2003年上线、单曲定价0.99美元。
而另一篇同主题的报告则写道:「iPod的问世无疑是数字音乐史上的里程碑事件,它彻底改变了人们获取和消费音乐的方式。苹果以极具前瞻性的产品理念,将5GB存储空间装进了一台掌上设备,开创了便携音乐播放器的全新时代。随后推出的iTunes Store更是以颠覆性的商业模式重塑了整个音乐产业的格局。」
这段文本只能提取出2个事实点:5GB存储空间、推出了iTunes Store。其余内容均为评价性修饰,比如“里程碑事件”“彻底改变”“极具前瞻性”等。两篇文本字数相近,但后者的信息量仅为前者的三分之一左右。
本次评测覆盖了9个主流厂商的大模型,以及36道涵盖技术调研、行业分析、公司调研等场景的研究题目。信息量指标的评测采用「Agent as a Judge」的方式,由大模型逐篇阅读报告并逐条抽取事实点,通过横向归一化将不同模型的信息点数量转换为10分制的最终分数。
评测结果显示,GPT系列的旗舰模型在信息量指标上落后于Claude系列模型,但在另一项「文章详实度」指标上得分更高,这意味着GPT系列的信息密度相对更低。为了探究原因,团队统计了信息搜集环节的工具调用分布,发现GPT的搜索工具调用次数甚至高于Claude模型,说明信息量不足并非因为接触的信息更少,而是存在信息丢失的问题。
进一步分析发现,两款模型在撰写研究笔记的方式上存在显著差异:Claude会直接将每个信息源的关键事实和数据以要点形式记录,而GPT则倾向于对每个信息源进行数百字的完整总结。这种笔记撰写方式导致GPT在环节就产生了较大的信息损失,最终影响了报告的信息量。定位到问题后,团队通过调整Prompt规范了GPT的笔记撰写方式,有效提升了其最终生成报告的信息量。
隐喻率指标
除了信息含量,报告的可读性也是用户最关心的部分之一。如何量化文本的文风特征,一直是团队面临的难题。直接让大模型为报告的易读性打分排序的方式不够可靠,结果缺乏解释性,无法有效指导产品优化。
直到观察到某款大模型的使用习惯后,团队获得了启发:该模型常用“胖”“瘦”描述文件大小,用“臂”“腿”指代组别概念,用“一等公民”形容核心元素。这种表达方式催生了「隐喻率」指标——通过统计模型文本中隐喻表达的使用频率,来侧面反映报告的可读性。
我们可以通过一个例子直观感受高隐喻率的文本:「全栈AI帝国率领评估军团与标注大军,向全球Tier1俱乐部发起冲锋,踏上下一阶段的马拉松。」。这句话中“率领”“发起冲锋”“踏上”都是动作隐喻,“AI帝国”“评估军团”“标注大军”“全球Tier1俱乐部”则构建了一套竞争征战的意象。而这段内容完全可以用更直白的方式表达:「全栈AI体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。」
过度使用的隐喻会让文本变得抽象复杂,读者需要额外的认知成本才能将比喻转化为直白的含义,从而降低了报告的可读性。从本质上来说,隐喻是将X概念映射为Y概念的语言函数,必然会带来信息损失,因为Y的信息量通常小于等于X。
基于以上分析,团队将隐喻率定义为:每一百句话中出现的隐喻表达次数。更高的隐喻率往往意味着报告更难读,且会伴随一定的信息损失。
隐喻率的评测同样采用「Agent as a Judge」的方式,测试覆盖了9个主流模型的36篇不同主题的中英文研究报告,且会在同一会话中处理同一主题下的多个模型报告,保证评测结果的相对可比性。
评测Prompt的核心约束包括:排除已经完全融入日常用语的无感隐喻(如“字段”“运行”“面对挑战”等)和术语性比喻(如“神经网络”),并要求每个标注同时输出对应的直白替换表述。如果一个“隐喻”无法找到合理的直白替换,那么它大概率并非真正的比喻,以此反向校验标注质量。句子切分规则上,中文按句号、问号、感叹号拆分,英文使用标准分句工具,Markdown标题、表格、纯链接行不计入句子总数。
我们以一道具体题目为例:“回顾索尼和任天堂过去二十年间的游戏主机技术进步,分析硬件性能如何影响游戏开发和消费者体验?”。在该题的测试结果中,某款模型的隐喻率为9.63,在187个句子中共有18处隐喻,比如“玩家如考古学家般拼凑真相”“开放结构是难度调节器”“哥特与宇宙恐怖无缝缝合”等。而另一款GPT系列模型的隐喻率仅为1.44,139个句子中仅有2处隐喻,比如“将前作的区域式结构推进为彼此咬合、捷径回环的巨大连续世界”。
整体评测结果显示,在本次题集和配置下,GPT系列模型的隐喻使用更为克制;Claude系列的某款模型隐喻率最高,偏好使用身体和有机体相关的表达,比如“橡胶的血统”“侵蚀社区灵魂”等;另一款模型的隐喻率明显更低,表述更偏向学术风格,比如“把安全外包给材料”“气候的函数”等;还有模型倾向使用宏大词汇,比如“黄金十年”“双引擎驱动”等;另有模型常用商业竞争相关的隐喻,比如“军备竞赛”“护城河”“棋局”等。
需要说明的是,隐喻率只是衡量报告可读性的众多视角之一,低隐喻率也不绝对等同于文章易读。但如果能围绕报告构建多个像隐喻率这样简洁可落地的评测信号,将有助于我们更深入地理解不同模型的特征。
回到衡量研究报告的两个核心维度:报告包含哪些信息,以及这些信息如何组织。这两个维度还有大量可挖掘的评测信号,比如参考文献质量、信息准确度、文章详实度、观点嵌套程度、长短句节奏等。即使是信息量指标,也还有很多待完善的方向,比如如何在提升信息量的同时避免冗余废话的增加。
如何将主观的用户体验通过简洁优雅的量化方式呈现,是评测工作中最需要用心打磨的部分。指标的有效性也需要长期的线上数据跟踪验证,最终筛选出经得住考验的信号,真正指导产品迭代。评测是一项复杂的系统工程,除了信号构建,如何搭建专属的评测集、设计合理的线上实验、搭建稳健的自动化评测系统,都是值得深入探讨的话题。
本次分享并未涉及评测领域的宏观洞察,而是通过团队在实际工作中的具体实践,分享一些可落地的经验。如果能推动更多相关的探索,将是非常有意义的事。

