文章摘要
研究团队对六款搭载网页搜索工具的主流大语言模型进行日常新闻问答能力测试。结果显示,模型回答英语问题准确率较高,但在非英语语言测试中表现下滑,多数错误出在检索环节。排名前四的模型在原始选择题场景准确率超90%,开放式提问时整体准确率下降。研究团队提出扩大搜索索引、优化排序逻辑、提升非英语查询处理能力等优化方向。

大语言模型在新闻资讯收集任务中,检索相关报道的能力始终是最薄弱的环节。

有研究团队针对六款搭载网页搜索工具的主流大语言模型进行了日常新闻问答能力测试。测试对象涵盖谷歌的两款Gemini系列模型、xAI的Grok 4、Anthropic的Claude 4.5 Sonnet,以及OpenAI的GPT-5和GPT-4o mini。测试周期为2026年2月9日至22日,研究人员基于权威新闻机构的公开报道,用阿拉伯语、英语、法语、印地语、俄语和土耳其语六种语言设计了测试题目。

核心逻辑

大语言模型回答训练数据之外的事实性问题,需要完成三个核心步骤:首先是接收到表述清晰的准确问题,其次是检索到与问题高度相关的文档,最后从文档中精准提取所需事实。任何一个环节出现偏差,都会影响最终回答的准确性。比如问题本身包含错误的人名、时间等前提,会让模型难以给出正确答案;如果检索到的文档没有涵盖所需信息,或者模型无法理解文档使用的语言,同样会导致回答出错。一套高性能的新闻问答系统,必须在这三个环节都做到位。

测试设计

测试过程中,每天都会针对当日新闻为每种语言生成25道选择题,总计150道题目,每道题都会以明确的时间背景开头,比如“今天是2026年2月10日”,并提供五个备选答案,正确答案均为可验证的具体事实细节,比如数字、地点或引述内容。

研究人员设置了三种测试场景:第一种是带有五个选项的原始选择题;第二种是加入错误前提的修改版题目,并新增“信息不足,无法回答”作为备选答案;第三种是移除所有备选答案的开放式提问。此外,研究团队还通过多个高精度模型的多数投票结果,将错误回答划分为八类,包括检索失败、检索到相关主题但细节不符的来源、理解能力不足、时间线错误等。

测试结果

整体来看,这些模型在回答表述清晰的英语问题时准确率较高,但也存在明显的短板:一是在非英语语言的测试中表现下滑,尤其是印地语问题;二是绝大多数错误都出在检索环节,而非模型本身的智能能力;三是当问题包含错误前提时,模型的表现会出现明显下降。

在回答原始选择题的场景中,排名前四的模型准确率均超过90%:Gemini 3 Flash以95.6%位居第一,Grok 4以95.0%紧随其后,Gemini 3 Pro达到93.7%,Claude 4.5 Sonnet为90.4%。GPT-5的准确率为85%,GPT-4o mini则为69%。当测试切换为开放式提问时,所有模型的相对排名保持不变,但准确率整体下降了11至22个百分点。

在所有语言的测试中,印地语问题的表现最差,所有模型的平均准确率仅为79.3%,即便问题使用其他语言提出,模型也经常会引用英文来源,比如维基百科的英文版本。

从错误原因来看,最常见的问题是检索失败,占比达到38.8%;第二常见的则是检索到了主题相关的文档,但其中包含看似合理实则错误的细节,无法准确回答具体问题,这类错误占比为32.7%。

在面对带有错误前提的修改版题目时,Grok 4的准确率达到70%,比其他模型至少高出15个百分点;而GPT-5的准确率仅为19%,几乎和随机猜测六个备选答案的结果相差无几。

优化方向

搭载网页搜索功能的大语言模型在事实信息查找方面具备天然优势,但它们的表现完全依赖于准确的输入、相关的文档检索以及精准的事实提取。由于绝大多数错误都发生在检索阶段,因此优化检索能力,相比单纯扩大模型参数规模,或许能为时效性信息查询带来更显著的性能提升。研究团队提出了三个具体的优化方向:一是扩大搜索索引的覆盖范围,确保更多相关文档能够被检索到;二是优化信息来源的排序逻辑,让更相关、更准确的文档优先呈现给模型;三是提升对非英语语言查询的处理能力,减少多语言场景下的检索偏差。

思考与展望

如今面向智能体而非人类使用的网页搜索引擎已经成为一个快速发展的新兴领域,这也意味着,为智能体打造更高效的网页搜索工具,依然存在大量的创新和优化空间。

以上内容不代表本平台立场,仅供读者参考