蚂蚁百灵开源金融增强模型 开放评测打通投研链

在金融领域,AI要真正落地成为专业生产力,绝非仅能回答简单的知识问答就能实现。一份合格的金融研究报告,需要从年报、财报、监管公告等多源信息中筛选可信数据,核对不同报告期的统计口径,完成复杂的估值建模,最终形成可被专业人士审核、复用的研究成果。金融AI面对的挑战远不止给出答案,更要明确数据来源、验证计算逻辑、确保结论可复核。
在外滩大会前夕,蚂蚁集团百灵正式推出首个金融增强开放模型Ling-3.0-flash-Fin,同时同步开放金融搜索Agent评测基准FinFIRST,逐步开放模型、工具与评测体系。该模型目前重点切入投资研究场景,试图打通从资料检索、分析推理到最终研究成果产出的完整任务链。
从单点问答到全链路作业:金融AI的能力跃迁
相较于传统金融大模型仅能解决问答、摘要等单点任务,Ling-3.0-flash-Fin的核心定位是适配真实金融工作流。该模型基于Ling-3.0-flash打造,延续了124B总参数、5.1B激活参数的配置,同时具备256K长上下文能力,在保证复杂金融内容处理能力的同时兼顾实际部署效率。通过金融语料持续预训练、领域后训练以及工具使用优化,模型进一步强化了对年报、财务工作簿、多份研究材料等复杂内容的处理能力。
与仅孤立完成单个任务的AI工具不同,Ling-3.0-flash-Fin更强调面向长链路Agent的工作能力,将信息检索、证据审查、计算、建模和报告准备等环节串联起来,帮助用户完成一整套完整的金融研究工作。
四项核心能力,打通完整投研工作链
目前Ling-3.0-flash-Fin率先从投资研究场景切入,重点强化了四项关键能力,形成了一套完整的投研工作闭环:
其一为信息检索能力,强调优先定位官方、一手及高可信数据源,同时关注信息发布时点与统计口径的一致性;其二是研究推理能力,通过多步计算和交叉验证厘清事实与假设,构建可复核的完整证据链;其三为估值建模能力,可直接进入真实财务工作簿,支持公式切换、跨表依赖处理与异常排查,让AI生成的结果能够无缝接入专业人员的原有工作流程;最后是研报撰写能力,能够系统化组织事实、数据与专业判断,生成可编辑、可审核的标准化研究材料。
这四项能力并非简单的功能堆叠,而是对应了从信息筛选、验证,到计算建模、最终产出研究成果的完整投研链路。这也标志着金融AI的行业竞争,已经从单点能力的比拼,转向全工作流的综合实力较量。
搭建金融AI的“评分尺”:FinFIRST评测体系
此次与模型同步推出的FinFIRST,瞄准了金融AI发展中的核心痛点:如何科学评判一个金融Agent的实际表现。
该评测基准由蚂蚁集团构建并开源,专业投行团队提供支持,共有50余位金融专业人士参与设计,重点评测金融搜索Agent在信息检索、信源选择、口径判断和推导过程等维度的能力。不同于传统的模型排行榜,FinFIRST要求优秀的金融AI不仅要给出正确答案,还必须清晰回答三个关键问题:信息从何处获取、采用的统计口径是什么、结论的推导逻辑如何。
在数据覆盖范围上,FinFIRST包含中国内地、美国、中国香港及其他全球市场的测试题目,其中中文题目占比60.2%,英文题目占比39.8%。超过五分之四的题目包含多个相关子问题,61.8%的题目需要进行显式计算,32.5%的题目需要调用多个信源交叉验证,75.6%的题目未直接指定信源,需要Agent自主完成搜索与判断,所有测试题目均使用公开可访问的信源。
FinFIRST试图将金融研究中的专业判断转化为可验证、可复用的标准化评测方法,为金融AI的研发与应用提供统一的参考标准。目前Ling-3.0-flash-Fin已在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准上完成测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模和银行业务等多个场景,评测结果显示其综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。
开放生态:从单一模型到整套能力输出
此次Ling-3.0-flash-Fin的发布,并非仅推出一款行业专用模型,而是同步开放了“模型+工具+评测”的完整生态。相较于单纯发布行业模型的做法,蚂蚁百灵希望将模型能力置于真实任务中进行验证,并通过开放评测体系邀请金融机构、研究团队与开发者共同参与迭代优化。
目前,Ling-3.0-flash-Fin已开放模型权重,并面向开发者提供API体验入口;FinFIRST评测基准也同步对外开放,进一步降低了金融AI研究与应用开发的门槛。对于金融行业而言,这种开放模式能够让更多真实业务场景的反馈反哺模型能力升级,推动金融AI技术的快速迭代。
金融领域只是蚂蚁百灵探索真实世界AI应用的一个重要切入口。随着AI技术从聊天、搜索场景逐步走向Agent化应用,模型的真正价值正在从“生成内容的数量”转向“能够承担的工作总量”。在医疗、企业服务等专业领域,AI最终能否形成规模化生产力,不仅取决于模型本身的智能水平,更取决于它能否理解行业规则、调用专业工具,并真正嵌入一项工作的完整流程。
从“回答一个问题”到“完成一项工作”,这或许正是大模型从通用能力走向专业生产力的关键一步。未来,蚂蚁百灵将继续探索在更大规模模型底座上的金融增强能力,提升长链路复杂任务的处理效率,并将应用场景从投资研究进一步拓展至更多金融业务领域。

