蚂蚁国际鹰序TST 2.0:金融预测新标杆,多银行应用验证

近期,一家全球科技企业推出自研的时序AI预测大模型2.0版本,该模型在全球权威时序预测基准测试中取得最优成绩,平均绝对比例误差降至0.666,领先多家全球顶尖科技公司的同类模型。这款模型最初专为跨境支付的外汇风险管理场景打造,后续将逐步拓展至电商供应链需求预测、航空运营管理等多个行业领域。目前已有多家大型金融机构将其应用于现金流预测与外汇管理业务,有效提升了流动性风险敞口的预测能力,模型整体预测准确率稳定超过93%,具备向金融以外行业落地的成熟条件。
当前,全球时序AI预测模型的技术迭代速度加快,包括多变量建模、长上下文支持、概率预测、跨采样率适配等能力成为主流厂商的研发重点。不过金融市场本身具备低信噪比、厚尾分布、波动率聚集、机制切换等特殊属性,同时不同数据源存在频率不一致、节假日错位、数据缺失等问题,导致通用时序模型的榜单优势很难直接转化为稳定的金融预测收益。
该企业的Falcon TST系列模型的演进路径颇具代表性:2025年先在外汇敞口和资金管理场景中完成业务验证,2026年又通过Falcon-2.0强化单变量预测效率,以Falcon-X补足异构多变量关系建模能力,最终的2.0版本是“通用时序基础能力+金融流程验证”的专用化尝试,其持续迭代的稳定表现展现了该企业在AI+金融领域的技术实力。
通用时序模型的金融场景适配挑战
首先,通用时间序列基础模型已经具备了显著的跨数据集迁移能力。某科技公司在2024年11月发布的GIFT-Eval基准测试覆盖28个数据集、超过14.4万条时间序列和1.77亿个测试数据点,配套的预训练数据点超过2300亿且不与测试集重叠,该基准推动行业从“单数据集专属训练”转向“一次预训练、跨任务零样本预测”的模式。此后,多家主流厂商的模型快速升级,核心目标从单一预测精度扩展到跨频率、跨变量和不确定性输出。
不过金融市场对通用模型提出了更为严苛的检验标准。金融收益率本身具备低信噪比、厚尾、波动率聚集和机制切换等特征,日内行情、日度收盘数据、利率曲线和宏观经济数据还存在频率不一致、节假日错位和缺失值等问题。2025年11月,曼彻斯特大学、伦敦大学学院的研究者发布的大规模金融实证论文显示,直接使用现成预训练的时序模型进行零样本预测和常规微调,整体效果偏弱;而在金融专属数据上重新预训练后,模型的预测表现和经济收益都得到明显改善。这说明通用预训练虽然提供了有价值的时间模式先验,但金融领域的模型效果仍高度依赖训练分布与目标任务的匹配度。
此外,金融时序模型的价值应当与“稳定产生交易收益”明确区分。2026年6月的一项独立研究针对5只美国高流动性股票进行了多模型对比测试,涵盖TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos和Chronos-2等多款模型,结果显示时序模型拿下了10个任务中的8个最优结果,但相对于随机游走基准的整体增益有限,仅少数任务通过显著性检验,且Meta相关的两个任务仍由本地监督训练的iTransformer胜出。因此金融机构更适合将时序模型视为可迁移的预测底座和开发效率工具,再通过领域专属数据、滚动回测和风险约束完成二次验证,才能适配实际业务需求。
主流时序模型的技术演进方向
近年来,多家科技厂商的时序基础模型都在向多变量、长上下文和概率预测方向迭代:
Chronos-2:推进通用上下文学习能力
亚马逊在2025年10月20日发布了120M参数的Chronos-2,原生支持单变量、多变量和协变量条件预测,并通过Group Attention在相关序列之间共享上下文信息。需要注意的是,初代Chronos采用“缩放量化后转为离散Token、再以语言模型交叉熵训练”的路线,但Chronos-2已经引入了全新的组注意力和通用上下文学习机制,不能简单沿用初代模型的数值分桶缺陷来评价新版本。亚马逊公布的“超过90%胜率”是指Chronos-2相对Chronos-Bolt的头对头对比结果,并非GIFT-Eval总榜胜率;而Chronos-Bolt的“最高250倍推理加速、20倍内存节省”也是相对初代同规模Chronos的对比数据。
TimesFM 2.5:小参数换取长上下文与分位数预测
谷歌研究团队在2025年9月15日发布的TimesFM 2.5,将模型规模从2.0版的500M降至200M,上下文长度从2048扩展至最高16384,并增加了可选的30M连续分位数预测头,最长支持1000步分位数预测。后续谷歌又在2025年10月恢复XReg协变量支持,2026年3月增加Agent技能接口,4月加入基于LoRA的微调示例,因此“2.5版在2026年一次性加入分位数、LoRA和Agent”的说法并不准确,模型正式发布与生态功能增强属于不同的时间节点。
Moirai 2.0:小参数也能实现通用基准领先
Salesforce在2025年8月8日发布的Moirai 2.0,将早期版本的Masked Encoder改为Decoder-Only Transformer,并将训练目标调整为分位数损失和多Token预测,同时增加了缺失值信息嵌入、随机Patch掩码和数据质量过滤机制。该模型的小型版本仅约11.4M参数,相比此前的Moirai Large参数量缩小约96%、推理速度提高44%,当时在GIFT-Eval无测试数据泄漏的模型中取得领先的MASE成绩。这一成果证明,时序基础模型的竞争正在从“参数堆料”转向“更合适的数据、目标函数和训练策略”。
FlowState:适配采样频率变化的状态空间模型
IBM研究团队在2026年7月6日公布的ICML 2026论文中推出FlowState模型,通过状态空间模型编码器和函数基解码器实现连续时间建模,能够在输入采样率变化和预测区间变化时动态调整时间尺度。IBM公开的GIFT-Eval提交版本仅9.1M参数,规模显著小于主流的Transformer时序模型。该路线更关注跨采样率适配和计算效率,但目前公开论文的重点并非复杂异构多变量关系建模,因此在金融场景中仍需要与跨资产、跨因子建模能力结合评估。
Falcon TST的差异化路径与落地验证
与多数先刷公开基准再寻找行业应用的时序模型不同,Falcon TST的发展路径是先完成金融业务验证,再逐步推出公开的模型家族:早在2025年5月,该企业就与巴克莱银行开展了TST外汇预测合作;同年7月与花旗银行启动航空客户外汇风险管理试点;8月与渣打银行将TST接入其SCALE流动性引擎;直到10月Falcon-1.0才正式在开源平台开放。
Falcon-1.0的核心设计是采用层次化混合专家架构处理多尺度时间模式,通过Patch级专家特化和样本级层次路由来适配不同时间尺度的序列数据。不过该模型的参数规模存在不同口径:官方公开的产品口径为25亿参数、覆盖3000亿个时间点,而2025年与多家银行的联合公告中则表述为“接近20亿参数”,两组数字大概率对应不同的模型阶段或统计标准,因此不应将参数规模作为Falcon优势的核心证据,更可靠的公开验证是其在小时、日、周等多时间尺度下的现金流及外汇敞口预测表现。
2026年,该企业又推出了Falcon-2.0和Falcon-X两个重要迭代版本:
Falcon-2.0:强化单变量预测效率与概率输出
Falcon-2.0基于ORBIT训练框架打造,属于Encoder-Only架构的单变量时序模型。相比初代的层次化混合专家架构,Encoder-Only架构更适合一次前向计算完成直接预测,减少了自回归逐步生成带来的延迟和误差累积。其公开API可直接输出0.01、0.05、0.10至0.95、0.99共21个分位点,并提供input_mask显式标记缺失值,对节假日、停牌或交易日错位等金融数据场景的处理更为友好。
Falcon-X:补齐异构多变量建模能力
该企业团队在2026年5月26日公开了Falcon-X的研究论文,最大公开实验版本为591M参数。Falcon-X将不同物理含义的变量转换为统一的隐空间表示,通过差分注意力同时识别正向和负向关联,再处理变量间的复杂关系并重建各变量的轨迹。该模型在GIFT-Eval测试中取得了0.687的MASE成绩,并在fev-bench完成了多变量评测。对于金融业务而言,这一改进的核心意义在于,模型开始直接处理“汇率—利率—波动率—商品”等异构变量之间的关系,不再仅依赖单条序列的自身历史数据。
需要注意的是,多变量输入只有在变量关系真实有效的前提下才能带来预测增益。圣克拉拉大学的研究者在2026年5月的测试显示,将美股科技龙头和美国国债利率的相关变量联合输入Chronos-2,总体预测效果优于单变量输入,但如果直接混合股票和利率两个面板数据,预测精度反而会下降。这一结论对Falcon-X同样具有参考价值:共享隐空间虽然能够扩大信息来源,但在金融生产环境中仍需要严格控制变量选择、信息时点和滚动回测流程,避免无关因子将噪声带入模型。
此外,分位数预测可以为风险管理流程提供支持,但不能直接等同于监管意义上的VaR和ES。Falcon-2.0和Falcon-X均提供多分位数输出,可用于构建悲观、中性和乐观的业务场景,也可作为风险价值和预期损失模型的重要输入。如果预测目标本身是资产收益或组合损益,低分位数可以用于估计尾部损失,但在真实的风控体系中,仍需要经过覆盖率检验、条件覆盖检验、压力情景测试和模型风险管理流程,才能判断分位数预测是否具备稳定的校准能力,仅凭API能够输出1%或5%分位点,不能直接推导模型已满足VaR或ES的监管要求。
金融机构的落地合作验证
目前已有多家大型金融机构将Falcon TST系列模型接入实际业务流程,实现了预测能力与真实资金管理的融合:
巴克莱银行:验证外汇对冲平台接入可行性
2025年5月,该企业宣布巴克莱银行将TST模型接入BARX NetFX外汇对冲平台,用于提升该企业自身的外汇敞口预测准确度。公开资料显示,TST可以按小时、日和周的维度预测现金流及外汇敞口,在该企业自身业务场景中的准确率超过90%。本次合作的核心价值在于,通过更准确的敞口预测减少不必要的对冲操作和银行风险溢价,再通过巴克莱银行既有Guaranteed FX流程完成风险管理。
花旗银行:航空客户线上售票外汇风险管理试点
2025年7月,花旗银行与该企业宣布联合试点,将Falcon TST与花旗银行的固定汇率解决方案结合,面向跨币种线上售票的航空公司客户。花旗银行的官方公告显示,首个航空客户在实际交易中已经降低了对冲成本,试点客户的对冲成本节省约30%。本次合作表明,时序基础模型开始以“预测即服务”的方式进入银行产品体系,最终的定价与交易仍由花旗银行既有外汇系统执行。
渣打银行:接入24小时外汇流动性管理流程
2025年8月,渣打银行与该企业宣布将Falcon TST接入该行的SCALE聚合流动性引擎,实现实时、24小时的外汇敞口预测。渣打银行公告显示,整合后对该企业的外汇敞口预测准确率超过90%,Falcon当时已覆盖该企业超过60%的外汇转换交易,相关外汇成本最高下降60%、流动性管理成本最高下降50%。需要说明的是,上述降本数据属于合作双方披露的业务口径,更适合作为商业落地成效的参考,不宜与公开学术基准直接对比。
Capital A:第三方企业客户的落地效果
2025年10月,Capital A旗下的亚航在官方新闻稿中披露,将Falcon用于多币种现金流和外汇敞口预测后,按小时、日和周的预测准确率达到90%,外汇对冲成本最高下降40%。Capital A称该项目为Falcon的首个商业部署,并披露航空行业版本加入了旅行行业相关的专属数据。该案例说明,行业专用化的实际价值更多来自模型、行业专属数据、银行交易设施和企业资金管理规则的组合,而非单个基础模型替代现有资金管理体系。
通用基准与实际业务的差异及未来趋势
需要明确的是,通用基准的领先成绩不能直接等同于金融业务的实际表现:GIFT-Eval仍是观察时序模型通用能力的重要窗口,但榜单成绩需要结合测试时间和数据重叠情况进行解读。Salesforce建立GIFT-Eval的初衷是统一零样本测试标准、减少数据泄漏并比较不同频率和变量数量的模型表现。2026年以来,Falcon-X、Falcon-2.0、FlowState新版本以及多种Agent模型持续加入榜单,排名频繁变化,部分后续论文还专门区分了“可能与GIFT训练数据存在重叠”的Chronos-2结果和更严格的无泄漏版本。对于金融机构而言,固定引用某一时点的“全球第一”排名容易失真,更有意义的是验证模型是否在自身的资产范围、数据频率、市场状态和回测窗口中保持稳定的表现。
现阶段并没有任何一条技术路线在金融任务上形成绝对优势:Chronos-2擅长将相关变量和协变量作为上下文输入,TimesFM 2.5依托长上下文和成熟生态保持较强的即插即用能力,Moirai 2.0证明小参数模型也能在通用基准上保持竞争力,FlowState突出跨采样率适配能力,而Falcon-2.0和Falcon-X则分别聚焦高效单变量预测与异构多变量关系建模。不同的金融任务对极端行情、时间对齐、外生变量、分位数校准和部署时延的要求各不相同,模型的选择需要从具体的业务目标倒推。
主流时序基础模型对比表
| 模型 | 公开版本与规模 | 核心技术路线 | 多变量与外生信息 | 金融应用观察 |
| Falcon TST 2.0 | Falcon-2.0最大实验版本585M;Falcon-X最大公开实验版本591M | Falcon-2.0为Encoder-Only+ORBIT;Falcon-X采用共享隐原型空间 | Falcon-X原生异构多变量;两者均提供分位数预测API | 已有外汇与资金管理场景验证;Falcon-2.0完整论文尚待公开 |
| Amazon Chronos-2 | 120M | Encoder-based Group Attention与上下文学习 | 原生支持单变量、多变量和协变量条件预测 | 独立金融研究显示相关变量联合输入有效,无关跨市场变量可能引入噪声 |
| Google TimesFM 2.5 | 200M;可选30M分位数头 | Decoder-Only,最高16k上下文 | 原生以单变量为主,可通过XReg加入协变量 | 金融基准平均表现较强,但部分资产仍被本地监督模型超过 |
| Salesforce Moirai 2.0 | Small约11.4M | Decoder-Only,分位数损失和多Token预测 | Moirai家族面向通用多序列预测,2.0强化缺失值和鲁棒性处理 | 通用效率突出;公开训练语料并非金融专用 |
| IBM FlowState | GIFT-Eval公开提交含9.1M版本 | 状态空间模型编码器+函数基解码器 | 重点解决跨采样率和可变预测区间 | 适合跨频率任务;复杂异构多变量关系仍需额外验证 |
数据整理自各技术公开资料与GIFT-Eval公开文档。
注:GIFT-Eval为动态榜单,且部分提交存在训练数据重叠标记。为避免把阶段性排名固化为长期结论,表中不列统一“当前排名”。
行业竞争的未来方向
当前,金融时序模型的竞争焦点已经从“能否实现零样本预测”转向“能否在真实风险流程中稳定落地使用”。通用模型已经证明大规模跨领域预训练可以显著降低时序建模的门槛,但金融领域的实证研究反复显示,领域专属数据和任务适配仍然是决定模型效果的关键因素。对于资金管理、流动性预测和外汇敞口等场景,衡量模型的核心标准应当逐步转向滚动回测稳定性、极端行情失效边界、分位数校准能力、数据泄漏控制、推理成本和系统接入能力。通用榜单仍有其参考价值,但只能回答模型“会不会预测”,无法单独回答“能否进入实际风控流程”。
Falcon TST 2.0已经形成了一条清晰的金融应用路径:2025年的主线是将TST模型嵌入巴克莱、花旗、渣打以及Capital A等机构的真实资金管理和外汇业务场景;2026年的主线则是通过Falcon-2.0和Falcon-X分别解决高效单变量预测和异构多变量预测的问题。公开的业务验证数据显示,这条路径具备较强的金融产品化基础。后续仍需要补齐Falcon-2.0完整论文、预训练数据构成、可复现评测和极端市场压力测试等信息,才能进一步验证其领先能力的可持续性。
整体来看,时序基础模型正在形成“通用底座与行业专用模型并存”的市场格局。TimesFM、Chronos等通用时序模型适合低成本试验、冷启动和跨行业快速迁移,而金融专用模型则更适合数据充足、指标明确、风险敏感的生产场景。Falcon TST 2.0的意义在于将竞争焦点进一步推向真实的金融流程:模型不仅需要理解时间规律、变量关系和不确定性,还要能够被银行与企业既有的风控、对冲和流动性管理体系所消化。金融机构最终采购的是一套能够被验证、被校准、被治理并持续产生业务价值的预测能力,模型规模只是其中的一项技术参数而已。

