靠预测市场!部署后持续学习的LLM跑赢前沿模型

当大语言模型跳出静态训练的封闭环境,进入持续流动的真实社会信息中,能否像人类一样不断更新对世界的认知?来自伊利诺伊大学厄巴纳-香槟分校的研究团队联合初创团队Astraculum,就此展开了系统性探索,并取得了突破性进展。
社交世界模型的核心逻辑
我们可以用物理世界模型做类比:物理世界模型能通过物体当前的速度、位置等状态,预测其受力后的运动轨迹。而社交世界模型(Social World Model,SWM)则试图解决一个类似的问题:当突发新闻出现时,AI能否预测人类社会的集体认知会发生怎样的转移?
为了量化“社会认知”的变化,研究团队选择了主流预测市场平台作为天然实验场。这类市场围绕尚未有定论的事件展开,参与者广泛且会用真金白银进行押注,其形成的价格能最敏锐地反映大众的集体信念变化,比问卷、社交媒体等方式更具参考价值。
在SWM的框架中,“社会认知的更新过程”被映射为世界模型中经典的状态转移。以“美联储九月是否降息”为例:
状态即信念:也就是大众当前的集体预判与近期走势。比如某合约报价62美分,就意味着市场参与者通过押注得出了“事件发生概率为62%”的结论,这就是当前社会系统的集体信念。
事件:即真实世界刚刚发生的突发新闻,相当于打破现有状态的输入信号。
SWM的目标并非直接预测事件本身的结果,而是预判大众在给定状态下对新信息的反应:在当前的集体信念基础上,刚发生的新闻会将市场信念推向哪个方向?简单来说,模型学习的是「当前信念 + 突发事件 → 下一时刻的信念」的映射关系。
从离线实验到真实场景的落地
为了将SWM从实验室推向真实环境,研究团队让模型直接接入实时新闻源和预测市场盘口。在每一个预测节点,模型可以获取此前的市场状态与最新出现的新闻,进而判断市场集体信念的移动方向。
举个具体的例子:2026年2月13日下午2点,市场正在预测“标普500是否会触及6000点”,当时合约价格为0.525。此时模型可以查看过去24小时的价格走势,以及过去一小时内发布的最新新闻,需要在结果揭晓前判断:这些新信息中是否有尚未被市场价格充分反映的内容?如果有,会将市场信念推向何处?
如果模型参数始终保持冻结,那么它从市场中获得的经验无法自动转化为后续的预测能力:每一次预测都基于同一个静态模型,上一次的对错不会影响下一次的判断。这就引出了更核心的问题:模型能否在部署过程中,将获得的真实反馈更新到自身参数中,让过去的经历真正改变未来的判断?
部署后的持续进化机制
现实世界的社会认知和市场逻辑并非静止不变:新闻的重要性会随时间变化,市场参与者的反应模式会迭代,宏观环境也会发生变化,且这些变化不会提前通知。参数冻结的静态模型很难适应后续的潜在变化,因此对于SWM来说,持续学习不仅是训练技巧,更是长期部署的必备能力。
那么,模型应该从每小时的市场反馈中学到什么?最直观的思路是让模型直接根据价格价差修正权重,但这种方式容易陷入噪声陷阱。突发新闻引发的市场涨跌只是表象,数字只能告诉模型“市场最后移动了多少”,却无法解释“哪些新闻真正重要”“这条新闻如何改变了参与者的判断”“市场更新了哪种对世界的理解”。因此更可靠的路径是跳过单纯的数值拟合,让模型直接学习「新闻事件 → 信念变动」的逻辑推理过程。
为此,团队采用了基于SDFT的推理自蒸馏方法,这套机制巧妙利用了事后的“特权信息”构建师生闭环:特权信息仅用于教学,不会被用于实时预测,所有预测都由未接触结果的模型独立完成。
具体的流程如下:当一小时后的真实市场结果揭晓时,系统首先让模型根据真实变化生成一段事后推演。随后,同一个模型会被拆分为“老师”和“学生”两个角色:
老师模型:拥有完整的事后推演作为特权信息,不会直接作答,而是基于这份上下文对学生模型的推理过程逐Token打分。
学生模型:只能看到当前的新闻和市场价格,没有任何特权信息辅助,需要独立完成实时预测。
在蒸馏阶段,老师模型会将学生模型的推理向“看过结果后的正确判断”对齐:比如学生还在认为市场会保持稳定,老师会引导其转向“事件正式延期”的结论。这样,模型参数中刻下的是「客观事件 → 大众情绪 → 市场动作」的完整逻辑链,而非单次的价格数字。
持续学习的实际效果
为了验证这套机制的有效性,团队选取了长达390天的真实市场数据,并按月切分为多个窗口,采用滚动训练的方式开展实验:部署 → 获取真实反馈 → 训练更新模型 → 继续部署,整个流程严格按照时间向前推进,完全模拟真实的部署环境。
实验结果展现了持续进化的力量:经过部署后持续更新权重的7B参数模型,在同等测试环境下击败了GPT-5.6、DeepSeek V4 Pro以及Claude Opus 5等一众前沿静态大模型。
具体来看,面对真实的资讯洪流,静态大模型全部跌穿了“仅看价格、不参考新闻”的基线,而通过持续自蒸馏的7B模型是全场唯一能超越该基线的模型。
从月度表现来看,模型的性能提升核心来源于稳定性:静态大模型在遇到特定月份的市场变动时会集体大幅失分,而7B模型在12个月的测试中没有任何一个月出现大幅失守的情况。
团队还对模型更新的副作用进行了验证:每一轮训练后都会冻结一份模型副本作为对照,并在无关任务上开展探针测试。经过12轮训练后,模型的推理长度和质量没有出现任何退化,不存在灾难性遗忘的问题。
背后的工程基础设施
大语言模型在预测市场的部署只是应用场景的冰山一角,任何希望让大模型跳出实验室、在真实动态数据中实现持续学习的团队,都会遇到三个核心工程难题:
如何确保模型只能获取当下的有效数据?在模型做出判断的时刻,必须严格避免提前泄露未来的信息。
如何精准获取真实反馈?现实世界的结果往往是碎片化且存在延迟的,系统需要精确判定何时可以收集到最终的真实结果,作为模型的训练标准。
如何验证更新的有效性?模型不断吸收新数据修改参数,如何确认它是在变得更聪明,而非出现灾难性遗忘或死记硬背?
为了解决这些问题,研究团队搭建了TrajOps:一个专为持续学习设计的标准化MLOps引擎。从工程落地的角度来看,TrajOps的核心逻辑非常务实,它向上层提供了三个核心接口:Collect(数据收集)、Inference(推理部署)、Train(模型训练),并在底层工作流中直接适配了标准的SDFT自蒸馏微调方案。
整个持续学习的循环在TrajOps上被清晰串联:
Collect接口:负责在事件落定前后,精准抓取新闻数据和姗姗来迟的真实市场结果。
Inference接口:负责管理时间视野,确保模型只能获取合法的历史数据,并维持持续部署的模型实例。
Train接口:直接调用内置的SDFT方案,将收集到的真实结果编译为训练信号,驱动模型权重的更新。
目前,这款7B参数的模型依然依托TrajOps在真实市场中持续运行,每天的实盘记录都会公开在trajops.astraculum.com。
研究团队及机构:
Haofei Yu、Yining Zhao、Jiaxuan You(伊利诺伊大学厄巴纳-香槟分校)
Chishang Yang、Junbo Yan、Senquan Gao(Astraculum)
相关学术研究可参考以下论文:Social World Model 以及 SDFT自蒸馏机制

