文章摘要
针对大模型部署后如何持续更新真实世界认知的AI领域问题,研究者提出SWM框架,以预测市场为验证场景,引入SDFT自蒸馏机制实现部署阶段持续学习,相关成果收录于ICML 2026。经真实数据回测,该7B模型性能击败一众前沿大模型,目前仍在真实市场持续运行并公开每日实盘记录。

在快速变化的社会环境中,大语言模型能否跳出训练阶段的静态知识,在实际部署过程中持续更新对真实世界的认知?这一问题成为了AI领域的重要探索方向。

来自科研机构与初创团队的研究者提出了Social World Model(SWM)框架,相关研究成果已被收录于ICML 2026,将预测市场作为验证这一方向的天然实验场。预测市场中参与者用真金白银下注,能精准反映大众的集体信念变化,相比问卷或社交媒体更具参考价值。

该框架将社会认知的更新类比为世界模型中的状态转移过程:以政策决议类事件为例,当前市场合约价格对应的大众预判就是当前信念,突发新闻则是触发状态变化的输入,模型的目标并非直接预测事件结果,而是学习“当前信念+突发事件”如何推导出下一时刻的集体认知。

  • 状态即信念:也就是大众当前的集体预判与近期走势,比如合约价格对应的概率数值,就是当前社会系统的集体判断
  • 事件即输入:真实世界刚刚发生的突发新闻,相当于打破现有市场状态的触发因素

要将SWM从实验室推向真实场景,需要让模型接入实时新闻和预测市场盘口。但如果模型参数保持冻结,那么过往的市场经验无法转化为后续的预测能力,也就无法适应不断变化的社会认知和市场逻辑。因此,部署阶段的持续学习成为了必备能力。

为了解决这个问题,团队引入了SDFT自蒸馏机制,相关方法可参考论文链接,利用事后的特权信息构建师生闭环。当真实市场结果揭晓后,模型先基于结果生成事后推演,再将模型分为老师和学生角色:老师拥有事后推演的特权信息,为学生的推理逐Token打分;学生则只能看到当前的新闻和市场价格,独立完成预测。通过这种方式,模型学习的是“事件→大众情绪→市场动作”的逻辑链,而非单纯的数值拟合。

团队选取了390天的真实市场数据进行滚动训练和回测,整个流程严格按照时间推进:部署→获取真实反馈→训练→更新模型→继续部署。实验数据显示,经过持续自蒸馏的7B模型,在同等测试环境下击败了GPT-5.6、DeepSeek V4 Pro以及Claude Opus 5等一众前沿大模型。静态大模型在面对特定市场波动时会出现大幅失分,而该7B模型在十二个月的测试中均保持了稳定的表现,且经过多轮训练后,模型的推理能力并未出现退化。

要实现大模型在真实场景中的持续学习,需要解决三大工程难题:如何确保模型只能获取当下的数据、如何精准获取延迟的真实反馈、如何验证更新是否有效。为此,团队搭建了TrajOps标准化MLOps引擎,提供Collect、Inference、Train三个核心接口,完整串联起数据收集、模型推理和权重更新的全流程,并适配了标准的SDFT自蒸馏方案。目前该7B模型仍依托这套基础设施在真实市场中持续运行,并公开了每日的实盘记录。

以上内容不代表本平台立场,仅供读者参考