文章摘要

当前的AI教学助手已经能够胜任不少标准化的教学任务:面对数学计算题可以一步步拆解解题步骤,批改英文作文时能精准指出语法错误,甚至在象棋对弈中可以清晰讲解后续的走法思路。在很多场景下,这类AI的输出已经和一位耐心细致的助教相差无几。

但教学效果的好坏从来不能只看教师端的表现。学生听完讲解后是否真的修正了错误?是否只是机械照搬提示?同一段指导对不同基础的学生能否产生差异化的效果?这些关键的反馈都发生在学生侧,而AI教师如果想要实现个性化的教学指导,就需要反复观察不同学生的真实反应。

在实际场景中,这类学生反应的收集主要依赖真人参与的教学实验。每次调整教学策略,都需要组织学生参与交互实验,收集完整的交互数据后再由人工进行评估。虽然AI模型本身可以快速迭代更新,但教育反馈的获取速度却受限于真人实验的周期,这成为了AI教师个性化训练的一大瓶颈。

针对这一矛盾,近期推出的StudentSim研究给出了新的解决方案。该研究的核心目标是提升AI教师的个性化指导能力,让其能够精准理解不同学生的优势与短板,并据此提供适配的教学支持。为此,研究团队将问题聚焦于学生模拟器的构建:能否基于真实的学生学习数据,训练出可评估、可复用的AI学生模型,让AI教师在正式上线前就能获得大量可反复调用的训练反馈?

这类学生模拟器并非孤例,当前AI agent研究领域中,用户模拟器已经成为热门方向,在客服、电商、医疗问诊、网页操作等场景中广泛应用。研究者通过构建模拟用户,让AI agent在正式上线前经历大量虚拟交互,提前测试其策略、话术的合理性与鲁棒性。而教育场景中的用户模拟则更为复杂:学生拥有相对稳定的知识边界、特定的错误习惯和个性化的学习轨迹,同一道题目,有的学生可能会算错符号,有的会误解核心概念,有的听完提示就能自行推导出答案,有的则需要更直接的手把手指导。近期被广泛讨论的“人类学生数字孪生”概念,正是围绕这类教育场景的个性化需求展开的。

传统学生建模的局限

其实,对学生行为进行建模并不是一个全新的研究课题。从1995年的贝叶斯知识追踪模型,到后续的深度知识追踪、注意力知识追踪模型,这条研究方向已经被探索了近30年,在拟合学生的整体行为表现上已经相当成熟。但这类传统模型存在一个共同的短板:它们只能接受题目、学生状态、能力值这类结构化输入,无法接收自然语言形式的教学指导,无论教师给出什么样的讲解,这类模型都无法像真实学生一样,根据指导做出相应的行为改变。

如果直接让大模型扮演学生,看起来似乎是一个便捷的解决方案:只需要给模型一段能力描述,比如“你是一个数学基础薄弱的小学生”,模型就能立刻切换成低龄学生的口吻,表现出犹豫和不确定的状态。但这种方法存在一个致命的问题:角色的语气和真实的认知水平并不同步。一个模型可以用小学生的语气说出“我不太懂”,但下一句话却可能给出微积分级别的推理过程。它看起来只是在扮演学生,但实际输出的反馈仍然受限于模型自身的知识储备,往往远高于其被设定的“人设”知识水平。

当用这类大模型扮演的学生来训练AI教师时,这种认知偏差会带来严重的问题。此时AI教师得到的反馈,并不是某个特定学生在当前能力边界下的真实反应,而是一个高能力模型经过人设包装后的虚假反馈。也正是因为这个原因,仅通过一段能力描述作为条件来约束大模型,是一条非常脆弱的实现路径。近年来这条路线被大量应用到教育场景中,包括对话辅导语料构建、多智能体课堂搭建、学习者数据生成等方向,但与此同时,也有大量研究从模型架构、保真度基准、教师使用体验等多个角度对其有效性提出了质疑。

在教育学领域中,评价一次教学指导是否有效,通常不能只看学生独立作答时的表现,还要观察学生在接受帮助后能够达到的水平。维果茨基提出的“最近发展区”理论,正是围绕这一核心展开:学生当前能够独立完成的任务,和在教师支持下能够完成的任务之间的差距,正是教学可以介入和发挥作用的空间。这一想法后来被动态评估发展为可操作的测量程序:不仅要记录学生答对还是答错,还要在给出提示后,观察学生的表现如何发生变化。

将这一思想应用到学生模拟器的设计中,就对应了两类核心能力。第一类是行为保真度:模拟器需要能够复现学生独立作答时的真实状态,包括其能力边界、常见的错误习惯和典型的选择倾向。第二类是指导响应能力:模拟器需要能够在接收到教师的教学指导后,产生符合该学生特点的行为变化,表现出这个学生在获得帮助后可能出现的学习更新。

StudentSim的设计与实践

StudentSim正是基于这两类能力,分别定义为behavioral fidelity和guidance responsiveness,并以此为标准训练和评估个性化的学生模拟器。

StudentSim的训练流程分为两个阶段。第一阶段,研究者会汇总同一领域内多名学生的真实学习记录,训练一个通用的学生行为模型,这个阶段主要学习该领域内学生的共性错误模式、回答格式以及接受指导后的修正路径。第二阶段,则会使用单个学生自己的专属学习记录进行二次训练,最终得到针对该学生的个性化模拟器。之所以采用这种两步走的训练方式,是因为单名学生的学习记录通常数量较少,直接训练很容易出现过拟合问题;先通过群体数据学习通用规律,再适配单个学生的个性化特征,可以更稳定地得到符合该学生特点的模拟器。

研究团队同时构建了StudentSimEval评估框架,该评估覆盖了60名真实学生,涉及国际象棋、第二语言英语写作和基础数学三个完全不同的场景。在国际象棋场景中,模拟器需要预测某位棋手在棋局中的走法,并在教练给出指导后修正之前的错误走位;在二语写作场景中,模拟器需要生成符合该学习者错误模式的作文片段,并根据教师的批改建议进行改写;在基础数学场景中,模拟器需要先预测学生的答案,再在接收讲解后修正错误。

尽管这三个场景的表面差异巨大,但评估的核心目标是一致的:首先看模拟器是否能够还原该学生本人的真实行为,其次看它能否对教师的指导做出符合该学生特点的响应。所有的测试方法都会使用同一份学生记录,并在相同的保留测试集上进行对比。

在国际象棋的评测结果中,StudentSim的F值为0.5150,R值为0.9067;而GPT-5.4的对应数值分别为0.2316和0.7186,Maia2的数值则为0.4535和0.2721。在二语写作和数学的实验中,StudentSim同样在两个评估指标上超过了对应的基线模型。这组结果清晰地展现了不同方法的优劣分工:GPT-5.4能够理解自然语言指导,但在模拟具体学生的真实行为时保真度不足;Maia2更贴近真实人类棋手的走法,但无法接收自然语言形式的教练提示并做出响应;而StudentSim通过真实的学习记录训练,并针对每个学生进行个性化适配,在个体行为还原和指导响应两个方面都实现了显著提升。

不过,学生模拟器本身并不是最终目的,其核心价值在于能够落地到真实场景中,用于改进AI教师模型。在以往的AI tutor训练中,奖励信号主要来自两个方向:一部分来自专家标注的优质辅导对话,另一部分来自使用评分量表的通用大模型裁判。也有部分尝试将奖励接入模拟学生,但这些模拟学生大多是通过角色扮演的大模型构建的,其认知水平并不保真,而非基于真实学习者数据训练的模拟器。StudentSim在这一点上提出了全新的解决方案。

研究团队进一步将StudentSim整合到AI tutor的强化学习流程中,实验场景选择了国际象棋。整个流程的逻辑是:系统先取出真实学生曾经犯下的错误走法,由AI tutor生成对应的教学指导,StudentSim在接收到该指导后,输出该学生可能的修正走法。随后,使用Stockfish计算修正走法相对于原错误走法的质量变化,将这个分数回传给AI tutor作为强化学习的奖励信号。

实验设置了三个对照组:不进行强化学习的基础AI tutor、使用GPT-5.4作为学生模拟器来生成奖励信号的AI tutor,以及使用StudentSim作为模拟器的AI tutor。三个实验组使用了相同的基础模型、SFT起点和GRPO设置,唯一的区别在于奖励信号的来源。

经过国际象棋评估者的盲评后,使用StudentSim作为奖励信号训练出的AI tutor,在准确性、指导质量和个性化评分三个维度上均排名第一。专家在盲评时打乱了所有样本的呈现顺序,三个评估维度分别为:准确性看“没有误导性事实错误”的回答占比,指导质量和个性化评分则采用1到5分的李克特量表。使用StudentSim训练的AI tutor在三个维度上都取得了最优的成绩。

更值得注意的是反向对照实验的结果:使用GPT-5.4作为学生模拟器训练出的AI tutor,不仅准确性输给了使用StudentSim的实验组,甚至还低于完全没有进行强化学习的基线模型。这是因为其认知水平不保真的模拟器,会将AI教师往错误的方向引导:一个认知水平不符合真实学生、但理解能力极强的模拟器,无论指导多么离谱,都能自行推导出某个答案,从而给错误的指导发放随机的奖励,最终导致强化学习朝着混乱甚至错误的方向优化。

StudentSim并没有完全取代真实的学生教学实验,而是将真实的学生学习记录转化为训练阶段可反复调用的模拟反馈,让AI tutor在进入真人实验阶段之前,就能完成多轮的筛选和优化。对于需要个性化反馈的AI教师系统来说,这类学生模拟器延续了当前热门的用户模拟器的思想脉络——即一切人类行为都可以被模拟,构建人类的数字孪生,为AI教师的个性化训练提供了一条颠覆性的工程路径:通过学习学生的错误模式和在指导下的行为变化,为AI教师的强化学习提供机器学习时间尺度下的高效反馈信号。

论文链接:https://arxiv.org/abs/2609.01591

代码链接:https://github.com/microsoft/StudentSim

Huggingface Paper主页:https://huggingface.co/papers/2609.01591

以上内容不代表本平台立场,仅供读者参考