TutorMoments:AI 导师知道何时该帮助、何时该放手吗?
返回文章列表
TutorMoments:AI 导师知道何时该帮助、何时该放手吗?
企业
文章
发布 2026年8月7日
赞 3
Kyle Wiggers
Ai2Comms
关注
allenai
📄 技术报告: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 数据: https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 代码: https://github.com/allenai/tutormoments
今天,我们推出 TutorMoments 的预览版——这是一个用于衡量前沿大语言模型(LLM)能否平衡教育中最困难的权衡之一的框架:何时介入帮助学生,何时退后一步让学生自己完成更多工作。
TutorMoments 是一个基于真实一对一数学辅导课程的重放式评估框架。经验丰富的数学教师会审阅来自美国辅导项目的对话记录,并标记出导师必须在“让问题更容易上手”和“推动学生自己进行更多推理”之间做出抉择的时刻。TutorMoments 随后将对话记录截取到该决策点,将其交给语言模型,让该模型在模拟会话中接管导师角色——学生由另一个语言模型扮演——以观察 LLM 导师会怎么做。
我们发现,在仅被告知“好好辅导”的情况下,模型倾向于过度帮助,给予过多支持,很少推动学生进行更深层次的思考。在导师的提示词中明确说明这一权衡(何时帮助与何时放手)确实能提升表现,但这并不能弥合与始终契合当下情境的人类辅导之间的差距,而且不同 LLM 在做出这一判断的可靠性上仍存在很大差异。
作为我们对开放研究承诺的一部分,我们发布了去标识化的辅导对话记录数据集、运行重放流程的代码,以及我们在这些对话记录中评估的关键时刻的模型导师重放结果,以供复现。我们希望 TutorMoments 能让教育工作者、研究人员以及构建 AI 导师的团队更精准地审视模型如何处理最重要的教学决策——并帮助该领域构建能够适应每位学生、而不是替他们完成工作的导师。
什么造就了一位好导师?
向一位优秀的数学导师求助,你很可能得到的回应是一个反问:“关于这个问题在问什么,你知道哪些信息?”这并不是不帮忙——优秀教学的一部分在于诊断学生确实知道什么,并在当下为他们提供恰当的支持。立即主动提供帮助会剥夺学生有助于学习的智力劳动。有时学生确实需要支持;而另一些时候,最有效的方式是推动学生通过解释正确答案来巩固理解。
然而,语言模型被训练成乐于助人的,而一个乐于助人的助手倾向于替你做最难的部分——解释概念、列出步骤、引导你得出答案。在辅导场景中,这可能会缩短“有益的挣扎”——那种费力的、有时令人沮丧的问题解决过程,而学习研究长期以来一直将这种过程与更深入的理解联系在一起。
大多数评估语言模型作为导师的基准测试并未捕捉到这种张力。它们倾向于奖励某一种特定行为——比如绝不透露问题答案,或总是提供提示——而不考虑这是否是针对学生实际理解水平做出的正确决策。但好的辅导并非一种可以在所有情况下通用的固定行为。它是一种判断:此刻、针对这个问题,这位学生需要什么?
TutorMoments 的工作原理
TutorMoments 建立在真实辅导数据之上。我们发布的数据集 TutorMoments-Preview 包含 462 份去标识化、纯文本的真实一对一数学辅导对话记录,对象为美国 2-7 年级学生,包含超过 1,500 个教师标注的关键时刻以及来自 27 位美国教师标注者的数千条自由文本标注。这些对话记录来自一个高剂量辅导项目,其学生大多就读于第一类学校(Title I schools),数据根据家长和监护人同意的研究条款共享;所有数据均经过去标识化处理,先是提供商完成第一轮,再经过额外的数学感知流水线。
所有标注均由经验丰富的数学教师完成,我们请他们阅读对话记录并标记关键学习时刻——记录当时的情况、导师做了什么、以及学生如何回应。每个关键时刻都是一个决策点,导师必须权衡搭建脚手架(scaffolding)(让问题更容易理解)与推动严谨性(pushing for rigor)(鼓励学生进行更难思考)之间的关系。
TutorMoments 的运行方式是:在某个关键时刻暂停对话记录,将会话交给一个语言模型,由该模型接管导师角色,与一个模拟学生进行五轮对话。我们将这些模型生成的延续内容称为重放(replay)。随后,一个基于 LLM 的评分流水线从三个方面评估每次重放:模型是否(1)在学生需要支持时搭建了脚手架,(2)在学生准备好接受更大挑战时推动了严谨性,以及(3)避免了过度搭建脚手架(比当下情境所需更多地降低了挑战难度)。
评分流水线从教师定义的真实标准出发:对每个关键时刻,确定它需要搭建脚手架还是推动严谨性。每位教师都对每个时刻进行了标注,当意见不一致时,我们取多数标签——如果三位教师标注了同一个时刻,两位认为需要推动严谨性,一位认为需要搭建脚手架,那么真实标准就是推动严谨性。随后,一个经过教师标注验证的独立 LM 分类器判断导师的实际行为是否符合当下情境的要求——“恰当”的回合意味着导师被分类的行为(搭建脚手架、推动严谨性或过度搭建脚手架)与教师判断该时刻应采取的举措一致。
初步结果
我们使用两种提示词在 TutorMoments 上运行了七个 LLM:一种是朴素提示词(plain prompt),不提供真正的指导——只告诉模型利用其对良好辅导的了解来回应学生;另一种是评估感知提示词(evaluation-aware prompt),明确说明搭建脚手架、过度搭建脚手架和推动严谨性之间的权衡。每个模型都在从辅导对话记录中提取的关键时刻上进行评分,这些时刻在“应搭建脚手架”和“应推动严谨性”之间等量分配。
表格中的每个数字都是 0 到 1 之间的评分——即模型在相关时刻做出恰当行为的比例——因此分数越高意味着模型做出正确判断的频率越高。例如,适当的严谨性得分为 0.50,意味着模型在需要推动严谨性的时刻中有一半做到了这一点。
阅读分数时需要注意几点:
人类导师是自然基准,而非上限。 我们不将人类导师视为理想实践的标准——即使是经验丰富的导师也会在当下做出次优选择。以相同方式在相同决策点评分时,我们对话记录中的人类导师得分为 0.458(适当的搭建脚手架)、0.182(适当的严谨性)和 0.496(避免过度搭建脚手架)——均低于模型的评估感知分数,大约在它们朴素提示词分数的范围内。但这并非声称 AI 导师优于人类教师。标注者专门寻找辅导本可以做得更好的时刻,因此数据集集中在错失的机会上,而非理想实践。
分数衡量的是导师行为,而非学习效果。 重放使用模拟的“先知式”学生,因此数字反映的是模型在决策点的行为——而非真实学生是否学到了东西。
严谨性的检测比搭建脚手架噪声更大。 评分流水线检测严谨性推动的可靠性较低,且底层标注中涉及严谨性的时刻(260 个)远少于搭建脚手架的时