INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
作者: Rose Niousha, Minwoo Kang, Narges Norouzi
分类: cs.AI, cs.CY
发布日期: 2026-08-11
备注: Accepted at the Conference on Language Modeling (COLM) 2026
💡 一句话要点
提出INSIDE框架以解决学生模拟中的推理缺失问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 学生模拟 推理能力 教育技术 内部对话生成
📋 核心要点
- 现有的LLM模拟器虽然能再现学生的行为,但无法有效捕捉其背后的推理过程,导致模拟结果缺乏深度。
- INSIDE框架通过生成基于布鲁姆分类法的内部对话,使LLM能够模拟学生的思维过程,从而提升模拟的真实度。
- 实验结果显示,INSIDE在行为真实度和推理一致性方面均有显著提升,最高一致性达57.9%,优于现有方法。
📝 摘要(中文)
基于大型语言模型(LLM)的模拟器通常能够再现可观察的行为,但未能捕捉其背后的推理过程。在教育领域,学生模拟的应用日益广泛,尤其是在评估辅导系统时,这一缺口尤为明显。为此,本文提出了INTERNAL STUDENT DIALOGUE(INSIDE)框架,旨在使LLM不仅能够模拟学生的行为,还能模拟其思维过程。INSIDE生成基于布鲁姆分类法的内部对话,涵盖认知、情感和行动维度,并在配对的思维轨迹和行为上进行模型微调。通过与不同的提示框架进行基线比较,评估模拟行为的真实度和生成内部对话的质量。实验结果表明,INSIDE在行为真实度和推理一致性方面均有显著提升,模型间的最高一致性达到了57.9%。
🔬 方法详解
问题定义:本文旨在解决现有LLM模拟器在学生行为模拟中缺乏推理能力的问题。现有方法往往只关注可观察行为,忽视了学生思维过程的多样性和复杂性。
核心思路:INSIDE框架的核心思想是通过生成内部对话,使模型不仅能模拟学生的行为,还能模拟其思维过程。该框架基于布鲁姆分类法,涵盖认知、情感和行动三个维度,增强了模型的推理能力。
技术框架:INSIDE的整体架构包括数据收集、模型微调和评估三个主要模块。首先,收集学生的思维轨迹和行为数据,然后对LLM进行微调,最后通过对比实验评估模型的表现。
关键创新:INSIDE的主要创新在于将内部对话生成与行为模拟相结合,突破了传统LLM只关注行为的局限,使得模型能够更全面地理解学生的思维过程。
关键设计:在模型微调过程中,采用了配对的思维轨迹和行为数据,设计了特定的损失函数以优化内部对话的生成质量,同时确保生成的对话与实际行为之间的高度一致性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,INSIDE框架在模拟行为的真实度和推理一致性方面均有显著提升。与基线模型相比,INSIDE在行为真实度和推理一致性上分别提高了57.9%,显示出其在学生模拟中的有效性和创新性。
🎯 应用场景
该研究的潜在应用领域包括教育技术、智能辅导系统和个性化学习平台。通过更准确地模拟学生的思维过程,INSIDE框架能够帮助教育工作者更好地理解学生的学习需求,从而优化教学策略和辅导方法,提升学习效果。未来,INSIDE还可能在其他领域的智能代理和人机交互中发挥重要作用。
📄 摘要(原文)
Large Language Model (LLM)-based simulators often reproduce observable actions but fail to capture the underlying reasoning behind them. In education, where student simulation is increasingly used for various applications such as evaluating tutoring systems, this gap is especially pronounced. Two students may submit identical submissions for entirely different reasons. We present INTERNAL STUDENT DIALOGUE (INSIDE), a student modeling framework that fine-tunes LLMs not only to act like students but also to think like them. INSIDE generates internal dialogue grounded in Bloom's Taxonomy across cognitive, affective, and action dimensions, and fine-tunes models on paired think traces and actions. We baseline against different prompting frameworks and evaluate on two axes: fidelity of simulated actions and quality of generated internal dialogue. Our evaluations show that INSIDE improves simulation fidelity in both action fidelity, matching code generation of real students, and reasoning alignment, achieving the highest alignment across models up to 57.9%.