論文の概要: StudentSim: Training LLM-based Student Simulators
- arxiv url: http://arxiv.org/abs/2609.01591v1
- Date: Tue, 01 Sep 2026 17:55:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.923696
- Title: StudentSim: Training LLM-based Student Simulators
- Title(参考訳): 学生Sim: LLMをベースとした学生シミュレータのトレーニング
- Authors: Ke Yang, Chenglong Wang, Michel Galley, Chandan Singh, Jeevana Priya Inala, ChengXiang Zhai, Jianfeng Gao,
- Abstract要約: StudentSimは、学生ごとのスパースデータを個別のシミュレータに変えるトレーニングフレームワークである。
その結果、シミュレーターは学生自身の反応を反映し、教師指導の下でそれらを更新する。
3つの領域全体で、StudioSimは両方のメトリクスでGPT-5.4を上回っている。
- 参考スコア(独自算出の注目度): 67.06331010637008
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI tutors are most useful when they adapt to each student's strengths, weaknesses, and preferred guidance, but evidence about which guidance works for which student is sparse, slow, and costly to collect from real learners. Student simulators can provide this signal as a proxy, yet existing approaches are limited: state-tracking models fit student behavior but struggle to process explanations or corrections, while LLM role-play follows guidance fluently but does not reliably match the competence of the student being imitated. We present StudentSim, a training framework that turns sparse per-student data into individualized simulators through pooled training followed by per-student specialization. The resulting simulators both mirror a student's own responses and update them under tutor guidance. We also introduce StudentSimEval, a standardized protocol covering 60 students across chess, second-language English writing, and mathematics, using public learner datasets with de-identified records shared for research. StudentSimEval measures behavioral fidelity (F), or how well a simulator matches a student's responses, and guidance responsiveness (R), or how readily it updates under tutor guidance, with all methods fit and evaluated on the same records. Across all three domains, StudentSim outperforms GPT-5.4 on both metrics. In chess, StudentSim reaches F=0.51 and R=0.91, compared with 0.23 and 0.72 for GPT-5.4 and 0.45 and 0.27 for Maia2. As a proof of concept, using StudentSim as a reward model for tutor reinforcement learning produces a chess tutor that expert humans rate as more accurate, better-guided, and more personalized than a no-RL baseline and a tutor trained against a GPT-5.4 simulator reward. Code is available at https://github.com/microsoft/StudentSim.
- Abstract(参考訳): AI家庭教師は、各生徒の強み、弱み、好みの指導に適応する際に最も有用であるが、実際の学習者から集めるのにどの指導が不十分で、遅く、費用がかかるかを示す証拠がある。
状態追跡モデルは生徒の行動に適合するが、説明や修正の処理に苦労する一方、LLMロールプレイは生徒が模倣される能力と確実に一致しない。
本研究では、学生ごとのスパースデータを、プールドトレーニングと学生ごとの専門化によって個別化されたシミュレータに変換するトレーニングフレームワークであるStudioSimを紹介する。
その結果、シミュレーターは学生自身の反応を反映し、教師指導の下でそれらを更新する。
また、チェス、第二言語英語、数学にまたがる60人の生徒を対象とした標準化されたプロトコルであるStudioSimEvalを紹介した。
学生SimEvalは、行動の忠実度(F)、シミュレータが学生の反応とどの程度うまく一致しているか、あるいは教師指導の下でどれだけ容易に更新できるかを計測し、すべてのメソッドが同じレコードに適合し評価する。
すべての3つの領域で、StudioSimは両方のメトリクスでGPT-5.4を上回っている。
チェスではF=0.51、R=0.91、GPT-5.4では0.23、GPT-5.4では0.72、Maia2では0.45、そして0.27となる。
概念実証として、チューター強化学習の報酬モデルとしてStudioSimを使用することで、専門家がGPT-5.4シミュレータの報酬に対してトレーニングされた非RLベースラインとチューターよりも正確で、より指導力が高く、パーソナライズされた、よりパーソナライズされたチェスのチューターを生成する。
コードはhttps://github.com/microsoft/StudentSim.comで入手できる。
関連論文リスト
- IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking [59.6657632820611]
IR-SIMは、迅速なシナリオ構築、ベンチマーク、ロボット学習のために設計された、スキルネイティブなナビゲーションシミュレータである。
シナリオは、モバイルロボットキネマティクス、幾何学的衝突チェック、LiDARセンシング、可視化、行動モジュールを指定するYAML設定ファイルで完全に定義されている。
実験では、複数のタスクにおいてIR-SIMの利便性と汎用性を示す。
論文 参考訳(メタデータ) (2026-06-07T16:55:37Z) - Who Am I? History-Aware Profiles for Student Simulation in Tutoring Dialogues [42.74448763964845]
歴史条件付き学生シミュレーションの課題を紹介する。
本研究の目的は,学生の学習履歴の情報を活用することで,生徒の対話を正確に予測することである。
両コンポーネントを強化学習(RL)で訓練し、忠実な学生シミュレーションに最適化されたプロファイルを得る。
論文 参考訳(メタデータ) (2026-05-28T15:02:51Z) - Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators [55.617099475539305]
大規模言語モデル(LLM)は、生徒のような反応を流線型に生成できるため、AI教師や人間教育者のトレーニングや評価のための模擬学生として魅力的である。
しかし、このようなシミュレータは、実際の学生と出力の類似性によって評価され、相互作用中に一貫性のある誤解を持つ学生のように振る舞うかどうかによって評価される。
シミュレーションが誤解駆動の信念状態を維持しているかどうかを判断し、フィードバックが誤解に対処した場合に選択的に更新する。
論文 参考訳(メタデータ) (2026-05-12T20:55:23Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants? [61.07963107032645]
大規模言語モデル(LLM)は、対話型アプリケーションでますます使われている。
人間の評価は、マルチターン会話におけるパフォーマンスを評価するためのゴールドスタンダードのままである。
我々は、909の注釈付き人間とLLMの会話を2つの対話タスクで行うベンチマークであるSimulatorArenaを紹介した。
論文 参考訳(メタデータ) (2025-10-06T23:17:44Z) - Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents [36.704574105201864]
大規模言語モデル(LLM)は教育に革命をもたらしており、LLMベースのエージェントは学生の振る舞いをシミュレートする上で重要な役割を果たしている。
学生シミュレーションにおける大きな課題は、様々な認知レベルにおける学生の多様な学習パターンをモデル化することである。
論文 参考訳(メタデータ) (2025-05-26T13:48:49Z) - Generalisable Methods for Early Prediction in Interactive Simulations
for Education [5.725477071353353]
シミュレーションにおける生徒のインタラクションデータを,期待性能に基づいて分類することは,適応的な指導を可能にする可能性がある。
まず,学生のタスク内動作を通して概念的理解を計測する。
そこで,我々は,クリックストリームデータから,シミュレーションの状態と学生の行動の両方をエンコードする,新しいタイプの特徴を提案する。
論文 参考訳(メタデータ) (2022-07-04T14:46:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。