論文の概要: Simulating Disengaged Students to Evaluate LLM-based Tutors
- arxiv url: http://arxiv.org/abs/2609.12331v1
- Date: Fri, 11 Sep 2026 01:28:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.581064
- Title: Simulating Disengaged Students to Evaluate LLM-based Tutors
- Title(参考訳): LLMに基づくチュータ評価のための中退学生のシミュレーション
- Authors: Xianghui Meng, Jionghao Lin,
- Abstract要約: Disengagement-Aware Students Simulators (DAS2) は、エンゲージメント、ゲーム、ホイールスピン、オフタスク、ミックスの5つの学習状態のモデルである。
DAS2は、AIチューターがデプロイ前にさまざまな学習者入力状態にどのように反応するかを評価するための事前デプロイフレームワークを提供する。
- 参考スコア(独自算出の注目度): 0.40105987447353786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Simulated students generated by computational models provide a practical way to evaluate tutoring strategies and pedagogical approaches used by human and AI tutors. However, such simulations should account for disengaged behaviors, including gaming the system, wheel-spinning, and off-task behavior, because tutors may need different responses for different learner states. We present Disengagement-Aware Student Simulators (DAS2), a reproducible pre-deployment protocol that models five learner-engagement states: engaged, gaming, wheel-spinning, off-task, and mixed, and evaluates AI tutor performance across these states. Using ASSISTments09, two coders independently labeled 100 sampled tutoring sessions based on anonymized interaction-log summaries. They achieved 84% agreement (Cohen's kappa = 0.78), and among agreed cases, human consensus labels matched DAS2 rule-based labels in 81% of cases (kappa = 0.75). Conditioning simulations on intended learner states reduced the correctness-rate gap between simulated and authentic sessions from 0.54 to 0.20 for gaming and from 0.51 to 0.18 for wheel-spinning. Fine-tuned Qwen2.5-7B better matched authentic response-time distributions, while prompt-only GPT-4o generated more distinguishable learner states. Evaluation of five AI tutors from the Claude, Llama, Gemini, Qwen, and GPT families showed that relative rankings remained stable across learner states and interaction lengths, while absolute performance varied, revealing state-specific differences in tutor support. Human validation further showed that automated tutor evaluation does not fully align with human judgment. DAS2 provides a pre-deployment framework for evaluating how AI tutors respond to diverse learner-engagement states before deployment.
- Abstract(参考訳): 計算モデルにより生成されたシミュレーションされた学生は、人間とAI教師が使用する学習戦略と教育的アプローチを評価する実践的な方法を提供する。
しかし、そのようなシミュレーションは、学習者が異なる学習者状態に対して異なる反応を必要とする可能性があるため、システムのゲーム、車輪スピン、オフタスクの動作など、無関係な振る舞いを考慮すべきである。
本稿では,学習者の参加状態(エンゲージメント,ゲーム,ホイールスピン,オフタスク,ミックス)をモデル化した再現可能な事前デプロイプロトコルであるDisengagement-Aware Students Simulators (DAS2)を紹介し,これらの状態におけるAI教師のパフォーマンスを評価する。
ASSISTments09を使用して、2人のプログラマが匿名の対話ログの要約に基づいて100のサンプル学習セッションを独立にラベル付けした。
彼らは84%の合意(コーエンのカッパ=0.78)を達成し、合意された事例の中で、人間のコンセンサスラベルは81%のケース(カッパ=0.75)でDAS2のルールベースのラベルと一致した。
学習者の意図した状態に対する条件付けシミュレーションにより、シミュレーションされたセッションと認証セッションの正しさと正しさのギャップはゲームでは0.54から0.20、ホイールスピニングでは0.51から0.18に縮小された。
微調整されたQwen2.5-7Bは応答時間分布と一致し、プロンプトのみのGPT-4oはより区別可能な学習状態を生成する。
Claude, Llama, Gemini, Qwen, GPTファミリーの5つのAI家庭教師の評価では、学習者状態と相互作用期間の相対的なランクが安定し、絶対的なパフォーマンスは変化し、家庭教師サポートの州別差が明らかになった。
人間の検証は、自動チューター評価が人間の判断と完全に一致しないことを示した。
DAS2は、AIチューターがデプロイ前にさまざまな学習者入力状態にどのように反応するかを評価するための事前デプロイフレームワークを提供する。
関連論文リスト
- StudentSim: Training LLM-based Student Simulators [67.06331010637008]
StudentSimは、学生ごとのスパースデータを個別のシミュレータに変えるトレーニングフレームワークである。
その結果、シミュレーターは学生自身の反応を反映し、教師指導の下でそれらを更新する。
3つの領域全体で、StudioSimは両方のメトリクスでGPT-5.4を上回っている。
論文 参考訳(メタデータ) (2026-09-01T17:55:10Z) - Which CS1 Students Will Fail? Identifying Digital Markers from Learning Analytics in Computer Systems and Architecture Using Weighted Academic Momentum and Interaction Logs [0.0]
デジタル学習プラットフォームは、苦労している学生を早期に特定する可能性を提供する、リッチな行動トレース(デジタルマーカー)を生成する。
本稿では,従来のマーカーとデジタルマーカーを組み合わせることで,初年度のCS1コースの障害を予測できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-16T08:32:54Z) - AI-Driven Assessment of Human Tutors: Linking Training Performance to Real-Life Practice [1.3597553728687461]
本稿では,訓練中のオープン応答と実生活指導の両立を評価するAI駆動システムを提案する。
我々はジェネレーティブAI(Gemini-2.5-pro)を用いて、教師のスキルを実生活のアプリケーションに伝達する過程を計測する。
論文 参考訳(メタデータ) (2026-06-17T02:28:10Z) - Faster Completion, Less Learning: Generative AI Reduced Study Time on Math Problems and the Knowledge They Build [0.6524460254566904]
自己報告による調査はほとんど変化を示さないが、小規模の行動研究では、学習結果を測定するための尺度や期間のないAIの利用が広く報告されている。
私たちは、タイム・オン・タスク分析のために、ALEKSの学習インタラクションを320万ドルで10年のパネルで行います。
これらの結果は、生成的AIが学生の学習方法と彼らが構築した知識を変化させた最初の大規模行動と結果の証拠である。
論文 参考訳(メタデータ) (2026-05-20T18:40:53Z) - Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators [55.617099475539305]
大規模言語モデル(LLM)は、生徒のような反応を流線型に生成できるため、AI教師や人間教育者のトレーニングや評価のための模擬学生として魅力的である。
しかし、このようなシミュレータは、実際の学生と出力の類似性によって評価され、相互作用中に一貫性のある誤解を持つ学生のように振る舞うかどうかによって評価される。
シミュレーションが誤解駆動の信念状態を維持しているかどうかを判断し、フィードバックが誤解に対処した場合に選択的に更新する。
論文 参考訳(メタデータ) (2026-05-12T20:55:23Z) - Personalized AI Practice Replicates Learning Rate Regularity at Scale [0.0]
学生は様々な教育的文脈で一貫した学習率を示す。
これらの結果は,デジタルプラットフォームであるCampus AIの学生インタラクションデータセットを用いて検証した。
論文 参考訳(メタデータ) (2026-03-09T13:33:28Z) - UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models [59.693733170193944]
大規模言語モデル(LLM)は、教育環境において、回答提供者からインテリジェントな家庭教師へとシフトしている。
最近の強化学習アプローチはこの制限に対処するが、2つの重要な課題に直面している。
これらの課題に対処するために一方向認知最適化法(UCO)を提案する。
論文 参考訳(メタデータ) (2025-11-12T01:27:02Z) - Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning [52.07170679746533]
大規模言語モデル(LLM)は、セラピー、教育、社会的役割プレイといったインタラクティブな環境において、人間のユーザをシミュレートするためにますます使われています。
LLM生成対話におけるペルソナの一貫性の評価と改善のための統一的なフレームワークを提案する。
我々は3つの自動メトリクス、即行一貫性、行間一貫性、Q&A一貫性を定義し、異なるタイプのペルソナドリフトをキャプチャし、それぞれが人間のアノテーションに対して検証する。
論文 参考訳(メタデータ) (2025-10-31T19:40:41Z) - SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants? [61.07963107032645]
大規模言語モデル(LLM)は、対話型アプリケーションでますます使われている。
人間の評価は、マルチターン会話におけるパフォーマンスを評価するためのゴールドスタンダードのままである。
我々は、909の注釈付き人間とLLMの会話を2つの対話タスクで行うベンチマークであるSimulatorArenaを紹介した。
論文 参考訳(メタデータ) (2025-10-06T23:17:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。