論文の概要: From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation
- arxiv url: http://arxiv.org/abs/2608.21668v1
- Date: Fri, 21 Aug 2026 22:19:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.368894
- Title: From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation
- Title(参考訳): 熟達プロファイルからシミュレートされた応答へ:忠実LLM学生シミュレーションのための確率的学生知識グラフ(SSKG)
- Abstract要約: 大規模言語モデル(LLM)は、異なる熟達レベルの学生をシミュレートするために、ますます使われている。
LLMは、低熟達の学生をシミュレートするように指示された場合でも、内蔵能力に応じて実行する傾向がある。
379 College Board-calibrated SAT Algebra items and five archetypal mastery profiles。
- 参考スコア(独自算出の注目度): 0.03110995905282905
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to simulate students at different mastery levels. These simulations can generate synthetic training data and stress-test tutoring systems. However, common prompt-based approaches leave the answer decision to the LLM, which tends to perform according to its built-in capabilities even when instructed to simulate a student with low mastery. As a result, these approaches may have difficulty distinguishing students with low and high levels of mastery. We demonstrate this limitation using 379 College Board-calibrated SAT Algebra items and five archetypal mastery profiles. Three LLMs from three vendors (Gemini 3.1 Flash Lite, Claude Haiku 4.5, and GPT-5.4-mini) achieve 96.8-100% accuracy across all profiles. To address this limitation, we introduce a method grounded in a Stochastic Student Knowledge Graph (SSKG). A curriculum knowledge graph (CKG) is extracted from an open algebra textbook, and each SAT solution is decomposed into a chain of required triples. The SSKG assigns a mastery probability to each triple, which is sampled to determine question correctness. An LLM then generates a first-person rationale consistent with the outcome. The simulation reduces accuracy to 44.1-85.2% across profiles and produces a clear monotone mastery gradient.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、異なる熟達レベルの学生をシミュレートするためにますます使われている。
これらのシミュレーションは、合成トレーニングデータとストレステスト学習システムを生成することができる。
しかし、一般的なプロンプトベースのアプローチは、解答の決定をLLMに任せる。
その結果、これらのアプローチは、中学・高学の学生を区別することが困難である可能性がある。
379 College Board-calibrated SAT Algebra items and five archetypal mastery profiles。
3つのベンダー(Gemini 3.1 Flash Lite、Claude Haiku 4.5、GPT-5.4-mini)のLCMは、全てのプロファイルで96.8-100%の精度を実現している。
この制限に対処するため,Stochastic Students Knowledge Graph (SSKG) を基盤とした手法を提案する。
オープン代数教科書からカリキュラム知識グラフ(CKG)を抽出し、各SAT解を必要三重項の連鎖に分解する。
SSKGは、各トリプルにマスター確率を割り当て、質問の正しさを決定するためにサンプリングされる。
LLMは結果と一致した一対一の合理性を生成する。
このシミュレーションにより、プロファイル全体で44.1-85.2%の精度が低下し、明確なモノトンマスターリー勾配が生成される。
関連論文リスト
- StudentSim: Training LLM-based Student Simulators [67.06331010637008]
StudentSimは、学生ごとのスパースデータを個別のシミュレータに変えるトレーニングフレームワークである。
その結果、シミュレーターは学生自身の反応を反映し、教師指導の下でそれらを更新する。
3つの領域全体で、StudioSimは両方のメトリクスでGPT-5.4を上回っている。
論文 参考訳(メタデータ) (2026-09-01T17:55:10Z) - Compiling Deterministic Structure into SLM Harnesses [0.6117371161379209]
小型言語モデル(SLM)は高価であり、大量使用にはデータ主権が制限される。
本稿では,エージェント改善を個別実行計画にコンパイルするSGDe(Semantic Gradient Descent)を提案する。
論文 参考訳(メタデータ) (2026-04-19T14:04:29Z) - S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs [48.80914119283909]
チェーン・オブ・シークレット(CoT)を備えた大規模言語モデルは、強力なパフォーマンスを実現し、振る舞いの窓を提供する。
最近の証拠は、CoT能力の改善には冗長な推論プロセスが伴うことを示唆している。
本研究では,効率的なCoT学習のためのアクティベーションステアリングに基づく自己サンプリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:37:36Z) - Take Out Your Calculators: Estimating the Real Difficulty of Question Items with LLM Student Simulations [36.23612429926861]
実世界の学生を対象とした数学質問の難易度を評価するため,オープンソースの大規模言語モデル(LLM)の予測値について検討した。
我々は,4年生,8年生,12年生の「教室」をシミュレートし,LLMを様々な習熟度を持つロールプレイングの学生に促す。
我々は,4級,8級,12級の相関関係を0.75,0.76,0.82まで観測した。
論文 参考訳(メタデータ) (2026-01-15T00:25:01Z) - MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization [103.74675519953898]
ロングチェーンのリフレクティブ推論は、複雑な現実世界の問題を解決するための前提条件である。
我々は42の難解な合成タスクの1,260のサンプルからなるベンチマークを構築した。
トレーニング後のデータを生成し、そのようなデータを活用するための学習パラダイムを探索する。
論文 参考訳(メタデータ) (2025-10-09T17:53:58Z) - Socratic-Zero : Bootstrapping Reasoning via Data-Free Agent Co-evolution [11.474213670364572]
Socratic-Zeroは、最小限のシード例から高品質なトレーニングデータを生成する、完全に自律的なフレームワークである。
このシステムは、既存のタスクやラベルを必要とせずに、自己改善カリキュラムを生成する。
Socratic-r-8Bは、以前のデータ合成法よりも平均的に+20.2ポイント向上する。
論文 参考訳(メタデータ) (2025-09-29T12:54:07Z) - Constructing a Question-Answering Simulator through the Distillation of LLMs [4.573445061106203]
質問応答シミュレータ (QA) は、学生の実際の学習行動を模倣し、質問に対する回答の正しさを予測するモデルである。
QAシミュレータは、実際の学生と対話することなく、教育推薦システム(ERS)が大量のトレーニングデータを収集することを可能にする。
そこで本研究では, LLMからドメイン知識と推論能力を蒸留し, 予測支援を行うLDSim (LLM Distillation Based Simulator) を提案する。
論文 参考訳(メタデータ) (2025-09-11T07:59:30Z) - Learning to Reason Across Parallel Samples for LLM Reasoning [48.41933431325965]
大規模言語モデル(LLM)において、テスト時間計算のスケーリングは大幅なパフォーマンス向上をもたらす
本稿では,このような複数のサンプル集合を利用する新しい手法を提案する。
5つの推論データセットの実験は、SSAの有効性と効率を実証している。
論文 参考訳(メタデータ) (2025-06-10T17:42:35Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - Ensemble ToT of LLMs and Its Application to Automatic Grading System for Supporting Self-Learning [0.8490659704051299]
Ensemble Tree-of-Thought (ToT)は、複数のモデルを統合することでLCM出力を強化するフレームワークである。
評価システムはまずLLMの分解傾向を評価し,次に複数の結果を生成し,シミュレーションによる議論を通じてそれらを統合する。
論文 参考訳(メタデータ) (2025-02-23T01:17:46Z) - Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions [47.83142414018448]
算術的推論とコード生成という,2つの一般的な推論タスクに注目します。
i) 数学やコーディング問題に対する摂動の一般的なオントロジー, (ii) 摂動を応用するための半自動手法, (iii) 2つのデータセットを紹介する。
混乱した質問に対して、すべてのモデルで大幅なパフォーマンス低下を示します。
論文 参考訳(メタデータ) (2024-01-17T18:13:07Z) - SatLM: Satisfiability-Aided Language Models Using Declarative Prompting [68.40726892904286]
本研究では,大規模言語モデル (LLM) の推論能力を向上させるために,新しい満足度支援言語モデリング (SatLM) 手法を提案する。
我々はLLMを用いて命令型プログラムではなく宣言型タスク仕様を生成し、既製の自動定理証明器を利用して最終解を導出する。
我々はSATLMを8つの異なるデータセット上で評価し、命令パラダイムにおいてプログラム支援されたLMよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2023-05-16T17:55:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。