論文の概要: Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
- arxiv url: http://arxiv.org/abs/2606.28186v1
- Date: Fri, 26 Jun 2026 15:32:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.52999
- Title: Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
- Title(参考訳): LLM推論における認知的エピソード : 解釈可能な人的項目の難易度予測を可能にする
- Abstract要約: Epi2Diffは、推論の痕跡を認知的根拠のあるエピソードシーケンスにマッピングするフレームワークである。
これらのエピソードは機能的な問題解決状態にグループ化され、推論スケール、労力割り当て、状態遷移を通じてモデル化が困難になる。
4つの実世界の人間の難易度データセットの実験は、Epi2Diffが一貫して強いベースラインを上回っていることを示している。
- 参考スコア(独自算出の注目度): 23.727849222494566
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Predicting human item difficulty is central to educational assessment, where reliable estimates support fairness and effective test construction. Existing methods often depend on costly human calibration or item-level textual representations, providing limited evidence about the cognitive processes that make items difficult. We argue that difficulty should be viewed not only as a property of item text, but also as an observable consequence of the problem-solving burden an item induces. Large Reasoning Models (LRMs) offer scalable process evidence through reasoning traces, but such evidence must be structured to support interpretable modeling. To this end, we introduce Epi2Diff (Episode to Difficulty), a framework that maps LRM reasoning traces into cognitively grounded episode sequences. These episodes group trace segments into functional problem-solving states, enabling difficulty to be modeled through reasoning scale, effort allocation, and state transitions. Epi2Diff extracts compact episode-dynamic features and combines them with semantic item representations for human difficulty prediction. Experiments on four real-world human difficulty datasets show that Epi2Diff consistently outperforms strong baselines, including fine-tuned small language models, LLM in-context learning, and supervised LLM adaptation. On SAT-derived classification benchmarks, Epi2Diff achieves an 8.1% average relative gain over supervised LLM fine-tuning baselines. Further analyses show that harder items induce more effortful, iterative, and implementation-centered episode dynamics, rather than merely longer responses. These results demonstrate that cognitive episodes in LRM reasoning traces provide a predictive and interpretable process representation for human item difficulty, offering a new lens for educational measurement with reasoning models.
- Abstract(参考訳): 人間の項目の難易度を予測することは教育評価の中心であり、信頼性の高い見積もりは公正さと効果的なテスト構築をサポートする。
既存の方法はしばしば、コストのかかる人間の校正やアイテムレベルのテキスト表現に依存し、アイテムを難しくする認知過程に関する限られた証拠を提供する。
我々は、難易度は、項目テキストの性質だけでなく、アイテムが引き起こす問題解決の重荷の観測可能な結果と見なすべきであると主張している。
大規模推論モデル(LRM)は、推論トレースを通じてスケーラブルなプロセスエビデンスを提供するが、解釈可能なモデリングをサポートするためにそのようなエビデンスを構築する必要がある。
この目的のために,LRM推論トレースを認知的根拠としたエピソードシーケンスにマッピングするフレームワークであるEpi2Diff(Episode to Difficulty)を紹介した。
これらのエピソードはセグメントを機能的な問題解決状態にトレースし、推論スケール、労力割り当て、状態遷移を通じてモデル化することの難しさを可能にする。
Epi2Diffは、コンパクトなエピソードダイナミックな特徴を抽出し、人間の難易度予測のためのセマンティックアイテム表現と組み合わせる。
4つの実世界の人間の難易度データセットの実験により、Epi2Diffは、微調整された小さな言語モデル、LLMインコンテキストラーニング、LLM適応の監督を含む、強いベースラインを一貫して上回っていることが示された。
SAT由来の分類ベンチマークでは、Epi2Diffは教師付きLDMの微調整ベースラインよりも平均8.1%の相対的なゲインを達成した。
さらなる分析により、より難しい項目は、単に長い応答よりも、より努力的で反復的で、実装中心のエピソードダイナミクスを誘発することが示された。
これらの結果は、LRM推論トレースにおける認知エピソードは、人間の項目の難易度を予測する予測的かつ解釈可能なプロセス表現を提供し、推論モデルを用いた教育用レンズを提供することを示した。
関連論文リスト
- Estimating Item Difficulty with Large Language Models as Experts [0.44101646956991475]
本研究は,3つの既成言語モデルを,応答データにアクセスできることなく,新たに作成された項目のラベル付けが困難であるとして評価した。
この調査では、判断形式(絶対対対ペア)、決定型(ハードな決定対トークン確率に基づく見積もり)、そして戦略の推進という3つの要因を横断する完全な因子的設計が用いられた。
LLMをベースとした評価では, 実験項目の難易度と中程度から強い正の相関が認められた。
論文 参考訳(メタデータ) (2026-05-18T15:42:13Z) - Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs [100.02824137397464]
難易度が増大する入力に遭遇した場合,大規模言語モデルが内部表現をどのように適応するかを検討する。
タスクの難易度が増大するにつれて、LLMの最後の隠れ状態は実質的にスペーサーとなる。
この空間性-微分的関係は、様々なモデルや領域で観測可能である。
論文 参考訳(メタデータ) (2026-03-03T18:48:15Z) - Four Quadrants of Difficulty: A Simple Categorisation and its Limits [4.304007567113229]
そこで我々は,困難信号の4つの四分法分類,すなわち人間対モデル,タスクに依存しない対タスク依存の分類を提案する。
タスクに依存しない機能はほとんど独立して振る舞うことができ、タスクに依存した機能だけが整合していることが分かりました。
これらの知見は、一般的なカリキュラム学習の直観に挑戦し、軽量でタスク依存の難易度推定器の必要性を強調している。
論文 参考訳(メタデータ) (2026-01-04T11:31:51Z) - Multimodal Behavioral Patterns Analysis with Eye-Tracking and LLM-Based Reasoning [12.054910727620154]
視線追跡データは、ユーザの認知状態に関する貴重な洞察を明らかにするが、その構造化された非言語的な性質のために分析することは困難である。
本稿では、視線追跡信号からの認知パターン抽出を促進するために、マルチモーダルな人間-AI協調フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-24T09:49:53Z) - MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM [58.2298313720146]
マルチモーダル幻覚は多源性であり、様々な原因から生じる。
既存のベンチマークでは、知覚誘発幻覚と推論誘発幻覚を適切に区別することができない。
論文 参考訳(メタデータ) (2025-05-30T05:54:36Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z) - Exploring the Potential of Large Language Models for Estimating the Reading Comprehension Question Difficulty [2.335292678914151]
本研究では,Large Language Models (LLMs) の有効性を検討した。
また,OpenAI の GPT-4o と o1 を用いて,学習支援・読解評価 (SARA) データセットを用いた理解的質問の読解の難しさを推定する。
その結果, モデルがIRTパラメータと有意に一致した難易度推定値を生成する一方で, 極端項目特性に対する感度に顕著な差があることが示唆された。
論文 参考訳(メタデータ) (2025-02-25T02:28:48Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Investigating the Robustness of Deductive Reasoning with Large Language Models [10.713787991104923]
大規模言語モデル(LLM)は多くの推論に基づくNLPタスクにおいて印象的な結果が得られることが示されている。
LLMが、非公式および自己形式化の両方の手法で、どの程度論理的推論タスクに頑健であるかは、まだ不明である。
論文 参考訳(メタデータ) (2025-02-04T17:16:51Z) - JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models [51.99046112135311]
LLM(Large Language Models)の厳密な評価のための合成推論ベンチマークであるJustLogicを紹介する。
JustLogicは非常に複雑で、多様な言語パターン、語彙、引数構造を生成することができる。
実験の結果, (i) LLMは人体平均値よりも同等かそれ以上に機能するが, 人体天井よりも著しく低下することがわかった。
論文 参考訳(メタデータ) (2025-01-24T15:49:10Z) - MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs [55.20845457594977]
大規模言語モデル(LLM)は、問題解決と意思決定の能力の向上を示している。
本稿ではメタ推論技術を必要とするプロセスベースのベンチマークMR-Benを提案する。
メタ推論のパラダイムは,システム2のスロー思考に特に適しています。
論文 参考訳(メタデータ) (2024-06-20T03:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。