論文の概要: Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach
- arxiv url: http://arxiv.org/abs/2607.26317v1
- Date: Tue, 28 Jul 2026 22:33:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.492433
- Title: Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach
- Title(参考訳): 心理学的校正のためのLLM-Simulated と Human Examine の調整:認知診断プロファイリングアプローチ
- Authors: Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson,
- Abstract要約: 大規模言語モデル(LLM)シミュレーション試験は早期校正への有望な経路を提供するが、その応答は正確すぎて不均一すぎる。
多様な認知プロファイルを持つ可視性検査のシミュレーションをLCMに促すフレームワークである認知診断プロファイル(CDP)を提案する。
- 参考スコア(独自算出の注目度): 2.2292507801284356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Psychometric calibration for educational tests typically requires costly human response data. Large language models (LLMs) simulated examinees offer a promising route to early calibration, but their responses are too accurate and too uniform. We propose Cognitive Diagnostic Profiling (CDP), a zero-shot framework that prompts LLMs to simulate plausible examinees with diverse cognitive profiles: binary attribute-mastery patterns are rendered as natural-language profiles and sampled under an uninformative or an informative distribution. Using the Tatsuoka fraction-subtraction dataset (536 examinees, 15 items, five attributes), we evaluated eight LLM configurations under no-profile, uninformative-CDP, and informative-CDP conditions, assessing alignment with human examinees at the ability-distribution, mastery-profile, and item-difficulty levels. CDP improved all three levels: distributional overlap rose across configurations; weighted correlations between profile-level scores and human profile expectations reached 0.92 to 0.98; and item-difficulty recovery improved in rank order and absolute alignment, most for reasoning-enabled models; in the strongest case, Gemini 3.0 Flash (Thinking), one-parameter logistic (1PL) difficulty Spearman correlations rose from 0.24 to 0.86 and 0.90 and the root-mean-square error (RMSE) fell from 6.31 to 1.30 and 0.90; the informative condition helped most where profile-level alignment was strong. CDP brings LLM-simulated examinees into closer psychometric alignment with human examinees, making them practical for operational test development.
- Abstract(参考訳): 心理学的校正は、一般的に人為的なデータを必要とする。
大規模言語モデル(LLM)シミュレーション試験は早期校正への有望な経路を提供するが、その応答は正確すぎて不均一すぎる。
本稿では,LLM に多彩な認知プロファイルを模擬するゼロショットフレームワークである認知診断プロファイル (CDP) を提案する。
立岡分画抽出データセット(536項目,15項目,5属性)を用いて,無名・無形・情報CDP条件下でのLCM構成を8つ評価した。
プロファイルレベルのスコアと人体プロファイルの予測の重み付けによる相関は0.92から0.98に到達し、アイテム微分リカバリはランク順と絶対整合性が改善された。最も強い例は、ジェミニ3.0フラッシュ(シンキング)、一パラメータロジスティック(1PL)の難しさ、スピアマン相関は0.24から0.86、0.90に増加し、ルート平均二乗誤差(RMSE)は6.31から1.30、0.90に低下した。
CDPは、LLMシミュレーション検査をヒト検体と密接な心理測定アライメントをもたらし、手術用テスト開発に実用的である。
関連論文リスト
- PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation [51.96735866702332]
PreBAはPCA重み付き検索とベイズ平均アグリゲーションを統合した検索拡張フレームワークである。
例えば、PreBAはパフォーマンスを大幅に改善し、MAEを最大40%削減し、ゼロショット推論でR2を-0.13から0.62に引き上げる。
論文 参考訳(メタデータ) (2026-02-27T07:19:23Z) - Predicting LLM Correctness in Prosthodontics Using Metadata and Hallucination Signals [4.680384065487852]
大規模言語モデル (LLM) は、医療や医学教育などの高度な領域で採用されている。
本研究では, 汎用モデル (GPT-4o) と推論中心モデル (OSS-120B) を多症例補綴学試験で解析し, 正当性予測の可能性を検討した。
以上の結果から, このメタデータベースのアプローチは, 解答の正解を前提として, 最大で+7.14%の精度向上と83.12%の精度向上を達成できることが示唆された。
論文 参考訳(メタデータ) (2025-12-27T07:51:50Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Can Reasoning LLMs Enhance Clinical Document Classification? [7.026393789313748]
大規模言語モデル(LLM)は、このタスクの正確性と効率性において有望な改善を提供する。
本研究では,8つのLDMの性能と一貫性を評価する。4つの推論(Qwen QWQ, Deepseek Reasoner, GPT o3 Mini, Gemini 2.0 Flash Thinking)と4つの非推論(Llama 3.3, GPT 4o Mini, Gemini 2.0 Flash, Deepseek Chat)。
その結果、推論モデルは精度71%(68%)とF1スコア(67%(60%))で非推論モデルを上回った。
論文 参考訳(メタデータ) (2025-04-10T18:00:27Z) - Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise [14.052630186550628]
プロセス教師付き報酬モデル(PRM)は、数学やコーディングといった分野において、大きな言語モデル(LLM)の出力に対してステップバイステップの検証を提供する。
LLM作成臨床ノートに段階的な報酬信号を提供するために,PRMを訓練するための新しい枠組みを導入する。
論文 参考訳(メタデータ) (2024-12-17T06:24:34Z) - What Do Learning Dynamics Reveal About Generalization in LLM Reasoning? [83.83230167222852]
モデルの一般化動作は,事前記憶列車の精度と呼ばれるトレーニング指標によって効果的に特徴づけられることがわかった。
モデルの学習行動と一般化を結びつけることで、トレーニング戦略に目標とする改善を導くことができる。
論文 参考訳(メタデータ) (2024-11-12T09:52:40Z) - Leveraging LLM-Respondents for Item Evaluation: a Psychometric Analysis [4.59804401179409]
我々は6種類のLDM(GPT-3.5, GPT-4, Llama 2, Llama 3, Gemini-Pro, Cohere Command R Plus)を用いて、人間の答えに類似した心理測定特性を持つ応答を生成する。
その結果,一部のLLMは大学生に比べて,カレッジ・アルジェブラの習熟度が高いことが示唆された。
論文 参考訳(メタデータ) (2024-07-15T16:49:26Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z) - Uncertainty Aware Learning for Language Model Alignment [97.36361196793929]
異なるタスクシナリオのモデルアライメントを改善するために,不確実性認識学習(UAL)を提案する。
トレーニングのラベルの平滑化値を個々のサンプルの不確実性に応じて適応的に設定する。
広く使われているベンチマーク実験では、我々のUALは標準教師あり微調整よりも著しく優れています。
論文 参考訳(メタデータ) (2024-06-07T11:37:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。