論文の概要: On the Limits of Metacognitive Monitoring in LLMs
- arxiv url: http://arxiv.org/abs/2609.34864v1
- Date: Mon, 28 Sep 2026 10:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:08:31.979147
- Title: On the Limits of Metacognitive Monitoring in LLMs
- Title(参考訳): LLMにおけるメタ認知モニタリングの限界について
- Abstract要約: 15ベンチマークにわたる4つのフロンティアモデルの信頼性レポートについて検討する。
モデルが競合数学の97%の問題を解き、解答時間の信頼度が誤差の上位に正解をランク付けする。
- 参考スコア(独自算出の注目度): 30.445219070616265
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reliable decisions depend on recognizing when an answer may be wrong. In biological cognition, metacognitive monitoring can dissociate from task performance, raising the question of how closely solving and judging are linked in language models. Here we study the confidence reports of four frontier models across 15 benchmarks. High task accuracy can coexist with weak error discrimination: a model solves 97% of competition mathematics problems while its answer-time confidence ranks correct answers above errors barely better than chance. Confidence separates correct answers from errors more effectively on questions solved by a separate reference model, while review brings limited improvement on reference-hard questions. Aggregate discrimination also rewards ranking correct answers on easy questions above errors on hard ones, which question-only forecasts already do well. Cross-evaluation helps most where the evaluator answered correctly, and errors shared by the two models usually retain high confidence. Hard questions and shared errors remain difficult targets for prompted self-review and peer oversight, even in models with strong problem-solving performance.
- Abstract(参考訳): 信頼性の高い決定は、答えが間違っていると認識することに依存する。
生物学的認知においては、メタ認知的モニタリングはタスクのパフォーマンスから解離し、言語モデルにどの程度密接な解法と判断が関連しているかという疑問を提起する。
ここでは、15のベンチマークで4つのフロンティアモデルの信頼性レポートについて検討する。
モデルが競合数学問題の97%を解き、解答時間の信頼度がエラー上の正解を偶然よりもわずかに良くランク付けする。
信頼は、別の参照モデルによって解決された質問に対して、正しい回答とエラーをより効果的に分離する。
集約的差別はまた、難しい質問のエラーよりも簡単な質問に対する正しい回答をランク付けする。
クロス評価は、評価者が正しく答えたほとんどの場所で有効であり、2つのモデルで共有されるエラーは、通常高い信頼を保っている。
厳密な質問と共有エラーは、強力な問題解決性能を持つモデルであっても、自己レビューとピア監視を誘発する難しいターゲットのままです。
関連論文リスト
- Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy [41.17236645999555]
本研究では,現実的な質問応答や数学的推論タスクにおいて,意味保存的言い回しの下でモデル解がどう変化するかを検討する。
4つのベンチマークと13のモデルで、モデル出力はプロンプトの正確な表現に依存することが多い。
多くの質問に対して、モデルはフレーズによって正しい答えと間違った答えを交互に行い、ミスマッチ率は23%以上に達する。
論文 参考訳(メタデータ) (2026-05-18T16:45:13Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models [0.0]
答えの不確かさは、ユーザーにとって誤解を招くことや深刻な幻覚を防ぐのに役立つ。
現在の方法では、無関係なトークンをフィルタリングし、近くのトークンや文間の潜在的な接続を調べることで、長い推論シーケンスを分析する。
本稿では,ステップ間の意味的相関を解析するために,ステップ間注意を取り入れた新しい手法を提案する。
論文 参考訳(メタデータ) (2026-01-19T20:04:34Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Improving Metacognition and Uncertainty Communication in Language Models [13.389881635116472]
大規模言語モデル(LLM)は、意思決定の文脈でますます使われている。
LLMの自信はしばしば誤解され、正解と誤解の区別が不十分である。
教師付き微調整が不確実性を伝達するモデルの能力を向上させるかどうかを検討する。
論文 参考訳(メタデータ) (2025-09-30T19:50:02Z) - Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA [10.122669382758122]
モデルに対して質問が効果的に解決できない場合、思考の急激な連鎖(CoT)が出現しがちであることを示す。
結果監督型報酬モデルと強化学習をグループ相対的優位性で適用し,その目的に可解性を取り入れた。
本結果は,CoT推論における幻覚の低減と信頼性向上の鍵要因として可溶性を強調した。
論文 参考訳(メタデータ) (2025-09-30T08:34:16Z) - UQ: Assessing Language Models on Unsolved Questions [149.46593270027697]
当社では,Stack Exchangeから提供された500の難解で多様な質問を対象としたテストベッドであるUQを紹介します。
未解決の質問は、人間が答えを求めるときにしばしば難しく自然に発生する。
上位モデルは15%の質問でUQ検証をパスし、予備的な人間の検証はすでに正しい答えを同定している。
論文 参考訳(メタデータ) (2025-08-25T01:07:59Z) - Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones? [65.43882564649721]
大きな言語モデル(LLM)は印象的な機能を示しているが、それでも矛盾する問題に悩まされている。
我々はConsisEvalベンチマークを開発し、各エントリは厳密な難易度で2つの質問から構成される。
相対的整合性スコアによる整合性向上の可能性を分析する。
論文 参考訳(メタデータ) (2024-06-18T17:25:47Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。