論文の概要: Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
- arxiv url: http://arxiv.org/abs/2606.32032v1
- Date: Tue, 30 Jun 2026 17:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.347845
- Title: Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
- Title(参考訳): メタ認知フィードバックを用いた強化学習 : LLMにおける忠実不確かさ表現
- Abstract要約: 本稿では,メタ認知的フィードバックによる強化学習を忠実な校正問題に適用する。
実験により、RLMFは様々なタスクにおいて汎用的で最先端のFCを実現することが示された。
RLMFは標準のRLを最大63%上回り、モデルの性能限界を評価し表現する能力を高めている。
- 参考スコア(独自算出の注目度): 60.80435138270317
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Metacognition is a critical component of intelligence that describes the ability to monitor and regulate one's own cognitive processes. Yet LLMs exhibit systemic deficiencies in key metacognitive faculties: they hallucinate with high confidence, fail to recognize knowledge boundaries, and misrepresent their internal uncertainty--undermining trustworthiness and reliability. Since monitoring task performance and adapting behavior accordingly are central to metacognition, we posit that models capable of accurately judging their own performance are better positioned to improve it. We operationalize this idea via two novel mechanisms: reinforcement learning with metacognitive feedback (RLMF), a paradigm to refine completion rankings during preference optimization based on the quality of a model's self-judgments of performance, and metacognitive data selection, which uses similar self-judgments to identify high-value training examples, outperforming naive active learning. We apply these innovations to the problem of faithful calibration (FC), a task that is itself fundamentally metacognitive: the goal is to align expressed with intrinsic uncertainty, difficult even for frontier LLMs. We adopt a two-stage, decoupled approach, first using these methods to calibrate the faithfulness of models' self-reported confidence scores, then mapping to natural, context-adaptable linguistic uncertainty via targeted output editing. Extensive experiments show RLMF achieves generalizable, state-of-the-art FC on diverse tasks while preserving accuracy. Further, RLMF surpasses standard RL by up to 63% while enhancing models' ability to assess and express their own capability limits. This positions RLMF as a promising paradigm to enhance LLM metacognition toward improved abilities and alignment, and suggests metacognitive performance as an effective RL signal to overcome limits of prior intrinsic feedback methods.
- Abstract(参考訳): メタ認知は、自分自身の認知過程を監視し制御する能力を記述する知性の重要な構成要素である。
しかし、LLMは重要なメタ認知能力において体系的な欠陥を示しており、高い信頼で幻覚し、知識の境界を認識しず、内部の不確実性を誤って表現し、信頼性と信頼性を損なう。
タスク性能の監視と適応行動はメタ認知の中心であるため,その精度を正確に判断できるモデルは,それを改善するために適切な位置にあると仮定する。
メタ認知フィードバックを用いた強化学習(RLMF)、モデルの自己判断の質に基づく選好最適化時の完成ランキングを洗練するためのパラダイム、メタ認知データ選択という2つの新しいメカニズムにより、このアイデアを運用する。
我々はこれらの革新を、本質的にメタ認知的なタスクである忠実校正問題(FC)に適用する。
まず、これらの手法を用いて、モデルが自己報告した信頼度スコアの忠実度を調整し、対象とする出力編集を通じて、自然な文脈適応可能な言語的不確実性にマッピングする。
広範囲にわたる実験により、RLMFは様々なタスクにおいて汎用的で最先端のFCを達成し、精度を保っていることが示された。
さらに、RLMFは標準のRLを最大63%上回り、モデルが自身の能力限界を評価し、表現する能力を高めている。
これにより,LPMFは能力向上とアライメント向上に向けたLCMメタ認知の促進に期待できるパラダイムとして位置づけられ,従来の固有フィードバック手法の限界を克服する有効なRL信号としてメタ認知性能が提案される。
関連論文リスト
- Decomposing and Steering Functional Metacognition in Large Language Models [7.62618887128252]
大規模言語モデルは機能的メタ認知状態の分解可能な空間を維持していることを示す。
これらの状態は、内部の活性化から線形に退避可能であり、異なる層回りのプロファイルを示す。
この結果から,ベンチマーク性能はタスク能力だけでなく,特定の機能的メタ認知状態の活性化を反映していることが示唆された。
論文 参考訳(メタデータ) (2026-05-09T13:22:47Z) - Process Supervision of Confidence Margin for Calibrated LLM Reasoning [52.373121066425455]
強化学習(RL)によるテスト時間計算のスケーリングは,大規模言語モデル(LLM)推論能力を向上させるための信頼性の高い経路として登場した。
しかし、結果に基づく報酬は、しばしばモデルに過信感を与え、幻覚、信頼できない信頼ベースの制御、不要な計算割り当てをもたらす。
本稿では,信頼性と信頼性を両立させるキャリブレーションを意識したRLフレームワークであるReinforcement Learning with Confidence Margin(textbfRLCM)を紹介する。
論文 参考訳(メタデータ) (2026-04-25T14:40:13Z) - Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning [31.629261193485053]
大規模推論モデル(LRM)は、複雑な現実世界のタスクを解くための強力なパラダイムとして登場した。
既存の結果のみのRLVRパイプラインのほとんどは、バイナリの正当性信号にのみ依存しており、モデルの本質的な不確かさをほとんど無視している。
本稿では,メタ認知型エントロピーキャリブレーションフレームワークEGPOを提案する。
論文 参考訳(メタデータ) (2026-02-26T08:40:06Z) - Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind [8.740788873949471]
大規模言語モデル(LLM)は急速に発展し、汎用タスクと専門タスクの両方に広く応用されている。
意図や指示が不正確に伝達されるとき、彼らは依然として、真のユーザニーズを理解し、応答するのに苦労しています。
論文 参考訳(メタデータ) (2026-02-14T16:01:59Z) - On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs [15.301640007799735]
単純な、制御されたテキストの摂動(キャプションや不正確なチェーン・オブ・シント(CoT)のトレース)は、堅牢性と信頼性が著しく低下していることを示している。
これらの脆弱性をよりよく理解するために、我々はRL微調整力学を分析し、精度と信頼のトレードオフを明らかにする。
論文 参考訳(メタデータ) (2026-02-13T01:12:00Z) - Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency [7.806516365113592]
大規模言語モデル(LLM)は、事実の正確性を必要とするアプリケーションでますます使われている。
事実チェックはこれらのエラーを軽減することができるが、既存の手法は通常、外的証拠を無差別に回収する。
本稿では,確率的確実性と一貫性(PCC)について紹介する。
論文 参考訳(メタデータ) (2026-01-05T21:57:41Z) - Confidence as a Reward: Transforming LLMs into Reward Models [54.98336080630691]
Confidence-as-a-Reward (CRew) は、モデルの最終回答に対するトークンレベルの信頼を報酬のプロキシとして利用する、トレーニング不要の手法である。
CRew は MATH500 および RewardMATH ベンチマークにおいて,既存のトレーニングフリー報酬手法よりも優れていることを示す。
本稿では,信頼度スコアと正当性信号を組み合わせた選好データを構成する訓練戦略であるCRew-DPOを提案する。
論文 参考訳(メタデータ) (2025-10-15T12:51:47Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - Tuning-Free Accountable Intervention for LLM Deployment -- A
Metacognitive Approach [55.613461060997004]
大規模言語モデル(LLM)は、自然言語処理タスクの幅広い領域にわたる変換的進歩を触媒している。
我々は,自己認識型誤り識別と訂正機能を備えたLLMを実現するために,textbfCLEARと呼ばれる革新的なテキストメタ認知手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T19:18:53Z) - Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation [71.91287418249688]
大規模言語モデル(LLM)は、たとえ関連する知識を持っていたとしても、事実的不正確さに悩まされることが多い。
我々は,LLMの自己評価能力を活用し,現実性に向けてモデルを操る訓練信号を提供する。
提案手法は,Llamaファミリーモデルに対して,3つの重要な知識集約タスクにおいて,現実的精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-02-14T15:52:42Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。