論文の概要: Nudgeability: Reasoning Models Follow Confidence Signals Without Tracking Their Own Competence
- arxiv url: http://arxiv.org/abs/2609.34572v1
- Date: Mon, 28 Sep 2026 08:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 12:17:16.340455
- Title: Nudgeability: Reasoning Models Follow Confidence Signals Without Tracking Their Own Competence
- Title(参考訳): 信頼度を追跡せずに、信頼のシグナルを追跡できるNudgeability
- Abstract要約: ツールを呼び出すことができる言語モデルを推論する際には、無視されるかデリゲートするかどうかを判断しなければならない。
感度、信頼度、疑念の度合い、デリゲートレートの変化、そしてターゲティングを測定します。
信頼言語はデリゲートの強力な制御面であるが、現在のモデルは実際の能力に応じて弱くしか使わない。
- 参考スコア(独自算出の注目度): 6.0685700176765875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning language models that can call tools must decide during inference whether to answer unaided or delegate. Any self-reflection mechanism for this must answer three questions: where the reflective signal comes from (verbal reports, output distributions, hidden states, a separate predictor), how it is presented to the model (numerical prediction, confidence token, prompt injection), and whether it changes the model's subsequent action. We isolate the third question. At a fixed point in otherwise identical reasoning trajectories, we insert a single first-person sentence expressing either confidence or doubt; the model then continues reasoning and chooses whether to answer directly or call a tool. Comparing these counterfactual continuations measures the causal effect of the reflective signal on delegation. We call this behavioral response Nudgeability and measure it along two dimensions: sensitivity, how strongly confidence and doubt change delegation rates, and targeting, whether delegation increases for problems the model cannot solve unaided and decreases for those it can. Across nine small-to-medium open-weight reasoning models from three families (Qwen, Gemma, and GLM) and two tasks, models are consistently sensitive: doubt increases delegation and confidence decreases it, with a median confidence-to-doubt swing of 20.6 percentage points, and 53 to 70 points for the larger provider-served models. This responsiveness is poorly targeted: a median 42% of induced flips are well-targeted, only a +2 percentage-point lift over a random-selection baseline. Confidence language is thus a strong control surface for delegation, but current models use it only weakly in accordance with their actual competence. Nudgeability offers a simple, post-training-free way to evaluate both sensitivity and targeting as endogenous self-reflection mechanisms mature.
- Abstract(参考訳): ツールを呼び出すことができる言語モデルを推論する際には、無視されるかデリゲートするかどうかを判断しなければならない。
反射信号がどこから来るか(言語レポート、出力分布、隠された状態、別個の予測器)、どのようにモデルに提示されるか(数値予測、信頼トークン、迅速な注入)、そしてそれがモデルの後続の動作を変更するか、という3つの疑問に答えなければならない。
3つ目の質問を分離する。
同一の推論軌跡の固定点において、信頼または疑念を表す1人1人文を挿入し、モデルが推論を継続し、直接答えるか、あるいはツールを呼び出すかを選択する。
これらの反事実的継続を比較することは、反射信号のデリゲートに対する因果効果を測定する。
我々は、この行動対応をNudgeabilityと呼び、それを2つの次元に沿って測定する。敏感さ、いかに自信と疑念が強いか、デリゲートレートを変えるか、そしてターゲティング、モデルが解決できない問題に対してデリゲートが増大するかどうか、そしてそれらに対して可能な限り減少する。
9つの小規模から中級のオープンウェイト推論モデル(Qwen、Gemma、GLM)と2つのタスクのうち、モデルは常に敏感である。
誘導されたフリップの中央値は42%で、ランダム選択ベースライン上では+2パーセンテージのリフトのみである。
したがって、信頼言語はデリゲートの強力な制御面であるが、現在のモデルは実際の能力に応じて弱くしか使用しない。
ナッジビリティは、内因性自己回帰メカニズムが成熟したとして、感度とターゲティングの両方を評価するための、単純で訓練後の自由な方法を提供する。
関連論文リスト
- When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment [76.62469105933384]
大規模言語モデル (LLM) は、ある答えにたどり着くためのショートカットを頼りにし、その決定を合理化する。
ConfLensは、推論を通じて最終的な回答における信頼の進化を追跡するフレームワークです。
本稿では,解答コミットメントに対する確率分布のエントロピーを測定するために,DACS(Distributal Answer Commitment Score)を提案する。
論文 参考訳(メタデータ) (2026-09-28T13:00:25Z) - When Confidence Signals Disagree: Local and Global Confidence in Autoregressive Language Models [0.0]
自己回帰言語モデルにおいて,異なる信頼度が経験的に交換可能であるかを検討する。
MMLU と ARC Challenge 全体では、2つの信号は弱い相関関係にあり、その正しさと大きく異なる。
より大きい局所-グローバル信頼ギャップは、より高い回答エントロピー、より明確なサンプル回答、低いモーダル・アンサー濃度と関連している。
論文 参考訳(メタデータ) (2026-09-15T10:08:48Z) - Can LLMs Reliably Self-Report Adversarial Prefills, and How? [9.80193616788089]
大規模言語モデル(LLM)は,良質なタスクに対して内観的能力を示すことを示す。
本研究は,モデルが先行応答が逆プレフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-22T17:56:30Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - LLMs Show No Signs Of Individuated Metacognition [0.023227405857540805]
20大言語モデルから二項信頼判断を分解する。
信頼性が異なる2つのモデルも性能が異なるかどうかを問う。
いずれの検査領域においても,有意な弁別メタ認知の証拠は見つからない。
論文 参考訳(メタデータ) (2026-05-22T23:54:33Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - Early Stopping for Large Reasoning Models via Confidence Dynamics [55.67938134245981]
大きな推論モデルは複雑な問題を解決するために長い連鎖生成に依存している。
重要な課題は、いつモデルが推論を止めて最終回答を生み出すべきかを決定することです。
中間回答の信頼性のダイナミクスを利用して推論をいつ終了するかを判断する早期停止手法であるCoDE-Stopを提案する。
論文 参考訳(メタデータ) (2026-04-06T17:59:45Z) - From Emergence to Control: Probing and Modulating Self-Reflection in Language Models [23.176641726866105]
自己回帰は、検証可能な報酬を伴う強化学習によって実現される強力な行動である。
自己回帰は微調整モデルに限らないことを示す。
論文 参考訳(メタデータ) (2025-06-13T20:40:13Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。