論文の概要: Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
- arxiv url: http://arxiv.org/abs/2608.29464v2
- Date: Tue, 01 Sep 2026 10:45:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.621834
- Title: Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
- Title(参考訳): 推論モデルにおける係り受けの忠実さ : 推論キューの届け先と提供方法
- Authors: Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini,
- Abstract要約: CoT(Chain-of- Thought)モニタリングは、推論トレースがモデルの回答を形作る情報を忠実に記録していると仮定する。
FACE-Evalは5,100サンプルの評価で、キュー位置(ユーザメッセージやツールリターン)と明示性を変化させる。
本研究は, クエフォロー回答の言語化コミットメントと, クエッドサンプルの非言語化導入度を測定した。
- 参考スコア(独自算出の注目度): 21.068964945790466
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) monitoring assumes that reasoning traces faithfully record the information that shapes a model's answer. Existing faithfulness tests often place explicit bias cues in the user message, while agents may encounter preferences through tool returns or raw artifacts. We introduce FACE-Eval (Faithful Attribution of Cue Effects Evaluation), a 5,100-sample evaluation that varies cue location (user message or tool return) and explicitness (direct summary or raw artifact). We measure verbalized commitment among cue-following answers and unverbalized adoption among all cued samples. We evaluate 15 open-weight models from eight families, with total parameters ranging from 4B to 1.60T. Every model has lower verbalized commitment for tool-return than user-message cues and for implicit than explicit cues. Unverbalized adoption is higher for tool-return cues on all 15 models and for implicit cues in 28 of 30 model-channel comparisons. A source-attribution prompt narrows the channel gap on seven models, sometimes by increasing user-channel unverbalized adoption, while telling models that their reasoning will be monitored does not reliably close the gap. We also use two transcript monitors (GPT-5.6-Luna and GPT-4o-mini) to detect preference adoption in the largest model of each family. Across 32 model-channel-explicitness cells, higher unverbalized adoption is associated with lower detection ability for both monitors (Pearson r=-0.54 and r=-0.78, respectively). These results suggest that CoT monitoring may be less reliable when preference information arrives through tools or must be inferred from raw artifacts, within the single-call, prefilled-tool setting tested here.
- Abstract(参考訳): CoT(Chain-of- Thought)モニタリングは、推論トレースがモデルの回答を形作る情報を忠実に記録していると仮定する。
既存の忠実度テストは、しばしばユーザーメッセージに明示的な偏見を与えるが、エージェントはツールリターンや生のアーティファクトを通じて好みに遭遇することがある。
FACE-Eval (Faithful Attribution of Cue Effects Evaluation) は5,100サンプルの評価で、キュー位置(ユーザメッセージやツールリターン)と明示性(直接要約や生のアーティファクト)が変化する。
本研究は, クエフォロー回答の言語化コミットメントと, クエッドサンプルの非言語化導入度を測定した。
我々は8家系の15のオープンウェイトモデルを評価し,総パラメータは4Bから1.60Tである。
どのモデルも、ユーザーメッセージのキューよりもツールリターン、明示的なキューよりも暗黙的なコミットメントを言葉で表しています。
全15モデルのツール・リターンキューや、30のモデル・チャネル比較のうち28の暗黙のキューでは、非言語化の採用がより高い。
ソース属性によって、7つのモデルのチャネルギャップが狭まり、時にはユーザチャネルの非言語化が増加する。
また、2つの転写モニター(GPT-5.6-Luna と GPT-4o-mini)を用いて、各家系の最大のモデルにおいて、好みの適応を検出する。
32以上のモデルチャネル特異性細胞では、高い非バーバル化が両方のモニター(Pearson r=-0.54 と r=-0.78)の検出能力の低下と関連している。
これらの結果は、CoTの監視がツールを介して優先情報が到着した場合や、ここでテストされたシングルコールでプリフィルされたツール設定内で、生のアーティファクトから推測される場合、信頼性が低いことを示唆している。
関連論文リスト
- One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions [0.0]
APIアグリゲータ、再販業者、推論プロバイダは、大きな言語モデル(LLM)を使用する。
既存の識別技術には、長いテキスト、トークンレベルのログ確率、反対に作られたプロンプト、またはモデル所有者の協力が必要である。
我々は,LLMの行動指紋を,自明なワンワードプロンプトに対する応答の実証的分布として定義する。
論文 参考訳(メタデータ) (2026-07-11T10:34:17Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models? [0.0]
CoT(Chain-of- Thought)推論は、安全クリティカルなデプロイメントにおける大規模言語モデルの透明性メカニズムとして提案されている。
本研究では,9つの建築家族を対象としたオープンウェイト推論モデルを498の質問に対して検討した。
41,832回の推論では、全体の忠実度は39.7% (Seed-1.6-Flash) から89.9% (DeepSeek-V3.2- Speciale) まで変化している。
論文 参考訳(メタデータ) (2026-03-23T21:21:37Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Stated Preference for Interaction and Continued Engagement (SPICE): Evaluating an LLM's Willingness to Re-engage in Conversation [0.0]
Stated Preference for Interaction and Continued Engagement (SPICE)は、大規模言語モデルにYESまたはNO質問をすることで引き起こされる単純な診断信号である。
10-interactionstimul setによる3-tone(親しみやすい,不明瞭,嫌悪感)を用いた実験では,4つのフレーミング条件で4つのオープンウェイトチャットモデルを検証した。
友好的な相互作用は継続をほぼ一様に好んだ(97.5% YES)が、虐待的相互作用は断念を強く好んだ(17.9% YES)
論文 参考訳(メタデータ) (2025-09-10T22:34:17Z) - Model Equality Testing: Which Model Is This API Serving? [59.005869726179455]
APIプロバイダは、基本モデルの定量化、透かし、微調整を行い、出力分布を変更することができる。
モデル平等テスト(Model Equality Testing)は,2サンプルテスト問題である。
単純な文字列カーネル上に構築されたテストは、歪みの範囲に対して77.4%の中央値を達成する。
論文 参考訳(メタデータ) (2024-10-26T18:34:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。