論文の概要: Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations
- arxiv url: http://arxiv.org/abs/2607.07229v1
- Date: Wed, 08 Jul 2026 10:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.351126
- Title: Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations
- Title(参考訳): Reasoning Consistency Scanning:AI安全性評価におけるチェーン・オブ・ワットの妥当性を監査するためのフレームワーク
- Abstract要約: 連鎖推論の不整合を検出する再利用可能な方法である推論整合性スキャンを導入する。
まず,一貫性を忠実性とは異なるものとして定式化し,矛盾性の6つの亜型分類を定式化する。
第3に、インスツルメンタルEval出力から手動で適応した60文字の検証済みのベンチマークを構築します。
第4に、4つのジェネレータモデルと3つのインスペクタ_evalsの評価結果について報告し、推論の不整合が存在し、検出可能であり、モデルとタスクタイプの両方で体系的に変化することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prior work has shown that chain-of-thought (CoT) reasoning is often unfaithful: a model's stated reasoning does not reliably reflect the process that produced its output. Detecting unfaithfulness, though, requires controlled experimental interventions, which cannot be applied to evaluation transcripts after the fact. We turn instead to a more tractable question that has received less attention: whether the stated reasoning is logically consistent with the answer it accompanies. Unlike faithfulness, consistency can be assessed from a transcript alone, with no intervention. We introduce reasoning consistency scanning, a reusable method for detecting this property in AI safety evaluation transcripts. Our contributions are fourfold. First, we formalize reasoning consistency as distinct from faithfulness and define a six-subtype taxonomy of inconsistency. Second, we build a validated benchmark of 60 transcripts, manually adapted from InstrumentalEval outputs. Third, we implement a working scanner for InspectScout, the first to target this property in safety evaluation transcripts. Fourth, we report results across four generator models and three evaluations from inspect_evals, showing that reasoning inconsistency is present, detectable, and varies systematically across both models and task types.
- Abstract(参考訳): モデルが主張する推論は、その出力を生み出す過程を確実に反映していない。
しかし、不誠実さを検出するには、制御された実験的介入が必要である。
代わりに、より難解な質問に目を向け、より注意を引いた: 主張された推論が、それに伴う答えと論理的に一致しているかどうか。
忠実さとは違って、一貫性は書面のみから評価でき、介入は不要である。
本稿では,AIの安全性評価書面に再利用可能な手法である推論整合性スキャンを導入する。
私たちの貢献は4倍です。
まず,一貫性を忠実性とは異なるものとして定式化し,矛盾性の6つの亜型分類を定式化する。
第2に、インスツルメンタルEval出力から手動で適応した60文字の検証済みのベンチマークを構築します。
InspectScout の動作スキャナを実装し,安全評価書面でこの特性を最初にターゲットとした。
第4に、4つのジェネレータモデルと3つのインスペクタ_evalsの評価結果について報告し、推論の不整合が存在し、検出可能であり、モデルとタスクタイプの両方で体系的に変化することを示す。
関連論文リスト
- The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics [0.9668407688201359]
チェーン・オブ・思想(CoT)推論は、大きな言語モデル(LLM)のパフォーマンスを改善する。
言語化されたCoTを利用して推論の正しさをモニタリングする既存のアプローチは、個々の中間ステップの意味的正しさまたは整合性を大きく評価する。
機能障害は、可視的推論の構造において、タスク依存の分散変化として表れることを示す。
論文 参考訳(メタデータ) (2026-08-04T08:04:36Z) - Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong [1.2744523252873352]
ブラックボックス(行動)によるFaithCoT-Benchの人間のアノテーションに対する不誠実なCoTの検出。
答えの正しさはあらゆるレベルで問題を構成する。
論文 参考訳(メタデータ) (2026-07-26T04:43:53Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models [7.185483586381928]
マルチターン推論モデルの故障は終端スコア評価にはほとんど見えない。
モデルは長い対話の早い段階で安全でないスタンスにロックすることができるが、その最終ターンの拒絶率は、堅牢に整列されたベースラインと区別できないように見える。
本稿では,CoT出力2x2安全行列のトレースレベル診断を提案する。
論文 参考訳(メタデータ) (2026-06-09T11:50:28Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models [14.927545906619295]
大規模言語モデルは、複雑なタスクを解決するために明示的なチェーン・オブ・シンク(CoT)推論にますます依存している。
LLMの安全性に関する既存の研究は、コンテンツ安全性に焦点を当てている。
我々は、推論の安全性をセキュリティの側面として認識する:モデルの推論の軌道が論理的に一貫したものであるという要求。
論文 参考訳(メタデータ) (2026-03-26T13:08:56Z) - Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations [60.27156500679296]
系統的な推論連鎖の摂動とデリバリートーンの操作による道徳シナリオにおけるCoT(Chain-of-Thought)の説明の役割について検討した。
1) 利用者は, 根拠に欠陥がある場合でも, 信頼感を保ち, 結果合意を信頼する傾向がみられた。
これらの結果は、CoTの説明が同時に明確化と誤解を招き、視覚的信頼よりも精査と批判的思考を奨励する説明を提供するNLPシステムの必要性を強調している。
論文 参考訳(メタデータ) (2025-11-15T02:38:49Z) - Logical Satisfiability of Counterfactuals for Faithful Explanations in
NLI [60.142926537264714]
本稿では, 忠実度スルー・カウンタファクトの方法論について紹介する。
これは、説明に表される論理述語に基づいて、反実仮説を生成する。
そして、そのモデルが表現された論理と反ファクトの予測が一致しているかどうかを評価する。
論文 参考訳(メタデータ) (2022-05-25T03:40:59Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。