論文の概要: When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models
- arxiv url: http://arxiv.org/abs/2609.02438v1
- Date: Wed, 02 Sep 2026 11:01:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.238633
- Title: When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models
- Title(参考訳): 認知度が十分でない場合:言語モデルにおける論理的妥当性表現、行動解離、因果判定
- Abstract要約: 5つのオープンウェイト変圧器モデルにおける論理的検証について検討する。
ほぼ簡潔な行動性能にもかかわらず、論理的妥当性は隠れた状態からほぼ完全に排除可能である。
以上の結果から, 妥当性を示唆し, 行動で表現し, 因果的に使用することは異なることが示唆された。
- 参考スコア(独自算出の注目度): 2.5819252531158683
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models can look capable of logical reasoning, but correct or incorrect answers alone tell us little about what the model represents internally. We study logical verification in five open-weight transformer models using matched valid--invalid premise--claim pairs that vary across inference families, semantic domains, templates, and difficulty levels. Despite near-chance behavioral performance, logical validity is often almost perfectly decodable from hidden states and remains strongly decodable under held-out templates, domains, and inference families. Validity also remains highly decodable on behaviorally incorrect examples in the conditions where correctness-conditioned evaluation is well defined. At the same time, exhaustive leave-one-out tests reveal clear limits to this generalization, and interventions along probe-derived validity directions have only weak, nonspecific effects compared with random controls. Our results suggest that representing validity, expressing it in behavior, and using it causally are distinct. Validity related information can be strongly decodable from a model's hidden states without being reliably expressed in its output.
- Abstract(参考訳): 大規模言語モデルは論理的推論が可能であるように見えるが、正しいか間違った答えだけで、モデルの内部で何を表現しているのかをほとんど教えてくれない。
提案手法は,提案手法に適合する有意な前提条件を用いた5つのオープンウェイト変圧器モデルにおける論理的検証について検討する。
ほぼ簡潔な振る舞いのパフォーマンスにもかかわらず、論理的妥当性は隠れた状態からほぼ完全に退避可能であり、保持されたテンプレート、ドメイン、推論ファミリの下では強く退避可能である。
正当性条件評価が適切に定義されている条件下では、動作上の誤った例に対して、妥当性も高い傾向が保たれている。
同時に、徹底的なアウトアウトテストは、この一般化の明確な限界を明らかにし、プローブ由来の妥当性方向に沿った介入は、ランダム制御と比較して弱く、非特異的な効果しか示さない。
以上の結果から, 妥当性の表現, 行動表現, 因果的使用は別物であることが示唆された。
妥当性関連情報は、その出力に確実に表現されることなく、モデルの隠れた状態から強く削除することができる。
関連論文リスト
- Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models [56.88565331713778]
推論指向のトレーニングは、モデル正しさに最も結びついている振る舞いを増幅することなく、トレースをより熟考的に見せることができる。
このミスマッチを、モデル推論トレースにおける振る舞いの有無に対して、振舞いがどの程度の正確性を変えるかを測定するメトリクスである振舞いリフトと定量化します。
我々は、思考モデルが自己認識、仮説テスト、不確実性認知を強く増幅する増幅自由ギャップの証拠を見つける。
論文 参考訳(メタデータ) (2026-08-13T20:37:59Z) - The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics [0.9668407688201359]
チェーン・オブ・思想(CoT)推論は、大きな言語モデル(LLM)のパフォーマンスを改善する。
言語化されたCoTを利用して推論の正しさをモニタリングする既存のアプローチは、個々の中間ステップの意味的正しさまたは整合性を大きく評価する。
機能障害は、可視的推論の構造において、タスク依存の分散変化として表れることを示す。
論文 参考訳(メタデータ) (2026-08-04T08:04:36Z) - Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers [0.7212939068975618]
言語モデルはそれらの予測に対して妥当な有理性を生成することができるが、これらの説明はモデルの内部的推論を忠実に表すものではないかもしれない。
本稿では,インラインクレームを推論トレースに挿入するフレームワークである検証器結合推論を提案し,プログラム的検証器出力を予測するための補助整合ヘッドを訓練する。
整合性トレーニングは、検証情報を合理性表現から復調可能にしますが、復調性は忠実な生成を保証しません。
論文 参考訳(メタデータ) (2026-06-19T18:37:24Z) - Evaluating Bivariate Causal Statements Based on Mutual Compatibility [7.594559816880284]
我々は$n$変数の集合上で因果文を評価する方法を開発した。
信頼の前提に頼らずに、この可算性の概念を定量化する互換性スコアを導入する。
両スコアが、一般的な設定における誤った因果関係文と正しく区別できるという理論的および実証的な証拠を与える。
論文 参考訳(メタデータ) (2026-05-29T19:15:09Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - On the Identifiability of Steering Vectors in Large Language Models [0.0]
アクティベーションステアリング法は大規模言語モデルの振る舞いを制御するために広く用いられている。
この解釈は、操舵方向が入力出力動作から識別可能で一意に回復可能であることを暗黙的に仮定する。
操舵ベクトルは、行動的に区別不能な介入の大きな同値類のため、基本的には識別不可能であることを示す。
論文 参考訳(メタデータ) (2026-02-06T15:53:50Z) - Pushing the Boundaries of Natural Reasoning: Interleaved Bonus from Formal-Logic Verification [49.506412445511934]
大きな言語モデル(LLM)は目覚ましい能力を示すが、その次は論理的不整合と報奨ハックを生み出す。
本稿では,自然言語生成プロセスと形式的記号的検証を動的にインターリーブする形式論理検証誘導フレームワークを提案する。
我々はこのフレームワークを,形式論理検証誘導制御による微調整とポリシー最適化の相乗効果を生かした,新しい2段階のトレーニングパイプラインを通じて運用する。
論文 参考訳(メタデータ) (2026-01-30T07:01:25Z) - Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification [56.51953062869371]
DoVerifier は、因果表現が与えられた因果グラフから導出可能であるかどうかをdo-calculus と probability theory の規則を用いてチェックする記号検証器である。
因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果的因果
論文 参考訳(メタデータ) (2026-01-29T03:22:58Z) - Are Language Models Efficient Reasoners? A Perspective from Logic Programming [109.47572890883248]
現代言語モデル(LM)は、強い推論能力を示すが、標準的な評価は、人間のような推論の重要な側面である効率性を見越しながら、正確性を強調する。
本稿では、論理プログラミングのレンズを用いて、LM推論効率を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-29T15:30:31Z) - Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability [70.4107059502882]
有理数拡張による学習言語モデルは、多くの既存の作品において有益であることが示されている。
モデル性能に対する合理的性の影響を徹底的に調査するため、包括的調査を行う。
論文 参考訳(メタデータ) (2025-05-30T02:39:37Z) - Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering [14.298418197820912]
大規模言語モデル(LLM)は、しばしば推論の限界を示し、しばしば内容の妥当性を論理的妥当性と混同する。
これは偏りのある推論を生じさせ、そこではもっともらしい議論は論理的に妥当か、あるいはその逆であると見なされる。
本稿では,アクティベーションステアリングによる形式推論におけるコンテンツバイアス軽減の問題について検討する。
論文 参考訳(メタデータ) (2025-05-18T01:34:34Z) - Logical Satisfiability of Counterfactuals for Faithful Explanations in
NLI [60.142926537264714]
本稿では, 忠実度スルー・カウンタファクトの方法論について紹介する。
これは、説明に表される論理述語に基づいて、反実仮説を生成する。
そして、そのモデルが表現された論理と反ファクトの予測が一致しているかどうかを評価する。
論文 参考訳(メタデータ) (2022-05-25T03:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。