論文の概要: From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- arxiv url: http://arxiv.org/abs/2609.23065v2
- Date: Wed, 23 Sep 2026 16:40:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.664193
- Title: From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- Title(参考訳): 概念的アライメントから因果的グラウンドリングへ--チェーン・オブ・サート・フェイントフルネスの介入テスト-
- Abstract要約: チェーン・オブ・シント(CoT)は、モデルの基本的推論に不信感を抱いているように思える。
私たちは内的概念の根拠として忠実を説いた。
本稿では,概念レベルのアライメントの相関尺度を3つ導入し,因果指標として$p$を導入し,共有概念を非難し,解答確率の低下を計測する。
- 参考スコア(独自算出の注目度): 47.3792127620216
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) can sound plausible yet be unfaithful to the model's underlying reasoning. Most prior work probes CoT faithfulness through input--output behavior or input attributions, leaving internal computation largely underexplored. We instead cast faithfulness as internal concept grounding: Does a large language model's (LLM) CoT reasoning engage the same internal concepts that support the LLM's direct prediction, and do the shared concepts causally drive its answer? Encoding a prediction pass and a CoT pass with a single shared sparse autoencoder (SAE), a reliable approximator of the latent concepts LLMs use, makes their internal concepts directly comparable. We introduce three correlational metrics of concept-level alignment and a causal metric, $Δp$, which ablates the shared concepts and measures the drop in answer probability. Across five LLMs and four datasets, concept alignment is generally high, as indicated by the correlational metrics; yet these only identify which concepts are shared, not how much they causally contribute. $Δp$ fills this gap: causal faithfulness varies substantially with model depth, peaking at mid-to-late layers rather than the final ones, and model scale reshapes the layer-wise profile. Moreover, causally important shared concepts are not always verbalized in the CoT. These dissociations suggest that faithfulness cannot be reliably assessed from surface-level or representational correspondence alone; assessing it requires causal tests of whether the internal concepts underlying a CoT actually drive the model's prediction.
- Abstract(参考訳): チェーン・オブ・シント(CoT)は、モデルの基本的推論に不信感を抱いているように思える。
これまでのほとんどの作業は、入出力動作や入出力属性を通じてCoTの忠実さを調査し、内部計算はほとんど探索されていない。
大きな言語モデル(LLM)のCoT推論は、LLMの直接予測をサポートする同じ内部概念に関わり、共有された概念がその答えを因果的に導くか?
予測パスとCoTパスを1つの共有スパースオートエンコーダ(SAE)で符号化する。
本稿では,概念レベルのアライメントの相関尺度を3つ導入し,因果指標として$Δp$を導入する。
5つのLLMと4つのデータセットにまたがって、相関メトリクスによって示されるように、概念のアライメントは一般的に高い。
因果的忠実度はモデル深度とともに大きく変化し、最終層よりも中から後期層にピークを迎え、モデルスケールはレイヤワイズプロファイルを満足させる。
さらに、因果的に重要な共有概念は、必ずしもCoTで言語化されるわけではない。
これらの解離は、忠実性は表面レベルまたは表現的対応だけでは確実に評価できないことを示唆している。
関連論文リスト
- A Geometric Unification of Concept Learning with Concept Cones [58.70836885177496]
解釈可能性の2つの伝統は、並べて進化してきたが、互いに話すことはめったにない:概念ボトルネックモデル(CBM)とスパースオートエンコーダ(SAE)。
両パラダイムが同じ幾何学的構造をインスタンス化することを示す。
CBMは人間の定義した参照ジオメトリを提供するが、SAEは学習した円錐がCBMをどの程度よく近似するか、あるいは包含しているかによって評価することができる。
論文 参考訳(メタデータ) (2025-12-08T09:51:46Z) - I Predict Therefore I Am: Is Next Token Prediction Enough to Learn Human-Interpretable Concepts from Data? [76.15163242945813]
大規模言語モデル (LLM) は、多くの人が知能の形式を示すと結論づけている。
本稿では,潜在離散変数として表現される人間解釈可能な概念に基づいてトークンを生成する新しい生成モデルを提案する。
論文 参考訳(メタデータ) (2025-03-12T01:21:17Z) - On the Concept Trustworthiness in Concept Bottleneck Models [39.928868605678744]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、推論プロセスを、概念マッピングと概念ラベル予測に分解する。
概念からラベルへの予測の透明性にもかかわらず、入力から中間概念へのマッピングはブラックボックスのままである。
概念が関連する領域から導出されているかどうかを評価するために、概念信頼性スコアと呼ばれる先駆的な指標が提案されている。
拡張されたCBMを導入し、特徴マップの異なる部分から概念予測を具体的に行えるようにした。
論文 参考訳(メタデータ) (2024-03-21T12:24:53Z) - Predictive Churn with the Set of Good Models [61.00058053669447]
本稿では,予測的不整合という2つの無関係な概念の関連性について考察する。
予測多重性(英: predictive multiplicity)は、個々のサンプルに対して矛盾する予測を生成するモデルである。
2つ目の概念である予測チャーン(英: predictive churn)は、モデル更新前後の個々の予測の違いを調べるものである。
論文 参考訳(メタデータ) (2024-02-12T16:15:25Z) - Can we Constrain Concept Bottleneck Models to Learn Semantically Meaningful Input Features? [0.6401548653313325]
概念ボトルネックモデル(CBM)は、人間の定義した概念の集合を最初に予測するため、本質的に解釈可能であるとみなされる。
現在の文献では、概念予測は無関係な入力特徴に依存することが多いことを示唆している。
本稿では,CBMが概念を意味的に意味のある入力特徴にマッピングできることを実証する。
論文 参考訳(メタデータ) (2024-02-01T10:18:43Z) - Do Concept Bottleneck Models Respect Localities? [14.77558378567965]
概念に基づく説明可能性法は、人間の理解可能な仲介者を用いて機械学習モデルの説明を生成する。
我々は、概念予測者が「関連」機能を利用して予測を行うかどうかを評価する。
概念予測器は必ずしも明確な概念を区別できないため、実際には多くの概念ベースモデルは局所性を尊重しない。
論文 参考訳(メタデータ) (2024-01-02T16:05:23Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - Causality-aware Concept Extraction based on Knowledge-guided Prompting [17.4086571624748]
概念は自然言語理解の恩恵を受けるが、既存の知識グラフ(KG)では完全とは程遠い。
近年,テキストベースの概念抽出において,事前学習言語モデル (PLM) が広く用いられている。
本稿では, PLM を用いた抽出器に知識誘導型プロンプトを装着することで, 概念バイアスを軽減することを提案する。
論文 参考訳(メタデータ) (2023-05-03T03:36:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。