論文の概要: Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning
- arxiv url: http://arxiv.org/abs/2605.23315v1
- Date: Fri, 22 May 2026 07:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.240077
- Title: Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning
- Title(参考訳): 理解のない収束: 言語モデルが表現に固執する時, 推論に異を唱える時
- Authors: Muhammad Usama, Dong Eui Chang,
- Abstract要約: 我々は,数学,科学,常識,真理にまたがる800の推論問題に対して,8つのファミリー(1.5Bから72Bパラメータ)から16の言語モデルにまたがる表現的類似性を評価する。
その結果、言語モデルにおける表現収束は、共有推論戦略よりも、共有入力処理制約を反映していることが示唆された。
- 参考スコア(独自算出の注目度): 8.695939803795499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models trained under diverse objectives and architectures have been shown to develop increasingly similar internal representations, an observation formalized as the Platonic Representation Hypothesis. Whether this representational convergence extends to the reasoning processes that operate over shared representations remains untested. We evaluate representational similarity across 16 language models from 8 families (1.5B to 72B parameters) on 800 reasoning problems spanning mathematics, science, commonsense, and truthfulness, stratifying by problem difficulty, computational stage, and causal relevance. Our analysis reveals three dissociations: a difficulty inversion, where models converge more on problems they collectively fail (Centered Kernel Alignment [CKA] = 0.897) than on those they solve (CKA = 0.830); a generation gap, where pre-decision representations align (CKA = 0.875) while post-decision representations diverge (CKA = 0.274); and epiphenomenal correctness, where shared information is decodable across models (66% transfer accuracy) but exerts minimal causal influence on predictions (1.5% to 5.5% flip rate across ablation protocols). These results indicate that representational convergence in language models reflects shared input processing constraints rather than shared reasoning strategies, with direct implications for ensemble design, interpretability transfer, and evaluations of model similarity. Code is available at https://github.com/Usama1002/convergence-without-understanding.
- Abstract(参考訳): 多様な目的とアーキテクチャの下で訓練された大規模な言語モデルは、プラトン表現仮説として形式化された、ますます類似した内部表現を開発することが示されている。
この表現収束が共有表現の上で作用する推論過程にまで拡張されるかどうかは、まだ証明されていない。
我々は,数学,科学,常識,真理にまたがる800の推論問題に対して,8つのファミリー(1.5Bから72Bのパラメータ)から16の言語モデルにまたがる表現的類似性を評価し,問題の難易度,計算段階,因果関係について検討した。
CKA = 0.830) と、事前決定表現が整合する(CKA = 0.875) と、後決定表現が発散する(CKA = 0.274) と、モデル間で共有情報が復調可能である(転送精度66%) が、アブレーションプロトコル間での因果的影響(1.5%から5.5%) である。
これらの結果から、言語モデルにおける表現収束は、共通推論戦略よりも共有入力処理制約を反映しており、アンサンブル設計、解釈可能性伝達、モデル類似性の評価に直接的な意味があることが示唆された。
コードはhttps://github.com/Usama1002/convergence-with-understanding.comで入手できる。
関連論文リスト
- Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models [0.30386424162918557]
大規模言語モデルがシンボルシステム間で共通の内部基質を共有することを示す。
中層にFARS(Format-Agnostic Reasoning Subspace)が存在することを示す。
また、宣言的-手続き的非対称性も発見する:表現は、いずれかまたはコードよりも、散文と数学の間でより互換性がある。
論文 参考訳(メタデータ) (2026-05-10T12:06:48Z) - Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale [40.31924374728614]
プラトン表現仮説(Platonic Representation hypothesis)は、異なるモダリティで訓練されたニューラルネットワークが一致し、最終的に同じ現実の表現に向かって収束することを示唆している。
この仮説の実験的証拠は脆弱であり, 評価体制に大きく依存していることが示唆された。
論文 参考訳(メタデータ) (2026-04-20T17:56:02Z) - Measuring Representation Robustness in Large Language Models for Geometry [7.743292557234699]
幾何学において、同一の問題はユークリッド、座標、ベクトル形式で表すことができる。
既存のベンチマークでは、固定フォーマットの精度が報告されている。
表現対応評価フレームワークGeoRepEvalを提案する。
論文 参考訳(メタデータ) (2026-04-03T11:36:49Z) - AI Mental Models: Learned Intuition and Deliberation in a Bounded Neural Architecture [0.0]
本稿では,有界なニューラルアーキテクチャが,シロジカル推論ベンチマーク上での直観と熟考の間に有意義な分断を生じさせるかどうかを問う。
実験1では、5倍のクロスバリデーションの下で、完全な9方向の人間の応答分布を予測するための直接神経ベースラインを評価した。
実験2では、計算的精神モデル理論に動機づけられた、直観と熟考の別々の経路を持つ有界なデュアルパスアーキテクチャを導入する。
論文 参考訳(メタデータ) (2026-03-23T20:44:38Z) - Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models [50.99097734404912]
RLフレンドリなモデルでは, クラス内コンパクト性やクラス間分離が, 正誤応答に対する確率割当に現れることを示す。
6つの数学ベンチマークによる実験では、すべてのモデルファミリで一貫した改善が見られ、AIME24では5.9ポイントまで向上した。
論文 参考訳(メタデータ) (2026-01-11T13:34:44Z) - CLEAR-3K: Assessing Causal Explanatory Capabilities in Language Models [3.137688620241855]
CLEAR-3Kは、ある文が別の文を因果的に説明するかどうかを言語モデルが判断できるかどうかを評価するために設計された、3000のアサーション推論質問のデータセットである。
各質問は、意味的関連性と真の因果的説明的関係を区別するために、アサーションとアサーションのペアと挑戦言語モデルを示す。
論文 参考訳(メタデータ) (2025-06-20T17:35:36Z) - Self-supervised Analogical Learning using Language Models [59.64260218737556]
自己教師型アナログ学習フレームワークであるSALを提案する。
SALは人間の類推過程を模倣し、高品質な記号解を明示的に伝達するようモデルを訓練する。
得られたモデルは、幅広い推論ベンチマークでベース言語モデルより優れていることを示す。
論文 参考訳(メタデータ) (2025-02-03T02:31:26Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - Beyond Instance Discrimination: Relation-aware Contrastive
Self-supervised Learning [75.46664770669949]
本稿では,関係認識型コントラスト型自己教師型学習(ReCo)をインスタンス関係に統合するために提案する。
当社のReCoは、常に顕著なパフォーマンス改善を実現しています。
論文 参考訳(メタデータ) (2022-11-02T03:25:28Z) - On the Strong Correlation Between Model Invariance and Generalization [54.812786542023325]
一般化は、見えないデータを分類するモデルの能力をキャプチャする。
不変性はデータの変換におけるモデル予測の一貫性を測定する。
データセット中心の視点から、あるモデルの精度と不変性は異なるテストセット上で線形に相関している。
論文 参考訳(メタデータ) (2022-07-14T17:08:25Z) - Causal Expectation-Maximisation [70.45873402967297]
ポリツリーグラフを特徴とするモデルにおいても因果推論はNPハードであることを示す。
我々は因果EMアルゴリズムを導入し、分類的表現変数のデータから潜伏変数の不確かさを再構築する。
我々は、反事実境界が構造方程式の知識なしにしばしば計算できるというトレンドのアイデアには、目立たずの制限があるように思える。
論文 参考訳(メタデータ) (2020-11-04T10:25:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。