論文の概要: Confidence is Not Competence
- arxiv url: http://arxiv.org/abs/2510.24772v1
- Date: Fri, 24 Oct 2025 17:22:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-30 15:50:44.479167
- Title: Confidence is Not Competence
- Title(参考訳): 信頼は能力ではない
- Authors: Debdeep Sanyal, Manya Pandey, Dhruv Kumar, Saurabh Deshpande, Murari Mandal,
- Abstract要約: 生成前評価と解法実行の2段階にわたる内部状態の幾何を解析する。
思考から行動機械への幾何学的複雑さの急激な減少は、自信と能力のギャップを機械的に説明する。
- 参考スコア(独自算出の注目度): 7.094715131203088
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) often exhibit a puzzling disconnect between their asserted confidence and actual problem-solving competence. We offer a mechanistic account of this decoupling by analyzing the geometry of internal states across two phases - pre-generative assessment and solution execution. A simple linear probe decodes the internal "solvability belief" of a model, revealing a well-ordered belief axis that generalizes across model families and across math, code, planning, and logic tasks. Yet, the geometries diverge - although belief is linearly decodable, the assessment manifold has high linear effective dimensionality as measured from the principal components, while the subsequent reasoning trace evolves on a much lower-dimensional manifold. This sharp reduction in geometric complexity from thought to action mechanistically explains the confidence-competence gap. Causal interventions that steer representations along the belief axis leave final solutions unchanged, indicating that linear nudges in the complex assessment space do not control the constrained dynamics of execution. We thus uncover a two-system architecture - a geometrically complex assessor feeding a geometrically simple executor. These results challenge the assumption that decodable beliefs are actionable levers, instead arguing for interventions that target the procedural dynamics of execution rather than the high-level geometry of assessment.
- Abstract(参考訳): 大規模言語モデル(LLM)は、しばしば、主張された信頼と実際の問題解決能力の間に曖昧な断絶を示す。
生成前評価と解法実行の2段階にわたる内部状態の幾何学を解析することにより、この疎結合の力学的な説明を提供する。
単純な線形プローブはモデルの内部の「可解性信念」をデコードし、モデルファミリー、数学、コード、計画、論理的タスクをまたいだ一般化された信念軸を明らかにする。
しかし、測地線は発散する - 信念は線型退化可能であるが、アセスメント多様体は主成分から測定されるような高い線型実効次元を持ち、その後の推論トレースはより低次元の多様体上で進化する。
この思考から行動機械への幾何学的複雑さの急激な減少は、信頼性-競合ギャップを機械的に説明する。
信念軸に沿ったステア表現の因果介入は最終解をそのまま残し、複素アセスメント空間における線形ヌッジが実行の制約されたダイナミクスを制御しないことを示す。
そこで、幾何学的に複雑なアセスメント器で、幾何学的に単純なエグゼキュータを供給している2システムアーキテクチャを明らかにした。
これらの結果は、デオード可能な信念は行動可能なレバーである、という仮定に挑戦し、代わりに、高いレベルの評価の幾何学よりも、実行の手続き的ダイナミクスをターゲットとする介入について議論した。
関連論文リスト
- How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning [17.18771466838129]
複雑な幾何学的問題を解くには、本質的にインターリーブな推論が必要である。
提案手法は,プロット・ソリューション・データに対するスーパーバイザード・ファイン・チューニング (SFT) によって推論性能が著しく低下することを示した。
表面模倣を超えた3つのカジュアルな制約を強制する強化学習フレームワークであるFairを提案する。
論文 参考訳(メタデータ) (2026-03-01T12:18:12Z) - Rectifying Geometry-Induced Similarity Distortions for Real-World Aerial-Ground Person Re-Identification [4.039576422478934]
航空地上人物再識別(AG-ReID)は、極端な視点と距離の相違により根本的な課題である。
既存の手法は幾何学的特徴学習や外観条件付きプロンプトに依存している。
Geometry-induced Query-Key Transformation (GIQT) は、カメラ幾何学におけるクエリキーの相互作用を条件に、類似性空間を補正する軽量な低ランクモジュールである。
論文 参考訳(メタデータ) (2026-01-29T08:41:42Z) - Scale-Consistent State-Space Dynamics via Fractal of Stationary Transformations [9.983526161001997]
最近のディープラーニングモデルは、中間表現の妥当性に関する構造的な保証なしに、ますます深度に依存している。
我々は、状態空間モデルのスケール一貫性潜在力学の構造的要件を定式化することにより、この制限に対処する。
我々は予測されたスケール一貫性の挙動を実証的に検証し、適応効率がアライメントされた潜在幾何学から現れることを示す。
論文 参考訳(メタデータ) (2026-01-27T12:44:20Z) - TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning [104.66714520975837]
古典的タングラムゲームのレンズを通して構成空間推論を評価するために,幾何グラウンドのベンチマークを導入する。
本稿では,タングラム集合を正確に機械で検証可能な座標仕様でグルーピングする記号幾何学的枠組みであるタングラム構成式(TCE)を提案する。
MLLMは、幾何学的制約を無視しながら、ターゲットのシルエットとのマッチングを優先する傾向がある。
論文 参考訳(メタデータ) (2026-01-23T07:35:05Z) - Geometric and Dynamic Scaling in Deep Transformers [13.697614668609205]
我々は、ディープトランスフォーマーの崩壊は基本的に幾何学的な問題であると主張する。
2つの原則によりこれらの障害に対処する統一的な幾何学的枠組みを提案する。
超深層ネットワークにおけるランク崩壊を回避するためには, 動的消去を許容しながら幾何的妥当性を強制することが重要であると予測した。
論文 参考訳(メタデータ) (2026-01-03T00:41:46Z) - GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation [48.04396968707237]
幾何学的問題解決における4つの推論レベルを特徴とする階層型ベンチマークであるGeoBenchを提案する。
属性抽出から論理的誤り訂正まで,様々な機能を体系的に評価する。
これらの結果はGeoBenchを総合的なベンチマークとして確立し、幾何学的問題解決システムを開発するための実用的なガイドラインを提供する。
論文 参考訳(メタデータ) (2025-12-30T09:56:37Z) - Geometrically-Constrained Agent for Spatial Reasoning [53.93718394870856]
視覚言語モデルは空間的推論において基本的な意味-幾何学的ギャップを示す。
現在のパラダイムは、このギャップを埋めることに失敗します。
本稿では,形式的タスク制約を導入することにより,このギャップを解消する学習自由エージェントパラダイムを提案する。
論文 参考訳(メタデータ) (2025-11-27T17:50:37Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought [64.43689151961054]
有向グラフ到達性問題に対する簡易な2層変圧器のトレーニング力学を理論的に解析する。
分析の結果,連続的思考を用いたトレーニングでは,まずインデックスマッチングロジットが増加し,その後は軽度な仮定の下で拘束されることがわかった。
論文 参考訳(メタデータ) (2025-09-27T15:23:46Z) - REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model [29.40036398095681]
推論多様体(Reasoning Manifold)は、すべての正しく推論された世代に対応する内部表現によって形成される潜在低次元幾何学構造である。
誤りと正しい推論サンプルに対応する内部モデル表現の空間的関係を定量的に比較することにより,障害の起源を説明するフレームワークであるREMAを構築した。
多様な言語およびマルチモーダルモデルおよびタスクに関する実験は、推論多様体の低次元の性質と誤った推論表現と正しい推論表現の間の高い分離性を示す。
論文 参考訳(メタデータ) (2025-09-26T16:02:27Z) - Information-Theoretic Bounds and Task-Centric Learning Complexity for Real-World Dynamic Nonlinear Systems [0.6875312133832079]
動的非線形系は静的および動的効果の結合による歪みを示す。
本稿では, 構造化分解, 分散解析, タスク中心の複雑性境界に基づく理論的枠組みを提案する。
論文 参考訳(メタデータ) (2025-09-08T12:08:02Z) - A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap [0.39073867995073247]
我々は、観測された失敗は基本的な認知境界の証拠ではなく、システムレベルの制約の予測可能な結果であると主張している。
当初、テキストのみの世代に限定してパズルを宣言することは不可能であると宣言されたモデルは、現在ではエージェントツールを使用して解決するだけでなく、それまで克服できなかった難易度をはるかに超える複雑さを習得している。
論文 参考訳(メタデータ) (2025-06-23T17:14:21Z) - Decoder ensembling for learned latent geometries [15.484595752241122]
我々は、関連する予想多様体上の測地線を容易に計算する方法を示す。
このシンプルで信頼性が高く、簡単に使える潜在測地に一歩近づきます。
論文 参考訳(メタデータ) (2024-08-14T12:35:41Z) - Understanding Augmentation-based Self-Supervised Representation Learning
via RKHS Approximation and Regression [53.15502562048627]
最近の研究は、自己教師付き学習とグラフラプラシアン作用素のトップ固有空間の近似との関係を構築している。
この研究は、増強に基づく事前訓練の統計的分析に発展する。
論文 参考訳(メタデータ) (2023-06-01T15:18:55Z) - Linear Adversarial Concept Erasure [108.37226654006153]
与えられた概念に対応する線形部分空間の同定と消去の問題を定式化する。
提案手法は, トラクタビリティと解釈性を維持しつつ, 深い非線形分類器のバイアスを効果的に軽減し, 高い表現性を有することを示す。
論文 参考訳(メタデータ) (2022-01-28T13:00:17Z) - Manifold Learning via Manifold Deflation [105.7418091051558]
次元削減法は、高次元データの可視化と解釈に有用な手段を提供する。
多くの一般的な手法は単純な2次元のマニフォールドでも劇的に失敗する。
本稿では,グローバルな構造を座標として組み込んだ,新しいインクリメンタルな空間推定器の埋め込み手法を提案する。
実験により,本アルゴリズムは実世界および合成データセットに新規で興味深い埋め込みを復元することを示した。
論文 参考訳(メタデータ) (2020-07-07T10:04:28Z) - On dissipative symplectic integration with applications to
gradient-based optimization [77.34726150561087]
本稿では,離散化を体系的に実現する幾何学的枠組みを提案する。
我々は、シンプレクティックな非保守的、特に散逸的なハミルトン系への一般化が、制御された誤差まで収束率を維持することができることを示す。
論文 参考訳(メタデータ) (2020-04-15T00:36:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。