論文の概要: Correctness Is a Direction: Geometric Answer Selection in Language Models
- arxiv url: http://arxiv.org/abs/2610.04512v1
- Date: Sat, 03 Oct 2026 13:21:04 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:04:04.946869
- Title: Correctness Is a Direction: Geometric Answer Selection in Language Models
- Title(参考訳): 正しさは方向である:言語モデルにおける幾何学的アンサーの選択
- Abstract要約: スコアリング方向がゼロショットログ確率スコアよりも優れていることを示す。
事実推論、ドメイン知識、真性に対する正当性方向は表現空間においてほぼ直交である。
- 参考スコア(独自算出の注目度): 37.52103844741668
- License:
- Abstract: Answer correctness is encoded as a recoverable geometric direction in the hidden states of language models. We show that the mean displacement from incorrect to correct answer representations, computed at approximately 70\% of model depth from fifty labeled examples with no parameter updates, yields a scoring direction that outperforms zero-shot log-probability scoring by up to +32.0 percentage points on factual benchmarks (ARC-Challenge and MMLU) and by +38.1 to +51.8 percentage points on TruthfulQA, across five models spanning 1B to 8B parameters in three architecture families (Llama, Qwen, Gemma). The method requires one forward pass and one dot product per candidate; no generation is performed at inference. Applied as a hallucination detector on individual (question, answer) pairs, the recovered direction achieves 0.693~AUROC versus 0.578 for log-probability scoring. We additionally find that correctness directions for factual reasoning, domain knowledge, and calibrated truthfulness are near-orthogonal in representation space, revealing that language models allocate geometrically independent subspaces to qualitatively distinct notions of correct answer, with architecture-dependent variation in the degree of separation. This structure explains the observed transfer pattern---the direction calibrated on factual questions transfers within task type but not across it---and suggests that LLM calibration failures may reflect a routing problem: the model's internal representation contains more correctness signal than its output behaviour exploits.
- Abstract(参考訳): 解答精度は、言語モデルの隠れ状態における復元可能な幾何方向として符号化される。
パラメータ更新を伴わない50のラベル付き例から約70%のモデル深度で計算し,実数ベンチマーク(ARC-Challenge と MMLU)の0ショット対数確率を最大32.0ポイント,TruthfulQAの+38.1から+51.8ポイント,3つのアーキテクチャファミリ(Llama, Qwen, Gemma)の1Bから8Bパラメータにまたがる5つのモデルにおいて,0ショット対数確率を最大32.0ポイント上回るスコア値を求める。
この方法は1つの前方通過と1つのドット積を必要とし、推論では生成は行われない。
個々の(質問、回答)ペアに幻覚検出器として適用され、回復方向は0.693~AUROC、対数確率スコアは0.578となる。
さらに、事実推論、ドメイン知識、キャリブレーションされた真理性に対する正当性方向が表現空間においてほぼ直交していることが判明し、言語モデルが幾何的に独立な部分空間を正解の質的に異なる概念に割り当て、分離の度合いのアーキテクチャ依存的な変化とともに明らかにした。
この構造は、観測された転送パターン、つまり、タスクタイプ内での実際の質問の移動に基づいてキャリブレーションされた方向は、その横断しない - を説明し、LCMのキャリブレーションの失敗は、ルーティングの問題を反映しているかもしれないことを示唆している。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams [0.0]
有害な意図は、大きな言語モデル残ストリームから幾何的に回復可能である。
我々はこの幾何学を6つの方向決定戦略によって特徴づける。
AdvBenchはホールドアウトのHarmBenchとJailbreakBenchにAUROC 0.96で転送される。
論文 参考訳(メタデータ) (2026-04-20T23:02:37Z) - ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data [0.0]
構成条件付きポストトレーニングは、モデルが学習した表現幾何学の構造化摂動として分析することができる。
グラフ, モデル, 基板間の構成による隠れ状態構造をトレースする, 幾何学第一のプログラムATLASを紹介する。
論文 参考訳(メタデータ) (2026-04-19T23:26:02Z) - Thinking in Different Spaces: Domain-Specific Latent Geometry Survives Cross-Architecture Translation [0.7162422068114824]
独立に訓練された言語モデルが幾何学的に互換性のある潜在表現に収束するかどうかを検討する。
我々は,大規模教師モデルの活性化ベクトルをより小さな学生モデルの座標系にマッピングする線形投影行列を学習する。
幾何アライメントの品質と行動補正率のほぼゼロの相関を報告する。
論文 参考訳(メタデータ) (2026-03-20T18:26:23Z) - Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement [0.0]
視覚言語モデルは、それらのテキスト経路が表現できないような幾何学を符号化する。
ロラ微調整(r=16, 2,000枚)は、このギャップを6.5度に縮める。
これらの知見は、単一の凍結したバックボーンがマルチタスク幾何学的センサーとして機能することを可能にした。
論文 参考訳(メタデータ) (2026-03-06T16:48:27Z) - The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models [1.45309944076563]
5つのアーキテクチャファミリから9つのモデルにまたがる正しさの表現を特徴付ける。
我々はアクティベーションステアリングによる因果性評価を行った。
正確性信号は内部に存在するが、出力では表現されない。
論文 参考訳(メタデータ) (2026-02-08T23:27:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。