論文の概要: The Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models
- arxiv url: http://arxiv.org/abs/2606.06188v1
- Date: Thu, 04 Jun 2026 13:59:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.836207
- Title: The Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models
- Title(参考訳): Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models
- Authors: Jinyang Zhang, Hongxin Ding, Yue Fang, Weibin Liao, Muyang Ye, Junfeng Zhao, Yasha Wang,
- Abstract要約: 隠れ状態の l2 ノルムがモデルの推論強度の内在的なシグナルとなることを示す。
このパターンに動機付けられて、推論強度とモデルの潜在幾何学との公式なリンクを確立する。
モデルアーキテクチャとベンチマークによる実験では、l2-normベースの技術が推論性能を著しく改善していることが示されている。
- 参考スコア(独自算出の注目度): 18.187988335064716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has sought to understand Large Language Models (LLMs) reasoning, yet a principled, model-intrinsic signal that captures its layer-wise reasoning dynamics remains underexplored. We bridge this gap by demonstrating that the l2 norm of hidden states serves as an endogenous signal of the model's reasoning intensity. Using Sparse Autoencoders (SAEs) as a diagnostic probe, we observe that LLMs' internal reasoning is marked by a sharp increase in reasoning feature activations concentrated in late layers. Motivated by this pattern, we establish a formal link between reasoning intensity and the model's latent geometry and theoretically prove that the l2 norm of hidden states bounds the activation strength of SAE reasoning features. Empirical correlation analysis and causal interventions further validate the l2 norm as a faithful indicator, where heightened norms consistently correspond to critical reasoning steps. We then introduce three test-time scaling techniques guided by l2 norms: (i) Adaptive Layer-wise Reasoning Recursion, (ii) Endogenous Reasoning State Steering, and (iii) l2-guided Response Selection, which requires no additional training or data and is compatible with advanced inference engines. Experiments across model architectures and benchmarks show that l2-norm-based techniques significantly improve reasoning performance, offering a principled yet simple lens to perceive and control LLM latent reasoning dynamics. Our code is available at https://github.com/zjy1298/The-Tell-Tale-Norm.
- Abstract(参考訳): 最近の研究は、Large Language Models (LLMs) 推論を理解することを目指しているが、その階層的推論力学を捉えた、原則的、モデル固有の信号は、まだ探索されていない。
我々は、隠れ状態のl2ノルムがモデルの推論強度の内在的なシグナルであることを示すことによって、このギャップを橋渡しする。
Sparse Autoencoders (SAEs) を診断用プローブとして用いて, LLMの内部推論は, 後期層に集中する特徴アクティベーションの急激な増加を特徴としている。
このパターンにより、推論強度とモデルの潜在幾何学との公式なリンクを確立し、隠れた状態の l2 ノルムが SAE 推論特徴の活性化強度に束縛されていることを理論的に証明する。
経験的相関分析と因果的介入により、l2ノルムは忠実な指標として検証される。
次に、l2ノルムでガイドされた3つのテストタイムスケーリングテクニックを紹介します。
一 適応層ワイズ推論再帰
(二)内因性推論状態ステアリング及び
3 l2-guided Response Selectionは、追加のトレーニングやデータを必要としず、高度な推論エンジンと互換性がある。
モデルアーキテクチャとベンチマークによる実験により、l2-normベースの技術は推論性能を著しく改善し、LCM遅延推論ダイナミクスを知覚し制御するための原則化された単純なレンズを提供することが示された。
私たちのコードはhttps://github.com/zjy1298/The-Tell-Tale-Norm.comで公開されています。
関連論文リスト
- LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation [33.48046116606003]
大規模言語モデル(LLM)において、潜在推論が効果的なパラダイムとして出現した
SFT-then-RLフレームワークであるLASAR(Latent Adaptive Semantic Aligned Reasoning)を提案する。
3つの実世界のデータセットの実験は、LASARがすべてのベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-11T08:52:53Z) - Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models [46.26628756478016]
大規模言語モデル(LLM)は、事前学習データにおける共用推論パターンを通じて推論能力を取得することが知られている。
コンフリクト中に信頼性スコアが著しく低下するため、推論競合は内部で検出可能であることを示す。
その結果, LLM推論は具体例に固定されているものの, アクティブな機械的介入は論理的スキーマをデータから効果的に切り離すことができることがわかった。
論文 参考訳(メタデータ) (2026-04-29T22:55:40Z) - CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching [50.65932158912512]
そこで我々は,新しい大言語モデルの開発を促進するために,因果推論ベンチマークCausalFlipを提案する。
CaulFlipは、イベントトリプル上に構築された因果判断の質問で構成されており、共同創設者、チェーン、コライダーの関係が異なっている。
回答のみのトレーニング,明示的なチェーン・オブ・ソート監視,そして内在型因果推論アプローチなどを含む,複数の訓練パラダイムによるLCMの評価を行った。
論文 参考訳(メタデータ) (2026-02-23T18:06:15Z) - Reason-IAD: Knowledge-Guided Dynamic Latent Reasoning for Explainable Industrial Anomaly Detection [85.29900916231655]
Reason-IADは、説明可能な産業異常検出のための知識誘導型動的潜在推論フレームワークである。
実験により、Reason-IADは最先端の手法よりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2026-02-10T14:54:17Z) - Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models [15.849480549367684]
本稿では,DAG生成タスクとして脆弱性推論をモデル化する新しいフレームワークであるDAGVulを提案する。
さらにReinforcement Learning with Verifiable Rewards (RLVR)を導入することで、モデル推論トレースをプログラム固有の論理と整合させる。
我々のフレームワークは、すべてのベースラインに対して平均18.9%の推論F1スコアを改善します。
論文 参考訳(メタデータ) (2026-02-06T13:19:45Z) - CTRLS: Chain-of-Thought Reasoning via Latent State-Transition [57.51370433303236]
チェーン・オブ・シント(CoT)推論は、大規模な言語モデルで複雑な問題を解釈可能な中間ステップに分解することを可能にする。
我々は,遅延状態遷移を伴うマルコフ決定プロセス(MDP)としてCoT推論を定式化するフレームワークであるgroundingSを紹介する。
我々は、ベンチマーク推論タスクにおける推論精度、多様性、探索効率の改善を示す。
論文 参考訳(メタデータ) (2025-07-10T21:32:18Z) - Reasoning with Exploration: An Entropy Perspective [111.0659496612249]
強化学習(RL)の中心的目標としてのバランシング探索と活用
エントロピーに基づく項による優位関数の増大という,1行のコードのみによる標準RLへの最小限の修正を導入する。
提案手法は,非常に大きなK値を用いて評価しても,Pass@K測定値において有意な利得が得られる。
論文 参考訳(メタデータ) (2025-06-17T17:54:03Z) - Think before You Simulate: Symbolic Reasoning to Orchestrate Neural Computation for Counterfactual Question Answering [9.875621856950408]
本稿では,反現実的推論のためのニューロシンボリックモデルを強化する手法を提案する。
我々は因果関係を表すために因果グラフの概念を定義する。
提案手法の有効性を2つのベンチマークで検証する。
論文 参考訳(メタデータ) (2025-06-12T14:37:11Z) - LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection [27.45348890285863]
本稿では,論理的推論を組み込んで従来の異常検出を拡張したReasoning Logical Anomaly Detection (RLAD)を提案する。
本稿では,Qwen2.5-VL 3B上に構築された小型マルチモーダル言語モデルであるLAD-Reasonerを提案する。
MVTec LOCO ADデータセットの実験では、LAD-Reasonerははるかに小さく、精度はQwen2.5-VL-72BとF1のスコアと一致している。
論文 参考訳(メタデータ) (2025-04-17T08:41:23Z) - Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models [49.61246073215651]
大規模言語モデル(LLM)は複雑なタスクにおいて顕著な機能を示した。
OpenAI o1とDeepSeek-R1の最近の進歩は、System-2推論ドメインのパフォーマンスをさらに改善した。
しかし、冗長な出力と冗長な出力による計算オーバーヘッドも大幅に発生する。
論文 参考訳(メタデータ) (2025-03-20T17:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。