論文の概要: GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
- arxiv url: http://arxiv.org/abs/2608.02585v1
- Date: Mon, 03 Aug 2026 17:55:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.74805
- Title: GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
- Title(参考訳): GradCuit:Credit-Assigned Gradient Flowによってロバストで解釈可能なテスト時間遅延推論が可能に
- Authors: Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng,
- Abstract要約: 本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
- 参考スコア(独自算出の注目度): 61.67411833252235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Optimization-based latent reasoning improves large language model outputs by optimizing instance-specific continuous states at test time while keeping model parameters frozen. Existing methods, however, typically connect these states to the reasoning trajectory through decoded tokens, making sequence-level credit assignment indirect and obscuring how latent updates shape subsequent reasoning. We introduce GradCuit (gradient through circuit), which inserts optimizable latent states at a selected Transformer layer between the hidden representations of the prompt and the generated continuation. Causal self-attention provides every continuation-token log-probability with a differentiable path to every preceding latent state through the remaining Transformer blocks, enabling reward-weighted gradients from the entire continuation to be assigned directly to the latents. Across five instruction-tuned backbones, three reasoning benchmarks, and two answer formats, GradCuit achieves an average accuracy of 64.5%, outperforming chain-of-thought prompting by 6.6 percentage points and the strongest competing method by 2.4 points. GradCuit also demonstrates greater robustness: across seven learning-rate settings, it consistently outperforms LatentSeek while reducing the standard deviation of accuracy from 1.53 to 0.82, and even its random-walk variant remains competitive with LatentSeek. For interpretability, token-level gradient attribution reveals that latent influence concentrates on reasoning-connector tokens, while layer analysis identifies early-to-middle Transformer layers as the most effective optimization space. By directly optimizing internal reasoning from outcome feedback, GradCuit opens a new axis of robust and interpretable test-time scaling, where LLMs adapt how they reason rather than merely regenerate, sample, or rerank outputs.
- Abstract(参考訳): 最適化ベースの潜在推論は、テスト時にインスタンス固有の連続状態を最適化し、モデルのパラメータを凍結させながら、大きな言語モデルの出力を改善する。
しかし、既存の方法は通常、これらの状態と復号されたトークンを通して推論軌跡を結び、シーケンスレベルのクレジット代入を間接的に作成し、潜在更新がその後の推論を形作るかを見極める。
本稿では、プロンプトの隠蔽表現と生成された継続の間に選択されたトランスフォーマー層に最適化可能な潜在状態を挿入するGradCuit(グラディエント・スルー・サーキット)を紹介する。
因果自己アテンション(Causal self-attention)は、残余のTransformerブロックを通して、先行しているすべての潜在状態への微分可能なパスを持つ継続トークンのログプロビタビリティを提供する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitは平均64.5%の精度を達成し、6.6ポイントのチェーン・オブ・シークレット、2.4ポイントの競合する最強の手法を達成している。
GradCuitはまた、より堅牢性を示している: 7つの学習速度設定において、LatentSeekを一貫して上回り、精度の標準偏差を1.53から0.82に下げ、ランダムウォークの変種でさえLatentSeekと競合するままである。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論-接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
結果フィードバックから内部推論を直接最適化することで、GradCuitは堅牢で解釈可能なテストタイムスケーリングの新たな軸を開く。
関連論文リスト
- TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs [5.676157325165344]
大規模言語モデル (LLM) は、しかしながら、誤った答えにつながるような、流動的な推論トレースを生成することができる。
TrACは、ある完了した推論トレースに固定されたアクティブ信号とパッシブ信号を組み合わせた正当性管理の不確実性定量化フレームワークである。
TrACはマクロAUROCを1.8%改善し、AURCを8サンプルの自己一貫性に対して3.4%削減する。
論文 参考訳(メタデータ) (2026-08-01T03:43:31Z) - Latent Thought Flow: Efficient Latent Reasoning in Large Language Models [23.52673819075993]
本稿では,可変長連続軌道をモデルとした潜在思考フロー(LTF)を提案する。
微調整と転写学習による実験では、LTFは明示的なCoTおよび潜在推論基準よりも優れており、精度は9.5%向上し、推論長は平均27.2%低下している。
論文 参考訳(メタデータ) (2026-06-15T05:02:46Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning [32.332197731504046]
デコード戦略は、大きな言語モデルの推論能力を形成する上で、中心的な役割を果たす。
グレディ復号やビームサーチといった従来の手法は、しばしばエラーの伝播に悩まされる。
本稿では,トークンレベルの適応性を世代に導入するエントロピー誘導復号化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-10T23:08:26Z) - Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning [66.22060690012512]
大規模な推論モデルは、より多くのテストタイム計算で改善されるが、しばしば過大評価され、正確さを向上することなくコストを上昇させる必要のない長い連鎖を生み出す。
本研究は,本質的な貢献に基づいて,ステップ間の長さ短縮を割り当てる,きめ細かいフレームワークであるSWAPを提案する。
論文 参考訳(メタデータ) (2026-02-27T20:23:59Z) - Internalizing LLM Reasoning via Discovery and Replay of Latent Actions [4.830503861275364]
連鎖プロセスの隠れ状態への内部化は、テスト時間計算をスケールするための非常に効率的なパラダイムとして現れている。
動的潜在軌道制御問題として推論強化を再構築するSTIR(Self-Distilled Tools for Internal Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:44:57Z) - Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning [21.58053831545995]
モデルの内部表現の時間的進化を特徴付ける潜在トラジェクトリ信号を導入する。
これらの信号は、クロス層メトリクスと出力ベースの信頼度の両方よりも、解の精度をより確実に予測できることが示される。
論文 参考訳(メタデータ) (2025-10-12T08:03:56Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。