論文の概要: Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
- arxiv url: http://arxiv.org/abs/2606.00726v1
- Date: Sat, 30 May 2026 13:38:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.677176
- Title: Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
- Title(参考訳): Latent Reward Steering:LLMにおける認知行動を促進する適応型推論時間フレームワーク
- Abstract要約: Latent Reward Steering (LRS) は、認知行動を促進する適応的な推論時間フレームワークである。
LRSは、中間潜伏状態の品質を推定するために最終回答の正しさによる推論トレースに基づいて潜伏報酬モデルを訓練する。
複数の推論バックボーンとベンチマークの実験では、さまざまなベースラインに対するパフォーマンスが一貫して改善されていることが示されています。
- 参考スコア(独自算出の注目度): 31.34530174385469
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Strong reasoning depends not only on model knowledge but also on how effectively cognitive behaviors are deployed during generation. Existing methods often rely on explicit behavior-level control, making them insufficiently adaptive when failures and required corrections vary across reasoning states, tasks, and models. To this end, we propose Latent Reward Steering (LRS), an adaptive inference-time framework that promotes cognitive behaviors by optimizing the sparse-autoencoder (SAE) latent states that implicitly carry them. Rather than relying on predefined cognitive behaviors or steering directions derived from them, LRS trains a latent reward model on reasoning traces by final answer correctness to estimate the quality of intermediate latent states. During inference, reward gradients provide state-specific correction directions for fragile latent states, while a reward and confidence gate restricts intervention to states the reward signal flags as fragile. Experiments on multiple reasoning LLM backbones and benchmarks show that \ours consistently improves performance over various baselines, and post-hoc analyses further indicate that \ours implicitly promotes good cognitive behaviors that fix the original reasoning errors. Code is available at: https://github.com/jiakanglee/Latent-Reward-Steering.
- Abstract(参考訳): 強い推論はモデル知識だけでなく、世代間の認知行動がいかに効果的に展開されるかにも依存する。
既存の手法は、しばしば明示的な行動レベルの制御に依存し、障害や必要な修正が推論状態、タスク、モデルによって異なる場合、それらが不十分に適応する。
この目的のために、我々は適応的推論時フレームワークであるLatent Reward Steering (LRS)を提案する。これは、暗黙的にそれらを運ぶスパースオートエンコーダ(SAE)潜在状態の最適化によって認知行動を促進する。
LRSは、事前に定義された認知行動やそれらに由来する操舵方向に頼るのではなく、最終回答の正しさによって痕跡を推論する潜在報酬モデルを訓練し、中間潜伏状態の質を推定する。
推論中、報酬勾配は、脆弱な潜伏状態に対して州固有の補正方向を提供する一方、報酬ゲートと信頼ゲートは、報酬信号フラグを脆弱な状態にするための介入を制限する。
複数の推論LDMのバックボーンとベンチマークの実験では、‘ours’はさまざまなベースラインよりも一貫してパフォーマンスを改善しており、ポストホック分析により、‘ours’は元の推論エラーを修正する良質な認知行動を暗黙的に促進することを示している。
コードは、https://github.com/jiakanglee/Latent-Reward-Steering.comで入手できる。
関連論文リスト
- Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models [56.88565331713778]
推論指向のトレーニングは、モデル正しさに最も結びついている振る舞いを増幅することなく、トレースをより熟考的に見せることができる。
このミスマッチを、モデル推論トレースにおける振る舞いの有無に対して、振舞いがどの程度の正確性を変えるかを測定するメトリクスである振舞いリフトと定量化します。
我々は、思考モデルが自己認識、仮説テスト、不確実性認知を強く増幅する増幅自由ギャップの証拠を見つける。
論文 参考訳(メタデータ) (2026-08-13T20:37:59Z) - Learning to Refine Hidden States for Reliable LLM Reasoning [0.21485350418225244]
大規模言語モデルは強力な推論能力を示すが、複雑な多段階設定では内部推論プロセスは不安定である。
本稿では,復号化前に隠蔽表現を反復的に更新する強化誘導潜時改善フレームワークReLARを提案する。
論文 参考訳(メタデータ) (2026-06-16T05:03:27Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Enhancing LLM Metacognition via Cognitive Pairwise Training [56.19495984013656]
検証可能な報酬を伴う強化学習は、証拠や推論が信頼できない場合に、モデルが自信を持って回答する意思を増す。
既存のSFT法やRL法は、主にLLMに対して応答レベルでの不確実性を拒否または表現するよう教えている。
本稿では,認知的中級アライメント段階である認知的ペアワイズトレーニング(CPT)を提案する。
論文 参考訳(メタデータ) (2026-05-30T19:53:19Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models [59.6715047267181]
小さな推論モデル(SRM)は、特に中間的推論ステップにおいて幻覚を起こす傾向がある。
オンライン強化学習に基づく既存の緩和手法は、結果に基づく報酬や粗粒度の連鎖評価に依存している。
本稿では、プロセス報酬モデルから、明示的な忠実度報酬を通じてステップレベルの監視を導入する、Fithfulness-Aware Step-Level Reinforcement Learning (FaithRL)を提案する。
論文 参考訳(メタデータ) (2026-02-05T17:15:12Z) - Mitigating Cognitive Inertia in Large Reasoning Models via Latent Spike Steering [12.332146893333949]
大規模推論モデル(LRM)は、テスト時間計算をスケールすることで、優れた性能を実現している。
LRMは、しばしば認知的慣性(動作慣性)または剛性(方向慣性)のどちらかを過度に考える失敗パターンである認知的慣性(Cognitive Inertia)に悩まされる。
論文 参考訳(メタデータ) (2026-01-30T02:47:12Z) - Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering [50.63386303357225]
本稿では,ニューロンの活性化に選択的に介入することで推論信頼性を向上させる軽量なテストタイムフレームワークであるAdaRASを提案する。
AdaRASは、極性を意識した平均差基準を介してReasoning-Critical Neurons(RCN)を特定し、推論中にアクティベーションを適応的に制御する。
10の数学およびコーディングベンチマークの実験では、AIME-24とAIME-25の13%以上のゲインを含む一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-01-27T17:53:01Z) - Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time [22.9491443902816]
本研究では、推論軌跡の構造と、異なる認知行動と相関する特別な注意点を明らかにする。
テスト時間における認知推論ステアリングのトレーニング不要な方法であるCRESTを提案する。
CRESTは非生産的推論の振る舞いを適応的に抑制し、高い精度と低い計算コストをもたらす。
論文 参考訳(メタデータ) (2025-12-31T02:46:04Z) - Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs [0.4115305983711515]
大規模言語モデル(LLM)のための自己修正フレームワークを開発する。
最終回答の正しさのみに頼るのではなく、細かな不確実性信号を利用する。
我々は不当な高信頼とエントロピースパイクをペナル化する複合報酬関数を設計する。
論文 参考訳(メタデータ) (2025-11-19T23:09:26Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity [6.908972852063454]
大規模言語モデルは、欠陥や無関係な推論トレースに依存しながら、正しい答えを生成することが多い。
本稿では,新しい学習目標であるtextbfCounterfactual Sensitivity Regularization (CSR)を紹介する。
CSRは、標準的な微調整とプロセスの監督に対する忠実度を最大70パーセント向上させる。
論文 参考訳(メタデータ) (2025-09-01T15:18:46Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。