論文の概要: AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency
- arxiv url: http://arxiv.org/abs/2604.16158v1
- Date: Fri, 17 Apr 2026 15:27:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.979643
- Title: AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency
- Title(参考訳): AtManRL: 異なる注意力による忠実な推論を目指して
- Authors: Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu,
- Abstract要約: 本稿では,AtManRLを提案する。AtManRLは,異なる注意操作を利用して,強化学習を通じてより忠実な推論を学習する手法である。
我々は、このサリエンシ報酬と結果に基づく報酬をGRPOフレームワークに統合し、正確性と解釈性を共同で最適化する。
- 参考スコア(独自算出の注目度): 40.19713302778418
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) increasingly rely on chain-of-thought (CoT) reasoning to solve complex tasks. Yet ensuring that the reasoning trace both contributes to and faithfully reflects the processes underlying the model's final answer, rather than merely accompanying it, remains challenging. We introduce AtManRL, a method that leverages differentiable attention manipulation to learn more faithful reasoning through reinforcement learning. By training an additive attention mask that identifies tokens in the CoT crucial for producing correct answers, we derive a saliency reward signal that encourages the model to generate reasoning traces that genuinely influence its final predictions. We integrate this saliency reward with outcome-based rewards within the GRPO framework to jointly optimize for correctness and interpretability. Experiments on GSM8K and MMLU with Llama-3.2-3B-Instruct demonstrate that our approach can identify influential reasoning tokens and enable training more transparent reasoning models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑なタスクを解決するためにチェーン・オブ・シント(CoT)推論にますます依存している。
しかし、推論トレースの両方がモデルの最終回答の根底にあるプロセスに寄与し、忠実に反映することを保証することは、単に伴うだけでなく、依然として困難である。
本稿では,AtManRLを提案する。AtManRLは,異なる注意操作を利用して,強化学習を通じてより忠実な推論を学習する手法である。
正解に不可欠なCoTのトークンを識別する付加的な注意マスクをトレーニングすることにより、モデルが最終的な予測に真に影響を及ぼす推論トレースを生成するよう促すサリエンシ報酬シグナルを導出する。
我々は、このサリエンシ報酬と結果に基づく報酬をGRPOフレームワークに統合し、正確性と解釈性を共同で最適化する。
Llama-3.2-3B-Instruct を用いた GSM8K と MMLU の実験により,本手法が有意な推論トークンを同定し,より透明な推論モデルの訓練を可能にすることを示す。
関連論文リスト
- Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Latent Chain-of-Thought for Visual Reasoning [53.541579327424046]
大型視覚言語モデル(LVLM)の解釈可能性および信頼性向上には,チェーン・オブ・シント(CoT)推論が不可欠である
我々は,LVLMにおける推論を後部推論として再構成し,償却変分推論に基づくスケーラブルなトレーニングアルゴリズムを提案する。
提案手法は,7つの推論ベンチマークにおいて,最先端のLVLMを強化することを実証的に実証する。
論文 参考訳(メタデータ) (2025-10-27T23:10:06Z) - From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization [62.07990937720985]
DRM(Dimension-level Reward Model)は、大規模言語モデルのための新しい監視フレームワークである。
DRMは3つの基本的、相補的、解釈可能な次元に沿って推論プロセスの品質を評価する。
実験の結果、DRMは効果的な監視信号を提供し、LCMの最適化を誘導し、推論能力を向上することが示された。
論文 参考訳(メタデータ) (2025-10-13T14:29:15Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards [48.55501117313608]
本稿では,視覚言語モデルにおけるステップ推論の連鎖について述べる。
ステップレベルの推論データ、プロセス報酬モデル(PRM)、強化学習トレーニングを含む、シンプルで効果的で完全に透明なフレームワークを提案する。
本稿では、視覚言語モデルのベースラインとして機能し、より複雑なマルチモーダル推論に関する洞察を提供する。
論文 参考訳(メタデータ) (2025-09-23T13:47:32Z) - Interleaved Reasoning for Large Language Models via Reinforcement Learning [22.403928213802036]
ロングチェーン・オブ・シント(CoT)は、大規模言語モデル(LLM)推論能力を向上する。
本稿では、強化学習(RL)を用いてLLMを指導し、マルチホップ質問に対する思考と回答をインターリーブする新しい学習パラダイムを提案する。
論文 参考訳(メタデータ) (2025-05-26T07:58:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。