論文の概要: To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation
- arxiv url: http://arxiv.org/abs/2606.29481v1
- Date: Sun, 28 Jun 2026 16:21:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.937864
- Title: To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation
- Title(参考訳): 言い換えるか、作るか:ヒントアンカレッド・ペアワイド・アグリゲーションによるショートカットなしの推論
- Abstract要約: HIPPOはヒント注入アグリゲーションとペアワイズ報酬モデルを統合する新しいRLフレームワークである。
極めて識別可能な選好信号を提供し、軽量な判断モデルにより真の推論推論を確実に識別することができる。
- 参考スコア(独自算出の注目度): 20.92880098291496
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: While reinforcement learning (RL) significantly enhances LLM reasoning, its efficacy is severely undermined by Pre-RL data overlap, where RL datasets overlap with pretraining or SFT corpora, causing models to exploit shortcuts by memorizing correct answers and fabricating post-hoc reasoning. To address this, we introduce HIPPO, a novel RL framework that integrates hint-injected aggregation with a tailored pairwise reward model. By utilizing hint injection to deliberately trigger overlap-induced behaviors, the resulting traces naturally serve as explicit anchors for pairwise comparison. This provides highly discriminable preference signals, enabling a lightweight judge model to reliably distinguish genuine reasoning deduction from shortcut-driven rationalization, while the pairwise formulation ensures stable and robust optimization compared to standard PRMs. Extensive experiments demonstrate that HIPPO yields substantial improvements over standard baselines and generalizes effectively to out-of-distribution general tasks, showing it extracts authentic, transferable reasoning skills rather than superficial shortcut patterns.
- Abstract(参考訳): 強化学習(RL)はLLM推論を著しく向上させるが、その有効性はプレRLデータの重なりによって著しく損なわれ、RLデータセットは事前学習やSFTコーパスと重なり、正しい回答を記憶し、ポストホック推論を作成することでショートカットを利用する。
これを解決するために,ヒント注入型アグリゲーションとペアワイズ報酬モデルを統合する新しいRLフレームワークであるHIPPOを紹介する。
ヒントインジェクションを利用して、重複による振る舞いを意図的にトリガーすることで、結果として得られるトレースは、ペア比較のための明示的なアンカーとして機能する。
これは高い識別可能な選好信号を提供し、軽量な判断モデルにより、真の推論推論とショートカット駆動の合理化を確実に区別できる一方、ペアワイドの定式化により、標準のPRMに比べて安定かつ堅牢な最適化が保証される。
広汎な実験により、HIPPOは標準ベースラインよりも大幅に改善され、分布外の一般的なタスクに効果的に一般化され、表面的ショートカットパターンよりも真正かつ伝達可能な推論スキルが抽出されることが示された。
関連論文リスト
- Training Large Language Models for Self-Explanation Faithfulness [10.933553638236036]
本稿では,自己説明の忠実度を直接最適化する強化学習(RL)手法を提案する。
決定に影響を及ぼす要因を正確に検出するために,モデルをトレーニングできるかどうかを検討する。
モデルが暗黙的に影響要因を識別し、それを開示するように訓練できることが示される。
論文 参考訳(メタデータ) (2026-07-23T09:20:38Z) - The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs [5.802098323678549]
結果に基づく強化学習(RL)を通じて整列された大規模言語モデル(LLM)は、しばしば重大な障害モードを示す。
我々は,このパラドックスを説明するために,構造因果モデル(SCM)と情報ボトルネック(IB)の原理をブリッジする理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-05-30T11:06:13Z) - Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization [59.20570719781289]
マルチモーダル大規模推論モデルは推論パラダイムを導入し、複雑な視覚言語タスクに強力な能力を示す。
既存のトレーニングベースの手法では、応答レベルの直接選好最適化(DPO)を通じて幻覚を緩和し、CoT(Chain-of-Thought)と最終回答をモノリシックな出力として扱い、協調的に最適化する。
我々は、応答生成条件としてCoTをモデル化し、異なるCoT条件下で同じ好みの回答を優先し、応答支持型推論連鎖アライメントを促進するReasoning-Conditioned Direct Preference Optimization (RC-DPO) を導出する。
論文 参考訳(メタデータ) (2026-05-27T03:27:23Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Reasoning Pattern Alignment Merging for Adaptive Reasoning [48.347817456299104]
Reasoning Pattern Alignment Merging (RPAM)
RPAMは、クエリ適応推論を容易にする機能アライメントに基づく階層的なモデルマージフレームワークである。
広く使用されている7つの推論ベンチマークの実験により、RPAMは強い性能を維持しながら推論コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-01-07T01:36:39Z) - Coupled Variational Reinforcement Learning for Language Model General Reasoning [83.82392089177841]
変分推論と強化学習を橋渡しするために,textitbCoupled bVari bReinforcement bLearning (CoVRL)を提案する。
CoVRLはベースモデルよりも12.4%向上し、最先端の検証不要なRLベースラインよりも2.3%向上した。
論文 参考訳(メタデータ) (2025-12-14T07:03:51Z) - Revisiting LLM Reasoning via Information Bottleneck [57.519119962528166]
大規模言語モデル(LLM)は、最近、検証可能な報酬付き強化学習(RLVR)を通じて推論能力の顕著な進歩を示した。
本稿では,情報ボトルネック(IB)の原理に基づくLLM推論の理論的特徴について述べる。
IB対応推論最適化(IBRO)を提案する。
論文 参考訳(メタデータ) (2025-07-24T13:14:25Z) - Reinforced Latent Reasoning for LLM-based Recommendation [92.56166822197919]
大きな言語モデル(LLM)は、複雑な問題解決タスクにおいて印象的な推論能力を示している。
既存の手法は通常、明示的なチェーン・オブ・シント(CoT)データによる微調整に依存している。
本研究では, 明示的なCoT推論から, コンパクトで情報密度の高い潜伏推論へ移行する代替手法について検討する。
論文 参考訳(メタデータ) (2025-05-25T11:03:45Z) - Hybrid Latent Reasoning via Reinforcement Learning [50.6763762323985]
大規模言語モデル(LLM)の能力を活用した強化学習(RL)による潜時推論について検討する。
RLをベースとしたハイブリッド潜在推論手法であるハイブリッド推論ポリシー最適化(HRPO)を導入する。
HRPOで訓練されたLLMは解釈可能であり、言語横断パターンや短い完了長といった興味深い挙動を示す。
論文 参考訳(メタデータ) (2025-05-24T01:26:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。