論文の概要: StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2608.08326v1
- Date: Sat, 08 Aug 2026 20:29:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.780663
- Title: StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning
- Title(参考訳): 構造Reward:自己補正型マルチモーダル推論のための効率的な構造化プロセスRewards
- Abstract要約: 検証可能な報酬(RLVR)を用いた強化学習は,多モーダル推論を改善するための効果的なアプローチとして現れている。
プロセス報酬モデルはよりきめ細かいフィードバックを提供するが、通常は個別に訓練された検証、コストのかかる連鎖アノテーション、あるいは大規模な言語モデルによるオンライン判断に依存している。
我々はStructRewardを紹介した。StructRewardは、構造化されたステップレベルの報酬アライメントを通じて高密度の強化信号を提供する計算効率のフレームワークである。
- 参考スコア(独自算出の注目度): 3.6795543408370466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has emerged as an effective approach for improving multimodal reasoning. However, most existing methods evaluate an entire response using a binary reward based only on final-answer correctness, thereby discarding the supervision available in intermediate reasoning steps. Process reward models offer finer-grained feedback, but they typically rely on separately trained verifiers, costly chain-of-thought annotations, or online judging by large language models (LLMs). In this work, we introduce StructReward, a compute-efficient framework that provides dense reinforcement signals through structured step-level reward alignment. StructReward represents each generated solution as a sequence of reasoning steps and aligns them with process-labeled reference steps using lightweight numerical, symbolic, and lexical matching rules. The aligned labels are aggregated into a dense process reward and combined with final-answer consistency and output-validity rewards through a gated Group Relative Policy Optimization (GRPO) objective. We further recycle policy rollouts into complementary supervision for response comparison and reflective self-correction, rather than discarding them after policy updates. Separately, we use a strong LLM to rewrite sampled correct trajectories into reflection-oriented training instances, further strengthening the policy's ability to evaluate and refine its reasoning. Since reward computation is performed online without an additional learned verifier or external LLM judge, StructReward substantially reduces the computational overhead of multimodal reinforcement learning. Experimental results show that structured process supervision and rollout recycling provide an efficient path toward self-improving multimodal reasoning.
- Abstract(参考訳): 検証可能な報酬(RLVR)を用いた強化学習は,多モーダル推論を改善するための効果的なアプローチとして現れている。
しかし、既存のほとんどの手法は、最終回答の正しさのみに基づいてバイナリ報酬を用いて応答全体を評価し、中間的推論ステップで利用可能な監視を破棄する。
プロセス報酬モデルはよりきめ細かいフィードバックを提供するが、通常は個別に訓練された検証、コストのかかる連鎖アノテーション、あるいは大規模言語モデル(LLM)によるオンライン判断に依存している。
本稿では,StructRewardについて紹介する。StructRewardは,構造化ステップレベルの報酬アライメントを通じて高密度強化信号を提供する計算効率のフレームワークである。
StructRewardは、生成された各ソリューションを推論ステップのシーケンスとして表現し、軽量な数値、記号、語彙マッチングルールを使用してプロセスラベル付き参照ステップと整列する。
整列されたラベルは、密集したプロセス報酬に集約され、最終回答の一貫性と出力-妥当性の報酬とを、グループ相対政策最適化(GRPO)の目標によって組み合わせられる。
さらに、ポリシー更新後に破棄するのではなく、レスポンス比較と反射自己補正の補完的な監視にポリシーロールアウトを再利用する。
第二に、我々は強力なLCMを使用して、サンプル化された正しい軌道をリフレクション指向のトレーニングインスタンスに書き換え、その推論を評価し、改善するポリシーの能力をさらに強化する。
報奨計算は、追加の学習検証器や外部LLM判定器を使わずにオンラインで行われるため、StructRewardはマルチモーダル強化学習の計算オーバーヘッドを大幅に削減する。
実験結果から, 構造化プロセスの監視とロールアウトリサイクルが, 自己改善型マルチモーダル推論への効率的な経路を提供することが示された。
関連論文リスト
- CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization [21.755134237801443]
CoRTは、ルーリック条件のGRPOのトークンレベルクレジット重み付け手法である。
比較の結果,CoRTは一致した応答レベルGRPOよりも改善していることがわかった。
論文 参考訳(メタデータ) (2026-07-28T12:45:19Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Credit Assignment with Resets in Language Model Reasoning [19.869062158993113]
ポストトレイン言語モデルは、トラジェクトリ内のすべてのトークンに対して、単一の結果報酬を均一に割り当てる。
この制限は、軌道全体を均一に更新するのではなく、目標とする故障推論ステップの洗練を可能にすることで対処できる。
本稿では、ランダムリセットポリシー最適化(RRPO)と自己リセットポリシー最適化(SRPO)の2つの手法を提案する。
論文 参考訳(メタデータ) (2026-05-25T07:11:50Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR [10.821950260274066]
RLVRによる強化学習は大規模言語モデル(LLM)の推論能力を大幅に向上させた。
プロセスに反するが結果の正しいロールアウトのトレーニングは、幻覚と回答コピーにつながる可能性がある。
RLVRプロセスの一般化のために,コントラスト学習機構を政策最適化(CLIPO)に組み込んだ。
論文 参考訳(メタデータ) (2026-03-10T17:59:54Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts [25.205293698698867]
我々はNested-ReFTを導入し、ターゲットモデルのサブセットがトレーニング中に非政治的な完了を生成する行動モデルとして機能する。
我々の理論的分析は、Nested-ReFTが制御された分散を伴う非バイアス勾配推定値を得ることを示している。
我々の経験的分析は、複数の数学推論ベンチマークとモデルサイズでトークン/秒として測定された計算効率の改善を実証している。
論文 参考訳(メタデータ) (2025-08-13T18:37:46Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment [44.33395106709674]
RLVR(Reinforcement Learning with Verifiable Rewards)は、ルールベースのバイナリフィードバックを使用することで、LLM(Large Language Models)の推論能力を改善した。
現在のRLVRメソッドは、通常、すべてのトークンに同じ報酬を割り当てる。
この粗い粒度のフィードバックは、正確なクレジット割り当てを妨げ、モデルがどの推論ステップが成功または失敗につながるかを特定するのが難しくなる。
論文 参考訳(メタデータ) (2025-08-04T11:06:08Z) - In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement [71.60563181678323]
大規模言語モデル(LLM)は様々なタスクで大きな成功を収めており、生成品質をさらに向上させるためには微調整が必要である場合もある。
これらの課題に対処する直接的な解決策は、教師なしの下流タスクから高信頼のデータを生成することである。
本稿では,プロンプトと全体的な擬似スーパービジョンを両立させる新しい手法,擬似教師付きデモアライメント・アライメント・アライメント・プロンプト・最適化(PAPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-04T03:39:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。