論文の概要: Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
- arxiv url: http://arxiv.org/abs/2608.30457v1
- Date: Mon, 31 Aug 2026 08:44:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.32019
- Title: Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
- Title(参考訳): 成果の学習:マルチモーダル幾何に対するCredit-Addressable Reasoning
- Authors: Jiani Guo, Junjie Wang, Jie Wu, Pengxiang Zhao, Dongdong Zhang, Shaohan Huang, Yujiu Yang, Furu Wei,
- Abstract要約: 推論中に露出したセマンティックユニットは、学習が代替品と比較し、クレジットを割り当てる場所を定義する。
我々は,この原理を,ライン順応可能な実行可能コードとして視覚的関係を表すCode-CoTでインスタンス化し,推論を型付きイベントに整理する。
9つの幾何ベンチマークで、CE-GRPOは平均76.04の精度を達成し、Qwen3-VL-8Bと軌跡レベルGRPOをそれぞれ8.09$と3.43ポイント上回る。
- 参考スコア(独自算出の注目度): 105.89493240787861
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal geometry reasoning requires VLMs to extract precise visual relations and preserve them through multi-step deduction. Existing free-form traces obscure the decisions that determine the answer, and trajectory-level reinforcement learning distributes a single terminal signal across the entire response. We introduce credit-addressable reasoning, in which the semantic units exposed during inference also define where learning compares alternatives and assigns credit. We instantiate this principle with Code-CoT, which retains the diagram, represents visual relations as line-addressable executable code, and organizes reasoning into typed events, and CE-GRPO, which selects event boundaries using structural priors and type-normalized entropy, samples complete continuations from shared prefixes, and converts outcome differences into localized advantages. Across nine geometry benchmarks, CE-GRPO achieves an average accuracy of 76.04, outperforming Qwen3-VL-8B and trajectory-level GRPO by $8.09$ and 3.43 points, respectively. Its relative advantage increases with the number of intermediate events, demonstrating the value of representation--optimization co-design for long, dependency-heavy multimodal reasoning.
- Abstract(参考訳): マルチモーダル幾何推論では、VLMは正確な視覚的関係を抽出し、多段階推論によってそれらを保存する必要がある。
既存の自由形トレースは、応答を決定する決定を曖昧にし、軌道レベルの強化学習は、応答全体にわたって単一の終端信号を分散する。
推論中に露出したセマンティックユニットは、学習が代替品と比較し、クレジットを割り当てる場所を定義する。
我々は、この原則を、ダイアグラムを保持し、視覚的関係を行順対応可能な実行可能コードとして表現し、推論を型付きイベントに整理するCode-CoTと、構造的先行値と型正規化エントロピーを用いてイベント境界を選択するCE-GRPO、共有プレフィックスからの完全継続をサンプリングし、結果差を局所化アドバンテージに変換するCE-GRPOでインスタンス化する。
9つの幾何ベンチマークで、CE-GRPOは平均76.04の精度を達成し、Qwen3-VL-8Bと軌跡レベルのGRPOをそれぞれ8.09$と3.43ポイント上回る。
その相対的な優位性は、中間イベントの数によって増大し、長い依存重大なマルチモーダル推論に対する表現-最適化共設計の値を示す。
関連論文リスト
- Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence [70.8951332710039]
マルチモーダル大言語モデル (MLLM) は複雑な空間的シーン理解と推論タスクにおいて有意な可能性を証明している。
しかし、彼らのオープンな推論プロセスは、意思決定の誤りやエラーの蓄積を招きやすいため、回答の品質が不安定になる。
本稿では,推論過程において動的に介入し,偏差を補正するアドバンテージ誘導型ゲーティングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T07:46:04Z) - Multi-Branch Policy Optimization for Multimodal Large Language Models [21.856599797665833]
マルチモーダルな大規模言語モデルに対するグループベース強化学習法は、トラジェクトリレベルの信用代入に依存している。
マルチモーダル推論は、テキストのみの設定よりも知覚の不確実性が高い。
視覚言語決定境界における推論木を構築する木ベースのフレームワークであるMulti-Branch Policy Optimization (MBPO)を提案する。
論文 参考訳(メタデータ) (2026-08-05T04:00:09Z) - Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance [7.682863634260091]
関係推論のためのグラフ構造拡張であるグラフ-GRPOを提案する。
結果レベルの報酬をグラフ上で伝達し、段階レベルの信用信号を導出する。
また,エッジワイド・クレジット・プロパゲーション係数を適応的に調整する主損失駆動型制御器を導入する。
論文 参考訳(メタデータ) (2026-05-29T08:36:08Z) - Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization [3.579200789027982]
RLVR(Reinforcement fine-tuning with verible rewards)は、大きな視覚言語モデル(LVLM)にツールの使用や多段階推論などのエージェント機能を持たせるための強力なパラダイムとして登場した。
顕著な経験的成功にもかかわらず、特に視覚エージェント強化細管(Visual Agentic Reinforcement Fine-Tuning, Visual-ARFT)は、このパラダイムの理論的基盤は理解されていない。
EmphTool-Augmented Markov Decision Process (TA-MDP)を導入する。
論文 参考訳(メタデータ) (2026-04-21T17:21:08Z) - PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models [38.47027398567909]
Perception-Grounded Policy Optimization (PGPO)は、トークンレベルでのメリットを動的に再評価する、新しいきめ細かなクレジット割り当てフレームワークである。
PGPOは,言語的先行音からの勾配雑音を抑えつつ,視覚的に依存するトークンの学習信号を積極的に増幅することを示す。
理論的および実証的な分析は、PGPOが勾配の分散を効果的に減少させ、訓練の崩壊を防ぎ、頑健で知覚的なマルチモーダル推論のための強力な正則化剤として機能することを確認する。
論文 参考訳(メタデータ) (2026-04-02T09:53:20Z) - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs [51.60575965819268]
本稿では,この相互依存を明示的にモデル化するToken-Reweighting(ToR)戦略を提案する。
ToRは複数のマルチモーダル推論ベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-26T06:25:27Z) - Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought [73.39221516441624]
マルチモーダル・チェーン・オブ・ソート(CoT)推論は、推論軌道を構築するために大きな視覚言語モデルを必要とする。
既存のReinforcement Learning with Verifiable Rewards (RLVR) 法は、様々な視覚的接地度を区別することなく、CoTを均一に扱う。
本稿では,隠れ状態の類似性に先立って認識を導き,トークンのエントロピーと統合する知覚探索ポリシー最適化(PEPO)を提案する。
論文 参考訳(メタデータ) (2026-03-24T06:38:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。