論文の概要: Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.01314v1
- Date: Sun, 02 Aug 2026 15:31:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.160419
- Title: Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
- Title(参考訳): remember-R1: 強化学習による長期的視覚提示の軽減
- Authors: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen,
- Abstract要約: MLLM(Multimodal large language model)は、複雑なタスクに対する長い連鎖推論に依存している。
推論シーケンスが長引くにつれて、モデルは徐々に視覚的証拠に頼らず、蓄積されたテキストの文脈に頼り、視覚的忘れを招きかねない。
本稿では,元来の推論軌道に直接プロセスレベルの監督を適用することで,長いコンテキストの視覚的忘れを緩和する強化学習フレームワークであるResert-R1を提案する。
- 参考スコア(独自算出の注目度): 50.56518447675037
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) increasingly rely on long chain-of-thought reasoning for complex tasks. However, as reasoning sequences lengthen, models may gradually rely less on visual evidence and more on accumulated textual context, leading to visual forgetting. Existing approaches do not directly constrain how visual evidence is used and maintained along the original reasoning trajectory, leaving long-context visual forgetting insufficiently addressed. To address this issue, we propose Remember-R1, a reinforcement learning framework that mitigates long-context visual forgetting by applying process-level supervision directly on the original reasoning trajectory. Specifically, Remember-R1 introduces rewards that encourage broader coverage of matched visual keywords, stronger persistence of visual dependence in later reasoning steps, and greater focus on question-relevant image regions. Experiments across multiple model scales and diverse multimodal benchmarks demonstrate that Remember-R1 consistently improves reasoning performance. Additional analyses further show that it slows the decline of visual attention during generation, supporting its effectiveness in mitigating long-context visual forgetting.
- Abstract(参考訳): MLLM(Multimodal large language model)は、複雑なタスクに対する長い連鎖推論に依存している。
しかし、推論シーケンスが長引くにつれて、モデルは徐々に視覚的証拠に頼らず、蓄積されたテキストの文脈に頼りやすくなり、視覚的忘れがもたらされる。
既存のアプローチは、元の推論軌道に沿って視覚的エビデンスがどのように使われ、維持されているかを直接的に制限せず、長いコンテキストの視覚的忘れが不十分なままである。
この問題に対処するため,従来の推論軌道に直接プロセスレベルの監督を適用することで,長いコンテキストの視覚的忘れを緩和する強化学習フレームワークであるResert-R1を提案する。
具体的には,マッチングされた視覚的キーワードの広範なカバレッジ,後の推論ステップにおける視覚的依存の強い持続性,質問関連画像領域への集中を奨励する報酬を導入する。
複数のモデルスケールと多様なマルチモーダルベンチマークによる実験は、Remember-R1が推論性能を一貫して改善することを示した。
さらなる分析により、世代間の視覚的注意の低下が遅くなり、長いコンテキストの視覚的忘れを緩和する効果が向上することが示された。
関連論文リスト
- VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning [15.03674139835036]
推論中に段階的に視覚的トークンを抽出するフレームワークであるVisionPulseを提案する。
VisionPulseは、推論中に視覚的間隔を強制することにより、関連する視覚的証拠を保持しながら冗長な視覚的コンテキストをフィルタリングし、推論トレースを自然に短縮する。
論文 参考訳(メタデータ) (2026-05-29T15:51:12Z) - Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention [41.546578522790114]
検証可能な報奨付き強化学習(RLVR)は,大規模言語モデルにおける複雑な推論を促進するための有望なパラダイムとして登場した。
忠実なマルチモーダル推論の両面に対処するために,視覚的注意を固定し,強化するトレーニングフレームワークであるFithful-MR1を提案する。
論文 参考訳(メタデータ) (2026-05-21T07:10:18Z) - IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning [15.580070614790776]
強化学習による多モーダルな大言語モデルは、複雑な視覚的推論タスクにおいて顕著な能力を示した。
現在の方法では、下流の推論を容易にするために、高次元の視覚シーンを個別のテキストプロキシにプリエンコードする。
推論軌道を補正して最適化する動的視覚再構成を導入する。
論文 参考訳(メタデータ) (2026-05-18T09:53:08Z) - Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification [55.357038267439684]
Visual Re-Examination (VRE)は、MLLMが視覚的な入力を追加することなく推論中に自律的に視覚的イントロスペクションを実行することができる自己進化型トレーニングフレームワークである。
VREは推論精度と知覚信頼性を継続的に改善し、特にロングチェーン環境では幻覚を著しく低減する。
論文 参考訳(メタデータ) (2026-03-27T12:22:13Z) - Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning [96.01617809845396]
Ground-R1は、明示的なエビデンスや合理的アノテーションを必要とせずに、基礎的な視覚的推論を可能にする強化学習フレームワークである。
グラウンドR1は優れた性能を示し、不確実性認識、空間認識、反復的洗練などの創発的な認知行動を示す。
論文 参考訳(メタデータ) (2025-05-26T17:51:47Z) - Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models [62.698520962933195]
LVLM(Large Vision-Language Models)は、クロスモデルタスクでは優れているが、長文推論ではパフォーマンスが低下する。
そこで本研究では,重要でないテキスト情報を選択的に除去する,学習不要なコンテキストプルーニング手法を提案する。
論文 参考訳(メタデータ) (2024-10-25T17:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。