論文の概要: MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
- arxiv url: http://arxiv.org/abs/2605.29951v1
- Date: Thu, 28 May 2026 13:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.370049
- Title: MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
- Title(参考訳): MuPHI:セマンティックグラウンドド・リワード最適化による暗黙のマルチモーダル・ハーム推論の学習
- Authors: Anisha Saha, Varsha Suresh, Teodora Kamova, Sophia Wiedmann, Timothy Hospedales, Vera Demberg,
- Abstract要約: 我々は、画像テキストペアを含むデータセットであるMultimodal Pragmatic Harm Interpretation (MuPHI)を導入し、害を微妙なマルチモーダルキューで符号化する。
MuPHIRMはマルチパースペクティブ報酬を最適化することで共同意味学を学習する推論強化トレーニングフレームワークである。
この結果から,推論指向報酬最適化は,ベンチマーク固有のショートカットを超えて一般化したマルチモーダルシステムを構築する上で,有望な方向性を示すことが示唆された。
- 参考スコア(独自算出の注目度): 14.713115117792503
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding how harm emerges from interaction between otherwise benign image-text pairs requires intent-aware cross-modal reasoning beyond surface-level features. Existing vision-language models (VLMs) excel at literal reasoning over perceptual cues but often fail to derive harmful semantics that rely on implicit, context-dependent reasoning. To evaluate VLMs on compositional harm detection and reasoning, we introduce Multimodal Pragmatic Harm Interpretation (MuPHI), a dataset containing image-text pairs where harm is encoded in subtle multimodal cues. MuPHI spans diverse harm categories and includes annotated harm rationales for assessing VLM reasoning chains. To improve both detection and reasoning in VLMs, we propose MuPHIRM, a reasoning-augmented training framework which learns joint semantics by optimizing multi-perspective rewards. MuPHIRM improves both harm detection and reasoning quality of VLMs while demonstrating superior out-of-distribution robustness compared to both trained and inference-time baselines. Our findings suggest that reasoning-oriented reward optimization offers a promising direction towards building multimodal systems that generalize beyond benchmark-specific shortcuts.
- Abstract(参考訳): 良識のある画像とテキストのペア間の相互作用によって害が生じるかを理解するには、表面的な特徴を超えた、意図に敏感なクロスモーダル推論が必要である。
既存の視覚言語モデル(VLM)は、知覚的手がかりよりもリテラル推論が優れているが、暗黙的で文脈に依存した推論に依存する有害な意味論を導出できないことが多い。
構成的害検出と推論に関するVLMを評価するために,微妙なマルチモーダルキューで害を符号化する画像テキストペアを含むデータセットであるMultimodal Pragmatic Harm Interpretation(MuPHI)を導入する。
MuPHIは様々な調和カテゴリーにまたがっており、VLM推論連鎖を評価するための注釈付き調和論理を含んでいる。
VLMにおける検出と推論の両方を改善するために,マルチパースペクティブ報酬を最適化して共同意味学を学習する推論強化トレーニングフレームワーク MuPHIRM を提案する。
MuPHIRMは、VLMの有害検出と推論品質の両方を改善し、トレーニングされたベースラインと推論時のベースラインに比較して優れた分布外ロバスト性を示す。
この結果から,推論指向報酬最適化は,ベンチマーク固有のショートカットを超えて一般化したマルチモーダルシステムを構築する上で,有望な方向性を示すことが示唆された。
関連論文リスト
- Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning [65.15766304205657]
In-context Learning (ICL) は、大規模なモデルをいくつかの例を使ってタスクに適応させるが、視覚言語モデル(VLM)への拡張は脆弱である。
我々の分析によると、基本的な限界は帰納的ギャップにあり、モデルはしばしば欠陥のある推論から正しい答えを導き出す。
帰納的帰納的プロセスとしてマルチモーダル ICL を再構成する枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-04T09:18:19Z) - Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization [89.68681087743876]
MLLM(Multimodal Large Language Models)は,マルチターン推論において視覚ツールを積極的に呼び出すことによって,イメージで考えるモデルにインセンティブを与えている。
結果に基づく報酬を頼りにする一般的な強化学習の実践は、テキストの妥当性が経営幹部の失敗を隠蔽するという事実を無視します。
マルチモーダルエージェントポリシー最適化(MAPO)を導入し、テキスト推論とモデルが生成する視覚行動のギャップを埋める。
論文 参考訳(メタデータ) (2026-04-08T07:48:07Z) - Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs [55.61018839017648]
CoT(Chain-of- Thought)推論は、複雑な推論タスクにおいて、MLLM(Multimodal large language model)を大幅に改善した。
既存のアプローチは、主に長いテキスト推論軌道に依存し、安定した視覚的注意ポリシーを学ぶための限られたメカニズムを提供する。
地域レベルの視覚的注意に基づく報酬を導入する強化学習フレームワークを用いて訓練された視覚的推論モデルであるSAYOを提案する。
論文 参考訳(メタデータ) (2026-02-09T03:33:23Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought [11.538345159297839]
チェーン・オブ・シンクレット(CoT)プロンプトは、多モーダル推論を強化するために、大きな視覚言語モデル(LLM)に適応している。
既存のLVLMは、CoT推論において生成された有理性の内容を無視していることが多い。
本稿では,新しいプラグイン・アンド・プレイ型推論時間復号法である理性強化復号法(RED)を提案する。
論文 参考訳(メタデータ) (2025-07-10T12:07:13Z) - Multimodal Mathematical Reasoning with Diverse Solving Perspective [65.07953438724105]
画像探索ペア毎に複数の多様な解トラジェクトリをキャプチャする新しいデータセットであるMathV-DPを紹介する。
本稿では,Qwen-VLに基づくモデルQwen-VL-DPを提案する。
本手法は,様々な推論の観点からの学習を重視し,正しい解と異なる解を区別する。
論文 参考訳(メタデータ) (2025-07-03T17:07:20Z) - CF-VLM:CounterFactual Vision-Language Fine-tuning [10.299136720220416]
CounterFactual Vision-Language Fine-tuning (CF-VLM)は、視覚言語モデルの因果推論能力を高める新しいフレームワークである。
CF-VLMは3つの補完的なトレーニング目標を導入している: 基本的なクロスモーダルアライメントの維持、実写シーン表現のユニークさと安定性の強化、最小限ながら重要な因果編集に対するモデルの感度の強化。
論文 参考訳(メタデータ) (2025-06-10T20:20:05Z) - Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning [95.44766931218896]
MLLM(Multi-modal large language model)は、テキストベースの推論に遅れを取っている。
本稿では,MLLMの推論コンポーネントをモジュール化し,容易に置き換え可能なパーセプション推論デカップリングを提案する。
本稿では,視覚知覚最適化(VPO)と呼ばれる新しい強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-05T02:28:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。