論文の概要: Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
- arxiv url: http://arxiv.org/abs/2606.25325v1
- Date: Wed, 24 Jun 2026 02:43:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.19594
- Title: Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
- Title(参考訳): Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
- Abstract要約: マルチモーダル知覚を明示的に最適化する強化学習フレームワークOPPOを提案する。
オムニ・パーセプション・リワード(Omni-Perception Reward)は、微妙な視覚的、音響的、感情的な手がかりに地道理を分解する。
実験により,OPPOはMER-UniBenchおよびMME-Emotion上で最先端の性能を達成することが示された。
- 参考スコア(独自算出の注目度): 31.945807748964068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We find that current emotion-oriented Omni-MLLMs still lack reliable omni-modal perception: they (i) underutilize multimodal cues in their reasoning trajectories and (ii) exhibit unfaithful behavior, often hallucinating modality-specific statements from other modalities. Building on these insights, we propose OPPO (Omni-Perception Policy Optimization), a reinforcement learning framework that explicitly optimizes multimodal perception. First, an Omni-Perception Reward decomposes ground-truth reasoning into fine-grained visual, acoustic, and emotion cues and rewards trajectories that semantically recover these cues. Second, an Omni-Perception Loss compares the policy under full and unimodally masked inputs, applying a KL penalty only to modality-specific evidence tokens to suppress cross-modal hallucination. We further introduce MEP-Bench, a diagnostic benchmark that quantifies utilization and faithfulness. Experiments show that OPPO achieves state-of-the-art performance on MER-UniBench and MME-Emotion, while substantially improving utilization and faithfulness scores on MEP-Bench, highlighting the importance of sufficient and faithful omni perception for multimodal emotion reasoning.
- Abstract(参考訳): 現在の感情指向型Omni-MLLMは、信頼性に欠けていることがわかっています。
一 推論軌道におけるマルチモーダルキューの活用及び利用
(ii)不信な振る舞いを示し、しばしば他のモダリティからモダリティ固有の言明を幻覚させる。
これらの知見に基づいて,マルチモーダル知覚を明示的に最適化する強化学習フレームワークOPPO(Omni-Perception Policy Optimization)を提案する。
第一に、オムニ・パーセプション・リワード(Omni-Perception Reward)は、地道理を微粒な視覚的、音響的、感情的なキューに分解し、これらのキューを意味的に回復する軌跡を報いる。
第二に、Omni-Perception Loss(英語版)は、完全な、一様にマスクされた入力の下でポリシーを比較し、モダリティ固有の証拠トークンにのみKLペナルティを適用して、モダリティの幻覚を抑制する。
また、MEP-Benchは、利用率と忠実度を定量化する診断ベンチマークである。
実験により、OPPOはMER-UniBenchとMME-Emotionの最先端性能を実現し、MEP-Benchの有効性と忠実度スコアを大幅に改善し、マルチモーダル感情推論における十分で忠実なオムニ認識の重要性を強調した。
関連論文リスト
- Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation [32.16800432913683]
両レンズフレームワークを介して動作した因果感(Causal Modality Sensitivity, CMS)を定式化する。
また、言語事前の診断データセットであるCausalMSBenchをキュレートする。
トレーニング不要な推論時間フレームワークであるModality Subspace Activation (MSA)を提案する。
論文 参考訳(メタデータ) (2026-07-31T05:46:40Z) - EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation [58.055014746373054]
マルチモーダル感情認識のための明確な不確実性監視フレームワークであるEmoEUSを提案する。
EmoEUSは、学習された分散推定を用いてモダリティを動的に重み付けすることで、不確実性を考慮したマルチモーダル融合を行う。
IEMOCAPとMELDの実験は、EmoEUSが最先端の手法を一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-19T18:09:22Z) - MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs [0.0]
感情分析のためのマルチモーダル適応Few-Shot Prompting (MAF) フレームワークを提案する。
MAFはクエリ関連デモを検索して統合し、MLLMの感情推論能力を文脈に敏感な方法で引き出す。
公開ベンチマークデータセットの実験では、MAFが大幅に、一貫したパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2026-06-14T09:16:36Z) - Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models [53.15468578562038]
マルチモーダル大言語モデル(MLLM)のための不確実性を考慮した探索的直接参照最適化(UE-DPO)手法を提案する。
まず、与えられた画像にトークン予測を根拠にしなかったモデルの不確かさを定量化する。
次に、好ましいサンプルにおいて、視覚的に不足したトークンに対する学習のプレッシャーを高め、非推奨サンプルにおける有益な知識の過度な報酬化を緩和する。
論文 参考訳(メタデータ) (2026-05-06T13:08:12Z) - ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence [4.505342761520748]
ONOTEは、様々な表記システムにまたがる主観的スコアのバイアスを取り除くために、標準ピッチ投影において決定論的パイプラインを用いたマルチフォーマットのベンチマークである。
先行する一様モデルの評価は、知覚的精度と音楽理論的理解の根本的な切り離しを露呈する。
論文 参考訳(メタデータ) (2026-04-22T16:06:48Z) - Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models [73.89069781682032]
我々は、Omni-Modal Large Language Models (OLLM) のモダリティ嗜好を定量化する。
従来のVLMの「テキスト・マディナンス」とは異なり、ほとんどのOLLMは視覚的嗜好が顕著である。
私たちの仕事は、機械的な理解と、より信頼できるOLLMを構築するための実践的なツールの両方を提供します。
論文 参考訳(メタデータ) (2026-04-18T08:25:52Z) - Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities [26.613566093134065]
マルチモーダル・センティメント・アナリティクスは、テキスト、音響、視覚的手がかりを統合することで人間の感情を推測する。
既存のアプローチでは、すべてのモダリティが完全であるのに対して、現実のアプリケーションは、ノイズやハードウェアの障害、あるいはモダリティの欠如につながるプライバシー制限にしばしば遭遇する。
我々は、不確実なモダリティ条件下でMSA用に設計されたプログレッシブ表現学習フレームワークPRLFを提案する。
論文 参考訳(メタデータ) (2026-03-10T02:45:02Z) - MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization [4.088161686930475]
オームニLLMにおけるモーダリティグラウンドリングを改善するためのモーダリティデカップリング直接選好最適化(MoD-DPO)を提案する。
MoD-DPOは、無関係なモダリティにおける汚職への不変性、および関連するモダリティにおける摂動に対する感受性を明示的に強制するモダリティ対応正規化用語を導入している。
実験により、MoD-DPOは認識精度と幻覚抵抗を一貫して改善し、従来の優先最適化基準よりも優れていた。
論文 参考訳(メタデータ) (2026-03-03T17:50:24Z) - Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization [69.05600758833471]
マルチモーダル大言語モデル(MLLM)における幻覚を緩和するための効果的なアプローチとして、直接選好最適化(DPO)が登場している。
我々は、直接選好監督(応答対)を伴う対称選好学習を行うシンメトリ・マルチモーダル選好最適化(SymMPO)を提案する。
従来の順序的嗜好学習に加えて、SymMPOは、左右の選好ペア間の選好ギャップを定量的に調節する、選好マージン整合性損失を導入している。
論文 参考訳(メタデータ) (2025-06-13T12:29:15Z) - Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs [62.9348974370985]
約ゼロの余剰コストで幻覚を緩和するための注意再配置(AttnReal)を提案する。
我々のアプローチは,MLLMの注意分布が,歴史的出力トークンによって特徴が支配されるという重要な観測によって動機付けられている。
この観測に基づいて、AttnRealは出力トークンからの過剰な注意をリサイクルし、それを視覚トークンに再配置することで、MLLMの言語優先への依存を軽減します。
論文 参考訳(メタデータ) (2025-03-11T11:52:37Z) - What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models [50.97705264224828]
大規模マルチモーダルモデルに反現実的思考を組み込む新しい手法である反現実的インセプションを提案する。
我々は、より広い文脈のシーン理解にまたがる応答をモデルが関与し、生成することを目指している。
オープンソースモデルとプロプライエタリモデルの両方を含む様々なLMMの包括的分析は、反事実的思考が幻覚を著しく減少させることを裏付ける。
論文 参考訳(メタデータ) (2024-03-20T11:27:20Z) - AesBench: An Expert Benchmark for Multimodal Large Language Models on
Image Aesthetics Perception [64.25808552299905]
AesBenchはMLLMの審美的知覚能力の総合評価を目的とした専門家ベンチマークである。
本稿では,プロの審美専門家が提供した多彩な画像内容と高品質なアノテーションを特徴とするEAPD(Expert-labeled Aesthetics Perception Database)を構築した。
本稿では,知覚(AesP),共感(AesE),評価(AesA),解釈(AesI)の4つの視点からMLLMの審美的知覚能力を測定するための統合的基準を提案する。
論文 参考訳(メタデータ) (2024-01-16T10:58:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。