論文の概要: Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
- arxiv url: http://arxiv.org/abs/2605.08965v1
- Date: Sat, 09 May 2026 14:18:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.997833
- Title: Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
- Title(参考訳): MLLMは視覚的説得について推論できるか? 推論の有効性と信条の評価
- Abstract要約: MLLMを予測前に推論するよう促すことは、常に役に立たず、説得力予測性能を低下させることさえ可能であることを示す。
本稿では,3次元忠実度評価フレームワークを導入し,合理性-決定整合性,合理性-画像の基底性,合理性-決定感度について述べる。
- 参考スコア(独自算出の注目度): 12.37405312423087
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite strong performance of Multimodal Large Language Models (MLLMs) on multimodal tasks, predicting whether and why an image is persuasive remains challenging. We first show that prompting MLLMs to reason before prediction does not consistently help, and can even reduce persuasiveness prediction performance, suggesting that naively generated rationales are unreliable signals for this task. Yet, no established methodology exists for training MLLMs to reason about visual persuasion or evaluating whether their rationales faithfully support their decisions. To address this gap, we show empirically and theoretically that diverse teacher-generated rationales, when used for supervised fine-tuning, improve visual persuasiveness prediction. We further introduce a three-dimensional faithfulness evaluation framework covering rationale-to-decision consistency, rationale-to-image groundedness, and rationale-to-decision sensitivity. Applying this framework shows that prediction performance alone does not guarantee faithful rationales, while rationale-to-decision sensitivity is most aligned with human rationale preferences. These findings motivate faithfulness-aware training objectives and scalable rationale supervision for visual persuasiveness evaluation. Our code and dataset will be made publicly available.
- Abstract(参考訳): マルチモーダルタスクにおけるMLLM(Multimodal Large Language Models)の性能は高いが、イメージが説得力を持つかどうかを予測することは依然として困難である。
まず,MLLMを予測前に推論するよう促すことは必ずしも役に立たないこと,さらには説得力予測性能を低下させることも示し,帰納的生成された合理性がこの課題に対して信頼できない信号であることを示唆した。
しかし、MLLMを訓練して視覚的説得について推論したり、理性が決定を忠実に支持するかどうかを評価するための確立した方法論は存在しない。
このギャップに対処するために、教師による微調整に使用する多様な教師生成的理性は、視覚的説得力の予測を改善することを実証的、理論的に示す。
さらに,有理間整合性,有理間接地性,有理間接地感を包含する3次元忠実度評価フレームワークを導入する。
この枠組みを適用すると、予測性能だけでは忠実な合理性を保証することができず、合理性から決定への感受性は人間の合理性選好と最も一致していることがわかる。
これらの知見は、視覚的説得力評価のための忠実な訓練目標とスケーラブルな合理性指導を動機付けている。
コードとデータセットは公開されます。
関連論文リスト
- Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning [82.86343313807158]
我々は、視覚的証拠が推論プロセスにどのように、いつ導入されるかが中心的な課題であると主張している。
この知見により,言語モデルが推論プロセスを制御するマルチモーダル推論フレームワークCSMRを提案する。
論文 参考訳(メタデータ) (2026-05-27T08:43:13Z) - When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning [52.21239821135325]
本稿では、効率的な推論のための新しいフレームワークDTSR(Dynamic Thought Sufficiency in Reasoning)を紹介する。
人間のメタ認知にインスパイアされたDTSRは、リフレクションシグナルモニタリングとThought Sufficiency Checkという2つの段階で動作する。
DTSRは推論長を28.9%から34.9%削減し、性能損失を最小限に抑えている。
論文 参考訳(メタデータ) (2026-04-08T07:56:28Z) - Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning [97.29507133345766]
我々は,動詞化可能な潜在推論により,コンパクトかつ高性能な計画を実現する効率的な推論フレームワークであるFast-ThinkActを提案する。
様々な具体的操作と推論ベンチマークの実験により、Fast-ThinkActは最大89.3%の推論遅延で強いパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-01-14T18:59:59Z) - Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking [11.763473690046721]
推論の拡張された視覚言語モデルは、より大きな能力と透明性を約束する明確な思考の連鎖を生成する。
モデルは、視覚的に不誠実な中間段階によって正しい答えに達するか、あるいは最終的な予測において、合理的に失敗する。
本稿では, 推論連鎖の知覚段階が画像中に存在するか否かに着目し, 推論鎖の視覚的忠実度を評価次元として紹介する。
論文 参考訳(メタデータ) (2025-12-13T07:04:42Z) - Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding [50.014363382140324]
モダリティ・コンパタンス(MI)は、感情に支配的なモダリティを識別するためのシンプルで効果的なメカニズムである。
MIGRは推論シーケンスを再編成し、その説明は対象の感情に対して最も重要なモダリティから始まる。
その結果、MIGRは推論信頼性を大幅に改善し、感情的に矛盾した説明を伴う正しい予測の事例を減少させることがわかった。
論文 参考訳(メタデータ) (2025-12-02T12:29:41Z) - Do Vision-Language Models Understand Visual Persuasiveness? [0.0]
バイナリ説得力判定のための高合意データセットを構築した。
視覚的説得因子(VPF)の分類について紹介する。
また,説得関連推論のための認知的ステアリングと知識注入戦略についても検討した。
論文 参考訳(メタデータ) (2025-11-21T08:28:02Z) - From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization [62.07990937720985]
DRM(Dimension-level Reward Model)は、大規模言語モデルのための新しい監視フレームワークである。
DRMは3つの基本的、相補的、解釈可能な次元に沿って推論プロセスの品質を評価する。
実験の結果、DRMは効果的な監視信号を提供し、LCMの最適化を誘導し、推論能力を向上することが示された。
論文 参考訳(メタデータ) (2025-10-13T14:29:15Z) - Perceptions to Beliefs: Exploring Precursory Inferences for Theory of Mind in Large Language Models [51.91448005607405]
ToMi と FANToM に文字認識を付加することにより,ヒト ToM 前駆体の評価を行った。
本稿では,LLMの強い知覚推定能力を利用した新しいToM手法であるPercepToMについて述べる。
論文 参考訳(メタデータ) (2024-07-08T14:58:29Z) - Learning From Correctness Without Prompting Makes LLM Efficient Reasoner [30.203952806009717]
大規模言語モデル(LLM)は様々なタスクで優れた性能を示してきたが、幻覚、不誠実な推論、有害な内容などの制限がまだ残っている。
人間のフィードバックや外部ツール,手工芸のプロンプトを不要にする,本質的な自己修正推論フレームワークをLLMに導入する。
論文 参考訳(メタデータ) (2024-03-28T02:12:49Z) - Self-Contradictory Reasoning Evaluation and Detection [31.452161594896978]
本稿では,自己矛盾推論(Self-Contra)について考察する。
LLMは文脈情報理解や常識を含むタスクの推論において矛盾することが多い。
GPT-4は52.2%のF1スコアで自己コントラを検出できる。
論文 参考訳(メタデータ) (2023-11-16T06:22:17Z) - From Heuristic to Analytic: Cognitively Motivated Strategies for
Coherent Physical Commonsense Reasoning [66.98861219674039]
ヒューリスティック分析推論(HAR)戦略は、モデル決定のための合理化のコヒーレンスを大幅に改善する。
以上の結果から, PLM推論の一貫性と信頼性を効果的に向上できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-10-24T19:46:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。