論文の概要: MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning
- arxiv url: http://arxiv.org/abs/2607.26465v1
- Date: Wed, 29 Jul 2026 04:37:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.541233
- Title: MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning
- Title(参考訳): MultivationBench: マルチモーダルシーケンスモチベーション推論のためのベンチマーク
- Abstract要約: マルチモーダルな大規模言語モデルは、社会的知性の可能性から大きな関心を集めている。
ストーリー駆動型ビジュアル物語におけるマルチモーダルモチベーション推論を厳格に評価するベンチマークであるMultivationBenchを紹介する。
すべてのテストされたモデルは、シーケンシャルなコンテキストにわたる一貫したモチベーション推論を維持するのに苦労しています。
- 参考スコア(独自算出の注目度): 53.157837009685466
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models have sparked significant interest due to their potential for social intelligence; however, their ability to perform sequential motivation reasoning remains insufficiently studied. Existing evaluations predominantly examine static text or isolated visual snapshots, which do not reflect the cumulative nature of real-world behavioral drivers. To address this gap, we introduce MultivationBench, a benchmark designed to rigorously evaluate multimodal motivation reasoning within story-driven visual narratives. The benchmark builds upon established psychological frameworks - Maslow's hierarchy and Reiss's basic desires - and requires models to integrate accumulated multimodal context to infer evolving motivations. Results indicate that MultivationBench presents a significant challenge: all tested models struggle to maintain consistent motivation reasoning across sequential contexts, revealing a critical disconnect between static recognition capabilities and the dynamic reasoning essential for human-like social understanding.
- Abstract(参考訳): マルチモーダルな大規模言語モデルは、社会的知性の可能性から大きな関心を集めているが、シーケンシャルな動機づけを行う能力はいまだに十分に研究されていない。
既存の評価は、実世界の行動ドライバーの累積特性を反映しない静的テキストや孤立した視覚スナップショットを主に調べている。
このギャップに対処するために,ストーリ駆動型ビジュアル物語におけるマルチモーダルモチベーション推論を厳格に評価するベンチマークであるMultivationBenchを紹介する。
このベンチマークは、確立された心理学的フレームワーク(Maslowの階層とReissの基本的な欲求)の上に構築され、進化するモチベーションを推測するために蓄積されたマルチモーダルコンテキストを統合するモデルを必要とする。
すべてのテストされたモデルは、逐次的コンテキストにわたる一貫したモチベーション推論を維持するのに苦労し、静的認識能力と人間のような社会的理解に不可欠な動的推論とを決定的に切り離すことを明らかにする。
関連論文リスト
- Multimodal Fact-Level Attribution for Verifiable Reasoning [80.60864342985748]
マルチモーダル大言語モデル(MLLM)は、多段階推論と長文生成を含む実世界のタスクにますます利用されている。
既存のマルチモーダルグラウンドベンチマークと評価手法は、複雑なマルチモーダル推論における属性評価に失敗する。
我々は、直接観察以上の推論を必要とする設定において、ファクトレベルのマルチモーダル属性を評価するためのベンチマークであるMuRGAtを紹介する。
論文 参考訳(メタデータ) (2026-02-12T03:10:02Z) - Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space [46.05748768260013]
テスト時間動的マルチモーダル遅延推論フレームワークを提案する。
信頼誘導の潜在ポリシー勾配最適化を、詳細な推論のために潜在シンクトークンに採用する。
7つのマルチモーダル推論ベンチマークと様々なモデルアーキテクチャによる実験により、DMLRは推論性能と知覚性能を大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-12-14T10:07:45Z) - ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation [79.17352367219736]
ROVERは1つのモダリティを使用して、もう1つの出力を誘導、検証、精査する。
ROVERは、相互モーダルな推論を明示的にターゲットとする、人間による注釈付きベンチマークである。
論文 参考訳(メタデータ) (2025-11-03T02:27:46Z) - ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning [76.95203056566191]
マルチモーダル推論は言語と視覚の反復的調整を必要とするが、何が意味あるインターリーブド思考の連鎖を構成するかは定かではない。
我々はThinkMorphを開発した。ThinkMorphは、視覚的エンゲージメントの異なるタスクにまたがる、約24Kの高品質なインターリーブ付き推論トレースに基づいて微調整された統一モデルだ。
ThinkMorphは、一貫性のある言語論理を維持しながら、視覚的コンテンツを具体的に操作する、プログレッシブなテキストイメージ推論ステップを生成することを学ぶ。
論文 参考訳(メタデータ) (2025-10-30T17:51:38Z) - Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark [73.27104042215207]
EMMAは,数学,物理,化学,コーディングにまたがる有機マルチモーダル推論を対象とするベンチマークである。
EMMAタスクは、各モードで独立に推論することで対処できない高度なクロスモーダル推論を要求する。
EMMA上での最先端MLLMの評価は、複雑なマルチモーダルおよびマルチステップ推論タスクの処理において、重大な制限を生じさせる。
論文 参考訳(メタデータ) (2025-01-09T18:55:52Z) - DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning
in Language Models [28.712359821231182]
大規模言語モデル(LLM)は、思考の連鎖(CoT)を利用して人間の思考を模倣することによって、言語モダリティの多段階的推論において顕著な進歩を遂げた。
これらの進歩をマルチモーダルな文脈に移すことは、労働集約的アノテーションの非現実的な必要性に限らず、より高い課題をもたらす。
本研究では,複数モーダリティを推論に組み込んだDDCoTプロンプトを提案する。
論文 参考訳(メタデータ) (2023-10-25T08:03:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。