論文の概要: MetaphorVU: Towards Metaphorical Video Understanding
- arxiv url: http://arxiv.org/abs/2605.25461v1
- Date: Mon, 25 May 2026 06:12:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:19.343108
- Title: MetaphorVU: Towards Metaphorical Video Understanding
- Title(参考訳): MetaphorVU: メタフォリカルビデオ理解を目指して
- Authors: Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun,
- Abstract要約: 本稿ではメタファーVU-Benchを提案する。
現在のMLLMは正確な比喩的ビデオ理解に苦しむが、それは主に欠陥のあるクロスドメインマッピングのため、人間のレベルよりはるかに遅れている。
この発見を動機として、マッピング強化としてのメタファ知識グラフを構築し、推論時間拡張フレームワークであるMetaphorBoostを提案する。
- 参考スコア(独自算出の注目度): 81.48044445740618
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Metaphorical videos are prevalent across various real-world scenarios to convey complex ideas, and understanding them typically requires high-order cognitive capabilities. The lack of systematic studies on metaphorical video understanding not only constrains the real-world applicability of MLLMs but also impedes the thorough assessment of their high-order cognitive capabilities. To bridge this gap, we propose MetaphorVU-Bench, the first systematic and comprehensive benchmark dedicated to metaphorical video understanding. Through experiments, we find current MLLMs struggle with accurate metaphorical video understanding, lagging far behind human level, primarily due to defective cross-domain mapping. Motivated by this finding, we construct a metaphor knowledge graph as mapping augmentation and propose MetaphorBoost, an inference-time enhancement framework achieving consistent performance improvement. Our benchmark, analysis, and method provide useful insights and a foundation for future research on advancing MLLMs.
- Abstract(参考訳): メタフォリカルビデオは、複雑なアイデアを伝えるために様々な現実世界のシナリオで普及しており、それらを理解するには一般的に高次認知能力が必要である。
メタファ的ビデオ理解に関する体系的な研究の欠如は、MLLMの現実的な適用性を制約するだけでなく、その高次認知能力の徹底的な評価を妨げている。
このギャップを埋めるために,メタファーVU-ベンチ(MetaphorVU-Bench)を提案する。
実験により、現在のMLLMは正確な比喩的ビデオ理解に苦慮し、主に欠陥のあるクロスドメインマッピングのために人間のレベルよりはるかに遅れていることがわかった。
この発見を動機として、マッピング強化としてのメタファ知識グラフを構築し、一貫したパフォーマンス向上を実現する推論時間拡張フレームワークであるMetaphorBoostを提案する。
我々のベンチマーク、分析、手法は、MLLMの進歩に関する今後の研究の基盤となる有用な洞察を与えてくれる。
関連論文リスト
- Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling [68.14113731953971]
本稿では,人間のような想像力をシミュレートするインプリシット・スパットIaLwOrldモデリングパラダイムMILOを紹介する。
提案手法は,複数のベースラインとベンチマークにまたがる空間推論能力を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2025-12-01T16:01:41Z) - Unveiling LLMs' Metaphorical Understanding: Exploring Conceptual Irrelevance, Context Leveraging and Syntactic Influence [40.32545329527664]
大規模言語モデル(LLM)は、知識統合、文脈推論、創造的生成における高度な能力を示す。
本研究では,LLMのメタファ処理能力について3つの視点から検討する。
論文 参考訳(メタデータ) (2025-10-05T09:45:51Z) - Metaphor identification using large language models: A comparison of RAG, prompt engineering, and fine-tuning [0.6524460254566904]
本研究では,大言語モデル(LLM)が全文でメタファ識別を自動化する可能性について検討する。
i) 検索拡張生成(RAG) モデルにコードブックを付与し,その規則や例に基づいて注釈を付けるように指示する手法, (ii) タスク固有の言語命令を設計する手法, (iii) ハンドコードされたテキストでモデルを訓練してパフォーマンスを最適化するファインチューニング,の3つの手法を比較した。
論文 参考訳(メタデータ) (2025-09-29T14:50:18Z) - MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models [56.49314029765706]
本稿では,LVMの幻覚を系統的に評価するベンチマークであるMESHを紹介する。
MESHでは、ターゲットインスタンスとトラップインスタンスを組み込んだバイナリとマルチチョイスフォーマットを備えたQA-Answeringフレームワークを使用している。
我々は,MESHがビデオの幻覚を効果的かつ包括的に識別する手法であることを実証した。
論文 参考訳(メタデータ) (2025-09-10T12:34:07Z) - Towards Multimodal Metaphor Understanding: A Chinese Dataset and Model for Metaphor Mapping Identification [9.08615188602226]
我々は、特定のターゲットドメインとソースドメインのアノテーションを含む中国のマルチモーダルメタファー広告データセット(CM3D)を開発した。
我々は,これらのマッピングを識別するための認知過程をシミュレートする,CPMMIM (Chain-of-NLP) Prompting-based Metaphor Mapping Identification Model) を提案する。
論文 参考訳(メタデータ) (2025-01-05T04:15:03Z) - Science is Exploration: Computational Frontiers for Conceptual Metaphor Theory [0.0]
本研究では,Large Language Models (LLM) が,自然言語データにおける概念的メタファの存在を正確に識別し,説明することができることを示す。
メタファアノテーションガイドラインに基づく新しいプロンプト手法を用いて,LLMが概念的メタファに関する大規模計算研究において有望なツールであることを実証した。
論文 参考訳(メタデータ) (2024-10-11T17:03:13Z) - Metaphor Generation with Conceptual Mappings [58.61307123799594]
我々は、関連する動詞を置き換えることで、リテラル表現を与えられた比喩文を生成することを目指している。
本稿では,認知領域間の概念マッピングを符号化することで生成過程を制御することを提案する。
教師なしCM-Lexモデルは,近年のディープラーニングメタファ生成システムと競合することを示す。
論文 参考訳(メタデータ) (2021-06-02T15:27:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。