論文の概要: MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios
- arxiv url: http://arxiv.org/abs/2606.14747v1
- Date: Fri, 05 Jun 2026 05:42:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-21 20:00:42.768843
- Title: MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios
- Title(参考訳): MMLongEmbed: 長期シナリオにおけるマルチモーダル埋め込みモデルのベンチマーク
- Authors: Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang,
- Abstract要約: MMLongEmbedは、長期コンテキストシナリオでMEMを評価するための最初の総合的なベンチマークである。
MMLongEmbedは、複数のコンテキスト範囲にまたがる4つの検索タスクで構成され、テキスト、ドキュメント、ビデオモダリティをカバーする。
- 参考スコア(独自算出の注目度): 44.67920911003142
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advancements have significantly expanded the theoretical context windows of Multimodal Embedding Models (MEMs). However, larger context windows do not necessarily translate into effective comprehension and representation of long-context multimodal inputs, which remains a critical bottleneck for real-world deployment. To address the lack of systematic evaluation in this setting, we introduce MMLongEmbed, the first comprehensive benchmark for evaluating MEMs in long-context scenarios. MMLongEmbed comprises four retrieval tasks spanning multiple context-length ranges, covering text, document, and video modalities. Through extensive evaluation of state-of-the-art models, we find that current architectures rely heavily on superficial feature matching and struggle to capture deep semantic and structural dependencies. We further observe that performance degradation varies systematically with context length and key information placement. Moreover, models exhibit substantially different robustness to redundant contextual information across modalities. For reproducibility, the benchmark and code are publicly available.
- Abstract(参考訳): 近年, マルチモーダル・エンベディング・モデル (MEM) の理論的文脈ウィンドウが大幅に拡張されている。
しかし、より大規模なコンテキストウィンドウは、必ずしも実世界の展開において重要なボトルネックである長文のマルチモーダル入力の効果的な理解と表現に変換されるとは限らない。
この環境での体系的評価の欠如に対処するため、長いコンテキストシナリオでMEMを評価するための最初の総合的なベンチマークであるMMLongEmbedを紹介する。
MMLongEmbedは、複数のコンテキスト範囲にまたがる4つの検索タスクで構成され、テキスト、ドキュメント、ビデオモダリティをカバーする。
最先端モデルの広範な評価を通じて、現在のアーキテクチャは表面的特徴マッチングに大きく依存し、深いセマンティックおよび構造的依存関係を捉えるのに苦労していることがわかった。
さらに、性能劣化は文脈長や重要情報配置とともに体系的に変化することを観察する。
さらに、モデルはモダリティ全体にわたって冗長な文脈情報に対して、かなり異なるロバスト性を示す。
再現性については、ベンチマークとコードが公開されている。
関連論文リスト
- HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding [1.8482679687103294]
HAVENは階層的に整列したマルチモーダル・ベンチマークである。
この統一アノテーションパラダイムに基づいて,要約,時間的推論,マルチモーダルグラウンド,サリエンシランキングにまたがる総合評価スイートを提案する。
論文 参考訳(メタデータ) (2026-05-19T00:48:14Z) - MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence [66.12781312894647]
MMCL-Bench(MMCL-Bench)は、視覚的・混合モダリティ教育の文脈からタスクローカルルール、手順、経験的パターンを学ぶためのベンチマークである。
この設定では、学習コンテキストを推論する前に、画像、スクリーンショット、マニュアル、ビデオ、フレームシーケンスから関連するエビデンスを復元し、ローカライズする必要がある。
厳密なスコアリングによるフロンティアマルチモーダルモデルを評価した結果、現在のシステムは堅牢なマルチモーダルコンテキスト学習には程遠いことが判明した。
論文 参考訳(メタデータ) (2026-05-12T19:57:37Z) - Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval [27.493644447594367]
MCMR (Multi-Conditional Multimodal Retrieval) は、自然言語クエリによる細粒度・多条件クロスモーダル検索を評価するために設計された大規模ベンチマークである。
製品ドメインは、上着と下着、宝石、靴、家具の5つ。
MLLMベースのマルチモーダルレトリバーと視覚言語リランカの多種多様なスイートをベンチマークし,その条件認識推論能力を評価する。
論文 参考訳(メタデータ) (2026-03-01T12:53:47Z) - Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional [40.11148315577635]
マルチモーダル大言語モデル(MLLM)を用いた23の視覚的質問応答ベンチマークにおける依存性の定量化のための大規模実験的検討を行った。
その結果,視力,質問 (テキスト) およびそれらの相互作用への依存度は,ベンチマーク内とベンチマーク内の両方で大きく異なることがわかった。
テキストのみのバイアスを軽減するための多くのベンチマークが、必然的に画像のみの依存関係を増幅していることがわかった。
この特徴はモデルのサイズにまたがって持続し、より大規模なモデルはこれらのモダリティ内依存を使い、マルチモーダル推論の欠如を隠蔽する高い性能を達成する。
論文 参考訳(メタデータ) (2025-09-27T21:13:29Z) - Benchmarking Retrieval-Augmented Generation in Multi-Modal Contexts [56.7225771305861]
本稿では,マルチモーダル大規模言語モデルの有効性を評価するためのベンチマークであるMulti-Modal Retrieval-Augmented Generation (M$2$RAG)を紹介する。
このベンチマークは、イメージキャプション、マルチモーダル質問応答、マルチモーダル事実検証、イメージリランクの4つのタスクで構成されている。
MLLMのコンテキスト利用能力を高めるため,マルチモーダル検索型インストラクションチューニング(MM-RAIT)も導入する。
論文 参考訳(メタデータ) (2025-02-24T16:25:25Z) - VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation [100.06122876025063]
本稿では,マルチドキュメント設定でQAシステムを評価するために設計された,初の総合ベンチマークであるVisDoMBenchを紹介する。
視覚とテキストのRAGを同時に利用する新しいマルチモーダル検索拡張生成(RAG)手法であるVisDoMRAGを提案する。
論文 参考訳(メタデータ) (2024-12-14T06:24:55Z) - Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning [68.43706033424378]
本研究では,大規模言語モデル(MLLM)において,テキスト中のテキスト長を効率的に向上する革新的な手法を提案する。
視覚トークンを用いて長文のテキストを処理するビジュアルインコンテキストテキスト処理(VisInContext)を提案する。
この技術は、トレーニングおよび推論段階の両方において、GPUメモリ使用率と浮動小数点演算(FLOP)を大幅に削減する。
論文 参考訳(メタデータ) (2024-06-04T17:59:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。