論文の概要: MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware
- arxiv url: http://arxiv.org/abs/2607.28006v1
- Date: Thu, 30 Jul 2026 10:54:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.516677
- Title: MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware
- Title(参考訳): MMLDSum-LLM:ビジュアルアライメントとキーワード認識によるマルチモーダル長文書要約
- Abstract要約: MMLDSum-Benchはマルチモーダル文書要約のための高品質なベンチマークである。
また,再現可能な2段階トレーニングフレームワークMMLDSum-LLMを提案する。
当社のアプローチはキー情報カバレッジと相互整合性を大幅に改善する。
- 参考スコア(独自算出の注目度): 11.787892687988368
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal long documents are core carriers of professional knowledge, where critical evidence is sparsely distributed across paragraphs and modalities. This easily causes key information omission and cross-modal hallucinations in summarization by multimodal LLMs. These issues stem from attention drift in long-range dependency modeling and gaps in inter-modal alignment. To address this, we introduce MMLDSum-Bench, a high-quality benchmark for multimodal long-document summarization, covering multiple domains, context-length scales, and visual-textual modality distributions. We further propose MMLDSum-LLM, a reproducible two-stage training framework that combines supervised fine-tuning with visual-alignment weighted loss and keyword-aware weighted loss, followed by GRPO with a multi-objective reward (keyword coverage, image-text alignment, ROUGE, and length control). Extensive experiments on MMLDSum-Bench, comparing against leading closed-source and open-source multimodal models under a unified evaluation protocol - including LLM-as-a-judge scoring, atomic-claim precision/recall, image-text alignment (ITA), and ROUGE - demonstrate that our approach significantly improves key-information coverage and cross-modal consistency.
- Abstract(参考訳): マルチモーダルな長い文書は専門知識のコアキャリアであり、重要な証拠は段落やモダリティに分散している。
このことは、マルチモーダルLLMによる要約において、キー情報の欠落やクロスモーダル幻覚を容易に引き起こす。
これらの問題は、長距離依存性モデリングにおける注意の漂いと、モーダル間アライメントにおけるギャップに起因する。
MMLDSum-Benchはマルチモーダルな文書要約のための高品質なベンチマークであり、複数のドメイン、コンテキスト-長さスケール、視覚-テクスチュアルなモダリティ分布をカバーしている。
MMLDSum-LLMは、教師付き微調整と視覚的調整による重み付き損失とキーワード認識による重み付き損失とを組み合わせた再現可能な2段階トレーニングフレームワークであり、GRPOと多目的報酬(キーワードカバレッジ、画像テキストアライメント、ROUGE、長さ制御)を併用する。
LLM-as-a-judgeスコア、アトミック-claim精度/リコール、画像テキストアライメント(ITA)、ROUGEなど、統一された評価プロトコルの下で、主要なクローズドソースおよびオープンソースマルチモーダルモデルと比較したMMLDSum-Benchに関する大規模な実験は、我々のアプローチがキー情報カバレッジとクロスモーダル一貫性を大幅に改善することを示した。
関連論文リスト
- MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios [44.67920911003142]
MMLongEmbedは、長期コンテキストシナリオでMEMを評価するための最初の総合的なベンチマークである。
MMLongEmbedは、複数のコンテキスト範囲にまたがる4つの検索タスクで構成され、テキスト、ドキュメント、ビデオモダリティをカバーする。
論文 参考訳(メタデータ) (2026-06-05T05:42:34Z) - HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding [1.8482679687103294]
HAVENは階層的に整列したマルチモーダル・ベンチマークである。
この統一アノテーションパラダイムに基づいて,要約,時間的推論,マルチモーダルグラウンド,サリエンシランキングにまたがる総合評価スイートを提案する。
論文 参考訳(メタデータ) (2026-05-19T00:48:14Z) - PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging [80.17966517536102]
マルチモーダル大規模言語モデルの事前学習の核心は、効果的なクロスモーダルアライメントの確立にあると論じる。
この知見に触発されて,マルチモーダル事前学習から学んだクロスモーダルアライメント機能を統合することを目的とした,アライメント後のマージタスクを導入する。
クロスモーダルプロジェクタのためのアライメント後マージフレームワークであるPivotMergeを提案する。
論文 参考訳(メタデータ) (2026-04-18T09:38:03Z) - Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval [27.493644447594367]
MCMR (Multi-Conditional Multimodal Retrieval) は、自然言語クエリによる細粒度・多条件クロスモーダル検索を評価するために設計された大規模ベンチマークである。
製品ドメインは、上着と下着、宝石、靴、家具の5つ。
MLLMベースのマルチモーダルレトリバーと視覚言語リランカの多種多様なスイートをベンチマークし,その条件認識推論能力を評価する。
論文 参考訳(メタデータ) (2026-03-01T12:53:47Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - MCiteBench: A Multimodal Benchmark for Generating Text with Citations [31.793037002996257]
MLLM(Multimodal Large Language Models)は多様なモダリティを統合するために進歩しているが、幻覚に悩まされることが多い。
既存の作業は主にテキストのみのコンテンツに対する引用の生成に重点を置いており、マルチモーダルシナリオの課題はほとんど解明されていない。
マルチモーダルな文脈で引用文を生成するMLLMの能力を評価するための最初のベンチマークであるMCiteBenchを紹介する。
論文 参考訳(メタデータ) (2025-03-04T13:12:39Z) - Benchmarking Retrieval-Augmented Generation in Multi-Modal Contexts [56.7225771305861]
本稿では,マルチモーダル大規模言語モデルの有効性を評価するためのベンチマークであるMulti-Modal Retrieval-Augmented Generation (M$2$RAG)を紹介する。
このベンチマークは、イメージキャプション、マルチモーダル質問応答、マルチモーダル事実検証、イメージリランクの4つのタスクで構成されている。
MLLMのコンテキスト利用能力を高めるため,マルチモーダル検索型インストラクションチューニング(MM-RAIT)も導入する。
論文 参考訳(メタデータ) (2025-02-24T16:25:25Z) - VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation [100.06122876025063]
本稿では,マルチドキュメント設定でQAシステムを評価するために設計された,初の総合ベンチマークであるVisDoMBenchを紹介する。
視覚とテキストのRAGを同時に利用する新しいマルチモーダル検索拡張生成(RAG)手法であるVisDoMRAGを提案する。
論文 参考訳(メタデータ) (2024-12-14T06:24:55Z) - Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion [70.9767518332692]
LLMを事前訓練された視覚モデルに組み込んだマルチモーダル大規模言語モデル(MLLM)は、近年、多様な視覚言語タスクにまたがる印象的なパフォーマンスを実証している。
しかし、複数の画像を含む文脈を理解するには不十分である。
本稿では,2つのフェーズ・パラダイムであるブラウズ・アンド・集中型を提案し,より深いマルチモーダルコンテキスト融合を実現する。
論文 参考訳(メタデータ) (2024-02-19T14:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。