論文の概要: Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment
- arxiv url: http://arxiv.org/abs/2609.02573v2
- Date: Sat, 05 Sep 2026 10:41:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.704644
- Title: Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment
- Title(参考訳): マルチモーダルLCM評価のための深くインターリーブされたテキストイメージコンテキスト
- Authors: Zihao Wang, Xi Xiang, Yuwen Sun, Yingyu Li, Yabo Zhang, Yihan Zeng, Fan Li, Wangmeng Zuo,
- Abstract要約: TIC-Benchは、テキストイメージの手がかりを統合し、深くインターリーブされたコンテキストの中で真実の事実を復元するモデルの能力を評価するように設計されている。
また,10種類のMLLMを評価し,人的専門家と比較してかなりの性能差が認められた。
- 参考スコア(独自算出の注目度): 57.41731607488101
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Current evaluations and training of multimodal models predominantly focus on multi-image tasks, largely overlooking interleaved text-image scenarios. In such multi-image tasks, text typically serves merely as task instructions, lacking deep semantic interaction with the visual content. In contrast, realworld applications like text-image co-creation, character tracking, and spatial reconstruction require constant interaction between text and images. Consequently, models must possess a deep understanding of these interleaved contexts. To bridge this gap, we introduce a novel benchmark, TIC-Bench (deeply interleaved Text-Image Contexts), designed to evaluate the capability of models to integrate text-image clues and recover the ground truth facts within deeply interleaved contexts. This benchmark encompasses three core domains: Logical, Temporal, and Spatial Association, which are further categorized into eight specific types, comprising a total of 2,280 questions. We evaluated 10 state-of-the-art MLLMs and observed a substantial performance gap compared to human experts, together with persistent difficulties in integrating evidence distributed across interleaved visual and textual inputs. Ultimately, this benchmark provides a valuable analytical tool for assessing and advancing the ability of multimodal models to effectively integrate text and image information in deeply interleaved contexts. TIC-Bench is publicly available at https://huggingface.co/datasets/pino10010/TIC-Bench
- Abstract(参考訳): マルチモーダルモデルの現在の評価とトレーニングは、主にインターリーブされたテキストイメージのシナリオを見越して、マルチモーダルタスクに焦点を当てている。
このようなマルチイメージタスクでは、テキストは一般的に単にタスク命令として機能し、視覚コンテンツとの深いセマンティックな相互作用を欠いている。
対照的に、テキストイメージの共創、文字追跡、空間再構成といった現実世界のアプリケーションは、テキストと画像の絶え間ない相互作用を必要とする。
したがって、モデルはこれらのインターリーブされた文脈を深く理解する必要がある。
このギャップを埋めるために, TIC-Bench (Deeply Interleaved Text-Image Contexts) という新しいベンチマークを導入する。
このベンチマークは、論理、時間、空間協会の3つの中核領域を含み、さらに8つの特定のタイプに分類され、合計2,280の質問を含む。
我々は,10種類の最先端MLLMを評価し,人間の専門家と比較してかなりの性能差がみられ,また,視覚的およびテキスト的入力に分散したエビデンスを統合することの難しさも見いだされた。
最終的に、このベンチマークは、マルチモーダルモデルにより、深くインターリーブされたコンテキストにおいて、テキストと画像情報を効果的に統合する能力を評価し、改善するための貴重な分析ツールを提供する。
TIC-Benchはhttps://huggingface.co/datasets/pino10010/TIC-Benchで公開されている。
関連論文リスト
- COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts [34.97838652946461]
COHERENCEは、MLLMがインターリーブされたコンテキストにおける微細な画像テキスト対応を回復する能力を評価するために設計されたベンチマークである。
我々は、6種類の誤り解析を行い、インターリーブ画像テキスト理解における失敗の微粒化を可能とした。
論文 参考訳(メタデータ) (2026-04-30T03:59:22Z) - Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion [14.3937321254743]
Infrared and visible image fusion (EGMT) のためのEntity-Guided Multi-Task Learning という新しい融合手法を提案する。
大規模視覚言語モデルにより生成された画像キャプションからエンティティレベルのテキスト情報を抽出する原理的手法を提案する。
並列マルチタスク学習アーキテクチャを構築し、画像融合とマルチラベル分類タスクを統合する。
また、視覚的特徴とエンティティレベルのテキスト的特徴のきめ細かい相互作用を容易にするために、エンティティ誘導型クロスモーダルインタラクティブモジュールも開発されている。
論文 参考訳(メタデータ) (2026-01-05T08:00:03Z) - Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents [99.62178668680578]
本稿では,単一の視覚変換器を用いてテキスト,画像,それらの組み合わせをモデル化する統合フレームワークであるビジョン中心コントラスト学習(VC2L)を提案する。
VC2Lは完全にピクセル空間で動作し、テキスト、ビジュアル、または組み合わせのいずれでも、すべての入力を画像として描画する。
ウェブ文書における複雑なクロスモーダル関係を捉えるため、VC2Lは連続するマルチモーダルセグメントを整列するスニペットレベルのコントラスト学習目標を採用している。
論文 参考訳(メタデータ) (2025-10-21T14:59:29Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs [61.56904387052982]
本稿では,マルチコンテキストの視覚的グラウンド化という新しい視覚的グラウンド化タスクを提案する。
オープンなテキストプロンプトに基づいて、複数の画像にまたがる関心のインスタンスをローカライズすることを目的としている。
我々は20以上の最先端MLLMと基盤モデルをベンチマークし、潜在的にマルチコンテキストの視覚的グラウンド化機能を有する。
論文 参考訳(メタデータ) (2024-10-16T07:52:57Z) - VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models [76.94378391979228]
我々は、Interleaved Image-Text (IITC) と呼ばれる、より要求の多い新しいタスクを導入する。
この課題は、画像とテキストの両方の過剰な要素を識別・無視し、質問に正確に答えるためにモデルに挑戦する。
このタスクを支援するために、科学コンテンツに関するIITCタスクに適した新しいVEGAデータセットを構築し、サブタスクである画像テキストアソシエーション(ITA)を考案した。
論文 参考訳(メタデータ) (2024-06-14T17:59:40Z) - Advanced Multimodal Deep Learning Architecture for Image-Text Matching [33.8315200009152]
画像テキストマッチングは、画像とテキスト間の意味的関連をマッチング関係としてモデル化することを目的とした、重要なマルチモーダルタスクである。
本稿では、視覚情報のための深層ニューラルネットワークの高レベル抽象表現能力と、テキスト意味理解のための自然言語処理モデルの利点を組み合わせた高度なマルチモーダルディープラーニングアーキテクチャを提案する。
実験の結果、既存の画像テキストマッチングモデルと比較して、最適化された新しいモデルは一連のベンチマークデータセットの性能を大幅に改善した。
論文 参考訳(メタデータ) (2024-06-13T08:32:24Z) - mTREE: Multi-Level Text-Guided Representation End-to-End Learning for Whole Slide Image Analysis [16.472295458683696]
マルチモーダル学習は視覚とテキストのデータを統合するが、その病理像やテキスト解析への応用は依然として困難である。
マルチレベルテキストガイド表現のエンド・ツー・エンド・ラーニング(mTREE)を導入する。
この新しいテキスト誘導アプローチは、テキスト病理情報からの情報を活用することで、WSI(Whole Slide Images)を効果的にキャプチャする。
論文 参考訳(メタデータ) (2024-05-28T04:47:44Z) - OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models [122.27878464009181]
テキスト関連視覚タスクにおいて, GPT4V や Gemini などの大規模マルチモーダルモデルの包括的評価を行った。
OCRBenchには29のデータセットがあり、最も包括的なOCR評価ベンチマークが利用できる。
論文 参考訳(メタデータ) (2023-05-13T11:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。