論文の概要: MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval
- arxiv url: http://arxiv.org/abs/2608.30949v1
- Date: Mon, 31 Aug 2026 15:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.476682
- Title: MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval
- Title(参考訳): Multi3IR:マルチパースペクティブなマルチドメインマルチモーダル情報検索のためのベンチマーク
- Abstract要約: Multi$3$IRは、オープンエンドクエリの多面的視点をレトリバーがいかによくカバーするかを評価するベンチマークである。
104.9KのStack Exchangeクエリで構成され、各クエリの暗黙の視点をキャプチャするパースペクティブ記述が注釈付けされている。
また,パラメータとラベル効率のよい手法であるSPINを提案する。
- 参考スコア(独自算出の注目度): 42.63487516145706
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Information retrieval (IR) increasingly targets open-ended queries that admit diverse perspectives. Existing IR benchmarks, however, focus primarily on closed-ended queries, while even open-ended benchmarks largely consist of queries whose supporting documents span a single subject domain and modality. We introduce Multi$^3$IR, a benchmark that evaluates how well retrievers cover the multifaceted perspectives of open-ended queries across diverse domains and modalities. It comprises 104.9K Stack Exchange queries, each annotated with perspective descriptions that capture the query's implicit viewpoints. We further propose SPIN, a parameter- and label-efficient method that learns noise vectors to steer embeddings toward diverse yet meaningful semantic directions. Experiments show that existing multimodal retrievers suffer from single-perspective bias, while SPIN substantially improves perspective coverage on Multi$^3$IR and generalizes well to unseen open-ended IR benchmarks. The dataset and experimental code are available at https://github.com/seokwon99/Multi3IR.
- Abstract(参考訳): 情報検索(IR)は、多様な視点を持つオープンエンドクエリをますますターゲットとしている。
しかし、既存のIRベンチマークは、主にクローズドなクエリに焦点を当て、オープンエンドなベンチマークでさえ、サポートドキュメントが単一の主題ドメインとモダリティにまたがるクエリで構成されている。
Multi$3$IRは、検索者が様々なドメインやモダリティにわたるオープンエンドクエリの多面的視点をどのようにカバーするかを評価するベンチマークである。
104.9KのStack Exchangeクエリで構成され、各クエリの暗黙の視点をキャプチャするパースペクティブ記述が注釈付けされている。
さらに,パラメータとラベル効率のよい手法であるSPINを提案する。
実験により、既存のマルチモーダルレトリバーは単一パースペクティブバイアスに悩まされ、SPINはMulti$3$IRの視点カバレッジを大幅に改善し、未確認のオープンエンドIRベンチマークによく適合することが示された。
データセットと試験コードはhttps://github.com/seokwon99/Multi3IRで公開されている。
関連論文リスト
- Do Composed Image Retrieval Benchmarks Require Multimodal Composition? [86.99911649534795]
合成画像検索ベンチマークでは,マルチモーダルな構成が必要であると推定される。
4つの広く使用されているCIRベンチマークと11のジェネリストマルチモーダルエンベディングモデルで、クエリの大部分が単一モードで解決できる。
CIRの性能は、真のマルチモーダル合成ではなく、単一モーダル信号から生じる。
論文 参考訳(メタデータ) (2026-05-14T12:56:36Z) - M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering [16.14696376349009]
M$3$-VQA は知識に基づく Visual Question Answering (VQA) ベンチマークである。
視覚的およびテキスト的ソースから複数の異なるエンティティを含む多様な多義性質問を導入する。
複数のドキュメントにわたるシーケンシャルなマルチホップ推論と並列なマルチホップ推論の両方を実行するモデルが必要です。
論文 参考訳(メタデータ) (2026-04-28T01:57:22Z) - LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval [0.0]
LITTAは、エビデンスページ検索のためのクエリ拡張中心の検索フレームワークである。
ユーザクエリが与えられた後、LITTAは大きな言語モデルを使用して補完的なクエリ変種を生成する。
拡張されたクエリからの候補は、エビデンスカバレッジを改善するために、相互のランクフュージョンを通じて集約される。
論文 参考訳(メタデータ) (2026-03-10T13:25:39Z) - Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval [27.493644447594367]
MCMR (Multi-Conditional Multimodal Retrieval) は、自然言語クエリによる細粒度・多条件クロスモーダル検索を評価するために設計された大規模ベンチマークである。
製品ドメインは、上着と下着、宝石、靴、家具の5つ。
MLLMベースのマルチモーダルレトリバーと視覚言語リランカの多種多様なスイートをベンチマークし,その条件認識推論能力を評価する。
論文 参考訳(メタデータ) (2026-03-01T12:53:47Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation [20.170643730917963]
M$3$KG-RAGはマルチホップマルチモーダル知識グラフ強化RAGである。
MMKGからクエリアラインな音声視覚知識を検索する。
推論の深さを改善し、MLLMの忠実さに答える。
論文 参考訳(メタデータ) (2025-12-23T07:54:03Z) - MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval [86.35779264575154]
マルチモーダル検索は、現代のAIアプリケーションにおいて重要なコンポーネントになりつつあるが、その評価は、より現実的で困難なシナリオの要求に遅れている。
マルチモーダル検索のための推論集約型ベンチマークであるMR$2$-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-30T15:09:14Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - UniIR: Training and Benchmarking Universal Multimodal Information
Retrievers [76.06249845401975]
命令誘導型マルチモーダルレトリバーであるUniIRを導入する。
UniIRは、10の多様なマルチモーダル-IRデータセットで共同で訓練された単一の検索システムであり、様々な検索タスクを実行するためにユーザー命令を解釈する。
我々は,汎用マルチモーダル情報検索の評価を標準化するために,総合的な結果を持つマルチモーダル検索ベンチマークであるM-BEIRを構築した。
論文 参考訳(メタデータ) (2023-11-28T18:55:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。