論文の概要: The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval
- arxiv url: http://arxiv.org/abs/2605.26941v1
- Date: Tue, 26 May 2026 12:31:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.087293
- Title: The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval
- Title(参考訳): マルチモーダル情報検索のための効率的な表現学習に関する第2回EReL@MIRワークショップ
- Authors: Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Xi Wang, Qijiong Liu, Qian Li, Joemon M. Jose,
- Abstract要約: EReL@MIRは、新しいソリューション、オープン課題、基礎モデル時代の表現学習のための新しい効率指標とベンチマークについて議論するために、学術と産業の研究者を集結させることを目的としている。
我々はMM 2026でEReL@MIRワークショップを開催することを提案し、学界や業界からの研究者を集めて、新しいソリューション、オープン課題、基礎モデル時代の表現学習のための新しい効率指標とベンチマークについて議論する。
- 参考スコア(独自算出の注目度): 51.801765084436646
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal representation learning has attracted increasing attention in AI, driven by the strong performance of large, pretrained multimodal foundation models such as Qwen, LLaVA, and CLIP. These models deliver impressive performance on a range of multimodal information retrieval (MIR) tasks, including web search, cross-modal retrieval, and recommender systems. Yet their massive parameter counts create major efficiency bottlenecks when adapting their representations for IR tasks during training, deployment, and inference. These limitations hinder the practical use of foundation models for representation learning in information retrieval. To address these issues, we propose organizing the EReL@MIR workshop at MM 2026, bringing together researchers from academia and industry to discuss emerging solutions, open challenges, and new efficiency metrics and benchmarks for multimodal IR representation learning in the foundation-model era. The workshop's official website is available at https://erel-mir.github.io/.
- Abstract(参考訳): マルチモーダル表現学習は、Qwen、LLaVA、CLIPといった大規模で事前訓練されたマルチモーダル基盤モデルの強力なパフォーマンスによって、AIの注目を集めている。
これらのモデルは、Web検索、クロスモーダル検索、レコメンデーションシステムを含む、様々なマルチモーダル情報検索(MIR)タスクにおいて印象的なパフォーマンスを提供する。
しかし、その膨大なパラメータは、トレーニング、デプロイメント、推論の間、IRタスクの表現に適応する際の大きな効率のボトルネックを生み出します。
これらの制限は、情報検索における表現学習のための基礎モデルの使用を妨げている。
これらの課題に対処するため、MM 2026でEReL@MIRワークショップを開催することを提案し、学界や業界からの研究者を集めて、新しいソリューション、オープン課題、基礎モデル時代のマルチモーダルIR表現学習のための新しい効率指標とベンチマークについて議論する。
ワークショップの公式ウェブサイトはhttps://erel-mir.github.io/.comで公開されている。
関連論文リスト
- Feature Fusion Revisited: Multimodal CTR Prediction for MMCTR Challenge [4.3058911704400415]
EReL@MIRワークショップは、マルチモーダル表現学習の効率向上を目的とした様々なアプローチを試す貴重な機会となった。
我がチームは第2タスク-勝者賞(Multimodal CTR Prediction)を受賞した。
論文 参考訳(メタデータ) (2025-04-26T16:04:33Z) - The 1st EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval [49.587042083937426]
我々は,Web Conference 2025で初めてのEReL@MIRワークショップを提案し,参加者に新しいソリューションの探求を依頼する。
このワークショップは、学術と産業の両方の研究者が議論し、洞察を共有し、コラボレーションを促進するためのプラットフォームを提供することを目的としている。
論文 参考訳(メタデータ) (2025-04-21T01:10:59Z) - RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training [55.54020926284334]
近年,MLLM (Multimodal Large Language Models) が注目されている。
検索拡張技術はLLMとMLLMの両方に有効なプラグインであることが証明されている。
本研究では,MLLMの新しい検索支援フレームワークであるRA-BLIP(Retrieval-Augmented Bootstrapping Language-Image Pre-training)を提案する。
論文 参考訳(メタデータ) (2024-10-18T03:45:19Z) - EmbedLLM: Learning Compact Representations of Large Language Models [28.49433308281983]
大規模言語モデルのコンパクトなベクトル表現を学習するためのフレームワークである EmbedLLM を提案する。
このような埋め込みを学習するためのエンコーダ-デコーダアプローチと,その有効性を評価するための体系的なフレームワークを導入する。
EmbedLLMはモデルルーティングにおいて,精度とレイテンシの両方において,従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-10-03T05:43:24Z) - NoteLLM-2: Multimodal Large Representation Models for Recommendation [71.87790090964734]
大規模言語モデル(LLM)は、テキスト理解や埋め込みタスクにおいて、例外的な習熟度を示している。
マルチモーダル表現のポテンシャル、特にアイテムツーイテム(I2I)レコメンデーションについては、未解明のままである。
本稿では,既存のLLMと視覚エンコーダの統合をカスタマイズし,効率的なマルチモーダル表現を実現するエンド・ツー・エンドのファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2024-05-27T03:24:01Z) - Generative Multimodal Models are In-Context Learners [60.50927925426832]
我々は37億のパラメータを持つ生成的マルチモーダルモデルであるEmu2を紹介し、大規模マルチモーダルシーケンスで訓練する。
Emu2は、マルチモーダルなインコンテキスト学習能力を示し、オンザフライ推論を必要とするタスクを解決しようとさえしている。
論文 参考訳(メタデータ) (2023-12-20T18:59:58Z) - How to Sense the World: Leveraging Hierarchy in Multimodal Perception
for Robust Reinforcement Learning Agents [9.840104333194663]
我々は表現モデルの設計における階層性を主張し、新しいマルチモーダル表現モデルであるMUSEに貢献する。
MUSEは,アタリゲームにおけるマルチモーダル観察を備えた深層強化学習エージェントの感覚表現モデルである。
我々は、強化学習エージェントの異なる設計に関する比較研究を行い、MUSEは、エージェントが最小性能の損失で不完全な知覚経験の下でタスクを実行できることを示した。
論文 参考訳(メタデータ) (2021-10-07T16:35:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。