論文の概要: MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control
- arxiv url: http://arxiv.org/abs/2604.06156v1
- Date: Tue, 07 Apr 2026 17:55:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.983749
- Title: MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control
- Title(参考訳): MMEmb-R1: ペアアウェア選択と適応制御による推論強化マルチモーダル埋め込み
- Authors: Yuchi Wang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li,
- Abstract要約: 適応型推論に基づくマルチモーダル埋め込みフレームワークであるMMEmb-R1を提案する。
我々は、潜在変数としての推論を定式化し、クエリターゲットアライメントに有用な推論経路を特定するためにペア認識推論選択を導入する。
MMEB-V2ベンチマーク実験により,本モデルでは4Bパラメータのみを用いて71.2のスコアを達成し,推論のオーバーヘッドと推論遅延を大幅に低減し,新たな最先端技術を確立した。
- 参考スコア(独自算出の注目度): 36.06412693943508
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: MLLMs have been successfully applied to multimodal embedding tasks, yet their generative reasoning capabilities remain underutilized. Directly incorporating chain-of-thought reasoning into embedding learning introduces two fundamental challenges. First, structural misalignment between instance-level reasoning and pairwise contrastive supervision may lead to shortcut behavior, where the model merely learns the superficial format of reasoning. Second, reasoning is not universally beneficial for embedding tasks. Enforcing reasoning for all inputs may introduce unnecessary computation and latency, and can even obscure salient semantic signals for simple cases. To address these issues, we propose MMEmb-R1, an adaptive reasoning-based multimodal embedding framework. We formulate reasoning as a latent variable and introduce pair-aware reasoning selection that employs counterfactual intervention to identify reasoning paths beneficial for query-target alignment. Furthermore, we adopt reinforcement learning to selectively invoke reasoning only when necessary. Experiments on the MMEB-V2 benchmark demonstrate that our model achieves a score of 71.2 with only 4B parameters, establishing a new state-of-the-art while significantly reducing reasoning overhead and inference latency.
- Abstract(参考訳): MLLMは、マルチモーダル埋め込みタスクにうまく適用されているが、生成的推論能力は未利用のままである。
埋め込み学習にチェーン・オブ・ソーシングを直接組み込むことは、2つの根本的な課題をもたらす。
第一に、インスタンスレベルの推論とペアの対照的な監視の間の構造的ミスアライメントは、モデルが単に表面的な推論形式を学ぶというショートカット行動を引き起こす可能性がある。
第二に、推論はタスクを埋め込むのに普遍的に有益ではない。
すべての入力に対する推論を強制すると、不要な計算とレイテンシが発生し、単純なケースでは明確な意味的な信号も見えなくなる。
これらの問題に対処するため,適応型推論に基づくマルチモーダル埋め込みフレームワークであるMMEmb-R1を提案する。
我々は、遅延変数としての推論を定式化し、クエリ-ターゲットアライメントに有用な推論経路を特定するために、対実的介入を用いたペア認識推論選択を導入する。
さらに、必要なときにのみ推論を選択的に実行するために強化学習を採用する。
MMEB-V2ベンチマーク実験により,本モデルでは4Bパラメータのみを用いて71.2のスコアを達成し,推論のオーバーヘッドと推論遅延を大幅に低減し,新たな最先端技術を確立した。
関連論文リスト
- Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning [50.352417879912515]
大規模言語モデル(LLM)は推論能力の進歩とともに複雑なタスクに優れる。
一般化可能な推論パターンを学習するために,LLMを明示的に訓練するためのグループ因果政策最適化を提案する。
次に、この報酬からトークンレベルのアドバンテージを構築し、ポリシーを最適化し、LCMにプロセス無効で事実上堅牢な推論パターンを推奨します。
論文 参考訳(メタデータ) (2026-02-06T08:03:11Z) - Structured Reasoning for Large Language Models [59.215789462977206]
本研究では、推論を明示的、評価可能、トレーニング可能なコンポーネントに分解するフレームワークであるStructured Reasoning(SCR)を提案する。
SCRは推論効率と自己検証を大幅に改善する。
既存の推論パラダイムと比較して、出力トークンの長さを最大50%削減する。
論文 参考訳(メタデータ) (2026-01-12T04:04:01Z) - Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models [72.4149653187766]
本稿ではAdrialversa Reasoning RAG(ARR)というReasoner-Verifierフレームワークを提案する。
ReasonerとVerifierは、回収された証拠を推論し、プロセス認識の利点によってガイドされながら、互いの論理を批判する。
複数のベンチマーク実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2026-01-08T06:57:03Z) - Directional Reasoning Injection for Fine-Tuning MLLMs [51.53222423215055]
マルチモーダルな大言語モデル(MLLM)は急速に進歩しているが、その推論能力は強いテキストのみのモデルよりも遅れていることが多い。
このギャップを埋める既存の方法は、大規模マルチモーダル推論データや強化学習の監督された微調整に依存している。
この問題を解決するために,DRIFT(Directional Reasoning Injection for Fine-Tuning)を提案する。
論文 参考訳(メタデータ) (2025-10-16T18:06:46Z) - ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models [76.28894983518164]
小型言語モデル (SLM) は大規模言語モデル (LLM) に代わる費用対効果がある。
彼らはしばしば、限られた能力と間違いや一貫性のない答えを生み出す傾向があるため、複雑な推論に苦しむ。
本稿では、垂直領域における堅牢かつ自己充足的推論のための強化学習フレームワークであるReaLMを紹介する。
論文 参考訳(メタデータ) (2025-08-17T14:50:23Z) - Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models [28.756240721942138]
RLLM(Reasoning large language model)は、最近、構造化および多段階推論によって顕著な機能を示した。
我々は新しいICLパラダイムであるThinking with Nothinking (JointThinking)を提案する。
JointThinkingは、数発のチェーン・オブ・シークレット(CoT)を2回、過半数で上回っている。
論文 参考訳(メタデータ) (2025-08-05T12:09:55Z) - Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs [7.501387372794562]
Deliberate-to-Intuitive reasoning framework (D2I)はマルチモーダル言語モデルの理解と推論能力を改善する。
本手法は,学習中の規則に基づく形式報酬のみを通じて,モダリティアライメントを高めるための意図的な推論戦略を定めている。
評価中、推論スタイルは直感に移行し、トレーニング中の意図的な推論戦略を取り除き、モデルが獲得した応答能力を暗黙的に反映する。
論文 参考訳(メタデータ) (2025-07-09T16:25:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。