論文の概要: ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding
- arxiv url: http://arxiv.org/abs/2607.28751v1
- Date: Thu, 30 Jul 2026 18:18:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.211491
- Title: ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding
- Title(参考訳): ReLoop-UME:Universal Multimodal Embeddingのための学習可能な検索レジスタ付きリカレント深さ
- Abstract要約: 普遍的マルチモーダル埋め込みは、異質なマルチモーダル入力を共有埋め込み空間にマッピングする。
本稿では,初期レイヤを一度実行するReLoop-UMEを提案する。
MMEB-V2 と MRMR では、ReLoop-UME は UME-R1 よりも44.9倍、PLUME より1.5倍速く動作しながら、バックボーン間の検索を継続的に改善している。
- 参考スコア(独自算出の注目度): 13.13700187820926
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Universal multimodal embedding (UME) maps heterogeneous multimodal inputs into a shared embedding space. Existing UME models either form embeddings through single forward encoding or add computation through explicit rationale tokens and latent autoregressive states. Although token expansion can improve complex matching, serial generation increases retrieval latency and makes the final embedding depend on generated intermediate states. This raises a different question: can useful computation be expanded along model depth while keeping the token workspace fixed? We analyze positive-negative similarity separation at every layer of independently trained UME models and observe a shared progression: early layers contextualize multimodal inputs, a contiguous middle-to-late stage forms retrieval-discriminative features, and the final layers map them into the embedding space. Based on this finding, we propose ReLoop-UME, which executes the early layers once, recurrently reuses a parameter-shared retrieval-forming block, and applies the final mapping layers after the last loop. Learnable Retrieval Registers provide persistent retrieval-specific states that accumulate and exchange evidence across loops, with the final register serving as the embedding readout. On MMEB-V2 and MRMR, ReLoop-UME consistently improves retrieval across different backbones while running 44.9x faster than UME-R1 and 1.5x faster than PLUME.
- Abstract(参考訳): ユニバーサルマルチモーダル埋め込み(UME)は異種マルチモーダル入力を共有埋め込み空間にマッピングする。
既存のUMEモデルは、単一のフォワードエンコーディングを通じて埋め込みを形成するか、明示的な合理化トークンや潜在自己回帰状態を通じて計算を追加する。
トークン拡張は複雑なマッチングを改善することができるが、シリアル生成は検索遅延を増加させ、最終的な埋め込みは生成された中間状態に依存する。
トークンのワークスペースを固定しながら、モデル深度に沿って有用な計算を拡張できるだろうか?
我々は、独立に訓練されたUMEモデルの全ての層における正負の類似性分離を分析し、共有進行を観察する: 初期層は、マルチモーダル入力を文脈化し、連続的な中間段階は、検索-識別的特徴を形成し、最終層はそれらを埋め込み空間にマッピングする。
そこで本研究では,初期レイヤを一度実行するReLoop-UMEを提案し,パラメータ共有検索生成ブロックを繰り返し再利用し,最終ループ後に最終マッピングレイヤを適用する。
Learnable Retrieval Registersは、ループにまたがってエビデンスを蓄積し交換する永続的な検索専用ステートを提供する。
MMEB-V2 と MRMR では、ReLoop-UME は UME-R1 よりも44.9倍、PLUME より1.5倍速く動作しながら、バックボーン間の検索を継続的に改善している。
関連論文リスト
- UEmbed: Unified Sparse and Dense Multimodal Embeddings [56.1131203949042]
本稿では,デコーダのみのマルチモーダル埋め込みモデルUEmbedを紹介する。
緩やかな語彙と密度の表現を1つの因果前方通過で生成する。
UEmbedを2B、4B、9Bスケールでトレーニングし、公開されているデータに基づいてトレーニングされたマルチモーダル埋め込みモデルよりも優れています。
UEmbedは1つのモデルに密でスパースな埋め込みを統一し、さらにスパース検索を拡張してテキストとマルチモーダル入力を統一する、という新しいパラダイムを提供する。
論文 参考訳(メタデータ) (2026-08-03T17:54:11Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning [14.508049757681862]
LLMベースのコーディングエージェントは、トークンの予算の大部分をリポジトリファイルを読むのに費やしている。
この定式化がモデリングのボトルネックを生み出すことを示す。
コード関連性を2つの解釈可能な品質次元に分解する構造化プルーニングフレームワークであるLaMRを提案する。
論文 参考訳(メタデータ) (2026-05-14T18:30:10Z) - PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - Attention Residuals [38.59138244826294]
PreNorm との残余接続は現代の LLM では標準的なものであるが、固定単位重み付きで全ての層出力を蓄積する。
本稿では,アテンション残余(AttnRes)を提案する。
論文 参考訳(メタデータ) (2026-03-16T09:32:21Z) - ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding [37.86179431483446]
自己回帰モデル(ARM)は、遅いシーケンシャル推論によって妨げられる。
本稿では,優れた性能と効率を実現するマスク付き拡散モデルReFusionを紹介する。
ReFusionは、2.33$timesの平均スピードアップを維持しながら、パフォーマンスギャップを強力なARMに橋渡しする。
論文 参考訳(メタデータ) (2025-12-15T17:41:19Z) - Recurrence Meets Transformers for Universal Multimodal Retrieval [59.92546492752452]
ReT-2は画像とテキストの両方からなるマルチモーダルクエリをサポートする統合検索モデルである。
検索構成の異なるM2KRとM-BEIRのベンチマークでReT-2を評価する。
検索強化された生成パイプラインに統合されると、ReT-2はEncyclopedic-VQAとInfoSeekデータセットのダウンストリームのパフォーマンスも向上する。
論文 参考訳(メタデータ) (2025-09-10T18:00:29Z) - Continual Referring Expression Comprehension via Dual Modular
Memorization [133.46886428655426]
Referring Expression (REC) は、自然言語で記述された対象のイメージ領域をローカライズすることを目的としている。
既存のRECアルゴリズムは、モデルへのデータ供給のトレーニングを前もって行うと強く仮定する。
本稿では、入ってくるタスクのストリーム上でモデルが学習するRECの新しい設定である連続参照表現(CREC)を提案する。
学習済みの知識を忘れずに,スクラッチから繰り返し再学習することなく,逐次的タスクのモデルを継続的に改善するために,デュアルモジュール記憶法という効果的なベースライン手法を提案する。
論文 参考訳(メタデータ) (2023-11-25T02:58:51Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。