論文の概要: Spherical Interpolation for Backward-Compatible Multimodal Representations
- arxiv url: http://arxiv.org/abs/2609.39836v1
- Date: Wed, 30 Sep 2026 14:32:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.895028
- Title: Spherical Interpolation for Backward-Compatible Multimodal Representations
- Title(参考訳): 後方対応型マルチモーダル表現のための球面補間法
- Abstract要約: 対照的な視覚言語モデルは、視覚表現とテキスト表現を共有正規化埋め込み空間にマッピングする。
ポストホックアライメントは、新しいモデルクエリを古いモデルギャラリー空間にマッピングすることで、この問題を部分的に軽減することができる。
これら2つの正規化クエリ表現間の球面測地線に沿って、ギャラリーを再インデックスすることなく検索を改善することができるかどうかを検討する。
- 参考スコア(独自算出の注目度): 10.628932392896376
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contrastive vision-language models map visual and textual representations into a shared normalized embedding space, making cosine similarity the natural metric for cross-modal retrieval. A practical challenge arises during model upgrades: independently trained models generally produce incompatible representation spaces, so replacing a deployed model typically requires recomputing embeddings for the entire gallery, which is prohibitively expensive at scale. Orthogonal post-hoc alignment can partially mitigate this problem by mapping new-model queries into the old-model gallery space. However, because independently trained models can differ in fine-grained representation structure, the orthogonal alignment remains approximate, leaving a residual angular discrepancy between the old-model query and the aligned new-model query. We study whether interpolation along the spherical geodesic between these two normalized query representations can improve retrieval without re-indexing the gallery. We characterize when this path contains an interior query direction closer to an idealized retrieval-optimal direction than either endpoint, and connect this characterization to Recall@$K$ through a local margin-based certification result. Experiments across multiple benchmarks and model families show that post-alignment spherical interpolation improves over orthogonal alignment alone, recovering backward-compatibility in most evaluated settings. Consistent with our geometric characterization, per-query oracle analysis shows that retrieval-favorable interior points occur frequently in practice. Code is available at https://github.com/miccunifi/SLERP_backward_compatibility .
- Abstract(参考訳): コントラスト的視覚言語モデルは、視覚的およびテキスト的表現を共有正規化埋め込み空間にマッピングし、コサイン類似性をクロスモーダル検索の自然な計量とする。
独立に訓練されたモデルは一般に非互換な表現空間を生成するため、デプロイされたモデルを置き換えるには、ギャラリー全体の埋め込みを再計算する必要がある。
直交的なポストホックアライメントは、新しいモデルクエリを古いモデルギャラリー空間にマッピングすることで、この問題を部分的に軽減することができる。
しかし、独立に訓練されたモデルでは微細な表現構造が異なるため、直交アライメントは近似的であり、古いモデルクエリとアライメントされた新しいモデルクエリとの残差が残る。
これら2つの正規化クエリ表現間の球面測地線に沿った補間が,ギャラリーを再インデックスすることなく検索を改善するかを検討する。
この経路がいずれのエンドポイントよりも理想的な検索最適方向に近い内部クエリ方向を含んでいる場合を特徴付け、この特徴をRecall@$K$に局所的なマージンベースの認証結果を通じて接続する。
複数のベンチマークとモデルファミリによる実験により、調整後の球面補間は直交アライメントのみよりも改善され、ほとんどの評価された設定において後方互換性が回復することが示された。
我々の幾何学的特徴と一致して、クエリーごとのオラクル分析は、検索に好適なインテリアポイントが実際に頻繁に発生することを示している。
コードはhttps://github.com/miccunifi/SLERP_backward_compatibility で公開されている。
関連論文リスト
- PriorPose: Reference-Guided Joint Deformation and Alignment for Category-Level Object Pose Estimation [65.40341394642324]
カテゴリレベルのオブジェクトのポーズ推定は、インスタンス固有のCADモデルなしで未確認のインスタンスに対して$(R,t,s)$の類似性変換を復元しようとする。
最も競争力のある方法は通信方式である。
カテゴリを明示的に保持する参照誘導対応フレームワークである PreferPose を提案する。
論文 参考訳(メタデータ) (2026-09-15T06:57:34Z) - Mapping Similarity Spaces across Embedding Models with Synthetic Query Probing [0.18006769874322107]
組込みよりもスコア分布間のマッピングを学習することで、類似度スコアがどのように関連付けられるかを検討する。
本稿では、文書からクエリを生成し、制御されたクエリ-チャンクペアを生成するSynthetic Query Probingを紹介する。
SciFactとプロプライエタリなコーパスの実験では、モデルはほとんどランクに一致するが、絶対スコアは体系的な歪みを示す。
論文 参考訳(メタデータ) (2026-08-06T10:38:13Z) - G$^2$TAM: Geometry Grounded Track Anything Model [49.05553245076823]
本稿では,RGB画像やビデオのみを用いて,3次元のインスタンス追跡を高速化するための統一的なフレームワークを提案する。
G$2$TAMは空間的に整列した幾何学的表現を暗黙記憶として使用し、安定したインスタンス識別とフレームとビュー間のローカライゼーションを保証する。
中心となるのは、視覚的およびテキスト的プロンプトを共有幾何学空間に統合し、エンドツーエンドの空間再構成とインスタンス一貫性マスク予測を可能にするクロスモーダル空間エンコーダである。
論文 参考訳(メタデータ) (2026-07-04T09:32:13Z) - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation [62.55421542903781]
生成された画像の空間的レイアウトを評価するために明示的に設計された検証可能な報酬モデルである textbfSpatialReward を提案する。
安定拡散とFLUXの実験により、空間的リワードをRLトレーニングに組み込むことで、空間的一貫性と全体的な生成品質が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-03-23T17:26:35Z) - Multi-Way Representation Alignment [19.53606443098969]
地図表現の現在の戦略は本質的にペアワイズであり、モデルの数と二次的にスケーリングし、一貫したグローバル参照を得られない。
我々はまず、モデル縫合のようなタスクに不可欠な内部幾何学を保存した共有宇宙を構築するために、一般化されたプロクリスト解析(GPA)を適用した。
次に、厳密な等尺的アライメントが検索に最適であることを示す。そこでは、カノニカル相関解析(CCA)のような合意を最大化する手法が一般的である。
このギャップを埋めるために、我々はついにGeometry-Corrected Procrustes Alignment (GCPA)を提案する。
論文 参考訳(メタデータ) (2026-02-05T21:33:45Z) - GMapLatent: Geometric Mapping in Latent Space [51.317738404571514]
エンコーダ-デコーダAIアーキテクチャに基づくドメイン間の生成モデルは、現実的な画像の生成に大きな注目を集めている。
幾何学的マッピングに基づく正準潜在空間表現を導入し、領域間潜在空間を厳密かつ正確に整列する。
グレースケールおよびカラー画像の実験は、GMapLatentの有効性、有効性および適用性を検証する。
論文 参考訳(メタデータ) (2025-03-30T12:02:36Z) - Backward-Compatible Aligned Representations via an Orthogonal Transformation Layer [20.96380700548786]
画像検索システムは、古い表現と新しい表現のミスアライメントにより、表現が改善されたモデルを更新する際の課題に直面している。
以前の研究では、バックフィルなしで新しい表現と古い表現を直接比較できる後方互換性のあるトレーニング方法が検討されてきた。
本稿では、後方互換性と独立に訓練されたモデルの性能のバランスをとることに取り組む。
論文 参考訳(メタデータ) (2024-08-16T15:05:28Z) - UFORecon: Generalizable Sparse-View Surface Reconstruction from Arbitrary and UnFavOrable Sets [20.767590006724117]
入力ビューの組み合わせの有効性を示すために、ビュー合成スコアを導入し、検証する。
これを実現するために、ソース画像間の相互作用とビルド相関フラストラムのモデル化にクロスビューマッチングトランスフォーマを適用した。
提案手法は,ビュー・コンビネーション・ジェネリゼーション・ジェネリザビリティにおいて,従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-03-08T06:27:13Z) - Finding Geometric Models by Clustering in the Consensus Space [61.65661010039768]
本稿では,未知数の幾何学的モデル,例えばホモグラフィーを求めるアルゴリズムを提案する。
複数の幾何モデルを用いることで精度が向上するアプリケーションをいくつか提示する。
これには、複数の一般化されたホモグラフからのポーズ推定、高速移動物体の軌道推定が含まれる。
論文 参考訳(メタデータ) (2021-03-25T14:35:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。