論文の概要: RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
- arxiv url: http://arxiv.org/abs/2605.27436v1
- Date: Fri, 22 May 2026 11:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.269855
- Title: RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
- Title(参考訳): Re-Trangle: 検索におけるコサイン類似性を超えてマルチモーダルアライメントを実現するか?
- Authors: Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra, Jingfen Qiao,
- Abstract要約: マルチモーダルアライメントは情報検索における意味的ギャップを埋めるために重要である。
伝統的な対角戦略は、幾何学的な盲点を導入する。
TRIANGLEフレームワークは、超球面上のモジュラリティ三重項の面積を最小化し、全体的アライメントを強制することで、この問題に対処する。
- 参考スコア(独自算出の注目度): 20.129704088831698
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal alignment is critical for bridging the semantic gap in information retrieval. However, traditional pairwise strategies introduce a geometric blind spot: while they align anchor modalities (e.g., text) with others, they lack constraints to enforce mutual consistency between peripheral modalities (e.g., video and audio). The TRIANGLE framework addresses this by minimizing the area of modality triplets on a hypersphere to enforce holistic alignment. In this reproducibility study, we verify the robustness of this geometric objective for retrieval tasks. We confirm that TRIANGLE outperforms pairwise baselines in zero-shot settings, achieving Recall@1 gains of up to +8.7 points, though benefits are domain-dependent. However, we fail to reproduce the reported learning-from-scratch results. Analysis using a synthetic toy dataset attributes this to instability when jointly optimizing geometric alignment with Data-Text Matching (DTM) loss. Furthermore, we find that cosine regularization primarily stabilizes text-to-video retrieval, and fine-tuning with domain supervision amplifies geometric benefits but reduces cross-dataset generalization. Our findings support the efficacy of geometric alignment while highlighting critical optimization sensitivities. Code available at https://github.com/ARIJIT00171/RE-TRIANGLE.
- Abstract(参考訳): マルチモーダルアライメントは情報検索における意味的ギャップを埋めるために重要である。
アンカーモダリティ(例えばテキスト)を他のものと整合させる一方で、周辺モダリティ(例えばビデオやオーディオ)間の相互整合性を強制する制約を欠いている。
TRIANGLEフレームワークは、超球面上のモジュラリティ三重項の面積を最小化し、全体的アライメントを強制することで、この問題に対処する。
本研究では,この幾何学的目的の頑健性を検証する。
TRIANGLEはゼロショット設定でペアワイズベースラインよりも優れており、ドメインに依存しながら、最大8.7ポイントのRecall@1ゲインを実現しています。
しかし、我々は報告された学習結果の再現に失敗する。
合成玩具データセットを用いた解析は、データテキストマッチング(DTM)損失と幾何学的アライメントを共同最適化する場合、不安定性に起因する。
さらに,コサイン正則化は主にテキスト・ビデオ検索を安定化し,ドメイン・インスペクションによる微調整は幾何学的利点を増幅するが,データセット間の一般化を減少させる。
本研究は, 重要な最適化感度を強調しつつ, 幾何アライメントの有効性を裏付けるものである。
コードはhttps://github.com/ARIJIT00171/RE-TRIANGLEで公開されている。
関連論文リスト
- Differentiable Geometric Indexing for End-to-End Generative Retrieval [32.54110566819413]
Generative Retrieval (GR) は単一の確率的フレームワーク内でインデックスと検索を統合するための有望なパラダイムとして登場した。
既存のアプローチは2つの本質的な対立に悩まされている。
本稿では,これらの誤りを解消するために,DGI(Dariable Geometric Indexing)を提案する。
論文 参考訳(メタデータ) (2026-03-11T04:46:42Z) - Multi-Way Representation Alignment [19.53606443098969]
地図表現の現在の戦略は本質的にペアワイズであり、モデルの数と二次的にスケーリングし、一貫したグローバル参照を得られない。
我々はまず、モデル縫合のようなタスクに不可欠な内部幾何学を保存した共有宇宙を構築するために、一般化されたプロクリスト解析(GPA)を適用した。
次に、厳密な等尺的アライメントが検索に最適であることを示す。そこでは、カノニカル相関解析(CCA)のような合意を最大化する手法が一般的である。
このギャップを埋めるために、我々はついにGeometry-Corrected Procrustes Alignment (GCPA)を提案する。
論文 参考訳(メタデータ) (2026-02-05T21:33:45Z) - Understanding and Improving UMAP with Geometric and Topological Priors: The JORC-UMAP Algorithm [1.7484982792736636]
次元削減技術、特に UMAP は高次元データの可視化に広く用いられている。
我々は幾何学的先行としてOllivier-Ricci曲率を導入し、幾何学的ボトルネックにおけるエッジを強化し、冗長リンクを減らす。
合成および実世界のデータセットの実験により、JORC-UMAPは標準的なUMAPや他のDR法よりも破断と崩壊を効果的に削減することが示された。
論文 参考訳(メタデータ) (2026-01-23T08:42:56Z) - Robust Scene Coordinate Regression via Geometrically-Consistent Global Descriptors [52.57327385675752]
幾何学的構造と視覚的類似性の両方に整合したグローバルな記述子を学習するアグリゲータモジュールを提案する。
これにより、信頼できないオーバーラップスコアによる誤関連が修正される。
挑戦的なベンチマークの実験では、大規模環境ではかなりのローカライゼーションが得られた。
論文 参考訳(メタデータ) (2025-12-19T04:24:03Z) - No-rank Tensor Decomposition Using Metric Learning [0.0]
本稿では,計量学習に基づく非ランクテンソル分解フレームワークを提案する。
フレームワークの収束に関する理論的保証を提供し、その計量特性の有界性を確立する。
提案手法は, トランスフォーマーに基づく手法と比較して, より少ないトレーニングデータセットで優れた性能を実現する。
論文 参考訳(メタデータ) (2025-11-03T18:21:53Z) - GoMVS: Geometrically Consistent Cost Aggregation for Multi-View Stereo [45.5438546016874]
我々は,GoMVSを提案し,幾何学的に一貫したコストを集約し,隣接したジオメトリをよりよく活用する。
提案手法はDTU, Tanks & Temple, ETH3Dデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2024-04-11T17:59:59Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Last-Iterate Convergence of Adaptive Riemannian Gradient Descent for Equilibrium Computation [52.73824786627612]
本稿では,テクスト幾何学的強単調ゲームに対する新たな収束結果を確立する。
我々のキーとなる結果は、RGDがテクスト幾何学的手法で最終定位線形収束を実現することを示しています。
全体として、ユークリッド設定を超えるゲームに対して、幾何学的に非依存な最終点収束解析を初めて提示する。
論文 参考訳(メタデータ) (2023-06-29T01:20:44Z) - Learnable Pillar-based Re-ranking for Image-Text Retrieval [119.9979224297237]
画像テキスト検索は、モダリティギャップを埋め、意味的類似性に基づいてモダリティコンテンツを検索することを目的としている。
一般的なポストプロセッシング手法であるリグレードは, 単一モダリティ検索タスクにおいて, 隣り合う関係を捕捉する優位性を明らかにしている。
本稿では,画像テキスト検索のための新しい学習可能な柱型リグレードパラダイムを提案する。
論文 参考訳(メタデータ) (2023-04-25T04:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。