論文の概要: Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning
- arxiv url: http://arxiv.org/abs/2607.17673v1
- Date: Mon, 20 Jul 2026 08:25:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.548419
- Title: Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning
- Title(参考訳): 客観的表現性を超えて:マルチモーダルコントラスト学習における幾何学的保存
- Abstract要約: 我々は,エンコーダのヤコビアン条件付けを三モーダルコントラスト学習の鍵要因とみなす。
本稿では,ジャコビアンを直接正規化することで,幾何保存エンコーダ(GPE)を導入する。
- 参考スコア(独自算出の注目度): 1.2472265402088736
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contrastive learning is increasingly moving toward settings with three or more modalities instead of image-text pairs. Yet, extending models from pairwise to higher-order multimodal alignment can introduce optimization and representation challenges. We identify encoder Jacobian conditioning as a key factor in trimodal contrastive learning: poorly conditioned encoders exhibit collapsing or amplified singular-value spectra, leading to exploding Jacobian condition numbers and degraded multimodal alignment. We introduce geometry-preserving encoders (GPEs) by directly conditioning the Jacobian through regularization and demonstrating that simple modifications like LeakyReLU activations and residual paths recover these geometric benefits. Across a synthetic benchmark and four real-world datasets including missing modalities, improving Jacobian conditioning boosts retrieval and linear probe performance across multiple contrastive objectives, whereas expressive objectives yield little benefit in linear probes. More broadly, our results show that multimodal contrastive learning depends not only on objective expressivity, but also on the geometric and optimization properties of the underlying encoders.
- Abstract(参考訳): コントラスト学習は、画像とテキストのペアではなく、3つ以上のモダリティで設定に向かっている。
しかし、ペアワイズから高階マルチモーダルアライメントへのモデル拡張は、最適化と表現の問題をもたらす可能性がある。
弱条件付きエンコーダは、崩壊または増幅された特異値スペクトルを示し、ジャコビアン条件数と劣化したマルチモーダルアライメントをもたらす。
本稿では,ジャコビアンを正規化することで幾何学保存エンコーダ(GPE)を導入し,LeakyReLU活性化や残留経路などの簡単な修正がこれらの幾何学的利点を回復することを示す。
合成ベンチマークと4つの実世界のデータセットの間には、モダリティの欠如、ヤコビアン条件付けの改善により、複数の対照的な目的に対して、検索と線形プローブ性能が向上する一方、表現的目的は線形プローブにはほとんど利益が得られない。
より広義には、マルチモーダルコントラスト学習は、目的表現性だけでなく、基礎となるエンコーダの幾何学的および最適化的特性にも依存することを示す。
関連論文リスト
- CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning [79.07656918674684]
CoME-VLは、対照的に訓練された視覚エンコーダと自己教師型DINOエンコーダを統合するモジュラーフュージョンフレームワークである。
提案手法は,RefCOCOのベースライン上での精度を高いマージンで向上させながら,検出のための最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-03T17:59:51Z) - Differentiable Zero-One Loss via Hypersimplex Projections [14.382224834970557]
分類性能の標準としてゼロ1損失長を考慮に入れた新しい微分可能近似を導入する。
本稿では,Jacobianを効率的に計算し,バイナリおよびマルチクラス学習システムに統合する方法を示す。
論文 参考訳(メタデータ) (2026-02-26T18:41:31Z) - ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization [9.85275171877854]
検索で解釈可能な推論をブリッジするフレームワークであるECCOを紹介する。
本稿ではまず,Chain-of-Thoughtデータセットを構築するためのリバースエンジニアリング手法を提案する。
次に,大規模言語モデルがストラテジストとして機能する協調推論機構を設計する。
論文 参考訳(メタデータ) (2026-01-23T01:23:20Z) - Point Cloud Quantization through Multimodal Prompting for 3D Understanding [20.397232104616574]
本稿では,ポイントクラウド解析のための簡易なマルチモーダルプロンプト駆動量子化フレームワークを提案する。
1) 事前訓練されたモデルからのテキスト埋め込みは、視覚的意味論を本質的にエンコードする。
我々は、量子化空間を維持しながら微分可能な離散化を実現するために、Gumbel-Softmax緩和を用いる。
論文 参考訳(メタデータ) (2025-11-15T07:51:10Z) - Iso-Riemannian Optimization on Learned Data Manifolds [6.345340156849189]
アイソ・リーマン幾何学を用いた学習データ多様体の最適化のための原理的フレームワークを提案する。
提案手法は,解釈可能なバリセンタ,クラスタリングの改善,逆問題に対する効率の良い解が得られることを示す。
これらの結果は、アイソ・リーマン幾何学の下での最適化が、学習された多様体の写像に固有の歪みを克服できることを証明している。
論文 参考訳(メタデータ) (2025-10-23T22:34:55Z) - Sparse and Dense Retrievers Learn Better Together: Joint Sparse-Dense Optimization for Text-Image Retrieval [11.20814404187967]
本稿では,自己知識蒸留による濃密表現と疎表現の双方向学習を実現するフレームワークを提案する。
この双方向学習は、両表現の共有教師信号として機能する、濃密で疎密な類似度の重み付けされた合計である類似度スコアを用いて達成される。
MSCOCOとFlickr30kの実験は、スパースレトリバーが既存のスパースベースラインを上回るだけでなく、高密度のリトリーバーよりも高いパフォーマンスを達成していることを示している。
論文 参考訳(メタデータ) (2025-08-22T13:25:58Z) - "Principal Components" Enable A New Language of Images [79.45806370905775]
証明可能なPCAのような構造を潜在トークン空間に組み込む新しい視覚トークン化フレームワークを導入する。
提案手法は、最先端の再構築性能を実現し、人間の視覚システムとの整合性を向上する。
論文 参考訳(メタデータ) (2025-03-11T17:59:41Z) - Optimizing Singular Spectrum for Large Language Model Compression [95.7621116637755]
SVDの分解したコンポーネントをデータ駆動で再スケールする新しい圧縮フレームワークであるSoCoを紹介する。
学習可能な特異スペクトルのおかげで、SoCoは重要度スコアに応じて成分を適応的にプーンする。
複数のLLMおよびベンチマークでの実験的な評価は、SoCoがモデル圧縮における最先端の手法を超越していることを示している。
論文 参考訳(メタデータ) (2025-02-20T23:18:39Z) - Tripod: Three Complementary Inductive Biases for Disentangled Representation Learning [52.70210390424605]
本研究では,文献から選択した3つの帰納バイアスを持つニューラルネットワークオートエンコーダを提案する。
しかし、実際には、これらの帰納バイアスをインスタンス化する既存の技術を組み合わせることは、大きな利益をもたらすことに失敗する。
学習問題を単純化する3つの手法に適応し、不変性を安定化する鍵正則化項とクォーシュ縮退インセンティブを提案する。
結果のモデルであるTripodは、4つのイメージアンタングルメントベンチマークのスイートで最先端の結果を得る。
論文 参考訳(メタデータ) (2024-04-16T04:52:41Z) - Hodge-Aware Contrastive Learning [101.56637264703058]
単純コンプレックスは、マルチウェイ依存によるデータのモデリングに有効である。
我々は、単純なデータを処理するための対照的な自己教師付き学習手法を開発した。
論文 参考訳(メタデータ) (2023-09-14T00:40:07Z) - Self-Supervised Generative-Contrastive Learning of Multi-Modal Euclidean Input for 3D Shape Latent Representations: A Dynamic Switching Approach [53.376029341079054]
本稿では,3次元形状の潜在表現を学習するための,生成型とコントラスト型を組み合わせたニューラルアーキテクチャを提案する。
このアーキテクチャでは、2つのエンコーダブランチをボクセルグリッドと、同じ形状のマルチビューイメージに使用している。
論文 参考訳(メタデータ) (2023-01-11T18:14:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。