論文の概要: Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- arxiv url: http://arxiv.org/abs/2606.29464v1
- Date: Sun, 28 Jun 2026 15:41:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.920209
- Title: Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- Title(参考訳): ビジョンランゲージデータセット蒸留のためのランクアウェアハイパーボリックアライメント
- Abstract要約: 視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
- 参考スコア(独自算出の注目度): 54.74045834035952
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-language dataset distillation (VLDD) compresses a large image-text paired dataset into a small set of synthetic pairs that can efficiently train contrastive vision-language models under strict data and compute budgets. Most existing methods match expert trajectories or cross-modal statistics, yet still enforce full-dimensional alignment in a Euclidean embedding space. This is often overly restrictive due to rank-deficient image--text correlation, with shared semantics concentrated in a low-dimensional range and remaining variation spread across a weakly correlated residual subspace. LoRS relaxes alignment at the similarity level by low-rank factorization, but does not explicitly control dominant alignment capacity and structure in the representation space. We thus propose a rank-aware hyperbolic alignment (RAHA) that combines hierarchical geometry with explicit alignment-capacity control. RAHA lifts multimodal representations to hyperbolic space and optimizes distilled pairs with asymmetric objectives that enforce geodesic alignment in the shared range while regularizing the residual subspace to preserve modality-private diversity and improve transfer robustness. Experiments on benchmarks show that RAHA demonstrates competitive cross-modal retrieval and improved transfer indicators under fixed budgets.
- Abstract(参考訳): 視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮し、厳密なデータと計算予算の下で、対照的な視覚言語モデルを効率的に訓練することができる。
既存のほとんどの手法は専門家の軌跡やクロスモーダル統計と一致するが、ユークリッド埋め込み空間においてフル次元のアライメントを強制する。
これは、低次元領域に集中し、残差が弱相関した残余部分空間に分散している、階数不足のイメージ-テキスト相関による過度に制限されることが多い。
LoRSは、低ランク因子化による類似度レベルでのアライメントを緩和するが、表現空間における支配的なアライメント能力と構造を明示的に制御しない。
そこで我々は階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは双曲空間への多モード表現を持ち上げ、共有領域における測地的アライメントを強制する非対称な目的を持つ蒸留ペアを最適化し、残余部分空間を正規化し、モダリティプライベートな多様性を保ち、移動ロバスト性を向上させる。
ベンチマーク実験により、RAHAは競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示すことが示された。
関連論文リスト
- GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution [5.770893169582546]
この研究は、属性をサブセットレベルの反事実的ユーティリティ予測として再定義する。
相互作用を意識したサロゲートであるGRASPを紹介する。
それは、既存のスケーラブルなベースラインを決定的に上回る。
論文 参考訳(メタデータ) (2026-06-05T04:17:50Z) - Multimodal Distribution Matching for Vision-Language Dataset Distillation [50.411341509805936]
マルチモーダル分散マッチング(Multimodal Distribution Matching)は、効率的かつ一般化可能なマルチモーダル蒸留のための幾何学的枠組みである。
MDMはデータ、モデル、損失レベルで補完的なコンポーネントを統合する。
マルチモーダルなセマンティクスを保存し、蒸留コストを大幅に削減し、建築全体にわたって頑丈な、コンパクトな合成セットを生成する。
論文 参考訳(メタデータ) (2026-05-22T10:41:58Z) - Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering [57.38215918201251]
本稿では,不完全なマルチビュークラスタリングのためのハイパーボリック拡張表現学習フレームワークであるHERLを提案する。
ポアンカレボール内で操作すると、HERLは表現学習を強化するために構造を意識した潜在空間を構築する。
HERLは最先端のアプローチよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-04-18T10:50:46Z) - INST-Align: Implicit Neural Alignment for Spatial Transcriptomics via Canonical Expression Fields [1.0487944945684993]
INST-Alignは、座標ベースの変形ネットワークと共有カノニカル表現場を結合する。
最先端の平均OT精度(0.702)、NN精度(0.719)、チャンファー距離(94.9%)を実現している。
また、生物学的に意味のある空間埋め込みとコヒーレントな3D組織再構築をもたらす。
論文 参考訳(メタデータ) (2026-04-13T21:44:18Z) - SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport [43.640561199880274]
プラトン表現仮説(英: Platonic Representation hypothesis)は、ニューラルネットワークが世界の共有統計モデルに向かって収束するという仮説である。
最近の研究は、凍結した事前学習された視覚と言語モデルを軽量なアライメント層に整列させることによって、この収束を利用する。
我々は、極めて少ない監督で有意義なアライメントが達成できるかどうか尋ねる。
事前訓練された単調エンコーダを少数の画像テキストペアと大量の未ペアデータを用いてアライメントする半教師付き設定を導入する。
論文 参考訳(メタデータ) (2026-02-26T18:55:06Z) - Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping [61.459927600301654]
マルチコンディション制御は従来のコンカデント・アンド・アットエンドの戦略によってボトルネックとなる。
分析の結果,これらの相互作用の多くは空間的にも意味的にも冗長であることがわかった。
本稿では,これらの冗長性を解消するための高効率なフレームワークであるPKAを提案する。
論文 参考訳(メタデータ) (2026-02-06T16:39:10Z) - Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models [84.78794648147608]
永続的な幾何学的異常であるモダリティギャップが残っている。
このギャップを埋める以前のアプローチは、過度に単純化された等方的仮定によってほとんど制限されている。
固定フレームモダリティギャップ理論(英語版)を提案し、モダリティギャップを安定バイアスと異方性残差に分解する。
次に、トレーニング不要なモダリティアライメント戦略であるReAlignを紹介します。
論文 参考訳(メタデータ) (2026-02-02T13:59:39Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。