論文の概要: HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
- arxiv url: http://arxiv.org/abs/2607.00428v1
- Date: Wed, 01 Jul 2026 04:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.718084
- Title: HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
- Title(参考訳): HyFL-CLIP:ロバスト長期理解のためのCLIPの双曲的微調整
- Abstract要約: HyFL-CLIPは、ユークリッドCLIPで学んだ確立されたテキストイメージアライメントを双曲空間に蒸留する双曲的微調整フレームワークである。
提案手法は,要約されたトークン・ワイド特徴,長文記述,短いテキスト・コンポーネントの構成,イメージをリンクして階層的セマンティクスをモデル化し,ハイブリボリック・エンテーメントとアインシュタイン・ミッドポイント・アグリゲーションによる部分的関係を捉える。
- 参考スコア(独自算出の注目度): 28.162977602129303
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: CLIP (Contrastive Language-Image Pre-training) has become a de facto paradigm for image-text alignment, but it struggles with long-context descriptions (>77 tokens) due to absolute positional encoding and pretraining on short captions. In long contexts, sentences are often reordered, summarized, or partially omitted. Although prior works extend CLIP with longer positional encodings, they often suffer from degraded image-text alignment under such text perturbations. We attribute this limitation to the Euclidean contrastive objective, which enforces strict one-to-one matching and lacks explicit mechanisms for modeling hierarchical relationships between global context and its constituent elements. To address this issue, we propose HyFL-CLIP, a hyperbolic fine-tuning framework that distills the well-established text-image alignment learned in Euclidean CLIP into hyperbolic space via cross-manifold similarity distillation, leveraging its geometry to capture hierarchical and entailment relations. Our method models hierarchical semantics by linking summarized token-wise features, long-context descriptions, constituent short textual components, and images, capturing part-whole relationships via hyperbolic entailment with Einstein midpoint aggregation. Experiments on diverse benchmarks, including long-context cross-modal retrieval, cross-modal retrieval with caption perturbations, intra-modality retrieval, and short-text cross-modal retrieval, show that HyFL-CLIP achieves more robust long-context understanding. In particular, it yields up to 19.5% improvement in long-text cross-modal retrieval under textual perturbations over the best prior method. We also show HyFL-CLIP can be seamlessly integrated into other model frameworks by applying it to Stable Diffusion XL (SDXL).
- Abstract(参考訳): CLIP(Contrastive Language- Image Pre-training)は、画像テキストアライメントのデファクトパラダイムとなっているが、絶対的な位置エンコーディングと短いキャプションでの事前トレーニングのために、長文記述(>77トークン)に苦労している。
長い文脈では、文はしばしば並べ替えられるか、要約されるか、一部省略される。
以前の作品ではCLIPを長い位置エンコーディングで拡張していたが、しばしばそのようなテキストの摂動の下で画像テキストのアライメントが劣化する。
この制限は、厳密な1対1のマッチングを強制し、グローバルコンテキストとその構成要素間の階層的関係をモデル化するための明確なメカニズムが欠如しているユークリッドのコントラスト的目的に帰着する。
この問題に対処するため, ユークリッドCLIPで学習したテキスト画像アライメントを多次元類似度蒸留により双曲空間に蒸留し, その幾何学を利用して階層的・包絡的関係を捉える, 双曲的微調整フレームワークHyFL-CLIPを提案する。
提案手法は,要約されたトークン・ワイド特徴,長文記述,短いテキスト・コンポーネントの構成,イメージをリンクして階層的セマンティクスをモデル化し,ハイブリボリック・エンテーメントとアインシュタイン・ミッドポイント・アグリゲーションによる部分的関係を捉える。
長文のクロスモーダル検索,キャプションの摂動を伴うクロスモーダル検索,モダリティ内検索,短文のクロスモーダル検索など,様々なベンチマーク実験により,HyFL-CLIPがより堅牢な長文理解を実現することが示された。
特に、テキストの摂動による長文のクロスモーダル検索において、最良先行法よりも19.5%向上する。
また,HyFL-CLIPをSDXL(Stable Diffusion XL)に適用することにより,他のモデルフレームワークとシームレスに統合可能であることを示す。
関連論文リスト
- Fine-grained CLIP fine-tuning with self-annotated region alignment [57.28808560528696]
対照的な言語-画像事前学習は、そのきめ細かい特徴表現に制限があることが示されている。
そこで我々は,CLIPファインチューニングにおける細粒度表現能力を高めるために,SFF-CLIP(Self-annotated Fine-fine-tuning for CLIP)を提案する。
論文 参考訳(メタデータ) (2026-07-15T10:06:39Z) - CLIP Is Shortsighted: Paying Attention Beyond the First Sentence [13.197160495980318]
トレーニング中に要約文を削除するDeBias-CLIPを導入し,全トークン位置を分散するために文サブサンプリングとテキストトークンパディングを適用した。
DeBias-CLIPは、最先端の長文検索を実現し、短文検索を改善し、文順置換に敏感でない。
論文 参考訳(メタデータ) (2026-02-25T21:27:00Z) - SuperCLIP: CLIP with Simple Classification Supervision [88.86549733903314]
Contrastive Language-Image Pretrainingは、画像とテキストを共有埋め込み空間に整列させることにより、視覚言語タスクの強力な一般化を実現する。
近年,CLIP様モデルでは,テキスト中の微細なセマンティック信号が依然として使われていないことが報告されている。
分類に基づく教師付きコントラスト学習のフレームワークであるSuperCLIPを提案する。
論文 参考訳(メタデータ) (2025-12-16T15:11:53Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP [4.6096940605642915]
MulCLIPは、画像コンポーネントで自然な長文構造をブリッジするエンドツーエンドフレームワークである。
画像と要約と長いキャプションの間には、グローバルなコントラストの一致が保たれている。
長いテキストシーケンスに対して位置埋め込みを拡張する。
論文 参考訳(メタデータ) (2025-12-08T03:23:41Z) - HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment [13.584710249222105]
HiMo-CLIPは、エンコーダアーキテクチャを変更することなくCLIPスタイルのモデルを強化する表現レベルフレームワークである。
HiMo-CLIPは2つの重要なコンポーネントを導入している: 階層分解(HiDe)モジュール。
複数の画像テキスト検索ベンチマークの実験は、HiMo-CLIPが強いベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-11-10T03:04:36Z) - FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs [0.351124620232225]
FineLIPは textbfFine の粒度のアライメントと textbfLonger のテキスト入力を組み込むことで、クロスモーダルなテキストイメージマッピングを強化する。
FineLIPはまず、より長いテキストを扱うために位置埋め込みを拡張し、続いてローカル画像とテキストトークンの動的集約を行う。
我々は、ゼロショット・クロスモーダル検索とテキスト・ツー・イメージ生成という2つのタスクにまたがって、長い詳細なキャプションを持つデータセット上でモデルを検証した。
論文 参考訳(メタデータ) (2025-04-02T17:19:59Z) - TULIP: Token-length Upgraded CLIP [57.818513403100326]
私たちは、CLIPのような視覚言語モデルで長いキャプションを表現するという課題に対処する。
これらのモデルは、固定された絶対的な位置符号化によって制限され、入力を最大77個のトークンに制限する。
トークン長を任意の長さにアップグレードできる一般化可能なT法を提案する。
論文 参考訳(メタデータ) (2024-10-13T22:34:15Z) - Symmetrical Linguistic Feature Distillation with CLIP for Scene Text
Recognition [77.93678598476149]
CLIP-OCR(Symmetrical Linguistic Feature Distillation framework)を新たに構築する。
CLIP画像エンコーダを逆CLIPテキストエンコーダでカスケードすることにより、画像からテキストまでの特徴フローで対称構造を構築する。
大規模な実験では、CLIP-OCRが6つのSTRベンチマークで平均精度93.8%で有効であることが示されている。
論文 参考訳(メタデータ) (2023-10-08T04:00:20Z) - BOSS: Bottom-up Cross-modal Semantic Composition with Hybrid
Counterfactual Training for Robust Content-based Image Retrieval [61.803481264081036]
CIR(Content-Based Image Retrieval)は,サンプル画像と補完テキストの合成を同時に解釈することで,対象画像の検索を目的とする。
本稿では,新しいアンダーラインtextbfBottom-up crunderlinetextbfOss-modal underlinetextbfSemantic compounderlinetextbfSition (textbfBOSS) とHybrid Counterfactual Training frameworkを用いてこの問題に取り組む。
論文 参考訳(メタデータ) (2022-07-09T07:14:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。