論文の概要: Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training
- arxiv url: http://arxiv.org/abs/2608.29313v1
- Date: Sat, 29 Aug 2026 14:55:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.922646
- Title: Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training
- Title(参考訳): Hyper3-CLIP:階層型ハイパーボリックビジョンランゲージトレーニング
- Abstract要約: Hyper3-CLIP(ハイパー3-CLIP)は、グローバル、ローカル、グローバルなコントラスト学習とクエリ条件の視覚プールを組み合わせた階層型双曲型VLMである。
これは、COCOとFlickrのR@5とR@10検索を改善し、VOCとCOCOのマルチラベル分類も改善した。
- 参考スコア(独自算出の注目度): 14.328379791611797
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: CLIP-like vision-language models (VLMs) trained with contrastive objectives learn strong global image-text representations, but their Euclidean embeddings and global pooling fail to encode relational structure such as part-whole and parent-child relations. Hyperbolic VLMs address this gap with entailment-based objectives, and text-conditioned variants improve fine-grained alignment through sentence- and phrase-level queries. However, these two lines of work remain separate: hyperbolic VLMs use static image and region features, while query-conditioned methods lack hierarchical geometric structure. We present Hyper3-CLIP, a hierarchy-conditioned hyperbolic VLM that combines global, local, and global-local contrastive learning with query-conditioned visual pooling. To train the model, we construct lightweight query hierarchies from text, comprising full captions, sentence fragments, localized part descriptions, and extracted phrases. Each query conditions the pooling of visual patches, and the resulting representations support image-text, whole-part, and parent-child entailment losses. Query-conditioned pooling is active only during training. Hyper3-CLIP improves R@5 and R@10 retrieval on COCO and Flickr, as well as multi-label classification on VOC and COCO, while remaining competitive on hierarchy metrics. We also audit zero-shot prompt sensitivity under fixed prompt regimes and study the effect of the localized GRIT part budget used during training. Code is available at https://github.com/Hyper3Labs/hyper3-clip.
- Abstract(参考訳): CLIPのような視覚言語モデル(VLM)は、対照的な目的によって訓練され、強力なグローバルな画像テキスト表現を学習するが、ユークリッドの埋め込みとグローバルプールは、部分全体や親子関係のような関係構造を符号化することができない。
ハイパーボリックなVLMはこのギャップをエンテーメントベースの目的とすることで解決し、テキスト条件の変種は文レベルのクエリやフレーズレベルのクエリによって微妙なアライメントを改善する。
双曲型VLMは静的画像と領域の特徴を使い、クエリ条件付き手法は階層的幾何学的構造を欠いている。
本稿では,グローバル,ローカル,グローバルなコントラスト学習とクエリ条件の視覚プールを組み合わせた階層型双曲型VLMであるHyper3-CLIPを提案する。
モデルをトレーニングするために,全文のキャプション,文の断片,部分記述の局所化,句の抽出といった,軽量なクエリ階層をテキストから構築する。
各クエリは、視覚パッチのプーリングを条件とし、結果の表現は、画像テキスト、全体部分、親子関係の損失をサポートする。
クエリ条件のプーリングはトレーニング中のみアクティブである。
Hyper3-CLIPは、COCOとFlickrのR@5とR@10検索を改善し、VOCとCOCOのマルチラベル分類も改善した。
また, 一定のプロンプト条件下でゼロショットプロンプト感度を検査し, トレーニング中に使用する局所GRIT部分予算の効果について検討した。
コードはhttps://github.com/Hyper3Labs/hyper3-clip.comから入手できる。
関連論文リスト
- HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding [28.162977602129303]
HyFL-CLIPは、ユークリッドCLIPで学んだ確立されたテキストイメージアライメントを双曲空間に蒸留する双曲的微調整フレームワークである。
提案手法は,要約されたトークン・ワイド特徴,長文記述,短いテキスト・コンポーネントの構成,イメージをリンクして階層的セマンティクスをモデル化し,ハイブリボリック・エンテーメントとアインシュタイン・ミッドポイント・アグリゲーションによる部分的関係を捉える。
論文 参考訳(メタデータ) (2026-07-01T04:40:11Z) - DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning [53.36809572236361]
少数のサンプルしか持たない新しいカテゴリーに一般化することを目的としている。
最近のアプローチでは、クラス名から派生したセマンティックな埋め込みで視覚表現を豊かにするために、大きな言語モデルが組み込まれている。
強化学習ゲーティング(DVLA-RL)を用いたデュアルレベル視覚言語アライメントを提案する。
論文 参考訳(メタデータ) (2026-01-31T16:09:37Z) - SuperCLIP: CLIP with Simple Classification Supervision [88.86549733903314]
Contrastive Language-Image Pretrainingは、画像とテキストを共有埋め込み空間に整列させることにより、視覚言語タスクの強力な一般化を実現する。
近年,CLIP様モデルでは,テキスト中の微細なセマンティック信号が依然として使われていないことが報告されている。
分類に基づく教師付きコントラスト学習のフレームワークであるSuperCLIPを提案する。
論文 参考訳(メタデータ) (2025-12-16T15:11:53Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion [33.66085762717581]
LLMはローカライズされたコード補完に優れていますが、コンテキストウィンドウが限られているため、リポジトリレベルのタスクに苦労しています。
GRACEは、静的および動的コードセマンティクスの両方をキャプチャするために、マルチレベルでマルチセマンティックなコードグラフを構築する。
実験によると、GRACEはすべてのメトリクスで最先端のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-09-07T09:01:48Z) - SmartCLIP: Modular Vision-language Alignment with Identification Guarantees [59.16312652369709]
Contrastive Language-Image Pre-Traiing (CLIP)citepradford2021 Learningは、コンピュータビジョンとマルチモーダル学習において重要なモデルとして登場した。
CLIPは、多くの画像テキストデータセットにおける潜在的な情報ミスアライメントに苦労し、絡み合った表現に悩まされている。
モジュラー方式で、最も関連性の高い視覚的およびテキスト的表現を特定し、調整する新しいアプローチである。
論文 参考訳(メタデータ) (2025-07-29T22:26:20Z) - ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking [17.736434513456576]
ReferGPTは、新しいゼロショット参照マルチオブジェクト追跡フレームワークである。
空間知識を付加した多モード大言語モデル(MLLM)により、3D対応キャプションを生成する。
また,CLIPに基づくセマンティックエンコーディングとファジィマッチングを利用して,MLLM生成されたキャプションとユーザクエリを関連付ける,堅牢なクエリマッチング戦略を提案する。
論文 参考訳(メタデータ) (2025-04-12T12:33:15Z) - TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives [65.82577305915643]
Contrastive Language-Image Pretraining (CLIP) モデルは、表現を学ぶためにテキストと視覚的モダリティ間の相互情報を最大化する。
そこで本研究では,テキスト・ツー・イメージ・ジェネレータを用いて,文脈内学習による「ハード」の負の字幕生成と,それに対応する負のイメージ生成が解となることを示す。
提案手法はTripletCLIPと呼ばれ,CLIPの構成能力を向上し,SugarCrepeベンチマークでは9%以上向上した。
論文 参考訳(メタデータ) (2024-11-04T19:24:59Z) - Towards Realistic Zero-Shot Classification via Self Structural Semantic
Alignment [53.2701026843921]
大規模事前訓練型視覚言語モデル(VLM)はゼロショット分類に有効であることが証明されている。
本稿では,アノテーションではなく,より広い語彙を前提とした,より難易度の高いゼロショット分類(Realistic Zero-Shot Classification)を提案する。
本稿では,ラベルのないデータから構造意味情報を抽出し,同時に自己学習を行う自己構造意味アライメント(S3A)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-24T17:56:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。