論文の概要: When Modality Gap Reduction Fails: Prediction-Level Hubness in CLIP
- arxiv url: http://arxiv.org/abs/2609.01103v1
- Date: Tue, 01 Sep 2026 11:46:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.609164
- Title: When Modality Gap Reduction Fails: Prediction-Level Hubness in CLIP
- Title(参考訳): モダリティギャップ低減が失敗した場合:CLIPの予測レベルハッチネス
- Authors: Shota Sato, Hajime Kiyama, Tosho Hirasawa, Mamoru Komachi,
- Abstract要約: 平均的な画像テキストのギャップが小さくなれば、必ずしも一貫した精度が向上するとは限らない。
モーダリティギャップ補正はクラス間の相対的な決定構造を変化させ、クラスの小さな部分集合に集中させる。
その結果, ギャップ補正は, 平均アライメントだけでなく, 下流の予測構造への影響も評価すべきであることが示唆された。
- 参考スコア(独自算出の注目度): 9.413762502389451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reducing the modality gap between image and text representations in CLIP is widely expected to improve cross-modal alignment and downstream performance. However, a smaller average image-text gap does not necessarily lead to consistent accuracy gains. We analyze this mismatch from the perspective of the decision structure in zero-shot classification, i.e. selecting the most similar class-text prototype for an input image. Zero-shot accuracy depends not only on average image--text alignment, but also on class-wise decision margins. Using Linear correction as an analytically tractable case, we show that modality gap correction can alter the relative decision structure among classes and cause predictions to concentrate on a small subset of classes. We refer to this output-space failure mode as prediction-level hubness. Furthermore, experiments across multiple datasets show that accuracy degradation under gap correction is consistently associated with increased prediction concentration, both for Linear correction and for learning-based correction methods. This provides a systematic explanation of why modality gap reduction does not consistently improve CLIP zero-shot accuracy from the perspective of downstream decision structure. Our results suggest that gap correction should be evaluated not only by average alignment, but also by its impact on downstream prediction structure.
- Abstract(参考訳): CLIPにおける画像とテキスト表現間のモダリティギャップの低減は、クロスモーダルアライメントと下流のパフォーマンスを改善することが広く期待されている。
しかし、平均的な画像テキストのギャップが小さくなれば、必ずしも一貫した精度が向上するとは限らない。
我々はこのミスマッチをゼロショット分類における決定構造の観点から分析し、入力画像に対して最も類似したクラステキストプロトタイプを選択する。
ゼロショット精度は、平均的な画像のアライメントだけでなく、クラス単位での決定マージンにも依存する。
線形補正を解析的トラクタブルなケースとして用いて、モダリティギャップ補正はクラス間の相対的な決定構造を変化させ、クラスの小さなサブセットに集中させる。
この出力空間障害モードを予測レベルのハブ性と呼ぶ。
さらに、複数のデータセットを対象とした実験により、ギャップ補正による精度劣化は、線形補正と学習ベース補正の両方において、予測集中の増加と一貫して関連していることが示された。
これにより、下流決定構造の観点から、なぜモダリティギャップ低減がCLIPゼロショット精度を一貫して改善しないのかを体系的に説明できる。
その結果, ギャップ補正は, 平均アライメントだけでなく, 下流の予測構造への影響も評価すべきであることが示唆された。
関連論文リスト
- Subtype Robustness Is Not Just Accuracy: Calibration Under Unseen Subtype Shift [1.2085879670633297]
サブタイプロバスト性は、テスト例が訓練を受けていないが既知の粗いカテゴリ内にあるきめ細かいサブタイプから来るとき、モデルが正しい粗い予測を保持するかどうかを問う。
本稿では,ImageNet, BREEDS, iNaturalist, CIFAR-100を5つのアーキテクチャで比較した。
論文 参考訳(メタデータ) (2026-08-02T01:49:59Z) - Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration [36.91587844807066]
マルチモーダル言語モデル (MLLM) は, マルチモーダル・クロスモーダル検索において高い性能を示した。
しかし、予測は意味的関連性よりも入力順序に支配される厳しい位置バイアスに悩まされる。
そこで本研究では,本質的な注意信号を利用した学習自由な注意誘導型脱バイアスフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T06:17:01Z) - LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs [61.06744611795341]
医用視覚言語モデル(VLM)は医用画像の強力なゼロショット認識器である。
本研究では,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ(texttttextbfLATA,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ)を提案する。
texttttextbfLATAは交換性を損なうことなくゼロショット予測をシャープにする。
論文 参考訳(メタデータ) (2026-02-19T16:45:38Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - AIR: Zero-shot Generative Model Adaptation with Iterative Refinement [27.322307161825844]
ゼロショット生成モデル適応(ZSGM)は、テキストガイダンスのみを使用して、事前訓練されたジェネレータをターゲットドメインに適応することを目的としている。
最近のZSGMアプローチの中心は、CLIPのような視覚言語モデルの埋め込み空間において、画像オフセットとテキストオフセットを整列する形で、テキストガイダンスを使用する方向損失である。
論文 参考訳(メタデータ) (2025-06-12T17:00:50Z) - Rethinking Early Stopping: Refine, Then Calibrate [49.966899634962374]
キャリブレーション・リファインメント分解の新規な変分定式化について述べる。
我々は,校正誤差と精錬誤差が訓練中に同時に最小化されないという理論的,実証的な証拠を提供する。
論文 参考訳(メタデータ) (2025-01-31T15:03:54Z) - Normalizing Flows for Conformal Regression [0.0]
Conformal Prediction (CP)アルゴリズムは、ラベル付きデータに基づいて出力を校正することで予測モデルの不確実性を推定する。
キャリブレーション過程をトレーニングすることで、間隔をローカライズする一般的なスキームを提案する。
PapadopoulosらによるError Reweighting CPアルゴリズム(2008年)とは異なり、このフレームワークは名目と経験的条件の妥当性のギャップを推定できる。
論文 参考訳(メタデータ) (2024-06-05T15:04:28Z) - On Calibrating Semantic Segmentation Models: Analyses and An Algorithm [51.85289816613351]
セマンティックセグメンテーションキャリブレーションの問題について検討する。
モデルキャパシティ、作物サイズ、マルチスケールテスト、予測精度はキャリブレーションに影響を及ぼす。
我々は、単純で統一的で効果的なアプローチ、すなわち選択的スケーリングを提案する。
論文 参考訳(メタデータ) (2022-12-22T22:05:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。