論文の概要: What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- arxiv url: http://arxiv.org/abs/2607.23271v1
- Date: Sat, 25 Jul 2026 16:15:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.043456
- Title: What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- Title(参考訳): CLIPが知っていても言えないこと - 凍結した中間機能から否定を回復する
- Abstract要約: CLIPのような対照的な視覚言語モデルは、意味論的に逆のフレーズをほぼ同一の埋め込みにマッピングする。
中層は構成構文を構築するが、最終層は視覚的アライメントが上昇するにつれてこの構造を崩壊させる。
本稿では,ピーク時のエンコーダを傍受する軽量なポストホック補正システムであるPeakPatchを提案する。
- 参考スコア(独自算出の注目度): 3.9492850032415876
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Contrastive vision-language models such as CLIP map semantically opposite phrases (e.g., "a dog" vs. "not a dog") to nearly identical embeddings, rendering them insensitive to negation. We attribute this failure to a phenomenon we call Representational Collapse: by tracking compositional divergence and visual alignment across the CLIP text encoder, we show that middle layers build compositional syntax, but the final layers collapse this structure as visual alignment rises, producing a syntax-blind final representation. To recover the lost negation signal without altering pretrained weights, we propose PeakPatch, a lightweight post-hoc correction system that intercepts the encoder at its compositional peak. An Embedding Correction Network (ECN) uses cross-attention to extract a negation-specific signal from the peak layer, anchored to a stable baseline, and predicts a deviation vector that re-injects the lost syntax into the final-layer embedding space. A complementary Score Correction Network (SCN) predicts bounded scalar score offsets for discriminative tasks. Both modules are trained jointly end-to-end while all CLIP parameters remain frozen, adding only 5.2M parameters (3.5% of the backbone) and preserving the standard cosine similarity interface. On NegBench, PeakPatch achieves 74.3% on COCO MCQ (+35.1 over CLIP, +17.8 over the best encoder fine-tuning method) and 65.5% on VOC MCQ, while outperforming all fine-tuning baselines on fully out-of-distribution negation retrieval despite training only 3.5% of the parameters. The corrected embeddings also transfer to text-to-image generation (+18.4 negation score) and generalize across ViT-B/32, ViT-L/14, and SigLIP backbones. Project URL: https://stevencylu.github.io/PeakPatch/.
- Abstract(参考訳): CLIPのような対照的な視覚言語モデルは、意味論的に反対のフレーズ(例: "犬" 対 "犬" 対 "犬" など)を、ほぼ同一の埋め込みにマッピングし、否定に敏感にする。
この失敗は、私たちがRepresentational Collapseと呼ぶ現象に起因している:CLIPテキストエンコーダ間の構成のばらつきと視覚的アライメントを追跡することで、中間層が合成構文を構築することを示すが、最終的なレイヤは、視覚的アライメントが上昇するにつれてこの構造が崩壊し、構文に盲目な最終表現が生成される。
予め訓練した重みを変化させることなく,失われる否定信号を回復するために,エンコーダを合成ピークにインターセプトする軽量なポストホック補正システムであるPeakPatchを提案する。
埋め込み補正ネットワーク(ECN)は、クロスアテンションを用いて、ピーク層から否定固有の信号を抽出し、安定したベースラインに固定し、失われた構文を最終層埋め込み空間に再注入する偏差ベクトルを予測する。
相補的なスコア補正ネットワーク(SCN)は、識別タスクの有界スカラースコアオフセットを予測する。
両方のモジュールは共同でエンドツーエンドで訓練され、全てのCLIPパラメータは凍結され、5.2Mパラメータ(バックボーンの3.5%)しか追加されず、標準のコサイン類似性インタフェースを保持する。
NegBenchでは、PeakPatchはCOCO MCQで74.3%(CLIPで+35.1、最高のエンコーダで+17.8)、VOC MCQで65.5%、トレーニングパラメータが3.5%であるにもかかわらず、完全なアウト・オブ・ディストリビューション否定検索ですべての微調整ベースラインを上回っている。
修正された埋め込みはまた、テキスト・ツー・イメージ生成(+18.4否定スコア)に移行し、ViT-B/32、ViT-L/14、SigLIPバックボーンをまたいで一般化する。
プロジェクトURL: https://stevencylu.github.io/PeakPatch/。
関連論文リスト
- Disparity Has a Sign: Stereo Matching Beyond the Zero-Disparity Plane [52.210414985125816]
立体視内容が、負の相違に対応するゼロの相違面の背後にある物体をどう含んでいるかを示す。
撮影者が作成した7本の公開映画から21,495ドルのステレオペアのベンチマークである textitZDPShift を提案する。
同じシーンコンテンツでは、ファンデーションは25.24ドルEPEから75.33ドルpxに上昇し、すべてのバックボーンが3ピクセルの差分誤差を超えるピクセルの約半分を残している。
論文 参考訳(メタデータ) (2026-09-06T19:58:35Z) - Can Scene Text Recognition Read Rare Compositions? [1.7844382164707184]
6つの標準ベンチマークにおいて、シーンテキスト認識は89-97%正確であると報告され、その問題が飽和として広く扱われている。
私たちは代替の読書を提示する。
同じテスト画像が、基準コーパスに対して、接地的単語の規則性と文字n-gramの新規性によって共同で成層されると、結果の5x5グリッドのレアワードxレアトリグラムコーナーでの精度は、q3/q3センタより10〜18pt下方に低下する。
論文 参考訳(メタデータ) (2026-09-01T07:16:42Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval [20.130842837418726]
本稿では,HN-CLIPを導入し,テキストエンコーダのテキスト・テキスト・ジオメトリを用いてアダプティブ・アダプティブ・類似性マージンを構築する。
結果として得られた目的は、トレーニング中に1つのキャプション類似性マトリックスとマスク付きロジットの追加のみを必要とする。
実験の結果、HN-CLIPは最強のライバルに対して+2.5から+4.0 R@1に改善され、GOALより2.4倍、StructXLIPより5.4倍高速にトレーニングされた。
論文 参考訳(メタデータ) (2026-08-19T04:16:46Z) - Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction [0.10499611180329804]
EEG-to-image評価は、視覚的忠実度と回復可能な意味を区別すべきである。
SSIM、LPIPS、CLIPは意味的に回復可能な出力や報奨を罰する。
我々はATM、ENIGMA、BrainVis、DreamDiffusionから6,855個の地上構造/再構成ペアを解析した。
論文 参考訳(メタデータ) (2026-07-14T05:40:23Z) - Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models [0.0]
隠れ状態反転問題を連続埋め込み空間最適化として検討する。
我々は、どのトークンが再構成を破るかを分析し、鋭い分類的非対称性を見つける。
GPT-2の最後の層が隠された状態は、原文と同じくらい敏感である。
論文 参考訳(メタデータ) (2026-07-01T12:18:12Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining [5.739405014622565]
CLIPスタイルのコントラスト事前トレーニングは、通常、サンプルレベルのフィルタリング信号を使用してWebスケールの画像テキストペアをキュレートする。
粗いミスマッチが取り除かれたら、より厳密なグローバルフィルタリングは、保持されたキャプションによって提供される構成上の監督をもはや追跡しない。
本稿では,制御されたナンストケン置換を画像条件付きフレーズセンシティブスコアに変換するフレーズレベルキュレーションフレームワークであるCPIを用いてこの問題に対処する。
論文 参考訳(メタデータ) (2026-05-21T15:55:15Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - Half-Truths Break Similarity-Based Retrieval [21.70058524831519]
テキスト記述が追加の詳細で拡張されると、その詳細が間違っている場合は、画像とテキストの類似性が低下する。
CLIPスタイルのデュアルエンコーダはこの直観に反することが多い。
本稿では,キャプションをエンティティとリレーショナルユニットに分解するCS-CLIPを提案する。
論文 参考訳(メタデータ) (2026-02-27T10:56:31Z) - Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning [23.10421006625293]
CLIPのようなビジョンランゲージモデル(VLM)は否定を理解するのに苦労する。
既存の方法は、微調整のCLIPのテキストエンコーダを通じて否定的理解を洗練し、過度に適合するリスクがある。
我々はCLIPの視覚的記述の理解能力を高めるプラグイン・アンド・プレイフレームワークであるCLIPGlassesを提案する。
論文 参考訳(メタデータ) (2026-02-24T15:55:39Z) - TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing [56.73004765030206]
STE(Scene Text Editing)は、視覚的一貫性を維持しながら、画像中のテキストを自然に修正することを目的としている。
本稿では,モジュラー属性をアンタングル化したSTEのための新しいフレームワークであるTripleFDSを提案する。
TripleFDSは、メインストリームのSTEベンチマークで最先端の画像忠実度(SSIM 44.54)とテキスト精度(ACC 93.58%)を達成する。
論文 参考訳(メタデータ) (2025-11-17T14:15:03Z) - Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic Segmentation [90.35249276717038]
弱教師付きセマンティックセグメンテーションのためのCLIPベースのシングルステージパイプラインであるWeCLIPを提案する。
具体的には、凍結したCLIPモデルを意味的特徴抽出のバックボーンとして適用する。
新しいデコーダは、最終予測のために抽出された意味的特徴を解釈するように設計されている。
論文 参考訳(メタデータ) (2024-06-17T03:49:47Z) - Composed Fine-Tuning: Freezing Pre-Trained Denoising Autoencoders for
Improved Generalization [93.95299500688286]
本稿では,出力の妥当性制約を考慮した構造化出力の予測問題に焦点をあてる。
本稿では,事前学習したデノイザを組み込んだ予測器を微調整するファインチューニングを提案する。
2層ReLUネットワークの場合、構成した微調整が予測器の複雑さを著しく低減することを示す。
論文 参考訳(メタデータ) (2020-06-29T17:14:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。