論文の概要: Invisible Shortcuts: Why Vision Encoders Know Your Camera
- arxiv url: http://arxiv.org/abs/2608.05424v1
- Date: Wed, 05 Aug 2026 21:36:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.666756
- Title: Invisible Shortcuts: Why Vision Encoders Know Your Camera
- Title(参考訳): Invisibleのショートカットは、カメラをエンコーダーが認識する理由
- Abstract要約: ディープビジョンモデルはショートカットを利用しており、監視信号と相関するキューに依存している。
我々は、異なるショートカット学習の源を識別する: ピクセルレベルで埋め込まれた目に見えないメタデータのトレース。
より強力なものは,メタデータのトレースに対する感度を体系的に向上し,メタデータの分散シフト時の性能が向上することを示す。
- 参考スコア(独自算出の注目度): 18.18309407263728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep vision models exploit shortcuts, relying on cues that correlate with supervision signals. Prior work has focused on visible biases, such as object-background or texture correlations. We identify a different source of shortcut learning: invisible metadata traces embedded at the pixel level, for metadata such as image processing and photo acquisition. We hypothesize that large-scale semantic supervision, whether through categorical labels (ImageNet) or billion-scale captions (LAION), naturally induces metadata-semantics correlations during pretraining, leading models to convert low-level signals into predictive features. By introducing controlled metadata-semantics correlations, we show that stronger ones produce systematically higher sensitivity to metadata traces and larger performance degradation under metadata distribution shifts. We further explore mitigation strategies applied during and after pretraining that reduce sensitivity not only to targeted metadata but also to unseen ones, without sacrificing performance on downstream tasks. Metadata sensitivity also has a positive side: it partly explains the strong generated-image detection ability of some encoders, while its mitigation can improve out-of-distribution generalization. Code: https://github.com/ryan-caesar-ramos/visual-encoder-traces
- Abstract(参考訳): ディープビジョンモデルはショートカットを利用しており、監視信号と相関するキューに依存している。
これまでの研究は、オブジェクトの背景やテクスチャの相関など、目に見えるバイアスに重点を置いてきた。
我々は,画像処理や写真取得などのメタデータに対して,画素レベルで埋め込まれた目に見えないメタデータトレースを識別する。
我々は,分類ラベル (ImageNet) や数十億のキャプション (LAION) を通じても,事前学習中にメタデータ・セマンティックな相関を自然に引き起こし,低レベルの信号を予測的特徴に変換するという,大規模セマンティック監視の仮説を立てた。
制御されたメタデータ・セマンティック相関を導入することにより、より強い相関がメタデータのトレースに対する系統的に高い感度と、メタデータの分散シフトによる性能劣化をもたらすことを示す。
さらに,事前学習の前後で適用される緩和戦略について検討する。これは,対象とするメタデータだけでなく,下流タスクのパフォーマンスを犠牲にすることなく,見つからないメタデータに対する感度を低下させる。
メタデータの感度にも肯定的な側面があり、一部のエンコーダの強力な生成画像検出能力を部分的に説明し、その緩和は分布外一般化を改善することができる。
コード:https://github.com/ryan-caesar-ramos/visual-encoder-traces
関連論文リスト
- Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints [4.598350938853635]
ビデオの偽造方法を特定することができない検出器は、間違ったシグナルを学習している可能性が高い、と私たちは主張する。
二分検出とは異なり、帰属誘導学習は共有埋め込み空間に強い幾何学的制約を課す。
本稿では,属性検出と属性抽出を共同で学習する属性誘導型マルチモーダルディープフェイク検出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T09:11:13Z) - LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories [1.4610038284393168]
視覚変換器(ViT)の誤差予測に関する研究
大規模言語モデルにおける内信号幻覚検出の動機付けにより、類似の深度信号がViTに存在するかどうかを考察する。
中間層に軽量な線形ヘッドを付加することにより、予測クラスのロジットとトップK競合の両方をキャプチャする最後のL層から特徴を抽出する。
これらの特徴に基づいて訓練された線形プローブは、エラーインジケータを予測する。
論文 参考訳(メタデータ) (2026-04-12T13:43:40Z) - Traces of Image Memorability in Vision Encoders: Activations, Attention Distributions and Autoencoder Losses [5.369009163979958]
本稿では,事前学習した視覚エンコーダにおける画像記憶可能性の相関について検討する。
これらの特徴が記憶可能性とある程度の相関があることが分かりました。
結果は、モデル内部の特徴と記憶可能性の関係に光を当てた。
論文 参考訳(メタデータ) (2025-09-01T13:11:59Z) - Processing and acquisition traces in visual encoders: What does CLIP know about your camera? [28.34664538014526]
これまでの研究は、画像変換と腐敗に対するビジュアルエンコーダの堅牢性を分析してきた。
画像取得プロセスと変換のパラメータを分析して、人間の目には微妙な、あるいは知覚できない、異なる視点を採る。
論文 参考訳(メタデータ) (2025-08-14T13:34:13Z) - Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection [50.343419243749054]
異常検出は、医学診断や工業的欠陥検出などの分野において重要である。
CLIPの粗粒化画像テキストアライメントは、微粒化異常に対する局所化と検出性能を制限する。
クレーンは最先端のZSADを2%から28%に改善し、画像レベルとピクセルレベルの両方で、推論速度では競争力を維持している。
論文 参考訳(メタデータ) (2025-04-15T10:42:25Z) - Understanding and Improving Training-Free AI-Generated Image Detections with Vision Foundation Models [68.90917438865078]
顔合成と編集のためのディープフェイク技術は、生成モデルに重大なリスクをもたらす。
本稿では,モデルバックボーン,タイプ,データセット間で検出性能がどう変化するかを検討する。
本稿では、顔画像のパフォーマンスを向上させるContrastive Blurと、ノイズタイプのバイアスに対処し、ドメイン間のパフォーマンスのバランスをとるMINDERを紹介する。
論文 参考訳(メタデータ) (2024-11-28T13:04:45Z) - Fine-grained Recognition with Learnable Semantic Data Augmentation [68.48892326854494]
きめ細かい画像認識は、長年続くコンピュータビジョンの課題である。
本稿では,識別領域損失問題を軽減するため,特徴レベルのトレーニングデータを多様化することを提案する。
本手法は,いくつかの人気分類ネットワーク上での一般化性能を著しく向上させる。
論文 参考訳(メタデータ) (2023-09-01T11:15:50Z) - UIA-ViT: Unsupervised Inconsistency-Aware Method based on Vision
Transformer for Face Forgery Detection [52.91782218300844]
そこで我々は、UIA-ViTと呼ばれるビジョン変換器に基づく教師なし不整合認識手法を提案する。
自己注意機構により、パッチ埋め込み間の注意マップは自然に一貫性関係を表現し、一貫性表現学習に適した視覚変換器となる。
論文 参考訳(メタデータ) (2022-10-23T15:24:47Z) - Steganalysis of Image with Adaptively Parametric Activation [2.4201849657206496]
Adap-tive Parametric Activation Moduleは、Nega-tiveの埋め込み信号を保存するように設計されている。
クラス間最大距離によるクロスエントロピー損失の限界を克服するために,コントラスト学習に基づく損失関数を適用した。
論文 参考訳(メタデータ) (2022-03-24T04:44:51Z) - Correlation-Aware Deep Tracking [83.51092789908677]
本稿では,自己/横断的意図に着想を得た,新たなターゲット依存型特徴ネットワークを提案する。
我々のネットワークは機能ネットワークの複数の層にクロスイメージの特徴相関を深く埋め込んでいる。
我々のモデルは、豊富な未ペア画像に対して柔軟に事前訓練が可能であり、既存の手法よりも顕著に高速な収束をもたらす。
論文 参考訳(メタデータ) (2022-03-03T11:53:54Z) - Learning Hierarchical Graph Representation for Image Manipulation
Detection [50.04902159383709]
画像操作検出の目的は、画像内の操作された領域を特定し、特定することである。
最近のアプローチでは、画像に残っている改ざんするアーティファクトをキャプチャするために、洗練された畳み込みニューラルネットワーク(CNN)が採用されている。
本稿では2つの並列分岐からなる階層型グラフ畳み込みネットワーク(HGCN-Net)を提案する。
論文 参考訳(メタデータ) (2022-01-15T01:54:25Z) - Data Augmentation for Object Detection via Differentiable Neural
Rendering [71.00447761415388]
注釈付きデータが乏しい場合、堅牢なオブジェクト検出器を訓練することは困難です。
この問題に対処する既存のアプローチには、ラベル付きデータからラベル付きデータを補間する半教師付き学習が含まれる。
オブジェクト検出のためのオフラインデータ拡張手法を導入し、新しいビューでトレーニングデータを意味的に補間する。
論文 参考訳(メタデータ) (2021-03-04T06:31:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。