論文の概要: What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks
- arxiv url: http://arxiv.org/abs/2607.09164v1
- Date: Fri, 10 Jul 2026 07:41:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.806168
- Title: What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks
- Title(参考訳): SEAMS:MSE保存ソフトマスクによる効率改善
- Abstract要約: 保存目的を用いてソフトマスクを直接最適化する充足型サリエンシ法SEAMSを紹介する。
それは、ソフトマスク、学習可能な予算、および3方向画像合成に基づく単純な最適化フレームワークに依存している。
凍結したViT-S/16とConvNeXtモデルによる実験は、同じ最適化パイプラインがオブジェクトレベル、クラス条件、トークンレベルの説明を生成することを示した。
- 参考スコア(独自算出の注目度): 7.6344209680112485
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Saliency maps are most useful when they identify the image regions that are sufficient to preserve a model's behaviour. We introduce SEAMS, a sufficiency-based saliency method that directly optimises a soft mask using a preservation objective. Given a frozen differentiable model output, such as a class probability, CLS embedding, or token representation, SEAMS searches for a compact mask that preserves the selected output. The approach relies on a simple optimisation framework based on soft masks, a learnable budget, and a three-way image composite generated entirely from the query image. As a result, it requires no auxiliary distractor dataset, architecture-specific attribution mechanism, or differentiable top-k relaxation. Experiments with frozen ViT-S/16 and ConvNeXt models show that the same optimisation pipeline can generate object-level, class-conditioned, and token-level explanations by changing only the preserved target. The resulting masks are compact, interpretable, stable across random initialisations, and competitive on insertion and deletion benchmarks. Our results also indicate that different architectures often rely on different sufficient evidence while achieving similar preservation fidelity, highlighting the architecture-dependent nature of visual explanations.
- Abstract(参考訳): 正当性マップは、モデルの振る舞いを保存するのに十分な画像領域を特定する場合に最も有用である。
保存目的を用いてソフトマスクを直接最適化する充足型サリエンシ法SEAMSを紹介する。
クラス確率、CLS埋め込み、トークン表現などのフリーズ可能なモデル出力が与えられたとき、SEAMSは選択した出力を保存するコンパクトマスクを検索する。
このアプローチは、ソフトマスクに基づく単純な最適化フレームワーク、学習可能な予算、およびクエリイメージから完全に生成された3方向画像合成に依存している。
結果として、補助的なイントラクタデータセット、アーキテクチャ固有の属性機構、および差別化可能なトップk緩和を必要としない。
凍結したViT-S/16とConvNeXtモデルを用いた実験では、同じ最適化パイプラインが保存対象のみを変更することで、オブジェクトレベル、クラス条件、トークンレベルの説明を生成することができる。
結果として生じるマスクはコンパクトで解釈可能で、ランダムな初期化にまたがって安定であり、挿入と削除のベンチマークで競合する。
また、異なるアーキテクチャは、しばしば異なる十分な証拠に頼りながら、類似した保存精度を達成し、視覚的説明のアーキテクチャに依存した性質を強調している。
関連論文リスト
- Where Does Generative Difficulty Reside? An Empirical Study of Target Representations [62.54876287800644]
ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
論文 参考訳(メタデータ) (2026-08-01T12:32:31Z) - SARIF: Segment Anything for Robust Image Forensics [2.9917768336120196]
我々は,SARIF(Segment Anything for Robust Image Forensics)を提案する。
SARIFは、フィードバック誘導マスクデコーダと、フォージェリー固有の情報を抽出して法医学的トレースをキャプチャするデュアルエンコーダ設計を導入している。
標準フォージェリローカライゼーションベンチマークの実験により、SARIFは、一般的な画像の破損に対して、強い平均的なクロスデータセット性能とロバスト性を達成することが示された。
論文 参考訳(メタデータ) (2026-06-19T05:21:48Z) - CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval [54.15776146365823]
Composed Image Retrieval (CIR)では、ユーザーは参照画像と操作テキストの両方を使用してターゲットイメージを検索できる。
CSMCIRは3つの相乗的コンポーネントを通して効率的なクエリターゲットアライメントを実現する統一表現フレームワークである。
論文 参考訳(メタデータ) (2026-01-07T09:21:38Z) - Rethinking Query-based Transformer for Continual Image Segmentation [59.40646424650094]
CIS(Class-incremental/Continual Image segmentation)は、各段階ごとに利用可能なカテゴリのセットが異なる段階において、イメージセグメンタを訓練することを目的としている。
現在の方法は、しばしば連続的な学習プロセスからマスク生成を分離する。
しかし, この研究では, 可塑性の喪失と入力データ順序への重み付けという, 切り離されたフレームワークの2つの重要な問題を明らかにした。
論文 参考訳(メタデータ) (2025-07-10T15:03:10Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - MaskInversion: Localized Embeddings via Optimization of Explainability Maps [49.50785637749757]
MaskInversionは、テスト時にマスクによって指定されたクエリ画像領域に対するコンテキスト認識の埋め込みを生成する。
オープン語彙のクラス検索、表現理解の参照、局所的なキャプションや画像生成など、幅広いタスクに使用することができる。
論文 参考訳(メタデータ) (2024-07-29T14:21:07Z) - FlowSDF: Flow Matching for Medical Image Segmentation Using Distance Transforms [60.195642571004804]
本稿では,セグメンテーションマスクの暗黙分布を表現するために,画像誘導型条件付きフローマッチングフレームワークであるFlowSDFを紹介する。
本フレームワークは,セグメンテーションマスクの正確なサンプリングと関連する統計指標の計算を可能にする。
論文 参考訳(メタデータ) (2024-05-28T11:47:12Z) - Mask Propagation for Efficient Video Semantic Segmentation [63.09523058489429]
ビデオセマンティックベースライン劣化(VSS)は、ビデオシーケンス内の各ピクセルにセマンティックラベルを割り当てることを含む。
SSSSと呼ばれるVSSのための効率的なマスク伝搬フレームワークを提案する。
当社のフレームワークは,フレーム単位のMask2Formerと比較して最大4倍のFLOPを削減し,Cityscapes検証セット上では最大2% mIoUしか使用できない。
論文 参考訳(メタデータ) (2023-10-29T09:55:28Z) - Pre-training with Random Orthogonal Projection Image Modeling [32.667183132025094]
Masked Image Modeling (MIM)は、ラベルを使わずに視覚前訓練のための強力な自己教師型戦略である。
ランダム直交投影画像モデリング(ROPIM)に基づく画像モデリングフレームワークを提案する。
ROPIMはノイズ分散が保証される場合の空間的トークン情報を低減し、局所的に変化するマスキング度の下で空間的画像領域全体をマスキングすると見なすことができる。
論文 参考訳(メタデータ) (2023-10-28T15:42:07Z) - Learning Efficient Coding of Natural Images with Maximum Manifold
Capacity Representations [4.666056064419346]
効率的な符号化仮説は、感覚系の応答特性が入力の統計に適応していることを提案する。
エレガントではあるものの、情報理論の特性は実際的な設定や最適化の目的関数として使うのが難しいことで知られている。
ここでは、多様体の容量を直接最適化し、最大多様体容量表現(MMCR)が得られるという仮定を概説する。
論文 参考訳(メタデータ) (2023-03-06T17:26:30Z) - Bayesian Deep Learning for Affordance Segmentation in images [3.15834651147911]
本稿では,画像の空き地を検出するための新しいベイズディープネットワークを提案する。
空間レベルでの動脈およびてんかんの分布を定量化する。
その結果,決定論的ネットワークの最先端性が向上した。
論文 参考訳(メタデータ) (2023-03-02T00:01:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。