論文の概要: Naming the Concepts Classifiers Rely On: Language-Anchored Decomposition for Faithful Explanation
- arxiv url: http://arxiv.org/abs/2607.07264v1
- Date: Wed, 08 Jul 2026 10:50:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.356717
- Title: Naming the Concepts Classifiers Rely On: Language-Anchored Decomposition for Faithful Explanation
- Title(参考訳): 概念分類器を命名する: 忠実な説明のための言語アンコレッドな解法
- Abstract要約: Language-Anchored Decomposition (LAD)は、モデルを変更することなく、名前と忠実な概念を同時に提供するポストホックフレームワークである。
LADは、概念挿入と削除の両方において、決定に関連のある空間的正確な説明を生成する。
- 参考スコア(独自算出の注目度): 8.895569370998093
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep neural networks are widely deployed in high-stakes visual applications where interpretability is critical, yet existing explanations face a trade-off: post-hoc concept methods recover factors that are faithful to a model's behavior but unnamed, while naming and by-design methods attach human-readable concepts only by retraining or altering the classifier. We propose Language-Anchored Decomposition (LAD), a post-hoc framework that delivers concepts which are simultaneously named, faithful, and obtained without modifying the model. For each class, a large language model proposes a concept vocabulary that CLIP-based similarity maps localize across image regions. Inverting standard non-negative matrix factorization, LAD fixes these language-grounded maps as the coefficient matrix and learns only a concept basis that reconstructs the frozen encoder's activations, so naming becomes a structural constraint and the model's own feature geometry determines which concepts are retained. Removing this anchor preserves accuracy but collapses attribution faithfulness. Across natural-image, scene, and medical-imaging benchmarks, LAD produces spatially precise explanations that are decision-relevant under both concept insertion and deletion, while uniquely providing stable, human-interpretable concept names.
- Abstract(参考訳): ディープニューラルネットワークは、解釈可能性が不可欠であるが、既存の説明ではトレードオフに直面している。 ポストホックの概念メソッドは、モデルの振る舞いに忠実だが命名されていない要素を復元する一方で、命名と設計の方法は、分類器のリトレーニングや変更によってのみ、人間の可読性の概念を付加する。
提案するLanguage-Anchored Decomposition (LAD) は,モデルの変更なしに同時に命名され,忠実な概念を提供するポストホックフレームワークである。
各クラスについて、大きな言語モデルは、CLIPベースの類似性が画像領域にまたがってローカライズされるという概念ボキャブラリを提案する。
標準的な非負行列分解を逆転させて、LADはこれらの言語基底写像を係数行列として修正し、凍結エンコーダの活性化を再構成する概念基底のみを学ぶため、命名は構造的制約となり、モデル自身の特徴幾何学はどの概念が保持されているかを決定する。
このアンカーを除去することは正確さを保つが、帰属の忠実さを損なう。
自然画像、シーン、医療画像のベンチマーク全体において、LADは、概念挿入と削除の両方において決定に関連のある空間的正確な説明を生成する一方で、安定した人間解釈可能な概念名を提供する。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models [6.701045531467819]
概念アンラーニングは、事前訓練されたテキスト-画像拡散モデルからターゲット概念を再トレーニングせずに消去することを目的としている。
既存のクローズドフォームメソッドは、テキストエンコーダの応答を通じてターゲット概念を表現する。
本稿では,層間相互アテンションアクティベーションからベースを隠蔽・保持するクローズドフォーム手法PUREを提案する。
論文 参考訳(メタデータ) (2026-05-25T12:18:47Z) - Explaining CLIP Zero-shot Predictions Through Concepts [54.05282304471016]
EZPCを導入し,CLIPのゼロショット予測を人間に理解可能な概念で説明する。
本手法は,言語記述から学習した概念空間にCLIPの合同画像テキスト埋め込みを投影する。
提案手法は,CLIPの強いゼロショット分類精度を維持しつつ,意味のある概念レベルの説明を提供する。
論文 参考訳(メタデータ) (2026-03-30T09:31:33Z) - A Concept is More Than a Word: Diversified Unlearning in Text-to-Image Diffusion Models [2.124297073085513]
概念アンラーニングは、テキスト・ツー・イメージ拡散モデルにおける有害なコンテンツ生成のリスクを低減するための有望な方向である。
既存のアプローチは通常、未学習のターゲット概念を特定するためにキーワードに依存している。
本稿では、文脈的に多様なプロンプトの集合を通して概念を表現する分散フレームワークであるDiversified Unlearningを提案する。
論文 参考訳(メタデータ) (2026-03-19T11:20:40Z) - Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification [39.219841379322716]
解釈可能な設計モデルは、予測に忠実な説明を提供するため、コンピュータビジョンにおいて勢いを増している。
提案する階層型概念埋め込み・探索(HCEP)は,潜在空間における概念埋め込みの階層構造を誘導するフレームワークである。
HCEPは, 競争的分類精度を維持しつつ, 概念精度とリコールにおいて, ベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-02-11T23:53:15Z) - Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations [20.859723044900154]
本稿では,PCBM-ReDについて述べる。PCBM-ReDは,事前学習した不透明なモデルに解釈性を再現する新しいパイプラインである。
最先端の精度を実現し、エンドツーエンドモデルのパフォーマンスギャップを狭め、より優れた解釈性を示す。
論文 参考訳(メタデータ) (2026-01-18T08:01:44Z) - Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation Models [56.35484513848296]
FADE(Fine grained Attenuation for Diffusion Erasure)は、テキストから画像への生成モデルのための非学習アルゴリズムである。
関連する概念に最小限の影響で目標概念を排除し、最先端の手法よりも保持性能が12%向上した。
論文 参考訳(メタデータ) (2025-03-25T15:49:48Z) - CRCE: Coreference-Retention Concept Erasure in Text-to-Image Diffusion Models [19.205261933636645]
本稿では,新しい概念消去フレームワークCRCEを紹介する。
コアフェルデンシャルと保持概念を意味的に明示的にモデル化することにより、CRCEはより正確な概念除去を可能にする。
実験により、CRCEは様々な消去タスクにおいて既存の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-03-18T13:09:01Z) - Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept Discovery [52.498055901649025]
ディープニューラルネットワークの「ブラックボックス」問題に対処するために、概念ボトルネックモデル(CBM)が提案されている。
本稿では,典型的なパラダイムを逆転させる新しいCBMアプローチであるDiscover-then-Name-CBM(DN-CBM)を提案する。
我々の概念抽出戦略は、下流のタスクに非依存であり、既にそのモデルに知られている概念を使用するため、効率的である。
論文 参考訳(メタデータ) (2024-07-19T17:50:11Z) - ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance [90.57708419344007]
新しい概念を学ぶ際に, 概念空間を明示的に規制するために, ** 連続保存損失** を利用するテクニックである **ClassDiffusion** を提示する。
このアプローチは単純ではあるが、ターゲット概念の微調整過程における意味的ドリフトを効果的に防止する。
論文 参考訳(メタデータ) (2024-05-27T17:50:10Z) - Do Concept Bottleneck Models Respect Localities? [14.77558378567965]
概念に基づく説明可能性法は、人間の理解可能な仲介者を用いて機械学習モデルの説明を生成する。
我々は、概念予測者が「関連」機能を利用して予測を行うかどうかを評価する。
概念予測器は必ずしも明確な概念を区別できないため、実際には多くの概念ベースモデルは局所性を尊重しない。
論文 参考訳(メタデータ) (2024-01-02T16:05:23Z) - Implicit Concept Removal of Diffusion Models [92.55152501707995]
テキスト・ツー・イメージ(T2I)拡散モデルはしばしば、透かしや安全でない画像のような望ましくない概念を不注意に生成する。
幾何学駆動制御に基づく新しい概念除去手法であるGeom-Erasingを提案する。
論文 参考訳(メタデータ) (2023-10-09T17:13:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。