論文の概要: ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI
- arxiv url: http://arxiv.org/abs/2607.09649v1
- Date: Fri, 10 Jul 2026 17:47:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.916942
- Title: ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI
- Title(参考訳): ConceptSMILE: 概念ベースの説明可能なAIの信頼性を検証する
- Abstract要約: ConceptSMILEは概念に基づく説明の信頼性を評価するためのモデルに依存しない摂動に基づく監査フレームワークである。
我々は、MedSAM由来の視覚概念とVLMに基づく意味概念を比較して、網膜基底画像上のConceptSMILEを評価する。
- 参考スコア(独自算出の注目度): 1.7827089308985398
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Concept-based explainable artificial intelligence (AI) can make model reasoning more human-understandable, but concept-level outputs are not automatically trustworthy. We introduce ConceptSMILE, a model-agnostic perturbation-based auditing framework for evaluating the reliability of concept-based explanations. Rather than replacing SMILE, ConceptSMILE extends its perturbation-based logic from feature- or region-level attribution to the auditing of human-understandable concept explanations. The framework perturbs input regions, measures concept-response shifts, applies locality weighting, and fits an XGBoost surrogate to approximate local concept behaviour. Reliability is assessed through attribution accuracy, surrogate fidelity, faithfulness, stability, and consistency. We evaluate ConceptSMILE on retinal fundus images by comparing MedSAM-derived visual concepts with VLM-based semantic concepts. Results show that reliability varies across concepts and pathways: MedSAM achieves stronger spatial attribution and the highest surrogate fidelity ($R^2 = 0.8503$, $R_w^2 = 0.8465$), while the VLM pathway shows stronger vessel faithfulness and stronger stability under selected artefact conditions. ConceptSMILE provides an independent audit layer for evaluating the trustworthiness of concept-based XAI.
- Abstract(参考訳): 概念に基づく説明可能な人工知能(AI)は、モデル推論をより人間的に理解しやすいものにするが、概念レベルのアウトプットは、自動的に信頼できるものではない。
本研究では,概念に基づく説明の信頼性を評価するためのモデルに依存しない摂動に基づく監査フレームワークであるConceptSMILEを紹介する。
SMILEを置き換えるのではなく、ConceptSMILEは、機能レベルや地域レベルの属性から人間の理解可能な概念説明の監査まで、摂動に基づくロジックを拡張している。
このフレームワークは入力領域を摂動させ、概念応答シフトを測定し、局所性重み付けを適用し、XGBoostサロゲートを局所的な概念行動に近似する。
信頼性は属性の正確性、忠実性、忠実性、安定性、一貫性を通じて評価される。
我々は、MedSAM由来の視覚概念とVLMに基づく意味概念を比較して、網膜基底画像上のConceptSMILEを評価する。
MedSAMはより強い空間属性と高いサロゲート忠実度(R^2 = 0.8503$, $R_w^2 = 0.8465$)を達成する一方、VLM経路は選択された人工物条件下でより強い血管忠実性とより強い安定性を示す。
ConceptSMILEは、コンセプトベースのXAIの信頼性を評価するための独立した監査層を提供する。
関連論文リスト
- Towards Fine-Grained and Verifiable Concept Bottleneck Models [11.236280871580155]
Concept Bottleneck Models (CBM) はブラックボックス予測器の解釈可能な代替手段を提供する。
既存のCBMは、予測された概念が正しい視覚的証拠に対応するかどうかを検証するのに苦労している。
局所的な視覚的エビデンスに各概念を根ざしたきめ細かいCBMフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-14T00:08:09Z) - Rethinking Concept Bottleneck Models: From Pitfalls to Solutions [53.84388497227224]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の理解可能な概念の基底予測である。
CBM-Suiteはこれらの課題に対処するための方法論的なフレームワークである。
論文 参考訳(メタデータ) (2026-03-05T19:37:49Z) - Concept Component Analysis: A Principled Approach for Concept Extraction in LLMs [51.378834857406325]
機械的解釈可能性(Mechanistic interpretability)は、大きな言語モデルからの抽出によって問題を緩和しようとする。
スパースオートエンコーダ (SAE) は、解釈可能・単意味的な概念を抽出するための一般的なアプローチである。
SAEは基本的な理論的曖昧さに悩まされており、LLM表現と人間解釈可能な概念との明確に定義された対応はいまだに不明である。
論文 参考訳(メタデータ) (2026-01-28T09:27:05Z) - FaCT: Faithful Concept Traces for Explaining Neural Network Decisions [56.796533084868884]
ディープネットワークは、幅広いタスクで顕著なパフォーマンスを示しているが、それらの機能に関するグローバルな概念レベルの理解は、依然として重要な課題である。
本稿では,概念に基づく説明の忠実さを強調し,モデル独立な機械的概念説明を用いた新しいモデルを提案する。
私たちの概念はクラス間で共有され、あらゆるレイヤから、ロジットへの貢献と入力-視覚化を忠実にトレースすることができます。
論文 参考訳(メタデータ) (2025-10-29T13:35:46Z) - Interpretable Reward Modeling with Active Concept Bottlenecks [54.00085739303773]
本稿では,解釈可能な嗜好学習を可能にする報酬モデリングフレームワークであるConcept Bottleneck Reward Models (CB-RM)を紹介する。
不透明報酬関数に依存する標準的なRLHF法とは異なり、CB-RMは報酬予測を人間の解釈可能な概念に分解する。
我々は,最も情報性の高い概念ラベルを動的に取得する能動的学習戦略を定式化する。
論文 参考訳(メタデータ) (2025-07-07T06:26:04Z) - Interpretability Illusions with Sparse Autoencoders: Evaluating Robustness of Concept Representations [23.993903128858832]
本研究では,SAE表現を操作するために対向的摂動が構築される現実的なシナリオを特徴とする評価フレームワークを開発する。
逆入力摂動は,ほとんどのシナリオにおいて,概念に基づく解釈を効果的に操作できることがわかった。
以上の結果から,SAEの概念表現は脆弱であり,モデル監視や監視に不適である可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-21T20:42:05Z) - Towards Robust and Reliable Concept Representations: Reliability-Enhanced Concept Embedding Model [22.865870813626316]
概念ボトルネックモデル(Concept Bottleneck Models, CBM)は、人間の理解可能な概念を意思決定の中間体として予測することにより、解釈可能性を高めることを目的としている。
概念に関係のない特徴に対する感受性と、異なるサンプルの同じ概念に対する意味的一貫性の欠如である。
本稿では,Reliability-Enhanced Concept Embedding Model (RECEM) を提案する。Reliability-Enhanced Concept Embedding Model (RECEM) は2つの戦略を導入する。
論文 参考訳(メタデータ) (2025-02-03T09:29:39Z) - On the Fairness, Diversity and Reliability of Text-to-Image Generative Models [68.62012304574012]
マルチモーダル生成モデルは 信頼性 公正性 誤用の可能性について 批判的な議論を巻き起こしました
埋め込み空間におけるグローバルおよびローカルな摂動に対する応答を解析し、モデルの信頼性を評価するための評価フレームワークを提案する。
提案手法は, 信頼できない, バイアス注入されたモデルを検出し, 組込みバイアスの証明をトレースするための基礎となる。
論文 参考訳(メタデータ) (2024-11-21T09:46:55Z) - Improving Intervention Efficacy via Concept Realignment in Concept Bottleneck Models [57.86303579812877]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の理解可能な概念に基づいて、解釈可能なモデル決定を可能にする画像分類である。
既存のアプローチは、強いパフォーマンスを達成するために、画像ごとに多数の人間の介入を必要とすることが多い。
本稿では,概念関係を利用した学習型概念認識介入モジュールについて紹介する。
論文 参考訳(メタデータ) (2024-05-02T17:59:01Z) - On the Concept Trustworthiness in Concept Bottleneck Models [39.928868605678744]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、推論プロセスを、概念マッピングと概念ラベル予測に分解する。
概念からラベルへの予測の透明性にもかかわらず、入力から中間概念へのマッピングはブラックボックスのままである。
概念が関連する領域から導出されているかどうかを評価するために、概念信頼性スコアと呼ばれる先駆的な指標が提案されている。
拡張されたCBMを導入し、特徴マップの異なる部分から概念予測を具体的に行えるようにした。
論文 参考訳(メタデータ) (2024-03-21T12:24:53Z) - Do Concept Bottleneck Models Respect Localities? [14.77558378567965]
概念に基づく説明可能性法は、人間の理解可能な仲介者を用いて機械学習モデルの説明を生成する。
我々は、概念予測者が「関連」機能を利用して予測を行うかどうかを評価する。
概念予測器は必ずしも明確な概念を区別できないため、実際には多くの概念ベースモデルは局所性を尊重しない。
論文 参考訳(メタデータ) (2024-01-02T16:05:23Z) - Evaluating the Stability of Semantic Concept Representations in CNNs for
Robust Explainability [0.0]
本稿では,コンピュータビジョンCNNにおける概念表現を扱う際の2つの安定性目標について述べる。
ガイドとなるユースケースは、オブジェクト検出CNNのためのポストホックな説明可能性フレームワークである。
本稿では,概念分離と一貫性の両面を考慮した新しい計量法を提案する。
論文 参考訳(メタデータ) (2023-04-28T14:14:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。