論文の概要: A framework for analyzing concept representations in neural models
- arxiv url: http://arxiv.org/abs/2605.01381v1
- Date: Sat, 02 May 2026 11:08:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.741148
- Title: A framework for analyzing concept representations in neural models
- Title(参考訳): ニューラルモデルにおける概念表現分析のためのフレームワーク
- Abstract要約: 2つの軸に沿った線形な概念部分空間について検討する:textitcontainment, 概念が部分空間で完全に表現されているかどうかをテストするが、外部では表現されない、textitdisentanglement, 他の概念から分離するためにテストする。
テキストモデルと音声モデルの両方の実験において、まず、概念部分空間は一意に決定されない可能性があることを強調し、概念部分空間解析の意義について議論する。
- 参考スコア(独自算出の注目度): 18.72886146851972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding how neural models represent human-interpretable concepts is challenging. Prior work has explored linear concept subspaces from diverse perspectives, such as probing and concept erasure. We introduce a unified framework to study these subspaces along two axes: \textit{containment}, which tests if a concept is fully represented in a subspace but not outside it, and \textit{disentanglement}, which tests for isolation from other concepts. In experiments on both text and speech models, we first highlight that concept subspaces may not be uniquely determined, and discuss the implications for concept subspace analysis. Then, we compare properties of concept subspaces estimated using five estimators, proposed in different communities. We find that (1) the choice of estimator impacts the containment and disentanglement properties; (2) the state-of-the-art concept erasure method, LEACE, performs well on both testing axes, but still struggles to generalize to unseen data; and (3) in HuBERT speech representations, phone information is both contained and disentangled from speaker information, while speaker information is hard to contain in a compact subspace, despite being disentangled from phones.
- Abstract(参考訳): 人間の解釈可能な概念をどのように表現するかを理解することは難しい。
以前の研究は、探索や概念消去といった様々な視点から線形概念部分空間を探求してきた。
2つの軸に沿ってこれらの部分空間を研究するための統一的なフレームワークを導入する: \textit{containment}, 概念が部分空間で完全に表現されているが、外部では表現されていないかどうかをテストする。
テキストモデルと音声モデルの両方の実験において、まず、概念部分空間は一意に決定されない可能性があることを強調し、概念部分空間解析の意義について議論する。
次に、異なるコミュニティで提案された5つの推定器を用いて推定した概念部分空間の特性を比較する。
その結果,(1) 推定器の選択が包絡特性や絡み合い特性に影響を及ぼすこと,(2) 最先端の概念消去手法であるLEACEは両試験軸において良好に機能するが,未確認データへの一般化に苦慮していること,(3) HuBERT 音声表現では,話者情報の格納・アンタングル化が困難でありながら,話者情報はコンパクトなサブ空間に格納することが難しいこと,などが判明した。
関連論文リスト
- A Geometric Unification of Concept Learning with Concept Cones [58.70836885177496]
解釈可能性の2つの伝統は、並べて進化してきたが、互いに話すことはめったにない:概念ボトルネックモデル(CBM)とスパースオートエンコーダ(SAE)。
両パラダイムが同じ幾何学的構造をインスタンス化することを示す。
CBMは人間の定義した参照ジオメトリを提供するが、SAEは学習した円錐がCBMをどの程度よく近似するか、あるいは包含しているかによって評価することができる。
論文 参考訳(メタデータ) (2025-12-08T09:51:46Z) - FaCT: Faithful Concept Traces for Explaining Neural Network Decisions [56.796533084868884]
ディープネットワークは、幅広いタスクで顕著なパフォーマンスを示しているが、それらの機能に関するグローバルな概念レベルの理解は、依然として重要な課題である。
本稿では,概念に基づく説明の忠実さを強調し,モデル独立な機械的概念説明を用いた新しいモデルを提案する。
私たちの概念はクラス間で共有され、あらゆるレイヤから、ロジットへの貢献と入力-視覚化を忠実にトレースすることができます。
論文 参考訳(メタデータ) (2025-10-29T13:35:46Z) - Explaining Explainability: Recommendations for Effective Use of Concept Activation Vectors [35.37586279472797]
概念ベクトル活性化(Concept Vector Activations, CAV)は、概念実証者のプローブデータセットを用いて学習される。
CAVの3つの特性として,層間不整合,(2)他の概念との絡み合い,(3)空間依存性について検討する。
これらの特性の存在を検出するためのツールを導入し、各特性がどのように誤解を招くのかを洞察し、その影響を軽減するためのレコメンデーションを提供する。
論文 参考訳(メタデータ) (2024-04-04T17:46:20Z) - A Geometric Notion of Causal Probing [85.49839090913515]
線形部分空間仮説は、言語モデルの表現空間において、動詞数のような概念に関するすべての情報が線形部分空間に符号化されていることを述べる。
理想線型概念部分空間を特徴づける内在的基準のセットを与える。
2つの言語モデルにまたがる少なくとも1つの概念に対して、この概念のサブスペースは、生成された単語の概念値を精度良く操作することができる。
論文 参考訳(メタデータ) (2023-07-27T17:57:57Z) - Multi-dimensional concept discovery (MCD): A unifying framework with
completeness guarantees [1.9465727478912072]
本稿では,概念レベルの完全性関係を満たす従来のアプローチの拡張として,多次元概念発見(MCD)を提案する。
より制約のある概念定義に対するMDDの優位性を実証的に実証する。
論文 参考訳(メタデータ) (2023-01-27T18:53:19Z) - Concept Activation Regions: A Generalized Framework For Concept-Based
Explanations [95.94432031144716]
既存の手法では、概念を説明する例は、ディープニューラルネットワークの潜伏空間の一定の方向にマッピングされていると仮定している。
そこで本研究では,DNNの潜在空間において,異なるクラスタに分散した概念例を提案する。
この概念活性化領域(CAR)は、グローバルな概念に基づく説明と局所的な概念に基づく特徴の重要性をもたらす。
論文 参考訳(メタデータ) (2022-09-22T17:59:03Z) - Overlooked factors in concept-based explanations: Dataset choice,
concept learnability, and human capability [25.545486537295144]
概念に基づく解釈可能性法は、事前に定義されたセマンティック概念のセットを使用して、ディープニューラルネットワークモデル予測を説明することを目的としている。
その人気にもかかわらず、文学によって十分に理解され、明瞭化されていない限界に悩まされている。
概念に基づく説明において、よく見過ごされる3つの要因を分析した。
論文 参考訳(メタデータ) (2022-07-20T01:59:39Z) - FALCON: Fast Visual Concept Learning by Integrating Images, Linguistic
descriptions, and Conceptual Relations [99.54048050189971]
自然に発生する複数のデータストリームによってガイドされる新しい視覚概念を素早く学習するフレームワークを提案する。
学習された概念は、未知の画像について推論することで質問に答えるなど、下流のアプリケーションをサポートする。
合成と実世界の両方のデータセットにおけるモデルの有効性を実証する。
論文 参考訳(メタデータ) (2022-03-30T19:45:00Z) - Sparse Subspace Clustering for Concept Discovery (SSCCD) [1.7319807100654885]
概念は高いレベルの人間の理解の鍵となる構成要素である。
局所帰属法では、サンプル間のコヒーレントモデル挙動を特定できない。
隠れた特徴層の低次元部分空間として、新しい概念の定義を提唱した。
論文 参考訳(メタデータ) (2022-03-11T16:15:48Z) - Human-Centered Concept Explanations for Neural Networks [47.71169918421306]
概念活性化ベクトル(Concept Activation Vectors, CAV)のクラスを含む概念的説明を紹介する。
次に、自動的に概念を抽出するアプローチと、それらの注意事項に対処するアプローチについて議論する。
最後に、このような概念に基づく説明が、合成設定や実世界の応用において有用であることを示すケーススタディについて論じる。
論文 参考訳(メタデータ) (2022-02-25T01:27:31Z) - Kernelized Concept Erasure [108.65038124096907]
概念消去のための線形ミニマックスゲームのカーネル化を提案する。
特定の非線形敵が概念を予測するのを防ぐことができる。
しかし、保護は異なる非線形敵に移動しない。
論文 参考訳(メタデータ) (2022-01-28T15:45:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。