論文の概要: Understanding Post-hoc Explainers: The Case of Anchors
- arxiv url: http://arxiv.org/abs/2303.08806v1
- Date: Wed, 15 Mar 2023 17:56:34 GMT
- ステータス: 処理完了
- システム内更新日: 2023-03-16 12:44:39.127337
- Title: Understanding Post-hoc Explainers: The Case of Anchors
- Title(参考訳): ポストホックな説明の理解:アンカーの場合
- Authors: Gianluigi Lopardo, Frederic Precioso, Damien Garreau
- Abstract要約: 本稿では,テキストの判断を説明するために,少数の単語群をハイライトする規則に基づく解釈可能性法の理論解析を行う。
アルゴリズムを定式化し有用な洞察を提供した後、数学的にアンカーが有意義な結果をもたらすことを示す。
- 参考スコア(独自算出の注目度): 6.681943980068051
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In many scenarios, the interpretability of machine learning models is a
highly required but difficult task. To explain the individual predictions of
such models, local model-agnostic approaches have been proposed. However, the
process generating the explanations can be, for a user, as mysterious as the
prediction to be explained. Furthermore, interpretability methods frequently
lack theoretical guarantees, and their behavior on simple models is frequently
unknown. While it is difficult, if not impossible, to ensure that an explainer
behaves as expected on a cutting-edge model, we can at least ensure that
everything works on simple, already interpretable models. In this paper, we
present a theoretical analysis of Anchors (Ribeiro et al., 2018): a popular
rule-based interpretability method that highlights a small set of words to
explain a text classifier's decision. After formalizing its algorithm and
providing useful insights, we demonstrate mathematically that Anchors produces
meaningful results when used with linear text classifiers on top of a TF-IDF
vectorization. We believe that our analysis framework can aid in the
development of new explainability methods based on solid theoretical
foundations.
- Abstract(参考訳): 多くのシナリオにおいて、機械学習モデルの解釈可能性は非常に必要だが難しいタスクである。
このようなモデルの個々の予測を説明するため、局所モデルに依存しないアプローチが提案されている。
しかし、説明を生成するプロセスは、ユーザにとって、説明すべき予測と同じくらい謎めいたものになり得る。
さらに、解釈可能性法は理論的な保証を欠くことが多く、単純なモデルに対するそれらの振る舞いはしばしば不明である。
説明者が最先端のモデルで期待通りに振る舞うことを保証することは不可能ではないが、少なくともすべてがシンプルで既に解釈可能なモデルで機能することを保証することはできる。
本稿では,Anchors(Ribeiro et al., 2018)の理論的解析について述べる。テキスト分類器の判断を説明するために,少数の単語をハイライトする一般的な規則に基づく解釈法である。
アルゴリズムを定式化し有用な洞察を提供した後、TF-IDFベクトル化の上に線形テキスト分類器を用いた場合、Anchorが有意義な結果をもたらすことを数学的に示す。
分析フレームワークは,理論的基礎に基づく新しい説明可能性手法の開発に有効であると考えている。
関連論文リスト
- Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Even-if Explanations: Formal Foundations, Priorities and Complexity [18.126159829450028]
線形モデルとツリーモデルの両方がニューラルネットワークよりも厳密に解釈可能であることを示す。
ユーザが好みに基づいて説明をパーソナライズすることのできる、嗜好に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-17T11:38:58Z) - Explainability for Large Language Models: A Survey [59.67574757137078]
大規模言語モデル(LLM)は、自然言語処理における印象的な能力を示している。
本稿では,トランスフォーマーに基づく言語モデルを記述する手法について,説明可能性の分類法を紹介した。
論文 参考訳(メタデータ) (2023-09-02T22:14:26Z) - Evaluating and Explaining Large Language Models for Code Using Syntactic
Structures [74.93762031957883]
本稿では,コード用大規模言語モデルに特有の説明可能性手法であるASTxplainerを紹介する。
その中核にあるASTxplainerは、トークン予測をASTノードに整合させる自動メソッドを提供する。
私たちは、最も人気のあるGitHubプロジェクトのキュレートデータセットを使用して、コード用の12の人気のあるLLMに対して、実証的な評価を行います。
論文 参考訳(メタデータ) (2023-08-07T18:50:57Z) - Local Interpretable Model Agnostic Shap Explanations for machine
learning models [0.0]
局所解釈可能なモデル非依存型シェイプ説明法(LIMASE)を提案する。
提案手法は, LIMEパラダイムの下でシェープリー値を用いて, 局所的忠実かつ解釈可能な決定木モデルを用いて, シェープリー値を計算し, 視覚的に解釈可能な説明を行うことにより, 任意のモデルの予測を行う。
論文 参考訳(メタデータ) (2022-10-10T10:07:27Z) - Don't Explain Noise: Robust Counterfactuals for Randomized Ensembles [50.81061839052459]
我々は確率論的問題として、堅牢な対実的説明の生成を定式化する。
アンサンブルモデルのロバスト性とベース学習者のロバスト性との関係を示す。
本手法は, 反実的説明から初期観測までの距離をわずかに増加させるだけで, 高いロバスト性を実現する。
論文 参考訳(メタデータ) (2022-05-27T17:28:54Z) - ExSum: From Local Explanations to Model Understanding [6.23934576145261]
ブラックボックスモデルの動作メカニズムを理解するために,解釈可能性法を開発した。
この目標をフルフィルするには、これらのメソッドによって生成された説明が正しいことと、人々が容易に確実に理解できることの両方が必要である。
本稿では,モデル理解の定量化のための数学的枠組みである説明要約(ExSum)を紹介する。
論文 参考訳(メタデータ) (2022-04-30T02:07:20Z) - Evaluating Explanations for Reading Comprehension with Realistic
Counterfactuals [26.641834518599303]
本稿では,機械読解タスクの説明を評価する手法を提案する。
説明は、現実的な反現実的な入力シナリオのセットに関して、RCモデルのハイレベルな振る舞いを理解することを可能にします。
本分析は,トークンレベルの属性よりもRCに適していることを示す。
論文 参考訳(メタデータ) (2021-04-09T17:55:21Z) - Beyond Trivial Counterfactual Explanations with Diverse Valuable
Explanations [64.85696493596821]
コンピュータビジョンの応用において、生成的対実法はモデルの入力を摂動させて予測を変更する方法を示す。
本稿では,多様性強化損失を用いて制約される不連続潜在空間における摂動を学習する反事実法を提案する。
このモデルは, 従来の最先端手法と比較して, 高品質な説明を生産する成功率を向上させる。
論文 参考訳(メタデータ) (2021-03-18T12:57:34Z) - Have We Learned to Explain?: How Interpretability Methods Can Learn to
Encode Predictions in their Interpretations [20.441578071446212]
解釈を定量的に評価する手法としてEVAL-X、償却説明法としてREAL-Xを紹介します。
EVAL-Xは、予測が解釈にエンコードされたときに検出でき、定量的および放射線学者評価を通じてREAL-Xの利点を示す。
論文 参考訳(メタデータ) (2021-03-02T17:42:33Z) - Towards Interpretable Natural Language Understanding with Explanations
as Latent Variables [146.83882632854485]
そこで本研究では,人間に注釈付き説明文の小さなセットだけを必要とする自然言語理解の枠組みを構築した。
我々のフレームワークは、ニューラルネットワークの基本的な推論過程をモデル化する潜在変数として、自然言語の説明を扱う。
論文 参考訳(メタデータ) (2020-10-24T02:05:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。