論文の概要: Rigorous Interpretation Is a Form of Evaluation
- arxiv url: http://arxiv.org/abs/2605.05508v1
- Date: Wed, 06 May 2026 23:16:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.441813
- Title: Rigorous Interpretation Is a Form of Evaluation
- Title(参考訳): 厳密な解釈は評価の一形態である
- Abstract要約: 我々は、解釈可能性は、表面レベルのパフォーマンス指標を超えて、よりリッチでより原則化されたモデル評価の形式として機能すると主張している。
我々は、解釈可能性が評価的に機能する3つの方法を探る。
その評価可能性を達成するために、解釈可能性の手法は、偽造可能で再現可能で予測可能な主張を生成する必要があると論じる。
- 参考スコア(独自算出の注目度): 30.0834796302356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current machine learning models are evaluated through behavioral snapshots, with benchmark accuracies, win rates and outcome-based metrics. Model explanations and evaluations, however, are fundamentally intertwined: understanding why a model produces a behavior can be as important as measuring what it produces. If we trusted interpretability, we argue that it can serve not merely as diagnostics but as a richer and more principled form of model evaluation beyond surface-level performance metrics. We explore three ways interpretability can function evaluatively: (1) fixing problems by identifying the root causes of unwanted behavior, (2) detecting subtly faulty mechanisms that invalidate model outputs, and (3) predicting potential issues before they arise by fully understanding the model's weaknesses. To fulfill its evaluative potential, we argue that interpretability methods must generate claims that are falsifiable, reproducible, and predictive -- that is, interpretability must meet scientific standards.
- Abstract(参考訳): 現在の機械学習モデルは、ベンチマークの精度、勝利率、結果に基づくメトリクスを含む、行動スナップショットを通じて評価される。
モデルがなぜ振る舞いを生み出すのかを理解することは、モデルが生み出すものを測定するのと同じくらい重要である。
解釈可能性(interpretability)を信頼するならば、単に診断だけでなく、表面レベルのパフォーマンス指標を超えて、よりリッチで原則化されたモデル評価の形式として機能する、と論じる。
本研究では,(1)不必要な行動の根本原因を同定して問題を修正すること,(2)モデル出力を無効にする下位欠陥機構を検出すること,(3)モデルの弱点を十分に理解することによる潜在的な問題を予測すること,の3つの方法を検討する。
その評価可能性を達成するためには、解釈可能性の手法は、偽造可能で再現可能で予測可能な主張を生成する必要がある、すなわち、解釈可能性は科学的基準を満たす必要がある、と論じる。
関連論文リスト
- Generative Interpretability via Scalable Neuro-Symbolic Models [2.1550607598300617]
我々は、生成的解釈可能性へのシフトを主張する。
本稿では、他の解釈可能性研究パラダイムと比較して、生成的解釈可能性の利点を示す。
論文 参考訳(メタデータ) (2026-09-11T20:54:08Z) - From Black-box to Causal-box: Towards Building More Interpretable Models [57.23201263629627]
本稿では, 因果解釈可能性の概念を導入し, 特定のモデルのクラスから対実的クエリを評価できるときの形式化について述べる。
我々は、与えられたモデルアーキテクチャが与えられた偽物クエリをサポートするかどうかを決定する完全なグラフィカルな基準を導出する。
論文 参考訳(メタデータ) (2025-10-24T20:03:18Z) - Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability [70.4107059502882]
有理数拡張による学習言語モデルは、多くの既存の作品において有益であることが示されている。
モデル性能に対する合理的性の影響を徹底的に調査するため、包括的調査を行う。
論文 参考訳(メタデータ) (2025-05-30T02:39:37Z) - Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors [61.92704516732144]
正当性予測の最も堅牢な特徴は、モデルの振舞いに特徴的な因果的役割を果たすものであることを示す。
モデル出力の正しさを予測するために因果メカニズムを利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T00:31:39Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Hard to Explain: On the Computational Hardness of In-Distribution Model Interpretation [0.9558392439655016]
機械学習(ML)モデルを解釈する能力はますます不可欠になりつつある。
近年の研究では、様々なモデルの意思決定を説明する計算複雑性を研究することにより、解釈可能性について正式に評価することが可能であることが示されている。
論文 参考訳(メタデータ) (2024-08-07T17:20:52Z) - Empirical Estimates on Hand Manipulation are Recoverable: A Step Towards
Individualized and Explainable Robotic Support in Everyday Activities [80.37857025201036]
ロボットシステムの鍵となる課題は、他のエージェントの振る舞いを理解することである。
正しい推論の処理は、(衝突)因子が実験的に制御されない場合、特に困難である。
人に関する観察研究を行うために必要なツールをロボットに装備することを提案する。
論文 参考訳(メタデータ) (2022-01-27T22:15:56Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - On the Lack of Robust Interpretability of Neural Text Classifiers [14.685352584216757]
本研究では,事前学習したトランスフォーマーエンコーダをベースとしたニューラルテキスト分類器の解釈の堅牢性を評価する。
どちらのテストも、期待された行動から驚くほど逸脱しており、実践者が解釈から引き出す可能性のある洞察の程度について疑問を呈している。
論文 参考訳(メタデータ) (2021-06-08T18:31:02Z) - A Bayesian Account of Measures of Interpretability in Human-AI
Interaction [34.99424576619341]
解釈可能なエージェントの振る舞いを設計するための既存のアプローチは、分離時の解釈可能性の異なる尺度を考える。
これらすべての振る舞いを有意義にモデル化できる改訂モデルを提案する。
この統合モデルによる興味深い結果を強調し、ユーザスタディの結果を動機付けます。
論文 参考訳(メタデータ) (2020-11-22T03:28:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。