論文の概要: Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence
- arxiv url: http://arxiv.org/abs/2609.05385v2
- Date: Mon, 07 Sep 2026 09:15:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.069069
- Title: Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence
- Title(参考訳): 必要か十分か : 行動証拠を用いたLCM説明の評価
- Authors: Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri, Christopher Martin, Vadim Pertsovskiy,
- Abstract要約: 我々は、名前付き要因の2つの解釈を検証した:必要、すなわち、要因の変更が出力を変えることを意味する。
我々は、これらの解釈を2つの総合的なユースケースで評価し、クライアントに助言を推薦し、有害性やリスクを判断する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM decision components that can operate within agent workflows often produce action-relevant recommendations or judgements together with explanations. Operators may use the named factors to monitor a system, diagnose errors, or decide when to escalate an output. Such use assumes that the explanations agree with the component's observable decision behaviour. We test two interpretations of the named factors: necessity, meaning that changing a factor would change the output, and sufficiency, meaning that retaining it while removing other changeable information would preserve the output. We evaluate these interpretations in two synthetic use cases: recommending advisors to clients and judging prompts for harmfulness or risk. Models return an output and the top three factors that most influenced it. Controlled black-box interventions estimate a necessity score for each factor by measuring how often changing it changes the output, and a sufficiency score by measuring how often retaining it preserves the output. Across eight models from the Claude, GPT, and Gemini families, the mean Spearman correlations between the cited ranking and the necessity and sufficiency scores are 0.349 and 0.354 for advisor recommendation, and 0.431 and 0.580 for prompt monitoring. Furthermore, an uncited factor scores above the lowest-scoring cited factor in 57.6% of advisor responses under necessity and 58.1% under sufficiency; the corresponding prompt-monitoring rates are 25.8% and 8.9%. The cited top three contain useful information but do not reliably identify the three factors with the strongest measured influence under necessity or sufficiency. The framework provides a black-box reliability check for explanations used in agent oversight while remaining scoped to individual LLM decisions.
- Abstract(参考訳): エージェントワークフロー内で動作可能なLCM決定コンポーネントは、しばしば説明とともにアクション関連勧告や判断を生成する。
オペレータは、名前付き要素を使用してシステムを監視したり、エラーを診断したり、いつ出力をエスカレートするかを決定することができる。
このような利用は、説明がコンポーネントの観測可能な決定行動と一致すると仮定する。
我々は、名前付き要因の2つの解釈を検証した:必要、すなわち、要因の変更が出力を変えること、そして十分である、つまり、他の変更可能な情報を取り除きながらそれを維持することは出力を保存することである。
我々は、これらの解釈を2つの総合的なユースケースで評価し、クライアントに助言を推薦し、有害性やリスクを判断する。
モデルは出力を返し、最も影響した上位3つの要素を返します。
制御されたブラックボックス介入は、アウトプットの変更頻度を測定することによって各要因の必要スコアを推定し、アウトプットの保持頻度を測定することによって、十分スコアを推定する。
クロード家、GPT家、ジェミニ家の8つのモデルにおいて、引用されたランキングと必要度と有効度とのスピアマンの相関は、勧告に0.349と0.354、即時監視に0.431と0.580である。
さらに、アクティベートされていない因子は、必要条件下でのアドバイザ応答の57.6%、満足度で58.1%で最低基準の基準値よりも高く、対応するプロンプトモニタリング率は25.8%と8.9%である。
引用されたトップ3は有用な情報を含んでいるが、必要または十分性の下で測定された最も強い影響を持つ3つの要因を確実に識別するものではない。
このフレームワークは、エージェント監視で使用される説明をブラックボックスで信頼性チェックすると同時に、個々のLCM決定の範囲を保っている。
関連論文リスト
- How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures [17.423679874903062]
本稿では,科学的図形理解のための診断用VLMベンチマークであるSciFigBenchを紹介する。
不確実性の下で、認識、推論、行動の信頼性を共同で評価する。
以上の結果から,モデル間での行動的差異が明らかとなった。
論文 参考訳(メタデータ) (2026-08-13T14:06:35Z) - Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents [4.309840398782996]
階層的推論では、失敗はエージェントが間違ったブランチにコミットする中間的な決定ポイントから生じることが多い。
本稿では,エージェントの行動空間内での明確化をナビゲーションと共有順序尺度で表す定式化であるACTION-Ratingを提案する。
エージェント自身の評価から2つの構造的に異なる情報探索モードが出現する:強制的(実行可能分岐なし)と機会的(主要な候補であるにもかかわらず残留不確実性)。
論文 参考訳(メタデータ) (2026-06-09T18:25:57Z) - Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults [0.0]
LLMエージェントは、ソーシャルフィード、検索結果、検索コンテキスト、電子メールキューなどのランク付けされた外部情報ストリームを消費した後、ますます行動する。
モデル,ペルソナ,トピック,最終決定のプロンプトを保持する制御プロトコルを導入し,エージェントが遭遇するポストの構成と順序だけを変化させる。
我々は, 逆降圧, デフォルト飽和, 一方のフィードが真に不確実な決定を下す非対称性の3つの応答機構を同定した。
論文 参考訳(メタデータ) (2026-05-30T22:43:23Z) - LLMs Show No Signs Of Individuated Metacognition [0.023227405857540805]
20大言語モデルから二項信頼判断を分解する。
信頼性が異なる2つのモデルも性能が異なるかどうかを問う。
いずれの検査領域においても,有意な弁別メタ認知の証拠は見つからない。
論文 参考訳(メタデータ) (2026-05-22T23:54:33Z) - From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs [5.838119242443381]
本稿では,3段階にまたがる構造的,解釈可能な推論を付加する推論トレース拡張RAGフレームワークを提案する。
矛盾認識信頼スコア(CATS)パイプラインを導入し、基礎性、事実的正確性、拒絶精度、紛争行動アライメントを評価する。
論文 参考訳(メタデータ) (2025-12-18T17:27:51Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation [57.380464382910375]
評価のためのフィードバックプロトコルの選択は,評価信頼性に大きく影響し,系統的なバイアスを生じさせることを示す。
ジェネレータモデルは、気を散らす機能を埋め込むことで好みをひっくり返すことができる。
我々は,データセットの特徴と評価目標に基づくフィードバックプロトコルの選択を推奨する。
論文 参考訳(メタデータ) (2025-04-20T19:05:59Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Evaluating Interventional Reasoning Capabilities of Large Language Models [58.52919374786108]
大規模言語モデル(LLM)は意思決定タスクを自動化するために使用される。
本稿では,LPMが介入に応じてデータ生成プロセスの知識を正確に更新できるかどうかを評価する。
さまざまな因果グラフ(例えば、コンバウンディング、仲介)と変数タイプにまたがるベンチマークを作成します。
これらのベンチマークにより、LLMが事実を記憶したり、他のショートカットを見つけたりすることで、変化を正確に予測する能力を切り離すことができます。
論文 参考訳(メタデータ) (2024-04-08T14:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。