論文の概要: MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations
- arxiv url: http://arxiv.org/abs/2610.02480v1
- Date: Thu, 01 Oct 2026 20:57:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:20:54.753771
- Title: MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations
- Title(参考訳): MEA: 忠実なモデル記述のための逆向き駆動型マルチエージェントシステム
- Abstract要約: 我々は、説明知識の障壁を完全に取り除くマルチエージェントフレームワークMEAを提案する。
本稿では,特徴属性にまたがる多様な質問タイプ,反事実推論,突発的特徴検出について紹介する。
We found that Frontier LLMs produce systematicly of unfaithful explanations。
- 参考スコア(独自算出の注目度): 25.142295941569262
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent years have seen the employment of a plethora of machine learning (ML) models in high-stakes domains, but they remain largely opaque to the practitioners who act on their predictions. While post-hoc explanation methods offer a lens into this model behavior, wielding them effectively demands expertise most domain experts lack: navigating high-dimensional outputs, selecting the best explanations, and synthesizing evidence across disparate tools. To this end, we present MEA, a multi-agent framework that removes the explanation knowledge barrier entirely: a Proposer agent selects and configures explanation tools based on the question and modality, while an Actor agent is optimized end-to-end against faithfulness, transforming the outputs into natural language explanations grounded in model behavior across tabular, text, and vision modalities. Further, we introduce diverse question types spanning feature attribution, counterfactual reasoning, and spurious feature detection, each paired with a perturbation-based faithfulness metric. We find that frontier LLMs systematically produce unfaithful explanations. By optimizing against faithfulness rewards augmented with a modality-adaptive penalty, MEA consistently outperforms post hoc explainers, agentic, and closed-source baselines across six datasets, with reward-driven optimization yielding faithfulness gains of +28% (tabular), +21% (text), and +34% (vision) over the untrained backbone. More broadly, our findings suggest that AI agents themselves can serve as a scalable, adaptable interface to ML explainability, opening a path toward natural-language explainability that generalizes beyond the fixed, single-purpose tools that have long defined the field.
- Abstract(参考訳): 近年、機械学習モデル(ML)がハイテイクドメインで採用されているが、予測を行う実践者にはほとんど不透明である。
ポストホックな説明法は、このモデル行動のレンズを提供するが、これらを効果的に扱うには、高次元のアウトプットのナビゲート、最良の説明の選択、異なるツール間でのエビデンスの合成といった、ドメイン専門家に欠けている専門知識を必要とする。
提案者エージェントは質問やモダリティに基づいて説明ツールを選択し,設定する一方,アクターエージェントは忠実さに対してエンドツーエンドに最適化され,表やテキスト,視覚のモダリティをまたいだモデル行動に基づく自然言語の説明に変換される。
さらに, 摂動に基づく忠実度尺度と組み合わせ, 特徴属性, 反実的推論, 突発的特徴検出にまたがる多様な質問型を導入する。
We found that Frontier LLMs produce systematicly of unfaithful explanations。
モダリティ適応的なペナルティで強化された忠実度報酬に対して最適化することにより、MEAは、6つのデータセットでポストホック説明、エージェント、クローズドソースベースラインを一貫して上回り、報酬駆動の最適化は、トレーニングされていないバックボーンに対して+28%(タブラル)、+21%(テキスト)、+34%(ビジョン)の忠実度向上をもたらす。
より広範に、我々の発見はAIエージェント自体がMLの説明可能性に対するスケーラブルで適応可能なインターフェースとして機能し、長い間フィールドを定義してきた固定された単一目的のツールを超えて一般化する自然言語説明可能性への道を開くことを示唆している。
関連論文リスト
- AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition [62.16431420189863]
LLMに基づくマルチモーダル感情認識は静的なパラメトリックメモリに依存しており、ニュアンス化された感情状態の解釈時にしばしば幻覚を与える。
本稿では,感情指向型マルチエージェント検索拡張生成フレームワークであるAffectAgentを紹介する。
AffectAgentは3つの共同最適化されたエージェント、すなわちクエリプランナー、エビデンスフィルタ、感情生成器から構成される。
論文 参考訳(メタデータ) (2026-04-14T13:49:19Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method [96.63801368613177]
本稿では,記述的理解から構造化多段階推論への映像異常解析を向上するタスクを提案する。
我々は8,641本のビデオからなる新しいデータセットを提示し、合計5万本以上のサンプルを作成し、ビデオ異常理解のための最大のデータセットの1つである。
提案したタスクとデータセットに基づいて,適応的階層的推論とリスク認識意思決定をサポートする,Vad-R1-Plusと呼ばれるエンドツーエンドのMLLMベースのVARモデルを開発する。
論文 参考訳(メタデータ) (2026-01-15T08:09:04Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach [9.942833203981069]
大規模言語モデル(LLM)は、自然言語の説明を生成する機会を提供する。
観客に適切な説明を与える強化学習に基づく微調整フレームワークであるLEXMAを紹介する。
LEXMAは他のLLMベースラインに比べて予測性能が大幅に向上した。
論文 参考訳(メタデータ) (2025-12-10T04:16:31Z) - SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models [37.102387880457535]
大規模言語モデル(LLM)は目覚ましい進歩を遂げているが、その内部メカニズムはほとんど不透明である。
スパースオートエンコーダ(SAE)は、LLM表現をより解釈可能な機能に分解するための有望なツールとして登場した。
本稿では,SAGE(SAE AGentic Explainer)というエージェントベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-25T20:14:29Z) - AIM: Amending Inherent Interpretability via Self-Supervised Masking [57.17600766859953]
自己スーパーバイザード・マスキング(AIM)によるインテリジェント・インタプリタビリティの向上について提案する。
AIMは、追加のアノテーションを必要とせずに、刺激的な代替品よりも真の機能の利用を促進する。
我々は、分布外一般化ときめ細かい視覚的理解の両方をテストする、さまざまな挑戦的なデータセットでAIMを検証する。
論文 参考訳(メタデータ) (2025-08-15T14:29:59Z) - MetaExplainer: A Framework to Generate Multi-Type User-Centered Explanations for AI Systems [1.9811010456089264]
ユーザ中心の説明を生成するために設計された,ニューロシンボリックなフレームワークであるMetaExplainerを紹介する。
提案手法には3段階のプロセスがある: まず, 現状の大規模言語モデル (LLM) を用いて, ユーザ質問を機械可読形式に分解し, 第二に, システムレコメンデーションを生成するタスクをモデル記述者メソッドに委譲し, そして最後に, 説明者出力を要約した自然言語説明を合成する。
論文 参考訳(メタデータ) (2025-08-01T04:01:40Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。