論文の概要: Explainability Framework for Policy-Aware Autonomous Agents
- arxiv url: http://arxiv.org/abs/2607.21209v1
- Date: Thu, 23 Jul 2026 11:22:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.390655
- Title: Explainability Framework for Policy-Aware Autonomous Agents
- Title(参考訳): 政策対応型自律エージェントのための説明可能性フレームワーク
- Abstract要約: 政策対応エージェントの理解可能な説明の仕方を概説する枠組みを提案する。
この枠組みは、社会科学の優れた説明の作り方に関する洞察を用いて設計されている。
Answer Set Programming言語で実装され、Pythonを使って情報抽出と自然言語翻訳を支援する。
- 参考スコア(独自算出の注目度): 1.2891210250935148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In the field of Artificial Intelligence, an agent is a system which is able to autonomously make decisions in order to reach a desired goal. As these systems grow more prevalent in our day-to-day lives, there has been an increased need to add explainability features which can provide an account for an agent's behavior. We therefore propose a framework that outlines how to produce comprehensible explanations for policy-aware agents, or agents which have rule-enforcing policies incorporated in their decision-making framework. This framework is designed using insights from the social sciences on how to produce good explanations. It is implemented in the Answer Set Programming language while using Python to assist with information extraction and natural-language translation. Because these agents incur penalties when violating policies, we are able to leverage these penalties to detect undesirable events in scenarios that are counterfactual to the agents' original actions. This lends itself to creating contrastive explanations (e.g., "the agent performed this action because, had it not, undesirable event X would have occurred."), which formulate the core component for our explainability framework. The framework is evaluated using a survey wherein human participants provide feedback on our program-generated explanations.
- Abstract(参考訳): 人工知能の分野では、エージェントは、望ましい目標を達成するために自律的に意思決定できるシステムである。
これらのシステムが日々の生活で普及するにつれて、エージェントの振る舞いを説明できる説明可能性機能を追加する必要性が高まっている。
そこで我々は、政策対応エージェントや、意思決定フレームワークに組み込まれたルール強化ポリシーを持つエージェントに対して、理解しやすく説明する方法を概説する枠組みを提案する。
このフレームワークは、社会科学の優れた説明の作り方に関する洞察を用いて設計されている。
Answer Set Programming言語で実装され、Pythonを使って情報抽出と自然言語翻訳を支援する。
これらのエージェントは、ポリシー違反時に罰則を発生させるため、エージェントの元々の行動に反するシナリオにおける望ましくない事象を検出するために、これらの罰則を利用することができる。
これは、対照的な説明(例えば、エージェントがこのアクションを実行した理由は、望ましくないイベント X が発生したからである)を作成するのに役立ち、説明可能性フレームワークのコアコンポーネントを定式化します。
このフレームワークは、人間の参加者がプログラム生成の説明に対してフィードバックを提供する調査によって評価される。
関連論文リスト
- Explaining AI Agents Through Execution Traces [1.8862116040247214]
本稿では,長期エージェントの実行トレースを構造化されたレポートと忠実な自然言語説明に変換するポストホックXAIフレームワークを提案する。
実行トレースにのみ依存するため、フレームワークはさまざまなエージェントアーキテクチャ、環境、タスクに適用される。
論文 参考訳(メタデータ) (2026-09-05T12:45:56Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - Real-Time Reasoning Agents in Evolving Environments [52.21796134114843]
進化する環境におけるエージェントに対する新しい問題定式化としてリアルタイム推論を導入する。
我々の研究は、実用的なエージェントを開発するための重要なテストベッドとしてリアルタイム推論を確立している。
論文 参考訳(メタデータ) (2025-11-07T00:51:02Z) - Toward a Theory of Agents as Tool-Use Decision-Makers [89.26889709510242]
真の自律性は、エージェントが、彼らが知っていること、必要なこと、そしてその知識を効率的に獲得する方法を統治する、一貫性のある疫学の枠組みに根ざす必要がある、と我々は主張する。
本研究では,内的推論と外的行動を等価な疫学ツールとして扱う統一理論を提案し,エージェントが内観と相互作用を体系的に調整することを可能にする。
この視点は、エージェントの設計を単なるアクションエグゼクタから知識駆動インテリジェンスシステムにシフトさせ、適応的で効率的でゴール指向の行動が可能な基礎エージェントを構築するための原則化された道筋を提供する。
論文 参考訳(メタデータ) (2025-06-01T07:52:16Z) - Intention-aware policy graphs: answering what, how, and why in opaque agents [0.1398098625978622]
エージェントは、複雑な環境で相互作用し、創発的行動の可能性を高める、AIベースの特殊なソフトウェアである。
本稿では,確率的グラフィカルモデルと,そのようなモデル設計のためのパイプラインを提案する。
提案する説明の解釈可能性および信頼性を評価するために,提案手法を貢献する。
このモデルは、エージェントの行動と世界状態の一部を観察することで構築することができる。
論文 参考訳(メタデータ) (2024-09-27T09:31:45Z) - DANLI: Deliberative Agent for Following Natural Language Instructions [9.825482203664963]
本稿では、過去の経験から得られた神経的・象徴的表現に基づいて推論と計画を適用するニューロシンボリック・リベレティブ・エージェントを提案する。
TEAChベンチマークでは,リアクティブベースラインよりも70%以上の改善が達成されている。
論文 参考訳(メタデータ) (2022-10-22T15:57:01Z) - Explaining Preference-driven Schedules: the EXPRES Framework [23.47188079362728]
EXPRESフレームワークを導入し、与えられた最適なスケジュールで優先権が満足できない理由を説明する。
EXPRESフレームワークは、 (i) 混合整数線形プログラミングモデルに基づいて、不満足な嗜好を説明する最高の理由セットを見つける説明生成器と、 (ii) 生成された説明を人間の解釈可能なものに変換する説明器から構成される。
論文 参考訳(メタデータ) (2022-03-16T19:15:21Z) - Explaining Reinforcement Learning Policies through Counterfactual
Trajectories [147.7246109100945]
人間の開発者は、RLエージェントがテスト時にうまく機能することを検証しなければならない。
本手法では, エージェントの挙動をより広い軌道分布で示すことにより, エージェントの挙動を分布変化下で表現する。
本研究では,2つのエージェント検証タスクのうちの1つに対して,ベースライン法よりも優れたスコアを得られることを示す。
論文 参考訳(メタデータ) (2022-01-29T00:52:37Z) - Inherently Explainable Reinforcement Learning in Natural Language [14.117921448623342]
本稿では,本質的に説明可能な強化学習エージェントの開発に焦点をあてる。
この階層的説明可能な強化学習エージェントは、インタラクティブフィクション、テキストベースのゲーム環境で動作する。
私たちのエージェントは、説明責任を第一級市民として扱うように設計されています。
論文 参考訳(メタデータ) (2021-12-16T14:24:35Z) - CausalCity: Complex Simulations with Agency for Causal Discovery and
Reasoning [68.74447489372037]
本稿では,因果探索と反事実推論のためのアルゴリズムの開発を目的とした,高忠実度シミュレーション環境を提案する。
私たちの作業の中核となるコンポーネントは、複雑なシナリオを定義して作成することが簡単になるような、テキストの緊急性を導入することです。
我々は3つの最先端の手法による実験を行い、ベースラインを作成し、この環境の可利用性を強調する。
論文 参考訳(メタデータ) (2021-06-25T00:21:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。