論文の概要: POLAR: Ontology-Guided Risk Prevention for Tool-Calling LLM Agents
- arxiv url: http://arxiv.org/abs/2610.08082v1
- Date: Tue, 06 Oct 2026 10:14:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.92935
- Title: POLAR: Ontology-Guided Risk Prevention for Tool-Calling LLM Agents
- Title(参考訳): POLAR:ツールカートリングLDMエージェントのオントロジー誘導型リスク予防
- Abstract要約: POLARは、構造化された2層オントロジーを通して可逆性を評価する小さなツール呼び出しエージェントのためのガードレールフレームワークである。
POLARは6人中4人の航空会社で平均タスク報酬を0.11から0.18ポイント改善するが、モデルドメインの細胞は18人のうち8人しか改善していない。
- 参考スコア(独自算出の注目度): 15.90814997177363
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM tool-use agents operate in dynamic environments where many actions carry operational risk. However, most safety mechanisms react only after errors manifest. Existing pre-emptive approaches either fine-tune the agent on chain-of-thought deliberation or compile natural-language guardrails into runtime checks, but they do so without exposing a structural, auditable verdict. We propose POLAR, a guardrail framework for small tool-calling agents that assesses reversibility through a structured two-layer ontology. POLAR assigns each action a graded reversibility score by deriving a candidate inverse sequence; calls failing a threshold are pruned before execution. Evaluated on $τ^2$-bench across six agent models, POLAR improves mean task reward by 0.11 to 0.18 points on airline for four of six agents, but only eight of eighteen model--domain cells improve overall; retail and stronger agents often regress. POLAR provides an auditable structural check and characterizes its task-utility trade-offs. Reward is not a direct measure of prevented harm.
- Abstract(参考訳): LLMツール使用エージェントは、多くのアクションが運用上のリスクを負う動的環境で動作する。
しかし、ほとんどの安全メカニズムはエラー発生後にのみ反応する。
既存のプリエンプティブアプローチは、チェーン・オブ・ザ・リベレーションのエージェントを微調整するか、自然言語のガードレールをランタイムチェックにコンパイルするが、構造的で監査可能なバリデーションは公開しない。
構造化された2層オントロジーによる可逆性評価を行う小型ツールコールエージェントのガードレールフレームワークであるPOLARを提案する。
POLARは、候補の逆列を導出することで、各アクションに段階的な可逆性スコアを割り当てる。
POLARは6つのエージェントモデルで$τ^2$-benchと評価され、6つのエージェントのうち4つのエージェントで平均タスク報酬を0.11から0.18ポイント改善するが、18のモデルドメイン細胞のうち8つだけが全体的な改善を行う。
POLARは監査可能な構造チェックを提供し、タスクユーティリティトレードオフを特徴付ける。
逆行は害を防げる直接的な手段ではない。
関連論文リスト
- BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents [20.217145643468598]
我々は、長距離ツール使用エージェントの軌道レベルの安全校正のためのベンチマークであるBlindspotを紹介する。
Blindspotは、適応的な対角的相互作用、ステートフルなツールの実行、実行に基づく適応を通じて、完全なユーザ-エージェント-環境トラジェクトリを評価する。
安全でない完成度, 適切な拒絶性, 便宜性, 過度な拒絶性, 繰り返し発生する頑健性, 拒絶後の失敗などをカバーする8つの指標を用いて, 13のプロプライエタリかつオープンウェイトLCMを評価した。
論文 参考訳(メタデータ) (2026-09-14T20:12:27Z) - Can AI Remediate Backend Failures Safely? GuardedAct with Blast-Radius-Aware Sandboxing [3.809305837930236]
GuardedActはサンドボックスファーストの修復フレームワークで、アクションジェネレータとプロダクション環境の間にブラスト・ラディウス対応の検証層を介在する。
我々は、DeathStarBenchソーシャルネットワークアプリケーションに注入された5つの障害シナリオについて、GuardedActを評価する。
論文 参考訳(メタデータ) (2026-09-10T08:58:13Z) - VST: Verifiable Structured Transport for Auditable Agent-to-Agent Alpha Discovery [11.790070440436294]
エージェント・ツー・エージェント(A2A)アルファ発見は、マイニングと評価エージェント間の繰り返しのフィードバックサイクルによって遅くなる。
我々はまず、この通信をEmphtyped, causally addressable, unicast recordの構造化エージェント対エージェントプロトコルとして再構成する。
型付けが提供するものは、スキーマチェック、決定論的にリプレイされ、構築によって予測を評価者にリークすることを防ぐ状態である。
論文 参考訳(メタデータ) (2026-09-07T05:43:50Z) - Operational Hallucination and Safety Drift in AI Agents [0.3823356975862005]
ツール使用自律エージェントのプランナーとして機能する大規模言語モデル(LLM)は、マルチターン実行における動的信頼性のリスクを導入する。
本稿では,複数のLLM(Safety Drift)とOperational Hallucination(Operational Hallucination)の2つの障害モードを実証的に特徴付ける。
本稿では、インテント-アクション整合性チェック、状態追跡、強制終了プリミティブを組み込んだ、軽量でプラグ&プレイのアーキテクチャ青写真であるAction-Aware Supervision Layerを提案する。
論文 参考訳(メタデータ) (2026-07-20T17:01:50Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - To Throw a Stone with Six Birds: On Agents and Agenthood [0.0]
Six Birds Theory (SBT)は、マクロな物体を原始体ではなく誘導的閉包として扱う。
SBT内では,タイプ正当性評価を行う。
我々はこの契約を4つのチェック可能なコンポーネントを用いて有限制御システムで運用する。
論文 参考訳(メタデータ) (2026-02-03T10:46:23Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。