論文の概要: Risk-Aware Reranking for Agentic Tool Retrieval
- arxiv url: http://arxiv.org/abs/2608.22751v1
- Date: Mon, 24 Aug 2026 03:20:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.877133
- Title: Risk-Aware Reranking for Agentic Tool Retrieval
- Title(参考訳): エージェントツール検索におけるリスク意識の再評価
- Authors: Qinfei Li, Xiaoxuan Dong, Jin Zhang, Dexu Yu, Wenhao Deng, Junchen Fu, Youhua Li, Hanwen Du, Chunxiao Li,
- Abstract要約: リスク認識ツール検索において,リスクの高いツールへの露出を低減しつつ,有用なツールを検索することを目的としている。
凍結した第1段レトリバー上に軽量なリグレードフレームワークを提案する。
提案手法は,レトリバーのみを優先し,ベースラインを再配置することで,関連性の向上,すなわち関連性に対する安全性のトレードオフを図っている。
- 参考スコア(独自算出の注目度): 13.019844558764099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool retrieval determines which external tools are exposed to an LLM agent for a user query or task, making retrieval a critical pre-execution safety boundary. Unlike document retrieval, tool retrieval exposes executable actions: a tool that is useful for one task may be unnecessary or risky for another. However, existing tool-retrieval methods primarily optimize semantic relevance, and safety evaluations often focus on failures after tool execution rather than risks introduced during retrieval. We study risk-aware tool retrieval, where the goal is to retrieve useful tools while reducing exposure to higher-risk tools. We propose a lightweight reranking framework on top of a frozen first-stage retriever. The framework models query-conditioned relevance and tool-level exposure risk separately, combines them through an explicit parameter controlling the tradeoff between safety and utility, smooths scores over a ToolGraph, and optionally applies rule-based safety constraints. To support retrieval-time safety evaluation, we annotate 6,108 tools across UltraTool and Seal-Tools with five ordinal risk levels and define metrics that measure risky-tool exposure in the top-$k$ results. Experiments on UltraTool and Seal-Tools show that our approach improves the relevance--safety tradeoff over relevance-only retrievers and reranking baselines, with the rule-filtered variant providing a conservative operating point for safety-critical deployments. These findings indicate that retrieval-stage filtering can reduce the candidate action space exposed to agents before execution, complementing downstream tool-use safeguards. The code and supplementary materials are available at: https://github.com/qli447/risk-aware-tool-retrieval-release.
- Abstract(参考訳): ツール検索は、ユーザクエリやタスクのLLMエージェントにどの外部ツールが露出しているかを判断し、検索を重要な事前実行安全境界とする。
ドキュメント検索とは異なり、ツール検索は実行可能なアクションを公開する。
しかし、既存のツール検索手法は主にセマンティックな妥当性を最適化し、安全評価は検索時に導入されるリスクではなく、ツールの実行後の障害に焦点を当てることが多い。
リスク認識ツール検索において,リスクの高いツールへの露出を低減しつつ,有用なツールを検索することを目的としている。
凍結した第1段レトリバー上に軽量なリグレードフレームワークを提案する。
フレームワークはクエリ条件の関連性とツールレベルの露出リスクを別々にモデル化し、安全性とユーティリティのトレードオフを制御する明示的なパラメータを通じてそれらを組み合わせ、ToolGraph上でスコアをスムースにし、任意にルールベースの安全制約を適用します。
検索時の安全性評価を支援するため,UltraToolとSeal-Toolsの6,108のツールを5つの順序的リスクレベルでアノテートし,トップ$kでリスクツールの露出を測定するメトリクスを定義した。
UltraTool と Seal-Tools の実験から,我々のアプローチは,関連のみの検索とベースラインの再設定による関連性-安全性のトレードオフを改善することを示し,ルールフィルタの変種は,安全クリティカルなデプロイメントのための保守的な運用ポイントを提供する。
これらの結果から, 検索段階のフィルタリングは, 実行前にエージェントに露出する候補行動空間を減少させ, 下流ツール使用の安全対策を補完する可能性が示唆された。
コードと追加資料は、https://github.com/qli447/risk-aware-tool-retrieval-release.comで入手できる。
関連論文リスト
- Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents [54.050506620820784]
エージェントツールアンラーニング(ATU)は、通常のツール使用を保持しながら、パラメトリックリコールとツールによるリカバリの両方を削減することを目的としている。
ATUは、ツール強化されたエージェントデプロイメント下で、ターゲットの忘れと保持ユーティリティのバランスを向上し、未学習をより堅牢にする。
論文 参考訳(メタデータ) (2026-08-21T18:34:48Z) - Breadcrumbing Search Agents [118.20284823674382]
LLMベースの検索エージェントは情報検索タスクに広く利用されているが、外部ツールへの依存度は重大なセキュリティリスクをもたらす。
検索およびページ観察を行うチャネルは脆弱なセキュリティ境界であることを示す。
制約付きツール仲介脅威モデルの下では、クエリ毎に1つのコントロールされた結果のみを追加することで、攻撃の成功を大幅に増加させることができる。
論文 参考訳(メタデータ) (2026-08-05T07:57:27Z) - ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift [0.0]
ドリフト中の検索・ツール利用エージェントに対する共形リスク制御手法であるToolChain-CRCを提案する。
この方法は各エージェントを行動、観察、最終的な出力の完全な軌跡として扱う。
ステップレベルのリスクスコアを構築し、それらを軌道上のリスクスコアに組み合わせ、アクセプションまたはインターベンルールを校正し、いつでもアラームを追加します。
論文 参考訳(メタデータ) (2026-06-16T20:27:37Z) - RUBAS: Rubric-Based Reinforcement Learning for Agent Safety [93.80584563695646]
RUBASは、エージェント安全性のためのルーリックベースの強化学習フレームワークである。
エージェントの動作は、ツール使用の安全性、引数の安全性、応答の安全性、役に立つ4つの次元に分けられる。
実験により、RUBASは標準アライメントベースラインよりも安全性を向上し、ツール接地幻覚を低減し、競争力を維持することが示されている。
論文 参考訳(メタデータ) (2026-06-02T09:02:14Z) - Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback [38.251599309409]
我々は,悪質なツールが探索中に合理的に振る舞う,異なる障害モード,認知的中毒について検討する。
ファイナルアクションリスクスコアリングのためのバックボーンに依存しないフレームワークであるVISTA-Guardを提案する。
論文 参考訳(メタデータ) (2026-05-17T13:51:34Z) - Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents [68.20752678837377]
本稿では,単一ターン有害なタスクを多ターン攻撃シーケンスに変換する基本的分類法を提案する。
この分類法を用いて,マルチターンツール使用エージェントの安全性を評価する最初のベンチマークであるMT-AgentRiskを構築した。
トレーニング不要で、ツールに依存しない、自己探索型防御ツールであるToolShieldを提案する。
論文 参考訳(メタデータ) (2026-02-13T18:38:18Z) - AgenTRIM: Tool Risk Mitigation for Agentic AI [5.4672006013914975]
ツール駆動型エージェントリスクの検出と緩和のためのフレームワークであるAgenTRIMを紹介する。
AgenTRIMは、これらのリスクに相補的なオフラインおよびオンラインフェーズを通じて対処する。
AgenTRIMは、高いタスク性能を維持しながら、攻撃成功を大幅に削減する。
論文 参考訳(メタデータ) (2026-01-18T15:10:18Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - Quantifying Distributional Robustness of Agentic Tool-Selection [8.457056023589951]
ツール選択の堅牢性を正式に認定する最初の統計フレームワークであるToolCertを紹介する。
本稿では,ToolCertが精度に高い信頼度を低下させ,エージェントの最悪の性能を定量的に評価することを示す。
偽装ツールを注入したり、検索を飽和させたりすることで、認証された精度はゼロ近く低下する。
論文 参考訳(メタデータ) (2025-10-05T01:50:34Z) - ToolTweak: An Attack on Tool Selection in LLM-based Agents [52.17181489286236]
対戦相手は,特定のツールの選択に対して,エージェントを体系的にバイアスし,等しく有能な代替手段に対して不公平な優位性を得ることができることを示す。
提案するToolTweakは,ベースラインの20%程度から最大81%までの選択率を向上する,軽量自動攻撃である。
これらのリスクを軽減するために、パラフレージングとパープレキシティ・フィルタリングという2つの防御効果を評価し、バイアスを低減し、エージェントが機能的に類似したツールをより平等に選択できるようにする。
論文 参考訳(メタデータ) (2025-10-02T20:44:44Z) - SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs [35.180946816997164]
大規模言語モデル(LLM)は、外部環境において様々なツールを自律的に呼び出す上で、優れたパフォーマンスを示している。
本稿では, LLMツール利用の安全性を評価するために, ツールを直接実行することによって生じる不可逆的な害を避けることを目的としている。
ツール利用セキュリティを総合的に評価する最初のベンチマークであるSafeToolBenchを提案する。
ツール利用セキュリティに対するLCMの認識を3つの観点から向上することを目的とした,新しいフレームワークであるSafeInstructToolも提案する。
論文 参考訳(メタデータ) (2025-09-09T01:31:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。