論文の概要: ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2606.28061v1
- Date: Fri, 26 Jun 2026 13:08:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.490732
- Title: ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
- Title(参考訳): ToolPrivacyBench: LLMエージェントの目的境界プライバシーのベンチマーク
- Authors: Shijing Hu, Liang Liu, Zhu Meng, Zhicheng Zhao,
- Abstract要約: 本研究では,タスクプライベートな原子が,認定されたツールや下流のシンクにのみルートされているかを検討する。
このベンチマークには2150件のケースが含まれており、その中には1150件の完全なプライバシーに敏感なビジネスケースが含まれている。
この評価は、目的に縛られたプライバシーの過剰開示を特徴付けるために広く使用されている9つのエージェントをカバーする。
- 参考スコア(独自算出の注目度): 11.854748143267779
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have increasingly moved from standalone text generation systems to agents that invoke external tools, access environments, and execute multi-step tasks. However, conventional function-calling benchmarks mainly evaluate task completion and API correctness, while privacy evaluation benchmarks typically focus on final responses or privacy judgments. Neither perspective captures purpose-bound information flow across an executed multi-tool trajectory. Motivated by this limitation in current agent evaluation, ToolPrivacyBench audits whether task-private atoms are routed only to authorized tools and downstream sinks, thereby evaluating both task completion and privacy over-disclosure during tool use. The benchmark contains 2,150 cases, including 1,150 fully synthetic privacy-sensitive business workflows and 1,000 cases adapted from existing multi-tool and function-calling benchmarks. Each case is represented by a policy knowledge base. After an agent executes against mock business backends, the evaluator compares recorded tool arguments and backend audit logs with this policy knowledge base. The evaluation covers nine widely used agents to characterize purpose-bound privacy over-disclosure. The results show that successful tool execution does not imply appropriate privacy disclosure: an agent may complete a task while transmitting unnecessary private information through intermediate tool calls. ToolPrivacyBench therefore formalizes a need-to-know disclosure boundary, under which each tool should receive only the information necessary for its stated purpose, and uses trajectory-level auditing to identify privacy over-disclosure in multi-tool workflows.
- Abstract(参考訳): 大規模言語モデル(LLM)は、スタンドアローンのテキスト生成システムから、外部ツールを起動し、環境にアクセスし、マルチステップタスクを実行するエージェントへと、ますます移行している。
しかしながら、従来の関数呼び出しベンチマークはタスク補完とAPIの正しさを主に評価する一方、プライバシ評価ベンチマークは一般的に最終応答やプライバシ判断に重点を置いている。
どちらのパースペクティブも、実行されたマルチツール軌跡にまたがる目的に縛られた情報の流れを捉えない。
現在のエージェント評価におけるこの制限により、ToolPrivacyBenchは、タスクプライベートな原子が承認されたツールと下流のシンクにのみルーティングされるかどうかを監査し、ツール使用時のタスク補完とプライバシーの過剰開示の両方を評価する。
ベンチマークには2,150のケースが含まれており、その中には1,150の完全合成プライバシに敏感なビジネスワークフローと、既存のマルチツールおよび関数呼び出しベンチマークに適合した1,000のケースが含まれている。
各ケースは、ポリシー知識ベースで表現されます。
エージェントがモックビジネスバックエンドに対して実行されると、評価者は記録されたツール引数とバックエンド監査ログをこのポリシー知識ベースと比較する。
この評価は、目的に縛られたプライバシーの過剰開示を特徴付けるために広く使用されている9つのエージェントをカバーする。
エージェントは、中間ツールコールを通じて不要なプライベート情報を送信しながらタスクを完了することができる。
そこでToolPrivacyBenchは、各ツールが指定した目的に必要な情報のみを受信する、必要な情報開示境界を形式化し、トラジェクトリレベルの監査を使用して、マルチツールワークフローにおけるプライバシー過剰開示を識別する。
関連論文リスト
- PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say [48.84133320567554]
LLMベースのエージェントは急速に進歩し、ユーザーのタスクを完了させるために外部ツールを自律的に呼び出している。
既存のプライバシベンチマークは、エージェントの応答や外部アクションが開示するものを監査するが、データがエージェントのコンテキストに最初に入力される取得ステージを見落としている。
LLMエージェントの取得段階のプライバシー漏洩を評価するベンチマークであるemphPrivacyPeekを紹介する。
論文 参考訳(メタデータ) (2026-05-29T04:55:12Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Do Phone-Use Agents Respect Your Privacy? [97.81424230136075]
我々は,モバイルエージェントのプライバシ行動を評価するための検証可能なフレームワークであるMyPhoneBenchを紹介する。
プライバシを無視する電話を、最小限のプライバシ契約によって許可されたアクセス、最小限の開示、およびユーザ制御メモリとして運用する。
10のモバイルアプリと300のタスクで5つのフロンティアモデルにまたがって、タスクの成功、プライバシに準拠したタスク補完、保存された好みの後での利用が、それぞれ異なる機能であることに気付きました。
論文 参考訳(メタデータ) (2026-04-01T14:50:50Z) - AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows [32.40442323501255]
エージェントパイプラインのすべての境界は、潜在的なプライバシー侵害の場所であり、独立して評価されなければならない、と我々は主張する。
本稿では,エージェント実行を情報フローのシーケンスに分解するフレームワークであるPrivacy Flow Graphを紹介する。
AgentSCOPEは,8つの規制領域にまたがる62のマルチツールシナリオのベンチマークであり,パイプラインの各段階で基礎的真理を示す。
論文 参考訳(メタデータ) (2026-03-05T07:45:31Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation [54.410825977390274]
LLMエージェントのコンテキストプライバシを評価するための既存のベンチマークは、主にシングルターン、低複雑さタスクを評価する。
まず、15ドメインにわたる158のリアルタイムハイテイクシナリオからなるベンチマーク-MAGPIEを示す。
次に、コンテキスト的にプライベートなデータに対する理解と、ユーザのプライバシを侵害することなくコラボレーションする能力に基づいて、最先端のLCMを評価します。
論文 参考訳(メタデータ) (2025-06-25T18:04:25Z) - Automated Privacy Information Annotation in Large Language Model Interactions [40.87806981624453]
実際の識別子の下で大きな言語モデル(LLM)と対話するユーザは、プライベート情報の開示を無意識にリスクを負うことが多い。
既存のプライバシ検出方法は、異なる目的とアプリケーションドメインのために設計されている。
249Kのユーザクエリと154Kの注釈付きプライバシフレーズを備えた大規模多言語データセットを構築した。
論文 参考訳(メタデータ) (2025-05-27T09:00:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。