論文の概要: ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions
- arxiv url: http://arxiv.org/abs/2609.18864v2
- Date: Fri, 18 Sep 2026 11:56:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.705498
- Title: ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions
- Title(参考訳): ASLEval: LLMエージェントセッションにおけるプライバシ露出の変位の測定
- Abstract要約: ローカルプロキシは、複数ステップのセッションで、許可されていない露出を見逃します。
ASLEvalは、隠れたターゲットセットを事前登録する認可対応フレームワークである。
- 参考スコア(独自算出の注目度): 18.225223569885497
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Privacy evaluations of tool-using LLM agents often inspect a designated action, final response, or attacker report. These local proxies can miss unauthorized exposure elsewhere in a multi-step session and lack common ground truth across outlets, reports, and tool paths. We introduce privacy exposure displacement, the mismatch between a local evaluation proxy and target-grounded session exposure, and ASLEval, an authorization-aware framework that pre-registers a hidden target set, measures all declared visible exits, and reserves internal traces for diagnosis. Across multiple enterprise-style environments and independently implemented runtimes, we observe three recurring patterns. An expected-outlet-only view misses 46.9% of exposure recovered by the visible-exit union; attacker self-reports combine omissions with high false discovery; and schema-aligned internal evidence usually precedes visible exposure at the request/probe level. Reducing model-visible returns changes this path but can eliminate normal-task success. Independent human review supports the adjudication pipeline while identifying harder console and candidate cases. These findings motivate benchmarks that declare the complete visible boundary, ground claims in pre-specified targets and authorization, and report privacy together with task utility.
- Abstract(参考訳): ツールを使用するLLMエージェントのプライバシ評価は、指定されたアクション、最終応答、またはアタッカーレポートを検査することが多い。
これらのローカルプロキシは、複数のステップのセッションにおいて、許可されていない露出を見逃し、アウトレット、レポート、ツールパスに共通する真実を欠く可能性がある。
本稿では, 局所評価プロキシと対象セッション露光のミスマッチ, および隠れたターゲットセットを事前登録する認証対応フレームワークASLEvalを導入し, 全可視出口を計測し, 診断のための内部トレースを予約する。
複数のエンタープライズスタイルの環境と独立して実装されたランタイムにまたがって、3つの繰り返しパターンを観察します。
望まれるアウトレットのみのビューは、可視出力ユニオンによって回収された露出の46.9%を見逃し、攻撃者による自己報告は、欠落と高い偽の発見を組み合わせ、スキーマに準拠した内部証拠は、通常、要求/プローブレベルでの可視露光に先行する。
モデルビジュアブルリターンの削減はこのパスを変えるが、通常のタスクの成功を排除できる。
独立した人間レビューは、難しいコンソールと候補ケースを特定しながら、偏見パイプラインをサポートする。
これらの発見は、完全な可視境界を宣言するベンチマーク、指定されたターゲットと承認の根拠となるクレーム、タスクユーティリティと共にプライバシを報告するベンチマークを動機付けている。
関連論文リスト
- Choric Masking in Ambient Release Systems: A Finite Certificate Calculus for Trace Indistinguishability under Bounded Audiences [0.2864713389096699]
本稿では,保護された座標を直接観測しない環境リリースシステムのための有限証明書計算を開発した。
正確で近似的なマスクに対する測定・ポリトープの等価性、二重分離証明書、注意レンズのためのデータ処理法則、強制的なユニークなジェスチャーのための下限、連結されたリリースのための構成規則、反復室負債定理を証明している。
論文 参考訳(メタデータ) (2026-06-11T23:17:08Z) - OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents [32.5466552510287]
漏れは累積的であり、個々に無害な放出は、正直だが、真正に曲がりくねった流しに蓄積される。
我々は、秘密に対する敵の信念がどれほど改善するかを予算化するランタイム仲介者であるOCELOTを提示する。
OCELOTは高いタスクユーティリティでのリークを著しく低減し、適応注入、ジェイルブレイク、累積推論、シンク共謀に抵抗する。
論文 参考訳(メタデータ) (2026-06-10T17:13:35Z) - AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels [51.56484100374058]
本稿では,私的推論チャネル間の影響を測定するための実証実験について述べる。
この方法は、上流のプライベートブロックを長さマッチングドナーブロックに置き換え、公開トークンシーケンスと下流ターゲットを固定し、下流ターゲットの負のログに似たシフトを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:27:43Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Safeguarding Privacy of Retrieval Data against Membership Inference Attacks: Is This Query Too Close to Home? [14.147748220718784]
RAGシステム用に設計された新しい類似性に基づくMIA検出フレームワークを提案する。
単純な検出・隠蔽戦略は攻撃者を難読化し、データユーティリティを維持でき、MIAに対してシステムに依存しないことを示す。
論文 参考訳(メタデータ) (2025-05-28T07:35:07Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。