論文の概要: When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills
- arxiv url: http://arxiv.org/abs/2608.03700v1
- Date: Tue, 04 Aug 2026 14:04:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.232764
- Title: When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills
- Title(参考訳): エージェントがあなたになるとき: ペルソナスキルにおけるプライバシー漏洩、偽装リスク、防衛のベンチマーク
- Authors: Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu, Tongliang Liu,
- Abstract要約: AntiSkillBenchはペルソナスキルパイプライン全体のリスクと防御を評価するエンドツーエンドのベンチマークである。
i) 多様なタスクシナリオにまたがる行動に富んだ50のプロファイルから構築された7,500人の個人を対象とする対話トレースのデータセット、(ii) スキルレベルのプライバシリークとエージェントレベルの属性開示と行動不正を計測する評価スイート、(iii) オンラインおよびポストホック介入の4つの構成をカバーする防衛評価を含む。
- 参考スコア(独自算出の注目度): 59.08894810908006
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Persona skills distill personal interaction histories into portable and executable artifacts for downstream agents. While enabling flexible personalization, this process concentrates fragmented personal signals, amplifies their impact through reuse, and challenges defenses designed for individual records or retrieval-based memory. To systematically investigate the safety of the persona-skill pipeline, we introduce AntiSkillBench, an end-to-end benchmark for evaluating risks and defenses across the persona-skill pipeline. It comprises: (i) a dataset of 7,500 persona-grounded dialogue traces, constructed from 50 behaviorally rich profiles spanning diverse task scenarios; (ii) an evaluation suite that measures skill-level privacy leakage and agent-level attribute disclosure and behavioral impersonation across three skill-distillation strategies; and (iii) a defense evaluation covering four configurations across online and post-hoc interventions, including active risk suppression and passive provenance protection. Experiments across three frontier agents show that persona-skill risks persist across agent backbones and distillation protocols, extending from explicit attributes to communication styles and personality traits. Existing defenses exhibit limited and distillation-dependent effectiveness, failing to generalize across risk and distillation strategies. These results highlight AntiSkillBench as a challenging benchmark for developing privacy-preserving and authenticity-aware persona skills.
- Abstract(参考訳): ペルソナスキルは、個人のインタラクション履歴を下流エージェントのためのポータブルで実行可能なアーティファクトに蒸留する。
フレキシブルなパーソナライゼーションを実現する一方で、このプロセスは断片化された個人信号に集中し、再利用を通じてその影響を増幅し、個々のレコードや検索ベースのメモリのために設計された防御に挑戦する。
ペルソナスキルパイプラインの安全性を体系的に調査するために,ペルソナスキルパイプライン全体のリスクと防御を評価するエンドツーエンドベンチマークであるAntiSkillBenchを導入する。
構成は以下の通り。
(i)多様なタスクシナリオにまたがる行動に富んだ50のプロファイルから構築された7,500件の対話トレースのデータセット。
2 スキルレベルのプライバシー漏洩及びエージェントレベルの属性開示及び3つのスキル蒸留戦略における行動偽造を計測する評価スイート
三 積極的なリスク抑制及び受動的前立腺保護を含む、オンライン及びポストホック介入の四つの構成をカバーする防衛評価。
3つのフロンティアエージェントに対する実験により、人格スキルのリスクは、明示的な属性からコミュニケーションスタイルや人格特性まで、エージェントのバックボーンや蒸留プロトコルにまたがって持続することが示された。
既存の防衛は限定的で蒸留に依存した有効性を示しており、リスクと蒸留戦略をまたいだ一般化に失敗している。
これらの結果から、AntiSkillBenchは、プライバシ保護と信頼性を意識したペルソナスキルを開発する上で、困難なベンチマークとして注目されている。
関連論文リスト
- Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response [0.0]
サイバー対応AIエージェントは、言語モデルとツール、メモリ、実行環境を組み合わせて、攻撃的なセキュリティタスクを実行する。
このレビューでは、その境界における5つの脆弱性クラスを合成する。マルチステップ攻撃チェーン、サンドボックス境界と競合する目的、サプライチェーンとクレデンシャル露出、永続的なコマンド・アンド・コントロール、自動アクションのスピード。
論文 参考訳(メタデータ) (2026-07-28T07:34:37Z) - AgentCanary: A Security Evaluation Framework for Autonomous AI Agents in Real Executable Environments [32.982317538632806]
本稿では,自律型AIエージェントの総合的セキュリティ評価フレームワークであるAgentCanaryを提案する。
AgentCanaryは3つのコントリビューションに沿って、システマティックなソリューションを提供する。
我々は,AgentCanaryのフロンティアモデルに対して,複数の確立した敵攻撃手法に対して,幅広いフロンティアモデルを評価する。
論文 参考訳(メタデータ) (2026-06-09T06:55:37Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Boundary-targeted Membership Inference Attacks on Safety Classifiers [70.20833439671131]
安全分類器は、セルフハームとメンタルヘルスの議論を含むセンシティブなデータセットに基づいて訓練される。
低信頼例を識別する新たな境界目標選択戦略を導入する。
実験により、相手は会話の19%を安全分類器が5%の偽陽性率でユーザーの苦痛を示すようにフラグ付けして回復できることが示された。
これは最先端のMIAメソッドだけで攻撃するより3.5ドル高い。
論文 参考訳(メタデータ) (2026-05-21T12:05:22Z) - Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation [50.87199039334856]
Retrieval-Augmented Generation (RAG) は知識集約型アプリケーションの基礎となっている。
近年の研究では、悪意あるクエリによって知識抽出攻撃が機密知識ベースコンテンツを回復できることが示されている。
本稿では,RAGシステムに対する知識抽出攻撃のための最初の体系的ベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-02-10T01:27:46Z) - The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration [72.33801123508145]
大規模言語モデル(LLM)はマルチエージェントシステムに不可欠なものである。
プライバシーリスクは、暗記、直接推論、シングルターン評価を超えて現れる。
特に、相互作用によって構成される一見無害な反応は、敵が機密情報の回復を累積的に行うことができる。
論文 参考訳(メタデータ) (2025-09-16T16:57:25Z) - Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets [16.619809695639027]
事前トレーニングと下流適応は、エンコーダとデータセットのレベルで洗練されたバックドア埋め込みにモデルを公開します。
本研究では,資源制約のある移動学習シナリオにおけるバックドアリスクを軽減する方法について検討する。
我々は,信頼性の高いデータとニューロンをピンポイントしてモデルセキュリティを強化することの重要性を強調する,Trusted Core (T-Core) Bootstrappingフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-16T11:33:03Z) - IMPersona: Evaluating Individual Level LM Impersonation [28.040025302581366]
本稿では,特定の個人の書き方や個人の知識を擬人化するためのLM評価フレームワークであるIMPersonaを紹介する。
我々は、Llama-3.1-8B-Instructのような、わずかにサイズのオープンソースモデルでさえ、関連するレベルでの偽造能力を達成することを実証した。
論文 参考訳(メタデータ) (2025-04-06T02:57:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。