論文の概要: Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation
- arxiv url: http://arxiv.org/abs/2608.03166v1
- Date: Tue, 04 Aug 2026 05:54:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.055931
- Title: Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation
- Title(参考訳): マルチエージェント評価を用いたロールプレイング言語エージェントの逆応力試験
- Abstract要約: Role-Playing Language Agents (RPLA) は、ハイテイクなアプリケーションにますます多くデプロイされている。
既存の評価アプローチは静的ベンチマークや孤立したシングルターンプロンプトに依存している。
本稿では,マルチターン対話による対向的ストレステストRPLAのためのモジュール型マルチエージェントプラットフォームを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Role-Playing Language Agents (RPLAs) are increasingly deployed in high-stakes applications such as healthcare assistance, customer support, and education, where maintaining consistent personas, ethical constraints, and behavioral coherence under adversarial pressure is critical. Existing evaluation approaches rely on static benchmarks or isolated single-turn prompts that fail to capture cumulative behavioral failures emerging over extended interactions. We present a modular multi-agent platform for adversarially stress-testing RPLAs through structured, multi-turn dialogue. The system coordinates three agents: a strategy-driven Interrogator Agent that applies six progressive adversarial strategies, a Target Agent representing the RPLA under evaluation, and an automated Judging Agent that scores behavior across role fidelity, drift, ethical deviation, and consistency dimensions. Through experiments across three personas and three LLM families, we demonstrate that multi-strategy adversarial evaluation reveals failure modes invisible to single-strategy testing, reducing overall robustness scores by 0.17--0.20 points on average. Cross-model validation confirms consistent degradation patterns across Llama-3.3-70B, GPT-4o-mini, and Claude-3.5-Haiku, with Authority Challenge and Emotional Manipulation emerging as the most effective attack strategies. Automated judging achieves strong human alignment ($r = 0.82$, Fleiss' $κ= 0.71$). This work is released as an open-source platform to support AI safety and reproducible RPLA benchmarking. While the framework enables systematic discovery of failure modes, we acknowledge potential ethical risks associated with adversarial testing methodologies and emphasize responsible usage for improving AI safety.
- Abstract(参考訳): ロールプレイング言語エージェント(RPLA)は、医療支援、カスタマーサポート、教育などの高度なアプリケーションに、一貫性のあるペルソナ、倫理的制約、敵の圧力下での行動的一貫性の維持が重要であるようになってきている。
既存の評価アプローチは、静的なベンチマークや独立した単一ターンプロンプトに依存しており、拡張されたインタラクションに対して発生する累積的な行動障害をキャプチャできない。
本稿では,マルチターン対話による対向的ストレステストRPLAのためのモジュール型マルチエージェントプラットフォームを提案する。
このシステムは6つのプログレッシブ・敵戦略を適用する戦略駆動のインターロゲータ・エージェント、評価対象のRPLAを代表するターゲット・エージェント、役割の忠実さ、ドリフト、倫理的偏差、整合性といった行動を評価する自動判断エージェントの3つのエージェントを協調する。
3つのペルソナと3つのLDMファミリーを対象とした実験により、マルチストラテジー逆数評価により、単一ストラテジーテストでは見えない障害モードが明らかになり、全体のロバストネススコアが平均0.17-0.20ポイント削減されることを示した。
クロスモデル検証は、Llama-3.3-70B、GPT-4o-mini、Claude-3.5-Haiku間の一貫した劣化パターンを確認する。
自動判定は強い人間のアライメント(r = 0.82$, Fleiss' $κ = 0.71$)を達成する。
この作業は、AI安全性と再現可能なRPLAベンチマークをサポートするオープンソースプラットフォームとしてリリースされている。
このフレームワークは、障害モードの体系的な発見を可能にするが、敵のテスト方法論に関連する潜在的な倫理的リスクを認識し、AI安全性を改善するための責任ある使用を強調する。
関連論文リスト
- Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations [0.09085204695117637]
従来の機械学習システムと比較すると、エージェントは計画、ツール呼び出し、動的環境相互作用を伴う複雑な障害モードを持つ。
モデルの内部表現が,マルチターンエージェント構成における最終的なタスク成功のシグナルをより強くするかどうかを検討する。
論文 参考訳(メタデータ) (2026-09-08T20:58:49Z) - Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - AgentCanary: A Security Evaluation Framework for Autonomous AI Agents in Real Executable Environments [32.982317538632806]
本稿では,自律型AIエージェントの総合的セキュリティ評価フレームワークであるAgentCanaryを提案する。
AgentCanaryは3つのコントリビューションに沿って、システマティックなソリューションを提供する。
我々は,AgentCanaryのフロンティアモデルに対して,複数の確立した敵攻撃手法に対して,幅広いフロンティアモデルを評価する。
論文 参考訳(メタデータ) (2026-06-09T06:55:37Z) - Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification [42.88763759237844]
大規模言語モデルに基づくマルチエージェントシステム(MAS)の悪意のあるエージェントは、誤情報を注入して他のエージェントを誤解させ、システム性能を損なう可能性がある。
本稿では,攻撃戦略を自律的に調整し,動的に調整する適応型協調攻撃フレームワークを提案する。
本稿では,エージェント通信における文レベルでのミスリード情報を識別・修正する防衛フレームワークであるSentence-Level Trustworthiness Analysis and Rectification(STAR)を紹介する。
論文 参考訳(メタデータ) (2026-05-27T07:56:33Z) - DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents [121.77550256034]
DecodingTrust-Agent Platform (DTap)は、AIエージェントのためのコントロール可能でインタラクティブなレッドチームプラットフォームである。
DTap-Redは、多様なインジェクションベクターを探索し、効果的な攻撃戦略を自律的に発見する、最初の自律的赤チームエージェントである。
DTapを通じて、さまざまなバックボーンモデル上に構築された一般的なAIエージェントの大規模評価を行う。
論文 参考訳(メタデータ) (2026-05-06T11:59:48Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs [1.036334370262262]
本稿では,エージェント実行を粒度のアクションとコンポーネントグラフに分解する可観測性に基づく評価フレームワークであるAgenSeerを紹介する。
モデルレベルとエージェントレベルの脆弱性プロファイルの根本的な違いを示す。
エージェントレベルの評価は、従来の評価には見えないエージェント固有のリスクを明らかにする。
論文 参考訳(メタデータ) (2025-09-05T04:36:17Z) - Robustness Testing for Multi-Agent Reinforcement Learning: State
Perturbations on Critical Agents [2.5204420653245245]
MARL(Multi-Agent Reinforcement Learning)は、スマート交通や無人航空機など、多くの分野に広く応用されている。
本研究は,MARLのための新しいロバストネステストフレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-09T02:26:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。