論文の概要: Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions
- arxiv url: http://arxiv.org/abs/2603.20925v1
- Date: Sat, 21 Mar 2026 19:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.152406
- Title: Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions
- Title(参考訳): 利益はレッドチーム:戦略的経済相互作用におけるストレステストエージェント
- Authors: Shouqiao Wang, Marcello Politi, Samuele Marro, Davide Crapis,
- Abstract要約: 我々は,手作りの攻撃を,その利益を最大化するために訓練された学習相手に置き換えるストレステストプロトコルである,利益主導のレッドチームを提案する。
我々はこれを4つの標準的経済相互作用のリーンアリーナでインスタンス化し、適応的利用性のための制御されたテストベッドを提供する。
評価エピソードをエージェントの簡潔なプロンプトルールに抽出し, 従来観測されていた障害を非効率にし, 目標性能を大幅に向上させる。
- 参考スコア(独自算出の注目度): 2.0415910628419067
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As agentic systems move into real-world deployments, their decisions increasingly depend on external inputs such as retrieved content, tool outputs, and information provided by other actors. When these inputs can be strategically shaped by adversaries, the relevant security risk extends beyond a fixed library of prompt attacks to adaptive strategies that steer agents toward unfavorable outcomes. We propose profit-driven red teaming, a stress-testing protocol that replaces handcrafted attacks with a learned opponent trained to maximize its profit using only scalar outcome feedback. The protocol requires no LLM-as-judge scoring, attack labels, or attack taxonomy, and is designed for structured settings with auditable outcomes. We instantiate it in a lean arena of four canonical economic interactions, which provide a controlled testbed for adaptive exploitability. In controlled experiments, agents that appear strong against static baselines become consistently exploitable under profit-optimized pressure, and the learned opponent discovers probing, anchoring, and deceptive commitments without explicit instruction. We then distill exploit episodes into concise prompt rules for the agent, which make most previously observed failures ineffective and substantially improve target performance. These results suggest that profit-driven red-team data can provide a practical route to improving robustness in structured agent settings with auditable outcomes.
- Abstract(参考訳): エージェントシステムが現実世界のデプロイメントへと移行するにつれて、それらの決定は、検索されたコンテンツ、ツール出力、他のアクターが提供する情報など外部からのインプットにますます依存する。
これらの入力が敵によって戦略的に形作ることができれば、関連するセキュリティリスクは、不利な結果に対処する適応戦略への迅速な攻撃の固定されたライブラリを超えて広がる。
本研究では,手技による攻撃をスカラー結果フィードバックのみを用いて最大化するために訓練された学習相手に置き換えるストレステストプロトコルである,利益駆動型レッドチームを提案する。
このプロトコルは、LCM-as-judgeスコア、アタックラベル、アタック分類を必要とせず、監査可能な結果を備えた構造化された設定のために設計されている。
我々はこれを4つの標準的経済相互作用のリーンアリーナでインスタンス化し、適応的利用性のための制御されたテストベッドを提供する。
制御された実験では、静的なベースラインに対して強いように見えるエージェントは、利益最適化された圧力の下で一貫して利用でき、学習した相手は明示的な指示なしに、探索、アンカー、偽りのコミットメントを発見する。
次に, 悪用エピソードをエージェントの簡潔なプロンプトルールに抽出し, 従来観測されていた障害を非効率にし, 目標性能を大幅に向上させる。
これらの結果から,利益主導型レッドチームデータにより,監査可能な結果を伴う構造化エージェント設定におけるロバスト性向上の実践的な道筋が得られることが示唆された。
関連論文リスト
- Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Co-Evolving Agents: Learning from Failures as Hard Negatives [38.61683607205988]
近年の研究では、自己改善剤を自力で生成し、精製し、自身の軌道で再訓練する研究が進められている。
本稿では、目標エージェントが補助故障エージェントと共同で改善する共進化型エージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-27T09:30:33Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - LegalSim: Multi-Agent Simulation of Legal Systems for Discovering Procedural Exploits [0.0]
我々は、AIシステムが符号化ルールにおける手続き的弱点をどのように活用できるかを探求する、敵対的法的手続のモジュラーマルチエージェントシミュレーションであるLegalSimを提案する。
PPO, 文脈的バンディット, LLM, 直接 LLM ポリシ, 手作りの4つのポリシーを比較し, バイナリケースの結果を最適化する代わりに, エージェントを効果的な勝利率を用いて訓練・評価し, 対向コストインフレーション, カレンダー圧力, 低利得の決済圧力, ルール準拠のマージンを組み合わせた複合エクスプロイトスコアを作成した。
論文 参考訳(メタデータ) (2025-10-03T18:01:57Z) - Active Test-time Vision-Language Navigation [60.69722522420299]
ATENAは、不確実なナビゲーション結果に対するエピソードフィードバックを通じて、実用的な人間とロボットのインタラクションを可能にする、テスト時のアクティブな学習フレームワークである。
特にATENAは、成功エピソードにおける確実性を高め、失敗エピソードにおいてそれを減らすことを学び、不確実性の校正を改善している。
さらに,自信ある予測に基づいて,エージェントがナビゲーション結果を評価することができる自己学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-07T02:24:44Z) - Strategic Classification With Externalities [11.36782598786846]
戦略分類問題の新しい変種を提案する。
実世界のアプリケーションによって動機づけられた我々のモデルは、あるエージェントの操作が他のエージェントに影響を与えることを決定的に許している。
特定の仮定の下では、このエージェント操作ゲームの純粋なナッシュ平衡はユニークであり、効率的に計算できることが示される。
論文 参考訳(メタデータ) (2024-10-10T15:28:04Z) - Disturbing Reinforcement Learning Agents with Corrupted Rewards [62.997667081978825]
強化学習アルゴリズムに対する報酬の摂動に基づく異なる攻撃戦略の効果を分析します。
敵対的な報酬をスムーズに作成することは学習者を誤解させることができ、低探査確率値を使用すると、学習した政策は報酬を腐敗させるのがより堅牢であることを示しています。
論文 参考訳(メタデータ) (2021-02-12T15:53:48Z) - Robust Reinforcement Learning on State Observations with Learned Optimal
Adversary [86.0846119254031]
逆摂動状態観測による強化学習の堅牢性について検討した。
固定されたエージェントポリシーでは、摂動状態の観測に最適な敵を見つけることができる。
DRLの設定では、これは以前のものよりもはるかに強い学習された敵対を介してRLエージェントに新しい経験的敵対攻撃につながります。
論文 参考訳(メタデータ) (2021-01-21T05:38:52Z) - Multi-Issue Bargaining With Deep Reinforcement Learning [0.0]
本稿では,バーゲティングゲームにおける深層強化学習の活用について検討する。
入札と受け入れ戦略のために2つのアクター・クリティカル・ネットワークが訓練された。
ニューラルエージェントは時間ベースのエージェントを活用することを学び、決定優先値の明確な遷移を達成する。
彼らはまた、譲歩、割引要因、行動に基づく戦略の異なる組み合わせに対して適応的な行動を示す。
論文 参考訳(メタデータ) (2020-02-18T18:33:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。