論文の概要: Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations
- arxiv url: http://arxiv.org/abs/2608.22444v2
- Date: Thu, 27 Aug 2026 12:35:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.639328
- Title: Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations
- Title(参考訳): 相反するアロネート・アロネート・アロネート・アロネート・アロケート・アロネート・アロケート・アロケート・アロケート・アロケート・アロケート・アロケート・アロケート・アロケート・アロネート・アロケート・アロケー
- Abstract要約: AIの安全性評価単位は依然として個々のモデルであるが、言語モデルエージェントは、相互作用する集団にますますデプロイされている。
本研究では,言語モデルモニタの集団が警告をエスカレートするか削除するかを判断するセキュリティトリアージタスクについて検討する。
ひとりのエージェントが判断する2つの警告が、ほぼ同一で、集団的な振る舞いをはるかに遠ざけていることがわかりました。
- 参考スコア(独自算出の注目度): 4.215221129670858
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The unit of AI safety evaluation is still the individual model, yet language-model agents are increasingly deployed in interacting populations that read and write one another's decisions. This raises a question no single-agent audit can answer: an agent that is well-calibrated on its own may still be pulled toward a different decision by the agents around it. We study this on a security-triage task, where populations of language-model monitors decide whether to escalate or dismiss alerts, and into which we can inject a committed minority that always pushes one way. We find that two alerts a single agent judges almost identically on its own can drive collective behavior far apart, so auditing any one member need not reveal what the population will do. Yet that collective behavior can be predicted in advance. From a population's benign, adversary-free operation alone, we calibrate a response function that forecasts, before any attack is run, how far a committed minority will later move it. We then ask what shifts the outcome and find that letting agents see each other's reasoning neutralizes a weak attack, while only delaying it against a strong one, turning the question from whether the population converges on the adversaries' choice into when. Finally, we exclude the hypothesis of capture being an irreversible trap: once the committed agents are removed, the population drifts back toward where it began, so capture is a temporary state. Alignment in isolation is not alignment in a population, yet what a population will do under attack can be read in advance, from how it behaves before any adversary arrives.
- Abstract(参考訳): AI安全性評価の単位は依然として個々のモデルであるが、言語モデルエージェントは、お互いの決定を読み書きする相互作用する集団にますますデプロイされている。
このことは、シングルエージェントの監査が答えられないという疑問を提起する。
我々はこれを,言語モデルモニタの人口が警告をエスカレートするか削除するかを判断し,常に一方向に進むコミットされたマイノリティを注入する,セキュリティトリアージタスクで研究する。
ひとりのエージェントが判断する2つの警告は、ほぼ同一であり、集団的な振る舞いをはるかに引き離す可能性があるため、どのメンバも、人口が何をするのかを監査する必要はない。
しかし、その集団行動は事前に予測できる。
集団の良心に満ちた無敵の作戦のみから、攻撃が実行される前に、コミットされた少数派がどのくらい後にそれを移動させるかを予測する応答関数を調整します。
結果にどのような変化があるのかを問うと、エージェントがお互いの推論を中和させることは弱い攻撃を中和する一方で、強い攻撃を遅らせるだけで、集団が敵の選択に収束するかどうかという問題からいつまで続くのかを論じる。
最後に、我々は捕獲が不可逆的な罠であるという仮説を除外する: コミットされたエージェントが取り除かれたら、人口はその開始地に向かって後退するので、捕獲は一時的な状態である。
孤立状態のアライメントは、集団の中で一致していないが、攻撃を受けている集団が何をするかは、敵が到着する前にどのように振る舞うかから事前に読み取ることができる。
関連論文リスト
- Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors [4.246803713067298]
我々は、複数のエージェントが悪質な目標を共同で狙う分散攻撃を形式化したマルチエージェントAI制御について研究する。
合成AIラボFakeLab(9つのサービス、86の良質なタスク、4つの攻撃目標)を開発した。
攻撃に協力するエージェントが増えるにつれて、エージェントごとの監視が攻撃者を捕まえる可能性が低下します。
論文 参考訳(メタデータ) (2026-07-08T13:03:25Z) - Conformity Generates Collective Misalignment in AI Agents Societies [37.32928545263465]
本稿では,AIエージェントの個体群を,コンフォーマンス・ダイナミクスを用いて,安定な不整合状態へと誘導することができることを示す。
9つの大きな言語モデルと100の意見ペアの意見ダイナミクスをシミュレートすると、各エージェントの振る舞いは2つの競合する力によって支配されていることが分かる。
論文 参考訳(メタデータ) (2026-05-11T15:30:48Z) - Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents [44.28040661008415]
大規模言語モデルエージェントが数百万の人口に拡大するにつれ、重要な疑問が浮かび上がってくる。
大規模自律エージェント社会において,この問題に対する最初の経験的評価を提示する。
社会は複雑な推論タスクにおいて、個々のフロンティアモデルを上回り、分散情報を滅多に合成せず、さらに簡単な調整タスクを失敗することが多い。
論文 参考訳(メタデータ) (2026-04-24T11:11:36Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Behind the Prompt: The Agent-User Problem in Information Retrieval [4.563318916484434]
情報検索におけるユーザモデルは、観察された振る舞いが意図を明らかにするという基本的な仮定に依存している。
エージェントが取る任意のアクションに対して、隠された命令は同一の出力を生成し、個々のレベルで意図を識別できないようにする。
エージェントネイティブソーシャルプラットフォームからの大規模コーパスによるエージェントユーザ問題について検討する。
論文 参考訳(メタデータ) (2026-03-04T01:42:14Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - When Agents See Humans as the Outgroup: Belief-Dependent Bias in LLM-Powered Agents [30.859825973762018]
本稿は、LSMによるエージェントは、人口統計バイアス(例えば、性別、宗教)だけでなく、グループ間バイアスも最小限の「us」と「them」の手がかりで示していることを示している。
エージェントは他のAIエージェントを内集団として扱うことができ、人間を外集団として扱うことができる。
論文 参考訳(メタデータ) (2026-01-01T07:18:36Z) - Can an Individual Manipulate the Collective Decisions of Multi-Agents? [53.01767232004823]
M-Spoilerは、マルチエージェントシステム内のエージェントインタラクションをシミュレートして、対向サンプルを生成するフレームワークである。
M-スポイラーは、敵対的サンプルの最適化を積極的に支援するスタブボーン剤を導入した。
本研究は,マルチエージェントシステムにおける個々のエージェントの知識によって引き起こされるリスクを検証した。
論文 参考訳(メタデータ) (2025-09-20T01:54:20Z) - Performative Prediction on Games and Mechanism Design [69.7933059664256]
エージェントが過去の正確性に基づいて予測を信頼するかを判断する集団リスクジレンマについて検討する。
予測が集合的な結果を形成するにつれて、社会福祉は関心の指標として自然に現れる。
よりよいトレードオフを実現し、それらをメカニズム設計に使用する方法を示します。
論文 参考訳(メタデータ) (2024-08-09T16:03:44Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z) - Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks [76.35478518372692]
エプシロン・イリューソリー(epsilon-illusory)は、シーケンシャルな意思決定者に対する敵対的攻撃の新たな形態である。
既存の攻撃と比較して,エプシロン・イリューソリーの自動検出は極めて困難である。
以上の結果から, より優れた異常検知器, 効果的なハードウェアおよびシステムレベルの防御の必要性が示唆された。
論文 参考訳(メタデータ) (2022-07-20T19:49:09Z) - Learning to Separate Clusters of Adversarial Representations for Robust
Adversarial Detection [50.03939695025513]
本稿では,最近導入された非破壊的特徴を動機とした新しい確率的対向検出器を提案する。
本稿では,非ロバスト特徴を逆例の共通性と考え,その性質に対応する表現空間におけるクラスターの探索が可能であることを推定する。
このアイデアは、別のクラスタ内の逆表現の確率推定分布を導出し、その分布を確率に基づく逆検出器として活用する。
論文 参考訳(メタデータ) (2020-12-07T07:21:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。