論文の概要: Safety of Latent Communication in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2609.39788v2
- Date: Thu, 01 Oct 2026 09:39:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.560593
- Title: Safety of Latent Communication in Multi-Agent Systems
- Title(参考訳): マルチエージェントシステムにおける潜時通信の安全性
- Abstract要約: 良質なリンクトレーニングであっても、テキストベースのコミュニケーションに対して有害なコンプライアンスを増大させることができることを示す。
攻撃者は、有害なクエリペアのリンクを最適化したり、さもなければ良質なトレーニングデータを中毒させることで、この効果を増幅することができる。
我々は、有害な目標応答を必要とせず、良質なタスク性能とともに有害なコンプライアンスに報いる強化学習攻撃を開発する。
- 参考スコア(独自算出の注目度): 2.3447798698078155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent communication enables multi-agent systems to exchange information directly in internal representation space, reducing the token, computation, and latency overhead of text-based communication. To this end, lightweight trainable links are introduced to map the sender's representations into the receiver's input space. In this work, we show that even benign link training can increase harmful compliance relative to text-based communication while the underlying safety-aligned agents remain unchanged. An attacker can amplify this effect by optimizing the links on harmful query--response pairs or poisoning otherwise benign training data. We further develop a reinforcement-learning attack that rewards harmful compliance alongside benign task performance without requiring harmful target responses. Across three communication topologies and four safety benchmarks, this attack raises the mean harmful-compliance score from 27.9 with benignly trained links to 76.9. Compared with direct supervised optimization, it also achieves higher average accuracy on two benign utility benchmarks. Adapting the rewards toward safer behavior also enables repair of compromised links, substantially reducing harmful compliance across all evaluated attacks without updating the agents. Overall, our results show that safety alignment requires considering the multi-agent system as a whole. Code: https://github.com/Muhammad-Huzaifaa/latent-safety
- Abstract(参考訳): 遅延通信により、マルチエージェントシステムは内部表現空間で情報を直接交換することができ、トークン、計算、テキストベースの通信の遅延オーバーヘッドを低減できる。
この目的のために、送信者の表現を受信者の入力空間にマッピングするために、軽量なトレーニング可能なリンクが導入された。
本研究は,テキストベース通信に対する悪質なリンクトレーニングであっても,基礎となる安全対応エージェントが変化しないまま,有害なコンプライアンスを増大させることができることを示す。
攻撃者は、有害なクエリペアのリンクを最適化したり、さもなければ良質なトレーニングデータを中毒させることで、この効果を増幅することができる。
我々はさらに、有害な目標応答を必要とせず、良質なタスク性能とともに有害なコンプライアンスを報いる強化学習攻撃を開発する。
3つの通信トポロジと4つの安全ベンチマークで、この攻撃は27.9点から76.9点まで適度に訓練されたリンクで有害なコンプライアンススコアを上げた。
直接教師付き最適化と比較すると、2つの良質なユーティリティベンチマークで平均精度が向上する。
より安全な行動に報酬を適用することで、妥協されたリンクの修復を可能にし、エージェントを更新することなく、評価されたすべての攻撃に対する有害なコンプライアンスを大幅に低減する。
以上の結果から,安全アライメントにはマルチエージェントシステム全体を考慮する必要があることが示唆された。
コード:https://github.com/Muhammad-Huzaifaa/latent-safety
関連論文リスト
- On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - The Alignment Waltz: Jointly Training Agents to Collaborate for Safety [80.16102254128518]
WaltzRLは、安全アライメントを協調的でポジティブなゲームとして定式化する、新しいマルチエージェント強化学習フレームワークである。
WaltzRLのコアとなるDIR(Dynamic Improvement Reward)は、会話エージェントがフィードバックをいかにうまく組み込むかに基づいて、時間とともに進化する。
我々の実験は5つの多様なデータセットで行われ、WaltzRLは安全でない応答と過度な拒絶の両方を著しく低減することを示した。
論文 参考訳(メタデータ) (2025-10-09T14:03:05Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Diffusion-aided Task-oriented Semantic Communications with Model Inversion Attack [8.014010065113707]
タスク指向意味コミュニケーションのための拡散支援フレームワークであるDiffSemを提案する。
DiffSemは、チャネルノイズを補償しながらセマンティックコンテンツを適応的に制御する送信側自己雑音機構を統合している。
実験の結果,DiffSem は適切な受信者に対して高い精度を達成できることを示し,提案手法の優れた性能を検証した。
論文 参考訳(メタデータ) (2025-06-24T05:21:27Z) - Secure Semantic Communication via Paired Adversarial Residual Networks [59.468221305630784]
本稿では,セキュリティを意識したセマンティック通信システムに対する敵攻撃の正の側面について検討する。
セマンティックトランスミッターの後に、セマンティックレシーバーの前に、一対のプラグイン可能なモジュールがインストールされる。
提案手法は,高品質なセマンティック通信を維持しつつ,盗聴者を騙すことができる。
論文 参考訳(メタデータ) (2024-07-02T08:32:20Z) - Certifiably Robust Policy Learning against Adversarial Communication in
Multi-agent Systems [51.6210785955659]
多くのマルチエージェント強化学習(MARL)では,エージェントが情報を共有し,適切な判断を下す上でコミュニケーションが重要である。
しかし、ノイズや潜在的な攻撃者が存在する現実世界のアプリケーションに訓練された通信エージェントを配置すると、通信ベースのポリシーの安全性は過小評価されている深刻な問題となる。
本研究では,攻撃者が任意の$CfracN-12$エージェントから被害者エージェントへの通信を任意に変更できる,$N$エージェントを備えた環境を検討する。
論文 参考訳(メタデータ) (2022-06-21T07:32:18Z) - Adversarial Attacks On Multi-Agent Communication [80.4392160849506]
現代の自律システムはすぐに大規模に展開され、協調型マルチエージェントシステムの可能性を広げる。
このような利点は、セキュリティ侵害に対して脆弱であることが示されている通信チャネルに大きく依存している。
本稿では,エージェントが学習した中間表現を共有してコミュニケーションする新しいマルチエージェント環境において,このような攻撃を探索する。
論文 参考訳(メタデータ) (2021-01-17T00:35:26Z) - Gaussian Process Based Message Filtering for Robust Multi-Agent
Cooperation in the Presence of Adversarial Communication [5.161531917413708]
マルチエージェントシステムにおける敵通信に対する堅牢性の提供という課題について考察する。
グラフニューラルネットワーク(GNN)に基づく通信アーキテクチャを提案する。
本手法は,非協力的エージェントがもたらす影響を低減できることを示す。
論文 参考訳(メタデータ) (2020-12-01T14:21:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。