論文の概要: You Can't Escape Your Own Activations : Evaluation Awareness and Multi-Agent Monitoring
- arxiv url: http://arxiv.org/abs/2609.03035v1
- Date: Wed, 02 Sep 2026 18:07:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.822182
- Title: You Can't Escape Your Own Activations : Evaluation Awareness and Multi-Agent Monitoring
- Title(参考訳): 自分自身のアクティビティをエスケープできない : 評価意識とマルチエージェントモニタリング
- Abstract要約: 衝突を検出するために設計された出力モニタは、難読化とステガノグラフィーによって騙されることがある。
エージェントが内部のアクティベーションを監視していることを明示的に知らせると、アクティベーションに基づく検出がどう変化するかを検討する。
- 参考スコア(独自算出の注目度): 4.119847434567505
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: LLM agents are increasingly deployed in multi-agent systems, where they can collude while keeping their actions benign. Output monitors designed to detect such collusions can be fooled by obfuscation and steganography, motivating the use of probes trained on internal activations. However, these probes are usually evaluated on agents that do not know they are being watched. We study how activation-based detection changes when agents are explicitly informed that their internal activations are being monitored, and when they additionally receive feedback from the monitor. We keep the models, probes, and thresholds fixed and change only what the agents are told: nothing (baseline), that an activation monitor is present (aware), or that a monitor is present together with the previous round's score (feedback). We test two games, a four-agent blackjack game and a two-agent Simmons prisoners game, using Qwen3-32B-AWQ and GPT-OSS-20B in homogeneous and mixed pairings. Telling agents about the monitor does not hide them. The best probes stay accurate in all three conditions, and the agents keep colluding.
- Abstract(参考訳): LLMエージェントはますますマルチエージェントシステムにデプロイされ、動作の良さを維持しながらコラージュすることができる。
このような衝突を検出するために設計された出力モニターは難読化とステガノグラフィーによって騙され、内部の活性化に基づいて訓練されたプローブの使用を動機付けている。
しかしながら、これらのプローブは通常、監視されていることを知らないエージェントで評価される。
エージェントが内部のアクティベーションを監視していることを明示的に通知し、モニターからフィードバックを受け取ると、アクティベーションに基づく検出がどう変化するかを検討する。
モデル、プローブ、しきい値が固定され、エージェントが話すものだけを変更する: 何も(ベースライン)、アクティベーションモニターが存在する(注意)、あるいはモニターが前のラウンドのスコアと共に存在する(フィードバック)。
我々は,Qwen3-32B-AWQ と GPT-OSS-20B を用いた4エージェントブラックジャックゲームと2エージェントシモンズ囚人ゲームという2つのゲームをテストする。
モニターについてエージェントに伝えることは、それらを隠さない。
最高のプローブは3つの条件すべてで正確であり、エージェントは衝突し続けます。
関連論文リスト
- A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense [1.0742675209112622]
CoT(Chain-of- Thought)モニタリングは、アクションできれいに見える報酬のハックをキャッチし、推論でのみ自分自身を裏切ることを目的としている。
ここでは、理屈をコントロールしている敵が、まさにそれを倒せる場所であることを示す。
論文 参考訳(メタデータ) (2026-08-01T10:42:41Z) - The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment [2.8807875670834506]
本稿では,マルチエージェントの会話をリアルタイムで監視し,どの参加者が不一致に行動しているかを特定するエージェントであるArbiterを紹介する。
Arbiterは限定的な「検査予算」の下で運用されており、リソースの使い方を慎重に決めなければならない。
リスクの高い金融アドバイスモデルから評価意識・衝突エージェントまで,5つの会話条件でArbiterを評価した。
論文 参考訳(メタデータ) (2026-06-09T11:57:02Z) - Stateful Online Monitoring Catches Distributed Agent Attacks [63.00394432922707]
我々は、リアルタイムクラスタリングを用いて、多くのエージェントの転写にまたがる弱い疑わしい信号を収集するオンラインステートフルモニターを開発した。
本研究の結果は,孤立したテキストではなく,ユーザグループを優先する,新たな安全モニタのクラスに向けられたものである。
論文 参考訳(メタデータ) (2026-05-29T17:57:00Z) - Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback [48.40096834514452]
言語モデルエージェントの内部推論を監督する手法として,Chain-of-Thought(CoT)モニタリングを提案する。
我々は、推論エージェントが彼らのプライベートなCoTが監視下にあると自律的に推測できるかどうかを尋ねる。
フェデラーモデルでは、フィードバックをブロックすることで、このモニターの存在を純粋に推測することができる。
論文 参考訳(メタデータ) (2026-03-14T00:12:14Z) - How does information access affect LLM monitors' ability to detect sabotage? [5.941142438950269]
情報アクセスがLCMモニタの性能に与える影響について検討する。
現代のシステムでは、情報が少ないと性能が良くなることがよく示される。
監視されていることを知らないエージェントが、より簡単に捕まえられることがわかりました。
論文 参考訳(メタデータ) (2026-01-28T23:01:31Z) - Async Control: Stress-testing Asynchronous Control Measures for LLM Agents [2.7146936326590425]
非同期モニタリングにおいて,モニタリングシステムがエージェントの動作を後回しにレビューする手法について検討する。
同期監視とは異なり、このアプローチは実行時のレイテンシを課すことなく、不可逆的な害が起こる前に攻撃を妨害しようとする。
私たちは、モニター開発を、ブルーチーム(モニターを設計する)とレッドチーム(破壊エージェントを作成する)の敵対的なゲームとして扱う。
論文 参考訳(メタデータ) (2025-12-15T16:56:28Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents [60.23552141928126]
PSG-AgentはLLMベースのエージェントのためのパーソナライズされた動的システムである。
まずPSG-Agentは、安定した特性のために相互作用履歴をマイニングすることでパーソナライズされたガードレールを作成する。
第二に、PSG-Agentは特別なガードでエージェントパイプラインを横断する継続的監視を実装している。
論文 参考訳(メタデータ) (2025-09-28T03:31:59Z) - Reliable Weak-to-Strong Monitoring of LLM Agents [6.922769543581406]
我々は,自律エージェントの隠蔽行動を検出するためのテスト監視システムを強調した。
我々は、様々なレベルのエージェントを組み込んだ監視レッドチーム(MRT)ワークフローを開発し、状況認識を監視する。
さらなる研究を促進するために、コード、データ、ログをリリースしています。
論文 参考訳(メタデータ) (2025-08-26T22:29:31Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。