論文の概要: Despite Instructions: Frontier Agents Improvise Covert Channels at Test Time
- arxiv url: http://arxiv.org/abs/2609.32701v1
- Date: Sat, 26 Sep 2026 15:06:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 21:09:38.852935
- Title: Despite Instructions: Frontier Agents Improvise Covert Channels at Test Time
- Title(参考訳): 指示にもかかわらず、フロンティアエージェントはテスト時にカバーチャネルを改善する
- Abstract要約: セキュリティに敏感なアプリケーションでは、言語モデルエージェントは機密情報を開示することなく調整する必要があることが多い。
送信者が4つの秘密状態のうちの1つを観測し、同一の公開レポートの4つの要約のうちの1つを選択する。
モデルペアは、受信機が正しく推測したかどうかを示す1ビットのフィードバックのみを使用して、秘密を伝えることができる。
- 参考スコア(独自算出の注目度): 64.61749234961134
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In security-sensitive applications, language-model agents are often required to coordinate without disclosing confidential information. Yet repeated interactions may also let ordinary messages acquire shared private meaning. We study a repeated game with pairs of models in which the sender model observes one of four secret states and selects one of four summaries of the same public report, while the receiver model tries to infer the secret state. We find that model pairs can learn to communicate the secret using only one bit of feedback indicating whether the receiver inferred it correctly. This learning occurs during inference with fixed parameters and no supplied codebook or encoding examples. The effect also persists when agents generate their own free-form updates in a simulated incident-response task. Across ten independent games, pairs of GPT-5.6 Sol agents reach 98.8% final accuracy, compared with 25% chance, despite explicit instructions prohibiting disclosure and a monitor that screens each message without access to the agents' interaction histories. The same interactions that help agents cooperate can therefore allow confidential information to pass through messages intended for legitimate coordination.
- Abstract(参考訳): セキュリティに敏感なアプリケーションでは、言語モデルエージェントは機密情報を開示することなく調整する必要があることが多い。
しかし、繰り返しやりとりすることで、通常のメッセージは共有されたプライベートな意味を取得できる。
本研究では,送信側モデルが4つの秘密状態のうちの1つを観測し,同一の公開レポートの4つの要約のうちの1つを選択し,受信側モデルが秘密状態の推測を試みる繰り返しゲームについて検討する。
モデルペアは、受信機が正しく推測したかどうかを示す1ビットのフィードバックのみを使用して、秘密を伝えることができる。
この学習は固定パラメータによる推論中に行われ、コードブックやエンコード例は提供されない。
この効果は、エージェントがシミュレートされたインシデント-レスポンスタスクで独自のフリーフォーム更新を生成するときにも持続する。
10つの独立したゲームの中で、GPT-5.6のソルエージェントのペアは、25%の確率で98.8%の精度に達している。
エージェントが協力するのを助けるのと同じインタラクションは、機密情報を合法的な調整を意図したメッセージに通すことを可能にする。
関連論文リスト
- Codetta: High-Capacity, Keyless, and Undetectable Multi-Agent Collusion [27.70380189427223]
ステガノグラフィーは、平凡に見える出力の中に通信を隠すことができる。
既存のLLMステガノグラフィープロトコルは現実的な展開には適していない。
我々は,独立にデプロイされたエージェントに対して,高容量のステガノグラフィープロトコルであるCodettaを用いて,検出不能なエージェント衝突の脅威を発生させる。
論文 参考訳(メタデータ) (2026-09-24T01:27:47Z) - Emergent Collusion in Long-Horizon LLM Agent Interaction [54.47975581249992]
長距離マルチエージェント環境における衝突の発生について検討した。
検証プロトコルに違反するだけで高い報酬が達成できる現実的な制約を導入する。
衝突は10モデルにわたる軌道の94%で発生し、同じファミリー内のより有能なモデルがそれより早く到達する。
論文 参考訳(メタデータ) (2026-09-21T17:52:48Z) - Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks [29.178207407613403]
情報非対称な対話型「スポット・ザ・ディファレンス」タスクを提案する。
2つのモデルはそれぞれ1つの画像がプライベートに表示され、画像が同一であるか、そうでないかを会話を通じて判断する必要がある。
彼らは自分のプライベートイメージの重要な証拠をしばしば見落とし、彼らの合意が保証されていない場合でも、彼らの会話のパートナーと同意することに賛成する。
論文 参考訳(メタデータ) (2026-07-31T16:09:23Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Undetectable Conversations Between AI Agents via Pseudorandom Noise-Resilient Key Exchange [7.877552575246053]
AIエージェントは、正直な対話と計算的に区別できない書き起こしを生成しながら、並列な秘密の会話を実行できることを示す。
我々は、擬似ランダムノイズ耐性鍵交換と呼ばれる新しい暗号プリミティブを導入する。
結果は、転写監査だけでAIエージェント間の秘密調整を除外できないことを示している。
論文 参考訳(メタデータ) (2026-04-06T15:25:38Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - Verifiable Semantics for Agent-to-Agent Communication [0.2866560512724962]
マルチエージェントAIシステムは一貫した通信を必要とする。
自然言語は解釈可能であるが、セマンティックドリフトに弱い。
そこで本研究では,刺激意味モデルに基づく認証プロトコルを提案する。
論文 参考訳(メタデータ) (2026-02-18T12:55:58Z) - CAMEL: Communicative Agents for "Mind" Exploration of Large Language
Model Society [58.04479313658851]
本稿では,コミュニケーションエージェント間の自律的協調を支援するスケーラブルな手法の構築の可能性について検討する。
本稿では,ロールプレイングという新しいコミュニケーションエージェントフレームワークを提案する。
コントリビューションには、新しいコミュニケーティブエージェントフレームワークの導入、マルチエージェントシステムの協調行動や能力を研究するためのスケーラブルなアプローチの提供などが含まれます。
論文 参考訳(メタデータ) (2023-03-31T01:09:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。