論文の概要: Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach
- arxiv url: http://arxiv.org/abs/2608.02698v1
- Date: Mon, 03 Aug 2026 13:00:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.902208
- Title: Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach
- Title(参考訳): ツール利用エージェント集団における適応被覆衝突のステガナリシス--ブラックボックス・クロスプリンシパルアプローチ
- Abstract要約: 大規模言語モデル(LLM)は、単一のオペレータではなく、多くのオペレータによって、共有インフラストラクチャに並行してデプロイされるようになっている。
これにより、シングルエージェントのセーフガードが逃避する集団レベルのリスクが生じる。
我々は,クロスラン相互情報推定,置換試験,分布シフト統計,タイミングとツールコール側チャネルを組み合わせたブラックボックスステガナリシス検出器を構築した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using agents built on large language models (LLMs) are increasingly deployed not by a single operator but by many, side by side on shared infrastructure. This creates a population-level risk that single-agent safeguards miss: a handful of agents can quietly coordinate, rigging a market, boosting one another in a review process, or timing a joint data grab, while each one looks perfectly well-behaved. The difficulty is that the organisations running these agents cannot see inside one another's models, so any realistic detector must work from behaviour alone: black-box, trace-only, and often with only partial visibility. We treat covert coordination as an information-hiding problem and build a black-box steganalysis detector that combines cross-run mutual-information estimation, permutation tests, distributional-shift statistics, and timing and tool-call side channels, all calibrated to a fixed false-positive budget. Our central move is to stop testing against a single fixed code: we pit the detector against an adversary that continually rewrites its encoding to slip past whatever the detector has learned, and we run this red-versus-blue contest in tool-using, memory-carrying environments rather than toy games. Capacity theory then tells us what to expect, a detection-capacity frontier, a covert bit-rate below which black-box detection is provably no better than chance. We set out an experiment to map this frontier, report clearly labelled placeholder results pending measurement, and flag a practical evasion, spreading a payload across sessions, that current methods largely miss.
- Abstract(参考訳): 大きな言語モデル(LLM)上に構築されたツール利用エージェントは、単一のオペレータではなく、多くのオペレータによって、共有インフラストラクチャに並行してデプロイされるようになっている。
少数のエージェントが、静かに調整したり、市場をリグしたり、レビュープロセスでお互いを強化したり、共同データの収集をタイミング付けしたりできる。
これらのエージェントを運用している組織は、互いのモデルの内部を見ることができないため、現実的な検出器は、ブラックボックス、トレースオンリー、そして多くの場合、部分的な可視性しか持たない行動からのみ動作する必要がある。
我々は,隠蔽コーディネーションを情報隠蔽問題として扱い,相互情報の相互推定,置換テスト,分布シフト統計,タイミングとツールコール側チャネルを組み合わせたブラックボックスステガナリシス検出器を構築し,いずれも固定された偽陽性予算に調整する。
私たちの中心となる動きは、単一の固定されたコードに対するテストをやめることです。私たちは、そのコードを書き直して、検出者が学んだことをスリップする敵に対して、検出器を落とします。
キャパシティ理論は、検出能力のフロンティア、つまりブラックボックス検出が偶然より確実に良くなる秘密のビットレートを教えてくれます。
我々は、このフロンティアをマッピングし、測定中のプレースホルダー結果を明確にラベル付けして報告し、実際の回避を警告し、セッションにペイロードを分散させる実験を行った。
関連論文リスト
- CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - The Best-Laid SCHEMEs: Coordinated Sabotage and Monitoring in Multi-Agent Systems [0.0]
SCHEMEは7つの設定と8つの実際のオープンソースライブラリにわたる17のタスクインスタンスのベンチマークである。
各設定は、エージェントの適切なサブセットが単独で成功しないように設計されている。
GPT 5.1 Codex と Gemini 3.1 Pro ですでに協調サボタージュが実用化されていることを示す。
論文 参考訳(メタデータ) (2026-05-27T23:30:21Z) - ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling [57.42714978834704]
ExCommは、探索段階のエージェントテストタイムスケーリングのための通信プロトコルである。
ExCommは、強いテスト時間スケーリングベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-21T07:38:44Z) - Detecting Multi-Agent Collusion Through Multi-Agent Interpretability [0.3467226901703539]
NARCBenchは環境分布シフト下での衝突検出のベンチマークである。
グループレベルでシナリオを分類するために,エージェントごとの詐欺スコアを集計する5つの探索手法を提案する。
単一のプローブ技術が全ての共謀タイプで支配的であり、異なる形の共謀が活性化空間で異なることを示唆している。
論文 参考訳(メタデータ) (2026-04-01T17:08:05Z) - RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection [9.898508403320438]
本稿では,テキストの逆転を検知する新しいブラックボックスフレームワークRTD-Guardを紹介する。
我々の重要な洞察は、敵攻撃における単語置換摂動は、置換トークン検出識別器が識別するために事前訓練されている「置換トークン」によく似ているということである。
プロセス全体では、敵データ、モデルチューニング、内部モデルアクセスは必要とせず、2つのブラックボックスクエリのみを使用する。
論文 参考訳(メタデータ) (2026-03-13T02:30:56Z) - Don't double it: Efficient Agent Prediction in Occlusions [1.1338062042380708]
密集した交通機関は、隠れた歩行者や車両が予期せず現れるため、自動運転車にとって重大な課題となる。
既存の学習ベースの手法は、1つのエージェントが複数回識別された場合、冗長な占有率予測を生成することが多い。
我々は、最先端のSceneInformerアーキテクチャをベースにした、新しいトランスフォーマーベースのアプローチであるMatchInformerを紹介する。
論文 参考訳(メタデータ) (2026-01-29T10:22:38Z) - Who's the Evil Twin? Differential Auditing for Undesired Behavior [0.6524460254566904]
赤いチームは2つの類似したモデルをトレーニングします。1つは良性データのみをトレーニングし、もう1つは隠れた有害な振る舞いを含むデータに基づいてトレーニングします。
我々は、CNNを用いて、ガウスノイズ分析、モデル拡散、統合勾配、敵攻撃など、様々なブルーチーム戦略を試す。
その結果、敵攻撃に基づく手法(100%正解、ヒントを用いた予測)の精度が高く、非常に有望であることがわかった。
論文 参考訳(メタデータ) (2025-08-09T04:57:38Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z) - Probabilistic Ranking-Aware Ensembles for Enhanced Object Detections [50.096540945099704]
本稿では,検知器から箱を囲むことの信頼性を向上するPRAE(Probabilistic Ranking Aware Ensemble)という新しいアンサンブルを提案する。
また,異なる数の箱を扱う必要性によって生じる信頼の不均衡問題に対処するためのbanditアプローチも導入する。
論文 参考訳(メタデータ) (2021-05-07T09:37:06Z) - Object Detection Made Simpler by Eliminating Heuristic NMS [70.93004137521946]
単純なNMSのないエンドツーエンドのオブジェクト検出フレームワークを示す。
検出精度は元の1段検出器と比べて同等か、さらに向上した。
論文 参考訳(メタデータ) (2021-01-28T02:38:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。