論文の概要: StegoMemory: Agentic Memory Acts as Covert Steganographic Channel
- arxiv url: http://arxiv.org/abs/2610.04589v1
- Date: Sat, 03 Oct 2026 15:23:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 18:37:06.992814
- Title: StegoMemory: Agentic Memory Acts as Covert Steganographic Channel
- Title(参考訳): ステゴメモリ:隠蔽ステガノグラフィーチャンネルとしてのエージェントメモリ法
- Abstract要約: エージェントが攻撃者が制御する文字列を1セッションでエンコードし、安全性を損なうことなく別のセッションで復元できるかどうかをテストする。
我々は91のモデルアタック構成、13のモデル、7のステガノグラフスキームにまたがる14,000のアタックトライアルを試験した。
その結果,エージェントメモリは永続的なクロスセッションサーキットチャネルとして機能することが示された。
- 参考スコア(独自算出の注目度): 1.0515290697720685
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Is agentic memory robust against stealthy steganographic attacks? We carry out a large-scale red-teaming exercise to test whether agents can encode attacker-controlled strings in one session and recover them in another without triggering safety oversight. Following SHADE-Arena-style tasks, we embed malicious side tasks to encode secret strings using steganography within otherwise benign tasks and evaluate them using independent task-completion and safety oversight. We test 14,000 attack trials spanning 91 model-attack configurations, 13 models, and 7 steganographic schemes: Acrostic, Mesostic, Telestich, Word-choice, Capitalization, Position-based, and Homoglyph. 41.2% of trials successfully encode the target payload in the generated response, while 29.8% survive the memory-write step with the encoding intact. Overall, 25.4% of trials yield a recoverable payload at retrieval, and 20.1% achieve exact-match recovery, including synthetic API keys and cryptographic material never exposed to the receiver. Among the exact-match transmissions, 71.4% also pass primary task-completion scoring and are independently judged safe by the oversight model, corresponding to 14.4% of all trials in which a successful covert transmission would appear to be an ordinary, benign interaction under task-level evaluation. Our results demonstrate that agentic memory can function as a persistent cross-session covert channel. The results further show that the principal bottleneck occurs at memory persistence rather than retrieval: once a steganographic payload survives the memory-write stage, a substantial fraction remains recoverable. We therefore argue that memory integrity, information-flow control, and covert-channel detection should be explicit security requirements for agentic systems.
- Abstract(参考訳): エージェント記憶はステルスステガノグラフィー攻撃に対して堅牢か?
我々は、攻撃者が制御する文字列を1セッションでエンコードし、安全性を損なうことなく別のセッションで復元できるかどうかをエージェントが検証するために、大規模なリピート演習を実施する。
SHADE-Arena型タスクに続き、悪意のあるサイドタスクを埋め込んでステガノグラフィーを用いて秘密文字列を符号化し、独立したタスク補完と安全監視を用いてそれらを評価する。
Acrostic, Mesostic, Telestich, Word-choice, Capitalization, Position-based, Homoglyph という,91のモデルアタック構成, 13のモデル, 7のステガノグラフスキームにまたがる14,000のアタックトライアルを検証した。
41.2%のトライアルが生成した応答で目標ペイロードをエンコードし、29.8%はそのままでメモリ書き込みのステップを生き延びた。
全体で25.4%のトライアルで回収可能なペイロードが得られ、20.1%が正確なマッチ回復を達成する。
正確なマッチの送信のうち、71.4%は一次タスク補完スコアをパスし、タスクレベルの評価の下で正常で良質な相互作用であるように見える全ての試験の14.4%に相当する監視モデルによって独立に判断される。
以上の結果から,エージェントメモリは永続的なクロスセッションサーキットチャネルとして機能することが示唆された。
ステガノグラフィーペイロードがメモリ書き込みの段階で生き残ると、かなりの割合が回復可能である。
したがって、メモリの完全性、情報フロー制御、および秘密チャネル検出は、エージェントシステムに対する明示的なセキュリティ要件であるべきだと論じる。
関連論文リスト
- MemSentry: A Framework for Detecting Persistent Memory Poisoning in Agentic AI [0.0]
提案する永続メモリ書き込みをインターセプトし,決定論的アクセプション,レビュー,あるいはQuantine決定を生成するフレームワークであるMemSentryを提示する。
MemSentryは、ソース信頼、セマンティックリスク、コンポーネント依存DAGに対する攻撃半径、アクセスリスク、署名されたセキュリティ状態デルタを共同で検討することで、各書き込みを評価する。
SBERT+LRは91.7%の精度と0.908のマクロF1スコアで最高性能を達成し、4つの手法はすべて外部の隔離クラスの脅威を100%検出した。
論文 参考訳(メタデータ) (2026-09-08T13:40:13Z) - ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents [23.994328225666663]
同僚は保護されたデータを開示し、不正な状態を操作し、不正なAPIを呼び出しながら、良質なタスクを完了することができる。
本稿では,行動安全を定義し,最終応答ではなく,実行軌跡からそのような行動リスクを評価するベンチマークであるActBenchを紹介する。
ActBenchには213のシナリオから600のケースが含まれており、15のリスク行動、6の実行スペース、48のWebサービスAPIがある。
論文 参考訳(メタデータ) (2026-08-10T11:45:03Z) - MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs [52.149036302760386]
大規模な言語モデルは、プロンプトによって引き起こされるシークレットを、流動的で良心的な出力にエンコードするように微調整することができる。
近年の研究では、内部の活性化から秘密を回収する線形プローブによる検出を提案する。
この防御は体系的に回避できるが,対象とするデータレベルの介入によって検出性が回復可能であることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:27:11Z) - Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors [9.503673758168693]
ローカルな微調整データセットは、APIキーや個人識別子、財務記録など、機密性の高いシークレットを常用する。
私たちは、実用的だが見過ごされたサプライチェーンベクターを使用します -- 標準アーキテクチャ定義としてキャモフラージュされたモデルコードです。
オンラインテンソルルールマッチングによる動的計算フローにおいてトークンレベルのシークレットにロックする決定論的フルチェーン機構を導入する。
論文 参考訳(メタデータ) (2026-04-30T05:03:08Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking [52.72486831074384]
サフィックスベースのジェイルブレイク攻撃は、敵のサフィックス、すなわち短いトークンシーケンスを付加し、LLMを安全でない出力にステアリングする。
提案するTrapSuffixは,推論パイプラインを変更することなく,トラップアラインな動作をベースモデルに注入する,軽量な微調整手法である。
様々なサフィックスベースのジェイルブレイク設定で、TrapSuffixは平均攻撃成功率を0.01%以下に下げ、平均追跡成功率87.9%を達成する。
論文 参考訳(メタデータ) (2026-02-06T11:43:56Z) - Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models [44.41218866933059]
微調整LDMは、ステガノグラフィーチャネルを介してプロンプトシークレットを出力に隠蔽的にエンコードすることができる。
任意の写像を埋め込み空間由来のものに置き換えることで、従来のスキームが100%回復可能であることを示す。
我々は、微調整によるステガノグラフィー攻撃を検出するには、従来のステガナシス以上のアプローチが必要であると論じる。
論文 参考訳(メタデータ) (2026-01-30T10:43:43Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - Transferable, Controllable, and Inconspicuous Adversarial Attacks on
Person Re-identification With Deep Mis-Ranking [83.48804199140758]
システム出力のランキングを乱す学習とミスランクの定式化を提案する。
また,新たなマルチステージネットワークアーキテクチャを開発することで,バックボックス攻撃を行う。
そこで本手法では, 異なるマルチショットサンプリングにより, 悪意のある画素数を制御することができる。
論文 参考訳(メタデータ) (2020-04-08T18:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。