論文の概要: Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
- arxiv url: http://arxiv.org/abs/2606.26356v1
- Date: Wed, 24 Jun 2026 20:09:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.07792
- Title: Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
- Title(参考訳): インストラクションブリード:プロンプト複合エージェントシステムにおけるクロスモジュール干渉
- Abstract要約: 1つのプロンプトモジュールを編集すると、共有変数や実行可能依存関係がないにもかかわらず、他のモジュールの振る舞いが静かに変わる。
我々はこれをコンポジション行動漏洩(CBL):コンテキストウィンドウを共有するモジュール間の干渉として定式化する。
我々は、CBLを再利用可能な3チャンネルプロトコルによって配置されたジョブ評価エージェント上で探索し、ボリューム、コンテンツ、フォームに沿った非焦点モジュールを摂動させる。
- 参考スコア(独自算出の注目度): 4.22293816564147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Practitioners of prompt-composed agentic systems report a recurring failure mode: editing one prompt module silently shifts the behavior of others despite no shared variable or executable dependency. We formalize this as compositional behavioral leakage (CBL): interference between modules sharing a context window. CBL is enabled by architectural non-isolation: transformer self-attention provides no formal boundary between concatenated modules. We probe CBL on a deployed job-evaluation agent (Claude Sonnet 4.6, 144 trials) through a reusable three-channel protocol that perturbs non-focal modules along volume, content, and form. Only the content channel produces a detectable paired effect (Cohen's d = 0.63, bootstrap 95% CI excluding zero); no recommendation flipped -- a sub-threshold regime invisible to standard QA but compounding across the thousands of decisions a deployed agent makes. CBL is orthogonal to known agent-failure axes (adversarial injection, cognitive degradation, multi-agent fault propagation, privacy leakage). We contribute an operational definition, a reusable protocol, a falsifiable prediction set, and a system-class characterization, establishing cross-module interference measurement as a requirement for prompt-composed agent evaluation.
- Abstract(参考訳): 1つのプロンプトモジュールを編集すると、共有変数や実行可能依存関係がないにもかかわらず、他のモジュールの振る舞いが静かに変わる。
我々はこれをコンポジション行動漏洩(CBL):コンテキストウィンドウを共有するモジュール間の干渉として定式化する。
CBL はアーキテクチャ上の非同型化によって実現される: 変換器の自己アテンションは連結加群間の形式的な境界を与えない。
我々は、CBLをデプロイされたジョブ評価エージェント(Claude Sonnet 4.6, 144 トライアル)上で、ボリューム、コンテンツ、フォームに沿って非焦点モジュールを摂動させる再利用可能な3チャネルプロトコルを用いて探索する。
コンテンツチャネルだけが検出可能なペア効果(Cohenのd = 0.63、ゼロを除くブートストラップ95%CI)を生成する。
CBLは、既知のエージェント障害軸(逆噴射、認知劣化、マルチエージェント断層伝播、プライバシー漏洩)と直交している。
本稿では, 操作定義, 再利用可能なプロトコル, 偽装可能な予測セット, システムクラスの特性評価に寄与し, エージェント評価の要件として, クロスモジュール干渉測定を確立する。
関連論文リスト
- Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control [0.0]
LLMエージェントはシステムプロンプト、ユーザ、メモリ、ツールから命令を仲裁するが、この仲裁は信頼境界を強制するものではない。
ソースフォーマット機能はモデルアクティベーションから線形にデオード可能であり、モデルがトリガーされたときの偽の権威を明示的に識別することができる。
モデル自己配置をセキュリティ境界ではなく機能として扱い、認証されたソースルーティングと機能限定ツールの実行を組み合わせた外部参照モニタを実装します。
論文 参考訳(メタデータ) (2026-08-28T16:34:05Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems [57.450132281381066]
ピアエビデンスが単一のメッセージによって決定されるのではなく、隠れたしきい値に達すると、バックドアの動作が起動される。
我々は,MASとBundary-Conditioned Backdoor Injection(BCBI)のための集合的エビデンス-ホールドバックドアパラダイムを導入する。
クリーンな通信力学を学習し,異常なエージェント更新を隔離する,クリーンな唯一の潜時防御であるLATTEを提案する。
論文 参考訳(メタデータ) (2026-08-02T08:38:44Z) - On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models [0.0]
我々は、制御権威行動を伴うプロンプトアクションモデルとして、誘導されたシステムを定式化する。
共有パイプライン内では,SFC(Semantic-Faithful Control)が実現不可能であることを示す。
根本原因とそれが要求するソリューションのクラスを特定します。
論文 参考訳(メタデータ) (2026-06-25T21:52:29Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines [0.0]
エージェント・ファミリー間のパッチ・ハーネスは、より高いコ・アダプティブ・コ・オクルージョンと、より安全性の低いコ・オクルージョン・コ・オクルージョンと関連があることが示されている。
我々は、診断のみから導かれた、エージェントごとの協調適応尺度を用いてこれを運用し、エージェント・ファミリー間のパッチ・ハーネスと一貫して関連していることを示す。
論文 参考訳(メタデータ) (2026-05-21T03:44:47Z) - Agentic Model Checking [12.832868209928039]
本稿では,LLMエージェントと境界モデルチェックバックエンドを結合するパラダイムを提案する。
我々は、BMC-Agentのアプローチをインスタンス化し、CとRustのLLM生成カーネルおよびコンパイラコード上で評価する。
論文 参考訳(メタデータ) (2026-05-20T17:25:52Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis [19.29853121538131]
我々はQwen-3ファミリー(0.6B-14B)と2つのメモリフレームワーク(mem0とA-MEM)の回路をトレースする。
我々は無監督段階診断を開発し,76.2%の精度でサイレント障害を責任ある手術に局在させる。
論文 参考訳(メタデータ) (2026-05-05T04:17:22Z) - Arbiter: Detecting Interference in LLM Agent System Prompts [0.0]
Arbiterは、システムプロンプト内の干渉パターンを検出するために、形式的評価ルールとマルチモデルLCMスカーリングを組み合わせたフレームワークである。
Claude Code (Anthropic), Codex CLI (OpenAI), Gemini CLI (Google)の3つの主要なコーディングエージェントシステムに適用される。
論文 参考訳(メタデータ) (2026-03-09T22:29:47Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check [54.08619694620588]
本稿では,2つの異なるエージェントパラダイムであるEmbodied AgentsとTool-Calling AgentsにまたがるdLLMの包括的評価を行う。
Agentboard と BFCL では,現在の dLLM が信頼できるエージェントバックボーンとして機能しないという,"ビットレッスン" が報告されている。
論文 参考訳(メタデータ) (2026-01-19T11:45:39Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Unsupervised Continual Anomaly Detection with Contrastively-learned
Prompt [80.43623986759691]
UCADと呼ばれる新しい非教師付き連続異常検出フレームワークを提案する。
このフレームワークは、対照的に学習したプロンプトを通じて、UDAに継続的な学習能力を持たせる。
我々は総合的な実験を行い、教師なし連続異常検出とセグメンテーションのベンチマークを設定した。
論文 参考訳(メタデータ) (2024-01-02T03:37:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。