論文の概要: Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs
- arxiv url: http://arxiv.org/abs/2608.29028v1
- Date: Sat, 29 Aug 2026 03:38:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.820163
- Title: Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs
- Title(参考訳): ルールのないファクト:マルチエージェントLLMハンドオフにおける境界メタデータの崩壊
- Abstract要約: 要約では,操作上の事実を優先的に保存しつつ,それらの事実の使い方を規定する境界メタデータを弱めていることを示す。
GPT-5-miniとDeepSeek-R1-32Bの双方のハンドオフレベルでは、境界標識と運用結果の生存はほぼ無関係である。
- 参考スコア(独自算出の注目度): 13.92589238677081
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent LLM systems often coordinate by compressing an upstream interaction into a handoff artifact that downstream agents treat as shared state. We show that this handoff step is a structural source of privacy leakage: summaries preferentially preserve operational facts while weakening the boundary metadata that governs how those facts may be used---a failure mode we call \emph{summary collapse}. On a controlled multi-agent coordination testbed we measure marker survival with a human-validated judge ($κ= 0.74$), where $σ_b = 1$ means every boundary marker survives verbatim and $σ_b = 0$ means all are lost. Boundary-marker and operational-fact survival are nearly uncorrelated at the handoff level on both GPT-5-mini and DeepSeek-R1-32B (Pearson $r$ near zero): uncompressed free-text handoffs preserve boundaries at $σ_b \approx 0.80$, whereas a $25$-word budget drops $σ_b$ to ${\approx}0.57$ while operational-fact survival stays near ceiling. Controlled downstream tests reveal that protection depends on \emph{boundary explicitness}: vague languages leak in $73\%$ of GPT and $50\%$ of DeepSeek cases, while explicit constraints reduce leakage to under $15\%$ across all three tested models. A no-handoff single-agent control further shows the failure is not reducible to multi-agent topology as direct full-marker access still leaks more often than the operationalized handoff. Prompt-only mitigation and exact-string redaction only partially address the problem, while a gold-derived audience allowlist nearly eliminates leakage across models, showing that correctly identifying audience boundaries is the key factor.
- Abstract(参考訳): マルチエージェントLLMシステムは、上流の相互作用を、下流のエージェントが共有状態として扱うハンドオフアーティファクトに圧縮することでコーディネートすることが多い。
要約は操作上の事実を優先的に保存し、それらの事実の使用方法を管理する境界メタデータを弱めます。
制御されたマルチエージェント協調テストベッドでは、マーカーの生存率を人間公認の裁判官(κ= 0.74$)で測定し、そこでは、$σ_b = 1$はすべての境界マーカーが冗長に生き残ることを意味し、$σ_b = 0$は全てのマーカーが失われることを意味する。
GPT-5-mini と DeepSeek-R1-32B (Pearson $r$ near zero): 圧縮されていない自由テキストハンドオフは、バウンダリを$σ_b \approx 0.80$で保持するが、25ドルワードの予算は$σ_b$ to ${\approx}0.57$とほぼ無関係である。
曖昧な言語は GPT の 73\% と DeepSeek の 50\% のケースにリークする一方、明示的な制約は3つのテストモデルすべてで 15\% 以下のリークを減少させる。
ハンドオフのないシングルエージェント制御は、操作されたハンドオフよりも直接フルマーカーアクセスが頻繁にリークしているため、マルチエージェントトポロジでは障害が再現できないことも示している。
プロンプトのみの緩和と厳密なストリングのリアクションは問題の一部にのみ対処する一方で、ゴールド由来のオーディエンス許容リストはモデル間のリークをほぼ排除し、オーディエンスの境界を正しく識別することが重要な要素であることを示している。
関連論文リスト
- Privacy-Preserving Topology-Guided Safety for LLM-Based Multi-Agent Systems via Federated Graph Learning [67.04448659688579]
FGLGuardは、AgentDojoのグランドサクセスレートを、ほぼ無防備なユーティリティ、APIコストゼロ、無視可能な機能損失で43%削減する。
フェデレーションはオプションではなく、オフ・ザ・シェルフ・トランスファーは流通シフトによって崩壊する。
Live FGLGuardは、AgentDojoのグランドサクセスレートを、ほぼ無防備なユーティリティ、APIコストゼロ、無視可能な機能損失で43%削減する。
論文 参考訳(メタデータ) (2026-09-02T07:57:12Z) - Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Memorization Is Not Extraction: Tight Differential-Privacy Bounds and Audit Blind Spots [9.539275654775706]
大規模言語モデルの記憶は、形式的関係が不明な定義の動物園を通じて測定される。
差分プライバシー(DP)は,これらすべてに対して同時にプロキシとして扱われることを示す。
論文 参考訳(メタデータ) (2026-08-27T23:28:08Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents [2.9512821350868754]
我々は、ステートフル境界を発見し、強調するブラックボックステスティングフレームワークであるAgentEvalを提案する。
盲目的にプロンプトする代わりに、AgentEvalはこのグラフの構造を使って特定のガードと前提条件をテストターゲットとして列挙する。
我々はAgentEvalを、エージェントの基盤となるソースコードにアクセス可能な特権付きホワイトボックス監査者に対してベンチマークします。
論文 参考訳(メタデータ) (2026-07-08T00:11:41Z) - Failure Modes of Deep Multi-Agent RL in Asynchronous Pricing: Reproducible Triggers, Trace Diagnostics, and a Partial Fix [1.5369106213673014]
同期DDPGエージェントは、コラシオンインデックス$= 0.69 pm 0.11$で確実に障害モード1をトリガーする。
部分的な修正を定量化します。非同期だけでコラシオンを48%削減し、レイテンシを追加することで、最低$0.28$にします。
気道内信号の崩壊と非回復を呈するトラジェクトリレベルのトレース診断を併用したスカラー・コルシオン・インデックスを施行した。
論文 参考訳(メタデータ) (2026-06-03T06:49:15Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models [0.0]
VLA(Vision-Language-Action)モデルはクリーンな入力で高い成功率に達するが、小さな逆方向の摂動で崩壊する。
PGD攻撃は、OpenVLA-7BのLIBEROの成功を95%ドルから5%以下に下げることを示す。
任意のVLAポリシーに対して、capability $I(Astar;Api)$と robustness $I(Api;Atildepi)-I(Api;)$ sum to at least $H(Astar)+I(X;Xt)
論文 参考訳(メタデータ) (2026-05-25T14:16:57Z) - Subtle Injection for Ground-truth Inference of LLM Training Data [0.2538209532048867]
SIGILは、認識不能なEmphcanary Sequenceを保護されたテキストとコードに埋め込むフレームワークである。
SIGILは、語彙規則、語彙句、構文、意味、コードパターンの5つのカナリア戦略を定義している。
論文 参考訳(メタデータ) (2026-05-18T14:48:44Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。