論文の概要: Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study
- arxiv url: http://arxiv.org/abs/2609.01693v1
- Date: Tue, 01 Sep 2026 16:24:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.701373
- Title: Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study
- Title(参考訳): MCP-to-A2Aエージェント構成における公開共有ラベルとVerbatim Field Egress:制御型マルチモデルによる検討
- Abstract要約: Model Context Protocolツールの使用のために別々に評価され、Agent2Agent(A2A)デリゲートは、エージェントが両方を使用するときの振る舞いを記述する必要はない。
一つの制御されたMCP-to-A2A構成でそのような挙動を計測する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety properties assessed separately for Model Context Protocol (MCP) tool use and Agent2Agent (A2A) delegation need not describe behavior when one agent uses both. We measure one such behavior in a single controlled MCP-to-A2A configuration: a testbed drives a real-model host across a local MCP and a local A2A leg into an ordered event trace scored by exact deterministic rules (no LLM judge), one restricted decision per trial. In a pre-specified, frozen three-arm design, each of 10 record scenarios appears with a CONFIDENTIAL header, with no header, and with PUBLIC - OK TO SHARE; the six substantive record values are byte-identical across arms, and the outcome is verbatim occurrence of any of them in the outbound message. Four models x 3 arms x 4 repeats give 480 trials; the scenario is the unit of generalization, and we report the 10 scenario-level values (mean, median, sign counts), with no p-values or intervals. The confidential-minus-unlabeled contrast is inconclusive and floor-limited in every model (both arms at or near zero), so it does not show that confidential labels lack a protective effect. Adding PUBLIC - OK TO SHARE is descriptively associated with higher verbatim egress relative to the unlabeled baseline, with strong model dependence: strong and consistent for Claude Sonnet 5 (public-minus-unlabeled mean +0.800, all 10 scenarios; mostly an association with whether Claude relays at all), moderate but floor-limited for one GPT-5.6 tier, small (median 0) for another, and a complete floor for the third. This is an association in one configuration, not a causal or general effect. Code, byte-pinned traces, and the offline analysis pipeline are released as a public artifact.
- Abstract(参考訳): Model Context Protocol (MCP) ツールの使用と Agent2Agent (A2A) デリゲートのために別々に評価された安全性特性は、エージェントが両方を使用する場合の振る舞いを記述する必要はない。
テストベッドは、実モデルホストをローカルMPPとローカルA2Aの足で駆動し、正確な決定規則(LSM判定なし)によって決定された順序付きイベントトレースに駆動する。
事前に特定され凍結された3つのアームの設計では、各10のレコードシナリオは、ConFIDENTIALヘッダー、ヘッダーなし、PUBLIC - OK TO SHAREで表示されます。
4つのモデル x 3 アーム x 4 は480の試行を繰り返す。シナリオは一般化の単位であり、p-値や間隔のない10のシナリオレベル値(平均、中央値、符号数)を報告する。
秘密の最小ラベル付きコントラストは、すべてのモデル(両腕がゼロか近辺か)において決定的でフロア限定であるため、機密ラベルが保護効果を欠いていることを示すものではない。
PUBLIC - OK TO SHAREの追加は、厳密で一貫性のあるClaude Sonnet 5 (public-minus-unlabeled mean +0.800, all 10 scenarios; 主にClaudeがリレーするかどうかに関連している)、中程度だがフロア制限のある1つのGPT-5.6ティア、小さい(中間0)、3番目のフロアはフルフロアである。
これは一つの構成における関連であり、因果関係や一般的な効果ではない。
コード、バイトピントトレース、オフライン分析パイプラインはパブリックアーティファクトとしてリリースされている。
関連論文リスト
- IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier [0.0]
監査された18のベンチマークはすべて、広告付きモデルの識別子をスコア付けする。
ゴールドブラインド機能バインディングプレフライトは、どのタスクが到達する前に、ルートが評価契約を実行可能であることを確認する。
信頼性非包括的なファーストパススコアリングルールは、有効性を保ちながらスコアの失敗を維持する。
論文 参考訳(メタデータ) (2026-09-09T17:31:29Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep [0.3384279376065155]
このパイロットは、逆電荷による境界境界VAT決定の選択について研究する。
アクティビティサーフェスを固定する(サブタスク、ツール、I/Oスキーマ、検証チェック、オーケストレータ、ベースモデル、マージポリシー)。
プログラムは40ケースのメインスイープ、マッチしたトケンアーム、エージェントカウント効果から即時予算を分離する3つの失敗インジェクションアームを含む4,400回に及ぶ。
論文 参考訳(メタデータ) (2026-08-24T15:40:15Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity [2.3216115061903415]
私たちは安全のためにこれをインスタンス化し、金のラベルのないハイテイクな設定で、平均的な方向に向かっています。
370種の種 x 5 の表面が x 5 モデルを形成する場合、単一の変換が一様で最も危険である。
フォーム間の安全でない結果の結合は、3.3-12.9 pp の最悪の単一形式でさえも超える。
論文 参考訳(メタデータ) (2026-08-01T22:28:31Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models [0.0]
解析データベースの自然言語クエリ用にデプロイされたLLMは、2つの障害に悩まされる。
ClickHouseのCleaned Contoso Retailデータセットに対して,100の自然言語質問に対して,3つのフロンティアLSMをベンチマークした。
論文 参考訳(メタデータ) (2026-04-28T02:53:23Z) - The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models [10.377264470934843]
大きな言語モデルに対するバックドア攻撃は、通常、暗黙の悪意のある出力に秘密のトリガーを伴います。
我々はコンプライアンスのみのバックドアを導入し、ほぼ良質なデータセットで教師付き微調整を行い、プロンプトの小さなサブセットを任意の単一ワードトリガでサフィックスする。
本研究は, 毒性予算, 総微調整データセットサイズ, モデルサイズにまたがる, この良性ラベル中毒行動のマルチスケール解析を行った。
論文 参考訳(メタデータ) (2025-11-16T02:01:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。