論文の概要: The Provenance Paradox in Multi-Agent LLM Routing: Delegation Contracts and Attested Identity in LDP
- arxiv url: http://arxiv.org/abs/2603.18043v1
- Date: Sun, 15 Mar 2026 17:36:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:05.717953
- Title: The Provenance Paradox in Multi-Agent LLM Routing: Delegation Contracts and Attested Identity in LDP
- Title(参考訳): マルチエージェントLPMルーティングにおける異常パラドックス:デリゲーション契約とLPPにおける証明されたアイデンティティ
- Abstract要約: デリゲートが自己報告された品質スコアをインフレーションできる場合、品質ベースのルーティングは証明されたパラドックスを生成する。
LLM Delegate Protocol(LDP)を拡張し、明確な目的、予算、障害ポリシを通じて権限を束縛する委譲契約を締結します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent LLM systems delegate tasks across trust boundaries, but current protocols do not govern delegation under unverifiable quality claims. We show that when delegates can inflate self-reported quality scores, quality-based routing produces a provenance paradox: it systematically selects the worst delegates, performing worse than random. We extend the LLM Delegate Protocol (LDP) with delegation contracts that bound authority through explicit objectives, budgets, and failure policies; a claimed-vs-attested identity model that distinguishes self-reported from verified quality; and typed failure semantics enabling automated recovery. In controlled experiments with 10 simulated delegates and validated with real Claude models, routing by self-claimed quality scores performs worse than random selection (simulated: 0.55 vs. 0.68; real models: 8.90 vs. 9.30), while attested routing achieves near-optimal performance (d = 9.51, p < 0.001). Sensitivity analysis across 36 configurations confirms the paradox emerges reliably when dishonest delegates are present. All extensions are backward-compatible with sub-microsecond validation overhead.
- Abstract(参考訳): マルチエージェントLLMシステムは、信頼境界を越えてタスクを委譲するが、現在のプロトコルは、検証不可能な品質要求の下でデリゲートを委譲しない。
我々は、デリゲートが自己報告された品質スコアをインフレーションできる場合、品質ベースのルーティングが証明されたパラドックスを生成することを示した。
我々はLDM Delegate Protocol(LDP)を拡張し、明示的な目的、予算、障害ポリシを通じて権限を束縛する委譲契約、証明された品質から自己報告されたアイデンティティモデル、自動回復を可能にする型付き障害セマンティクスを記述した。
10個のシミュレートされたデリゲートと実際のクロードモデルで検証された制御実験では、自己評価された品質スコアによるルーティングはランダム選択よりも悪い(シミュレーション: 0.55 vs. 0.68; 実モデル: 8.90 vs. 9.30)。
36個の構成にまたがる感度解析により、不適切なデリゲートが存在する場合にパラドックスが確実に出現することを確認した。
すべての拡張は後方互換性があり、サブマイクロ秒バリデーションのオーバーヘッドがある。
関連論文リスト
- Safety Invariants for Agents Orchestrating Irreversible State Transitions: A Four-Dimensional Formalism Evaluated on Public Ledgers [0.0]
フォーマリズムを使って、実行忠実性( executionfidelity)と呼ばれる保証を記述し、証明します。
7つの安全不変量は、経験から数えられるのではなく、忠実性条件に由来するもので、保証を解除する。
システムはデプロイされ、8つのチェーンにまたがる108のプロダクション書き込み操作によって、障害分類が復活する。
論文 参考訳(メタデータ) (2026-08-01T17:29:42Z) - DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making [0.7699235580548228]
DFAH-Benchは、金融業者の意思決定における観測可能な行動不安定性を測定するリプレイベンチマークである。
同じツールパスに従っている間、フロンティアモデルは95%の時間で決定に合意できるのは77%に過ぎません。
入力によらず1つの出力に崩壊することでほぼ完全な一致を達成できるパターンマッチング,比較的一貫したツール使用プロセスを持つ安定した実行器,そして物質的に異なるツールパスとエビデンスコンタクトを通じて同じ結論に達する軌道分岐器の3つの挙動プロファイルを同定する。
論文 参考訳(メタデータ) (2026-06-10T03:31:09Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - IMPACT-HOI: Supervisory Control for Onset-Anchored Partial HOI Event Construction [72.51952455865155]
我々は,エゴセントリックなプロシージャビデオに注釈を付けるための混合開始型フレームワークIMPACT-HOIを提案する。
IMPACT-HOIは、このタスクを部分的に指定され、オンセットされたイベント状態の漸進的な解決として捉えている。
9人の参加者によるユーザスタディでは、手動のアノテーションアクションが13.5%減少し、46.67%のイベントマッチレート、確認されたフィールド違反がゼロである。
論文 参考訳(メタデータ) (2026-05-03T01:37:40Z) - SentinelAgent: Intent-Verified Delegation Chains for Securing Federal Multi-Agent AI Systems [0.0]
本稿では、連邦政府のマルチエージェントAIシステムにおけるデリゲートチェーンの検証のための正式なフレームワークであるSentinelAgentを紹介する。
Delegation Chain Calculus (DCC) は7つの特性を定義している。6つの決定論的(権威の狭さ、ポリシーの保存、法的な再構築性、カスケードの封じ込め、スコープ-アクションの適合性、出力スキーマの適合性)と1つの確率的(インテリジェントな保存)である。
Intent-Preserving Delegation Protocol (I PDP)は、非LLM Delegation Authority Serviceを通じて実行時に7つのプロパティをすべて強制する。
論文 参考訳(メタデータ) (2026-04-03T06:25:18Z) - Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models [52.61023005303122]
低信頼度再マッシングは、誘導配列分布のエントロピーを制約しながら、品質のプロキシを改善することを示す。
我々は,デコード時に,この分布をほぼ対象とする簡易なインディペンデント・ハスティングス・サンプリング器を開発した。
論文 参考訳(メタデータ) (2026-04-01T02:01:30Z) - LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems [0.0]
現在のプロトコルでは、モデルレベルのプロパティを第一級プリミティブとして公開していない。
5つのメカニズムを導入したAIネイティブ通信プロトコルであるLDM Delegate Protocol(LDP)を提案する。
アイデンティティを意識したルーティングは、デリゲートの特殊化によって、簡単なタスクの12倍のレイテンシを実現するが、小さなデリゲートプールの集約品質は向上しない。
論文 参考訳(メタデータ) (2026-03-09T19:13:17Z) - ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning [9.381086885165208]
推論時間アンサンブル法は、多様な推論経路をサンプリングしたり、複数の候補解を集約することで、性能を向上させることができる。
本稿では,ALIGN(Aligned Delegation for Multi-Agent LLM Reasoning)という,ALIGN(Aligned Delegation for Multi-Agent LLM Reasoning)を提案する。
提案手法は,候補解に対する等速アクセスと公正に比較した場合,ALIGNが単一エージェント生成よりも期待性能を確実に向上することを示す理論的保証を確立する。
論文 参考訳(メタデータ) (2026-01-28T00:29:21Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Operator: A Protocol for Trustless Verification Under Uncertainty [0.0]
検証ゲームにおいて,コラテラライズされたクレームによる正当性を強制するプロトコルを提案する。
タスクは意図として公開され、解決者はそれらを満たすために競います。
どんな挑戦者でも、検証プロセスのトリガーとして挑戦することで結果に挑戦することができる。
不正なエージェントがスラッシュされ、正しい反対が報われ、誤検証自体を罰するエスカレーションパスが設けられる。
論文 参考訳(メタデータ) (2025-07-01T10:22:35Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - Formalizing the Problem of Side Effect Regularization [81.97441214404247]
本稿では,補助ゲームフレームワークを用いたサイドエフェクト正規化のための公式な基準を提案する。
これらのゲームでは、エージェントは部分的に観測可能なマルコフ決定プロセスを解決する。
このPOMDPは、エージェントが将来的なタスクをこなす能力と、プロキシ報酬を交換することで解決されることを示す。
論文 参考訳(メタデータ) (2022-06-23T16:36:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。