論文の概要: Maat: Independent Deterministic Contract-Based Governance for Multi-Agent LLM Workflows
- arxiv url: http://arxiv.org/abs/2609.34017v1
- Date: Sun, 27 Sep 2026 23:23:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 07:43:02.603346
- Title: Maat: Independent Deterministic Contract-Based Governance for Multi-Agent LLM Workflows
- Title(参考訳): Maat:マルチエージェントLLMワークフローのための独立決定論的契約ベースガバナンス
- Abstract要約: 私たちは、バージョン管理されたワークフロー契約アンカーに対してエージェントからエージェントへのハンドオフを検証するランタイムガバナンス層であるMaatを紹介します。
データレベルの欠陥を注入した6つの制御ドメイン(6~15エージェント、522トライアル)と決定論的7チェックルーブリックで評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-language-model multi-agent systems (LLM-MAS) introduce a characteristic reliability problem: an error produced by one agent can be accepted as context by downstream agents and propagate across the workflow. Many proposed safeguards rely on learned or LLM-based judges whose verdicts are themselves probabilistic; we ask whether a deterministic layer can instead stop contract-detectable handoff defects. We present Maat, a runtime governance layer that validates agent-to-agent handoffs against a versioned workflow contract, or anchor, with no language model in the validation or scoring path. We evaluate it in six controlled domain workflows (6-15 agents, 522 trials) with injected data-level defects and a deterministic seven-check rubric. Version 1 reported gains in all six workflows (2.9-26.5%). A post-publication audit found that three benchmark scorers credited any early halt as a prevented defect. On paired trials where the governed run completed or halted on a finding attributable to a verified defect, the rubric score changes by +7.7% to +29.1% in five workflows and is flat in software development; model-call cost falls 17-53% where attributable halts occur early. A hand review of all 94 governed-arm halts found 35 false alarms (37%), caused by validator defects rather than model behaviour; counting those halts as failed work, the governed arm scores below the ungoverned arm in four of six workflows. The results support deterministic handoff validation for contract-expressible defects and show that validator configuration and halt attribution must themselves be tested; they do not establish universal correctness, hallucination detection, or model-independent effectiveness.
- Abstract(参考訳): 大規模言語モデルマルチエージェントシステム(LLM-MAS)は、あるエージェントが生成したエラーを、下流エージェントによってコンテキストとして受け入れ、ワークフローを伝搬する。
多くのセーフガードの提案は、検証が確率的である学習またはLLMベースの判断に依存しており、決定論的層が代わりにコントラクト検出可能なハンドオフ欠陥を阻止できるかどうかを問う。
私たちは、バージョン管理されたワークフロー契約に対してエージェントからエージェントへのハンドオフを検証するランタイムガバナンス層であるMaatを紹介します。
データレベルの欠陥を注入した6つの制御ドメインワークフロー(6~15エージェント、522トライアル)と、決定論的7チェックルーブリックで評価した。
バージョン1では、すべての6つのワークフロー(2.9-26.5%)で改善が報告された。
公開後の監査では、3人のベンチマークスコアラーが早期停止を予防欠陥と認定した。
検証された欠陥に起因する発見に対して、管理された実行が完了または停止したペアトライアルにおいて、ルーブリックスコアは5つのワークフローにおいて+7.7%から+29.1%に変化し、ソフトウェア開発においてフラットである。
94件の腕停止のハンドレビューでは、モデルの動作よりもバリケータの欠陥が原因で、35件の誤報(37%)が見つかった。
その結果、コントラクト表現可能な欠陥に対する決定論的ハンドオフ検証をサポートし、バリデータの設定と停止属性自体をテストする必要があることを示し、普遍的正当性、幻覚検出、モデル非依存の有効性を確立していない。
関連論文リスト
- Persuaded, Not Informed: Incentive-Misaligned Witnesses Defeat In-Context Grounding [0.0]
より強力なモデルで対処されていない障害モードを特定します。
文脈が楽観主義へのインセンティブを持つ当事者による主張を含む場合、モデルはこの主張を証拠として扱い、明確化は会社の記録を容認できないとみなす。
論文 参考訳(メタデータ) (2026-09-23T23:52:24Z) - Engineering Reliable Commit Gates for Agentic AI: Cost-Aware Verification Portfolios under Common-Mode Data Failures [4.287745257410248]
コスト対応コミットゲートのランタイム保証ベンチマークを提案する。
48のタスクテンプレートは、6つの障害レジームで2,880のシナリオを生成する。
結果は明確なエビデンスライン、コストアウェアの選択、コミットタイムの実施を動機付けます。
論文 参考訳(メタデータ) (2026-09-10T01:42:40Z) - AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents [2.8000808592516293]
AgentAuditは10の能力、グラウンド、セキュリティ、振る舞いの次元にわたって、実行トレース全体を評価する。
記録された実行トレースのみを読み出し、エージェントの実行方法に干渉しない。
我々は,9つの言語モデル(OpenAI GPT-5, Claude Sonnet 5, Sarvam 105B, Llama 3.3 70B, Gemini 2.5 Flash)を,9つの能力と対向タスクで評価した。
論文 参考訳(メタデータ) (2026-09-09T08:29:16Z) - Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation - Identity Adequacy and Evidence Adequacy [0.0]
本報告では,81回にまたがる147件の番号付インシデントに対して,生産エージェント型ソフトウェアデリバリプラットフォームが故障したことを報告する。
50-4連続して成功したツールコールのループには、エラーレートブレーカが見つからない。
メッセージではなくデリゲートを執行単位とする7つの信頼性プリミティブを導出します。
論文 参考訳(メタデータ) (2026-08-26T15:38:21Z) - Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency [0.025718125188898048]
我々は,現時点のタスクを個別に保持するプロセスベンチトレースに対して,擬似アラームを計測する。
完了した監査 -> モデルのコンテキストにすでにある修復エピソードは、15のモデルxワードの組み合わせのうち15の偽のアラームを低くする。
論文 参考訳(メタデータ) (2026-08-17T01:41:43Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。