論文の概要: Beyond Object Validation: Relational Conformance in Multi-Artifact Agent Releases
- arxiv url: http://arxiv.org/abs/2607.14155v1
- Date: Tue, 14 Jul 2026 18:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.843662
- Title: Beyond Object Validation: Relational Conformance in Multi-Artifact Agent Releases
- Title(参考訳): オブジェクト検証を超えて: 多要素エージェントリリースにおけるリレーショナルコンフォーマンス
- Abstract要約: 1つのDRSSリリースでは、台帳が60ポイント、証明書が1つ失敗し、100ポイントのゴールドパスが報告された。
私たちは、同じような障害が製品契約になったDocsや、証拠が修復作業に変わるBrand Shuttleとともに、その失敗を研究しています。
本論文は,障害クラスを確立し,いくつかのメカニズムが実用的であることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent systems validate inputs, tool calls, and generated objects. The final package often escapes the same scrutiny. In one DRSS release, the ledger supported 60 points and a failed certificate; the report announced a 100-point Gold Path. Every local gate was green. The package contradicted itself. We study that failure alongside Schema Docs, where similar faults became product contracts, and Brand Shuttle GEO, where evidence is turned into repair work. The result is a candidate Schema-SIP Relational Conformance profile (SIP-RC). It models a release as a graph: claims point to evidence, decisions carry bounded authority, derived artifacts retain their execution conditions and lineage, and published bytes must match the package that was checked. Hard failures cannot be averaged away, and a validator recomputes critical decisions on a separate path. The paper establishes the failure class and shows that several mechanisms are practical. Whether the full profile performs better than existing checks remains an open experiment.
- Abstract(参考訳): エージェントシステムは入力、ツールコール、生成されたオブジェクトを検証する。
最後のパッケージは、しばしば同じ精査から逃れる。
1つのDRSSリリースでは、台帳は60ポイントをサポートし、証明書は失敗し、レポートは100ポイントのゴールドパスを発表した。
すべての門は緑であった。
パッケージ自体が矛盾した。
同じような障害が製品契約になったSchema Docsや,証拠を修復作業に転換したBrand Shuttle GEOとともに,その失敗を調査します。
その結果、スキーマ-SIPリレーショナルコンフォーマンスプロファイル(SIP-RC)が候補となる。
クレームはエビデンスを指し示し、決定は有界な権威を持ち、派生した成果物は実行条件と系統を保持し、発行されたバイトはチェックされたパッケージにマッチしなければならない。
ハード障害を平均化することはできず、バリデーターは別の経路で重要な決定を繰り返す。
本論文は,障害クラスを確立し,いくつかのメカニズムが実用的であることを示す。
完全なプロファイルが既存のチェックよりも優れているかどうかは、まだオープンな実験だ。
関連論文リスト
- From Transient Prompts to Persistent Control: Scientific Poster Generation via Recursive Semantic-Geometric Contracts [67.34566880931716]
PosterVisorは、ポスター生成を一時的なプロンプトから永続的なコントロールに移行するコントロールフレームワークである。
オーケストラは、紙と視覚資産にルーリックを置き、それらをセマンティック幾何学契約にコンパイルする。
Recursive Contract Enforcement (RCE) は証拠が現れると、ステージ全体のチェックを動的にトリガーする。
論文 参考訳(メタデータ) (2026-09-15T15:32:07Z) - SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents [63.65682461568621]
ソフトウェアエンジニアリングエージェントのためのリポジトリレベルのベンチマークであるSWE-Gateを導入し、機能的正当性とともにレビュー制約コンプライアンスを明示的に評価する。
SWE-Gateは、実際のプルリクエストレビューコメントからレビュー制約を導き、これらの制約に関するリポジトリレベルの修復インスタンスを合成する。
各インスタンスは、非準拠およびゴールドパッチとともに、機能テストと制約テストの分離を提供し、イシュー解決能力とレビュー制約コンプライアンスの明確な分離を可能にする。
論文 参考訳(メタデータ) (2026-09-03T17:53:34Z) - Can MCP Clients Decide What to Do After Failure? A Result-Only Actionability Audit [0.0]
本稿では,MCPの故障結果のみから決定論的ソフトウェアが何を学べるかを考察する。
10個のサンプルサーバから安全に21個の障害を誘導する小さな実験において、タイプドフィールドは18件の障害を露呈し、8件の幅広いポリシーを公表した。
語彙ソース監査は、同じテキスト中心のpat-ternを見つける。
論文 参考訳(メタデータ) (2026-08-31T06:45:17Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - The Patchwork Problem in LLM-Generated Code [3.4562767039451674]
本稿では,リポジトリアーティファクトのグラフ表現に対する一貫性不変量として構造コヒーレンスを定式化する。
2つのフロンティアモデルに対する実証的な評価によると、構造的失敗の大部分は、型チェック、テスト、SASTを完全に回避している。
論文 参考訳(メタデータ) (2026-07-09T23:01:54Z) - Can Code Specify a System Precisely Enough to Formally Verify It? [0.0]
本報告では,業務用レストラン・ポイント・オブ・セールシステムの支払ワークフローを実運用ソフトウェアで評価する。
コアプロトコルは、正確に定義された障害モデルの下で手作りのラインアクティベートされたモデルに対して正しい。
生産用サンドボックスの1つのプローブは、全リカバリはしごを到達不能にする応答形状のばらつきを露呈した。
論文 参考訳(メタデータ) (2026-07-06T13:39:00Z) - Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents [0.0]
PortICOは、プランナーに露出する機能のリファレンスモニターである。
明示的なタスクコントラクトを初期機能にコンパイルし、ルールを付与し、信頼できるクロージャ述語、グローバルな否定ルールを付与する。
論文 参考訳(メタデータ) (2026-06-21T13:52:37Z) - Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems [0.6526824510982799]
本稿では,アクション証明書を中心としたランタイム中立ガバナンスモデルであるProof-Carrying Agent Actions (PCAA)を提案する。
PCAAは5つのチェックポイント(事前行動の許容、行動のオープン、仮定のキャプチャ、承認、結果のクロージャ)を統括する。
異種エージェント制御プレーンと開示バウンダリ評価プロトコルの参照実装を用いてモデルについて検討する。
論文 参考訳(メタデータ) (2026-06-02T18:10:35Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - An Executable Benchmarking Suite for Tool-Using Agents [3.5322131912413908]
このスイートは、WebArena Verified、SWE-GymスライスとSWE-bench互換の検証、および一般的なワークロードアダプタを介してMiniWoB++を接続する。
承認されたエビデンスには、レイテンシ、無効動作、パッチ生成コスト、検証済みメタデータ、リプレイバインディング、そして1つの監査可能な契約下での証明が記録されている。
論文 参考訳(メタデータ) (2026-05-10T21:24:53Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence [64.95492752484171]
GenAudit - 文書基底タスクの事実チェック LLM 応答を支援するためのツール。
GenAuditは、レファレンス文書でサポートされていないクレームを修正したり削除したりすることでLCMレスポンスを編集することを提案し、また、サポートしているように見える事実の参照から証拠を提示する。
GenAuditは、さまざまなドメインから文書を要約する際に、8つの異なるLCM出力でエラーを検出することができる。
論文 参考訳(メタデータ) (2024-02-19T21:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。