論文の概要: REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows
- arxiv url: http://arxiv.org/abs/2609.00643v1
- Date: Tue, 01 Sep 2026 03:22:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.266327
- Title: REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows
- Title(参考訳): REVISE: エージェントワークフローにおけるオンラインリビジョンのためのバリデーションガイド付きリカバリ
- Authors: Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen, Yirui Liu,
- Abstract要約: textscReviseは構造化エージェントのきめ細かい回復に有効である。
無効な作業を止め、最初期の紛争を超えて有効に確立された進捗を保ち、影響を受けた地域のみを再計算する。
モデルコールをフルリスタートに対して40.6--56.0%、サフィックス再計算に対して31.3--43.6%削減する。
- 参考スコア(独自算出の注目度): 5.5444120195759785
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent revisions expose a fundamental correctness--efficiency trade-off during concurrent execution. Discarding ongoing work preserves latest-version correctness but wastes progress that may remain valid, whereas reusing prior work preserves efficiency but risks propagating stale state into outputs and tool effects. Existing recovery strategies resolve this trade-off in an imbalanced way with coarse-grained policies: they either favor efficiency by allowing potentially stale work to continue, or favor correctness by restarting the workflow or recomputing a linear suffix from the earliest conflict, thereby discarding unaffected progress. We present \textsc{Revise}, a validity-guided runtime for fine-grained recovery in structured agent workflows. When a revision arrives, \textsc{Revise} first intersects its delta with recorded data and control dependencies and propagates the resulting impact through the partially executed DAG to identify affected work. It then stops invalid work, preserves validity-established progress beyond the earliest conflict, and recomputes only the affected region. Incomplete provenance conservatively expands recovery, while reused results are revalidated before commit. Analysis of real coding-agent traces show online recovery opportunities: 118 sessions retain observable work before a queued later message is delivered; across 167 overlapping assistant responses, enqueue-to-completion overlap reaches 56.55~s at p95. Across 300 challenging revision/commit executions, \textsc{Revise} matches a latest-version oracle with no stale outputs or effects. On unmodified LangGraph and LLMCompiler applications using Qwen3-14B, it reduces model calls by 40.6--56.0\% relative to full restart and by 31.3--43.6\% relative to suffix recomputation. Under serving pressure, it further reduces revision-to-correct-completion tokens by 13.26\% and improves SLO goodput by 3.07--5.43\%.
- Abstract(参考訳): エージェントのリビジョンは、実行時の基本的な正しさ-効率のトレードオフを明らかにする。
進行中の作業に注意することは、最新のバージョン正しさを保っているが、有効であるかもしれない進歩を無駄にし、一方、以前の作業の再利用は効率を保っているが、古い状態をアウトプットやツールエフェクトに伝播させるリスクがある。
既存のリカバリ戦略は、このトレードオフを粗大な政策と不均衡な方法で解決する: 彼らは、潜在的に不安定な作業の継続を許すことによって効率を優先するか、ワークフローを再起動するか、初期の紛争から線形接尾辞を再計算することで正しさを優先する。
本稿では、構造化エージェントワークフローのきめ細かいリカバリのための妥当性誘導型ランタイムであるtextsc{Revise}を提案する。
リビジョンが到着すると、 \textsc{Revise} はそのデルタと記録されたデータとコントロールの依存関係を最初に交わし、部分的に実行されたDAGを通じて影響を伝播して、影響を受ける作業を特定する。
その後、無効な作業を停止し、最初期の紛争を超えて妥当性が確立された進捗を保ち、影響を受けた地域のみを再計算する。
不完全な成果は回復を保守的に拡張し、再利用された結果はコミット前に再評価される。
118のセッションは、キューされた後続のメッセージが配信される前に観測可能な作業を保持し、167のオーバーラップしたアシスタント応答において、待ち行列と補完のオーバーラップは、p95で56.55~sに達する。
300の挑戦的なリビジョン/コミットの実行に対して、 \textsc{Revise}は、古い出力やエフェクトのない最新のバージョンオラクルとマッチする。
Qwen3-14Bを使用した無修正のLangGraphおよびLLMCompilerアプリケーションでは、完全な再起動に対して40.6--56.0\%、サフィックス再計算に対して31.3--43.6\%のモデルコールを削減している。
サーブプレッシャーの下では、リビジョン・トゥ・コレクション・コンプリートトークンを13.26\%削減し、SLO出力を3.07--5.43\%改善する。
関連論文リスト
- PURA: Provably Unbiased and Robust Multi-Bit Watermarking for AI-Generated Text Attribution [83.66032773976904]
PURAは、テキスト属性に対する不偏で頑健なマルチビット透かし方式である。
PURAはトークンの確率を直接摂動するのではなく、鍵付き逆変換サンプリングによって潜在サンプリング空間にペイロードを埋め込む。
PURAは、高負荷体制において、既存の非バイアスベースラインを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2026-08-23T04:44:27Z) - Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework [49.16055123488827]
大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
論文 参考訳(メタデータ) (2026-08-09T22:59:13Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation [27.0859707906163]
AgentTetherは実行時修復フレームワークで、基礎となるエージェントや環境を変更することなく、実行後の診断とガイド付きリカバリを自動化する。
オフラインのノーマルビヘイビアモデルとランローカルグラフ検出器を組み合わせることで、障害クリティカルなサブトラジェクトリをローカライズする。
オフラインの診断とガイダンスツールとして、あるいはオンラインの修復レイヤとしてデプロイできる。
論文 参考訳(メタデータ) (2026-07-07T13:40:31Z) - Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents [99.67681154381803]
Test-time Rule Acquisition and Compiled Enforcement (TRACE)は、コーディングエージェントランタイムのためのスキル層パイプラインである。
開発者が事前に記述した実行時チェックとは異なり、TRACEスキルはユーザのチャット修正に由来する。
論文 参考訳(メタデータ) (2026-06-11T10:43:40Z) - Regimes: An Auditable, Held-Out-Gated Improvement Loop Demonstrated on LongMemEval with ActiveGraph [0.0]
イベントソースのエージェントランタイムは、制御された改善をファーストクラスのワークフローに変換する。
エージェントの状態が追加のみのイベントログの決定論的プロジェクションである場合、障害が記録され、実行がログから正確にリプレイされ、候補パッチスコープがタイプされたパイプラインシームに反映され、ゲートが監査可能である。
我々は、ActiveGraphランタイムのループであるRegimesでこれを実証し、失敗した評価を診断し、パイプラインポイントで修復を提案し、静的チェック、サンドボックスの実行、インサンプル評価、ホールドアウトバリデーションの後にのみそれを促進します。
論文 参考訳(メタデータ) (2026-06-08T23:04:35Z) - SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows [16.693609667845948]
SKILL.nbは,エビデンス・リバース・キャリブレーションによるライフサイクルポリシーによる再利用可能なエージェント管理のためのフレームワークである。
SKILL.nbは選択的な形式化を使用する: 実行はどのワークフローステップを実行可能なコードにするかを決定する。
ゲート条件付き実行では、各ステップがゲートの検証時にコードを実行したり、ドリフトが実行可能実現を無効にした場合にローカルにフォールバックすることが可能になる。
論文 参考訳(メタデータ) (2026-06-06T08:27:18Z) - From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work [0.10312968200748114]
本稿では,AIネイティブな作業が人工物生成計算の有向非巡回グラフ(DAG)として表現される実行モデルを提案する。
制御された2つのポリシーメモ更新タスクにおいて、ループ中心の更新ベースラインに対する実行行リプレイを比較した。
論文 参考訳(メタデータ) (2026-05-07T14:39:37Z) - ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning [12.44509691077682]
本稿では,繰り返し発生する障害をプロセス知識グラフのシンボル編集に変換する神経シンボルエージェントであるANNEALを紹介する。
その中核となるメカニズムであるFDKA(Failure-Driven Knowledge Acquisition)は、責任のあるオペレータをローカライズし、制約付きLLM生成を通じて型付きパッチを合成し、提案を検証する。
4つのドメインと27のマルチシードランをまたいだANNEALは、永続的な構造修復を行う唯一の評価システムである。
論文 参考訳(メタデータ) (2026-05-04T05:24:03Z) - Outcome-Conditioned Reasoning Distillation for Resolving Software Issues [49.16055123488827]
本稿では, 検証済みパッチを監督として, リポジトリ内問題を解決したO-CRD(Outcome-Conditioned Reasoning Distillation)フレームワークを提案する。
歴史的修正から始まり、検証結果から段階的な修理トレースを後方に再構築する。
SWE-Bench Liteでは、GPT-4oではPass@1が10.4%、DeepSeek-V3では8.6%、GPT-5では10.3%増加する。
論文 参考訳(メタデータ) (2026-01-30T18:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。