論文の概要: Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers
- arxiv url: http://arxiv.org/abs/2608.03836v2
- Date: Thu, 06 Aug 2026 15:41:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.73217
- Title: Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers
- Title(参考訳): Resume Means Resume: ワークフローパーシステンス層におけるチェックポイント、インターバル、リサムセマンティクスのためのマシンクリックコンフォーマンス契約
- Abstract要約: 実行状態を維持して、実行を中断し、クラッシュを生き残るためのフレームワークは、すでに実行された効果に対して、再開が何を意味するのかを判断し続けなければなりません。
5つの広くデプロイされたエージェントワークフローフレームワークがそれぞれ異なる答えを出し、マシンチェック可能なコントラクトを公開せず、動作が記述するフラグメントにも違反する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A framework that persists execution state so a run can be interrupted, survive a crash, and continue must decide what a resume means for effects that already fired. Five widely deployed agent workflow frameworks answer differently, none exposes a machine-checkable contract, and behavior violates even the fragments they state. The RESUME CONTRACT states six properties over the persistence API (prefix continuation, effect exactly-once, fork determinism, checkpoint validity, consume-once, recovery determinism), plus fork-intent and liveness obligations. A TLA+ model checks a reference semantics exhaustively, unchanged at scaled bounds (7.4 million states); a 39-cell fault matrix and two companion modules yield the separating models independence requires, and consume-once splits, its consumption clause independent of all six others. A deterministic, LLM-free harness measures them at pinned releases. LangGraph 1.2.9 durably records a second resume value and never consults it, persists schema-invalid state silently, and re-executes durably recorded work after a real SIGKILL: exactly-once across interrupts, at-least-once across crashes, on one API. CrewAI 1.15.2 re-executes completed effect-bearing methods against its written claim; pydantic-graph 1.x cannot resume after a mid-node crash; no two probed frameworks share a conformance profile. Consume-once holds sequentially and fails under concurrent delivery: k processes resuming one parked interrupt fire the gated effect k times, saturation 1.0 in 36 of 40 cells, and the failure crosses hosts. REMIT, a reference sequencer whose Verus-verified recovery core is line-identical to the shipped executable, repairs the fork and validity cells. The cross-process cell is repaired at the read path, and that repair ships: an opt-in gate claims consumption in the shared store, serving one racer and refusing the rest before any node executes.
- Abstract(参考訳): 実行状態を維持して、実行を中断し、クラッシュを生き残るためのフレームワークは、すでに実行された効果に対して、再開が何を意味するのかを判断し続けなければなりません。
5つの広くデプロイされたエージェントワークフローフレームワークがそれぞれ異なる回答をし、マシンチェック可能なコントラクトを公開せず、動作が記述するフラグメントにも違反する。
RESUME CONTRACTは、永続化API上の6つのプロパティ(修正継続、エフェクト・オンス、フォーク決定性、チェックポイント妥当性、コンシューム・オンス、リカバリ決定性)とフォークインテントとライブネス義務)を記述している。
TLA+モデルは、スケールした境界(740万状態)で変化のない参照セマンティクスを抜本的にチェックし、39セルのフォールトマトリックスと2つの共役モジュールが独立性を必要とする分離モデルを生成する。
決定論的でLLMのないハーネスは、ピン付きリリースでそれらを計測する。
LangGraph 1.2.9は2度目の再試行値を記録し、決して参照せず、スキーマ非有能な状態を静かに保持し、実際のSIGKILLの後、永続的に記録された作業を再実行する。
CrewAI 1.15.2は、完了したエフェクトベアリングメソッドを再実行し、pydantic-graph 1.xは、中間ノードのクラッシュ後に再開できない。
kプロセスは1つの停止した割り込みを再開し、ゲート効果をk回発射し、飽和1.0を40個の細胞のうち36個にし、障害はホストを横断する。
Verusで検証されたリカバリコアが出荷された実行可能ファイルに線形に識別された参照シーケンサであるREMITは、フォークと有効セルを修復する。
プロセス横断セルはリードパスで修復され、その修復ゲートは共有ストアで消費を請求し、1人のレーサーにサービスを提供し、ノードが実行される前に残りを拒否する。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies [17.09836507714724]
本稿では,凍結視覚言語行動(VLA)ポリシーのためのAGM(Achievement-Grounded Memory)を提案する。
AGMは、タスクをプログレスポインタ付きサブゴールシーケンスとして表現し、現在のサブゴールが物理的証拠によって検証された後にのみ、このメモリを前進させる。
RoboMME Countingベンチマークでは、AGMがPickXTimesとBinFillに到達し、メモリ拡張ベースラインを平均で上回っている。
論文 参考訳(メタデータ) (2026-08-30T03:50:49Z) - Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework [49.16055123488827]
大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
論文 参考訳(メタデータ) (2026-08-09T22:59:13Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives [0.0]
この契約は、広く使用されている6つのオープンソースフレームワークのどれにも当てはまらない。
モデルフリーディファレンシャルプローブは、繰り返し発生するシリングリークを分離する。
SoundGATEは環境外部のRustゲートであり、すべての副作用を認めなければならない。
論文 参考訳(メタデータ) (2026-07-15T05:55:38Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents [0.0]
PortICOは、プランナーに露出する機能のリファレンスモニターである。
明示的なタスクコントラクトを初期機能にコンパイルし、ルールを付与し、信頼できるクロージャ述語、グローバルな否定ルールを付与する。
論文 参考訳(メタデータ) (2026-06-21T13:52:37Z) - Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents [99.67681154381803]
Test-time Rule Acquisition and Compiled Enforcement (TRACE)は、コーディングエージェントランタイムのためのスキル層パイプラインである。
開発者が事前に記述した実行時チェックとは異なり、TRACEスキルはユーザのチャット修正に由来する。
論文 参考訳(メタデータ) (2026-06-11T10:43:40Z) - Regimes: An Auditable, Held-Out-Gated Improvement Loop Demonstrated on LongMemEval with ActiveGraph [0.0]
イベントソースのエージェントランタイムは、制御された改善をファーストクラスのワークフローに変換する。
エージェントの状態が追加のみのイベントログの決定論的プロジェクションである場合、障害が記録され、実行がログから正確にリプレイされ、候補パッチスコープがタイプされたパイプラインシームに反映され、ゲートが監査可能である。
我々は、ActiveGraphランタイムのループであるRegimesでこれを実証し、失敗した評価を診断し、パイプラインポイントで修復を提案し、静的チェック、サンドボックスの実行、インサンプル評価、ホールドアウトバリデーションの後にのみそれを促進します。
論文 参考訳(メタデータ) (2026-06-08T23:04:35Z) - Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks [40.270213696031625]
OverEager-Genは、良質なタスクの振る舞いをオーバーイーガーするベンチマークである。
クロード・コードでは、同意宣言を削除するだけで、オーバーイーガー率は0.0%から17.1%に上昇する。
オーバーイーガー・ジェン(OverEager-Gen)は、入場前に各シナリオの識別力を認定する。
論文 参考訳(メタデータ) (2026-05-18T16:00:41Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management [47.49917373646469]
既存の防御は肥大した記憶を与えられたまま扱い、回復力を維持することに集中する。
我々は、明示的なメモリ管理を通じて間接的なインジェクションを防御するフレームワークであるAgentSysを紹介する。
論文 参考訳(メタデータ) (2026-02-07T06:28:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。