論文の概要: A Telemetry-Driven Model for Quantifying Upgrade Risk in Durable Workflow Execution
- arxiv url: http://arxiv.org/abs/2607.13617v1
- Date: Wed, 15 Jul 2026 09:07:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.715683
- Title: A Telemetry-Driven Model for Quantifying Upgrade Risk in Durable Workflow Execution
- Title(参考訳): 耐久性ワークフロー実行におけるアップグレードリスクの定量化のためのテレメトリ駆動モデル
- Abstract要約: 既存の緩和策は、すべての変更を最大限に危険とみなし、古いバージョンを排水する。
本稿では,飛行中の走行をアップグレードするリスクを定量化する閉形式確率モデルを提案する。
ゼロ後方リスク判定が新しいバージョンの下で安全なリハイドレーションを証明していることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Durable workflow engines reconstruct execution state by deterministically replaying an immutable event log, coupling every in-flight run to the code version that produced its history: a new deployment can invalidate the replay of runs started under the old version, silently corrupting state or halting progress. Existing mitigations -- pinning, patch gates, side-by-side deployment -- treat every change as maximally dangerous and drain old versions, untenable for workflows that sleep for weeks. We present a closed-form probabilistic model that quantifies the risk of upgrading in-flight runs from workflow version $V_1$ to $V_2$ using only a static structural diff and telemetry the protocol already persists -- event logs, step payloads, historical paths -- with no dry-run, sandbox, or shadow execution. Risk decomposes along three axes (protocol, interface, state migration) and combines an exact backward (rehydration) term, computed on recorded prefixes modulo trace equivalence of concurrent completions, with a probabilistic forward term from hitting probabilities in an empirically estimated Markov model of control flow. Estimation is Bayesian throughout, so the Workflow Upgrade Risk (WUR) score carries a credible interval and thin telemetry surfaces as uncertainty. We prove that a zero backward-risk verdict certifies safe rehydration under the new version, and derive a policy partitioning runs into migrate, review, and pin classes. Finally we drop the inter-run independence assumption: coupling through hooks, hierarchy, and shared resources is captured by an empirical coupling graph, fleet risk becomes the least fixpoint of a failure-contagion operator, and the coupling-aware migrate/pin partition is computed exactly as a minimum s-t cut.
- Abstract(参考訳): 永続的なワークフローエンジンは、イミュータブルなイベントログを確定的に再生し、その履歴を生成するコードバージョンに飛行中のすべての実行を結合することで、実行状態を再構築する。
既存の緩和策 -- ピン止め、パッチゲート、サイドバイサイドデプロイメント -- は、すべての変更を最大限危険とみなし、古いバージョンを取り除き、数週間寝ているワークフローには耐えられない。
我々は、ワークフローバージョンである$V_1$から$V_2$へのアップグレードのリスクを定量化する、クローズドフォームの確率モデルを提示します。
リスクは3つの軸(プロトコール、インターフェース、状態移動)に沿って分解され、記録されたプレフィックスで計算された正確な後方(リハイドレーション)項と、同時完了のモジュロトレース同値と、経験的に推定された制御フローのマルコフモデルで確率を打つ確率的前方項を結合する。
評価はベイズ的であり、ワークフローアップグレードリスク(WUR)スコアは信頼性のある間隔を持ち、薄いテレメトリ表面は不確実性である。
ゼロの下位リスク判定は、新しいバージョンの下で安全なリハイドレーションを証明し、ポリシー分割が移行、レビュー、ピンクラスに実行されることを証明します。
最後に, フック, 階層, 共有リソース間の結合を経験的結合グラフで捉え, 艦隊リスクを失敗・感染オペレーターの最小固定点とし, 結合を意識した移行/ピン分割を最小のs-tカットとして正確に計算する。
関連論文リスト
- FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces [32.850551109913845]
大規模言語モデル(LLM)の安全なデプロイにとって、ジェイルブレイク攻撃は依然として重要な脅威である
このプロンプト中心のパラダイムは、ステートフルで関数呼び出し環境における構造的脆弱性を見落としていることを示す。
我々は、シミュレートされたモデレーショントレースに基づくブラックボックス攻撃フレームワークであるSMTを通じて、このアーキテクチャ欠陥を利用する。
論文 参考訳(メタデータ) (2026-07-01T06:08:07Z) - Decoupling Inference from State Updates in Low-Latency Feature Engines via Probabilistic Thinning [6.081561157196023]
確率的シンニングにより、ストリーミング機械学習パイプラインにおける状態永続性からの推論を分離する。
我々は、高頻度のインメモリ制御プレーンやクロスワーカーを使わずに、永続パス制御が実現可能であることを示す。
実験全体では、最大90%のイベントが保存中の永続化パスから除外され、場合によっては下流のユーティリティを改善している。
論文 参考訳(メタデータ) (2026-06-15T17:18:05Z) - Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models [61.74572554094633]
比クリッピングは流れモデルに不適であると主張する。
本稿では,比クリッピングを分岐近位制約に置き換えるFlow-DPPOを提案する。
実験により,フローDPPOはKL近位効率が向上し,高い報酬が得られることが示された。
論文 参考訳(メタデータ) (2026-06-09T15:59:57Z) - GraphFlow: An Architecture for Formally Verifiable Visual Workflows Enabling Reliable Agentic AI Automation [0.0]
GraphFlowは、ミッションクリティカルなプロセスにおけるエージェントAI自動化の信頼性向上を目的とした、ビジュアルワークフローシステムである。
既存のワークフロープラットフォームは、耐久性のある実行と可観測性を提供するが、セマンティックな正確性を保証するものはほとんどない。
3つの臨床現場で1年間のパイロットが8,728件のコホート登録ワークフローを実行し、97.08%の完成率を記録した。
論文 参考訳(メタデータ) (2026-05-14T15:33:05Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - Step-level Optimization for Efficient Computer-use Agents [51.29573359027217]
我々は、強力なコンピュータ利用エージェントは、実際は高価で遅いと論じている。
本稿では,コンピュータ利用エージェントのためのイベント駆動ステップレベルカスケードを提案する。
論文 参考訳(メタデータ) (2026-04-29T19:59:36Z) - Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning [7.445072780282545]
提案するRewind-ILは,生成アクションチャンク模倣ポリシーのためのトレーニングフリーオンラインセーフガードフレームワークである。
Rewind-ILは、TIDE(Temporal Inter-chunk Discrepancy Estimate)に基づくゼロショット故障検知器と、状態再起動機構を結合する。
オンラインのRewind-ILは、重複するアクションチャンクの自己整合性を監視し、チェックポイントライブラリと類似性を追跡し、失敗すると、実行を最新の検証された安全な状態に戻す。
論文 参考訳(メタデータ) (2026-04-17T20:41:14Z) - Unbiased Gradient Estimation for Event Binning via Functional Backpropagation [64.88399635309918]
バックプロパゲーション中に弱微分を合成することにより任意の双対関数の非バイアス勾配推定のための新しいフレームワークを提案する。
自己監督型光流ではECEが9.4%,SLAMでは5.1%低下し,事象に基づく視覚知覚において大きなメリットが示された。
論文 参考訳(メタデータ) (2026-02-13T04:05:03Z) - Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering [0.0]
カオスエンジニアリングはレジリエンスのリスクを明らかにしますが、広く頻繁に実行するには高価で運用上のリスクがあります。
我々は、単純な接続のみのトポロジモデルにより、フェールストップフォールトの下で、高速で低リスクなアベイラビリティー推定を行うことができると主張している。
論文 参考訳(メタデータ) (2025-06-12T10:59:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。