論文の概要: GraphFlow: An Architecture for Formally Verifiable Visual Workflows Enabling Reliable Agentic AI Automation
- arxiv url: http://arxiv.org/abs/2605.14968v1
- Date: Thu, 14 May 2026 15:33:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.915614
- Title: GraphFlow: An Architecture for Formally Verifiable Visual Workflows Enabling Reliable Agentic AI Automation
- Title(参考訳): GraphFlow: 信頼性の高いエージェントAI自動化を実現する、形式的に検証可能なビジュアルワークフローのためのアーキテクチャ
- Abstract要約: GraphFlowは、ミッションクリティカルなプロセスにおけるエージェントAI自動化の信頼性向上を目的とした、ビジュアルワークフローシステムである。
既存のワークフロープラットフォームは、耐久性のある実行と可観測性を提供するが、セマンティックな正確性を保証するものはほとんどない。
3つの臨床現場で1年間のパイロットが8,728件のコホート登録ワークフローを実行し、97.08%の完成率を記録した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GraphFlow is a visual workflow system designed to improve the reliability of agentic AI automation in multi-step, mission-critical processes. In these workflows, small errors compound rapidly: under an idealized model of independent steps, a ten-step process with 90% per-step reliability completes successfully only 35% of the time. Existing workflow platforms provide durable execution and observability but offer few semantic correctness guarantees, while agentic systems plan at inference time, making behavior sensitive to prompt variation and difficult to audit. GraphFlow is designed to address this gap by treating workflow diagrams as the executable specification, a single artifact defining data scope, execution semantics, and monitoring. At compile time, a restricted class of diagrams is specified to produce reusable automations whose contracts (preconditions, postconditions, and composition obligations) are intended to be proof-checked before admission to a shared library. At runtime, a durable engine records outcomes in an append-only event log and can enforce contracts at system boundaries, supporting replay, retries, and audit. Swimlanes make trust boundaries explicit, separating verified logic from external systems, human judgment, and AI decisions. A year-long pilot across three clinical sites executed 8,728 cohort-enrolled workflow runs with a 97.08% completion rate under an early prototype without the verified-core subsystem; observed failures were localized primarily to external integrations. The formal semantics and proof-checked admission model described here are specified and under active development. Evaluation of the verified core is reserved for future work.
- Abstract(参考訳): GraphFlowは、マルチステップでミッションクリティカルなプロセスにおけるエージェントAI自動化の信頼性向上を目的とした、ビジュアルワークフローシステムである。
これらのワークフローでは、小さなエラーが急速に複雑になる: 独立したステップの理想化されたモデルの下では、90%の信頼性を持つ10ステップのプロセスが、わずか35%の時間で完了する。
既存のワークフロープラットフォームは、耐久性のある実行とオブザーバビリティを提供するが、セマンティックな正確性を保証することは少ない。
GraphFlowは、ワークフロー図を実行可能な仕様として扱い、データスコープ、実行セマンティクス、監視を定義する単一のアーティファクトとして扱うことで、このギャップを解決するように設計されている。
コンパイル時に制限されたダイアグラムのクラスが指定され、共有ライブラリに入る前に、契約(条件、条件、条件、構成義務)が証明チェックされることを意図した再利用可能な自動化を生成する。
実行時に、耐久性のあるエンジンは追加のみのイベントログに結果を記録し、リプレイ、リトライ、監査をサポートするシステムバウンダリでコントラクトを強制することができる。
スイムレーンは信頼境界を明確にし、検証済みロジックと外部システム、人間の判断、AI決定を分離する。
3つの臨床現場で1年間のパイロットが8,728件のコホートを登録したワークフローを実行し、検証済みのサブシステムなしで初期プロトタイプで97.08%の完了率で実行した。
ここで述べられている形式的意味論と証明チェックされた受入モデルは、特定され、活発に開発されている。
検証されたコアの評価は、将来の作業のために予約されている。
関連論文リスト
- ContextFlow: In-Context Flow Matching for Robot Manipulation [91.60992853468242]
本研究では,コンテキスト内模倣学習のための連続的な動作分布を学習する条件付きフローマッチングモデルであるContextFlowを紹介する。
LIBEROでは、ContextFlowがICRTを35パーセント上回っている。
実際のロボットでは、シングルアームとバイマニュアルの両方のタスクの見当たらない構成に一般化し、新しいペンアンカッピング構成で40%の成功を達成している。
論文 参考訳(メタデータ) (2026-09-06T21:53:58Z) - Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes [0.0]
タイプされた状態、条件付きルーティング、決定論的ツール、再試行、割り込み、チェックポイント、トレースがどのように適合するかを示すために、実行可能なレシピを3つ提示する。
LangGraphはワークフローの複雑さに適合する位置にあり、普遍的なデフォルトではない。
論文 参考訳(メタデータ) (2026-07-21T17:07:13Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills [14.679874305674156]
FlowEvoはトレーニング不要のフレームワークで、成功したトレースを再利用可能なスキルレコードにコンパイルする。
FlowEvoは,(1)ワークフロー・トゥ・スキルコンパイル,(2)スキル・トゥ・ワークフローフィードバック,(3)スキル・キュレーションの3つの組み合わせによって構成されている。
論文 参考訳(メタデータ) (2026-04-18T06:52:42Z) - Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation [3.225273674498579]
我々は,大言語モデルがコンパイルフェーズ中に実行可能なコードアーティファクトを生成するパラダイムであるコンパイルAIについて研究し,その後,さらなるモデル実行を必要とせずに決定的に実行する。
当社のコントリビューションは、ハイテイクなランタイムエンタープライズへの適用に関するシステム指向の研究です。
論文 参考訳(メタデータ) (2026-04-06T20:25:20Z) - AVDA: Autonomous Vibe Detection Authoring for Cybersecurity [0.1633272850273525]
AVDAは、モデルコンテキストプロトコル(MCP)を活用して、組織コンテキストをAI支援コード生成に統合することで検出を自動化するフレームワークである。
我々は,多種多様な生産検出コーパスと最先端LCMの3つのオーサリング戦略 – Baseline, Sequential, Agentic – を評価した。
その結果,エージェント品質の87%をトークンコストの40倍以下で達成できた。
論文 参考訳(メタデータ) (2026-03-26T21:52:33Z) - TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization [4.62716665682001]
TopoPilotは、複雑な科学的視覚化を自動化するための信頼性が高くエージェント的なフレームワークである。
TopoPilotは、信頼性の高い運用を保証するために、系統的なガードレールと検証メカニズムを組み込んでいる。
評価では、TopoPilotは99%以上の成功率を達成したが、ベースラインでは50%以下で、包括的なガードレールやチェックがない。
論文 参考訳(メタデータ) (2026-03-26T05:56:53Z) - RuntimeSlicer: Towards Generalizable Unified Runtime State Representation for Failure Management [23.96013849484881]
メトリクス、トレース、ログは、システム実行時の振る舞いを補完するビューを提供する。
Slicerは、メトリクス、トレース、ログを1つの整列したシステム状態の埋め込みにエンコードするタスクに依存しない表現モデルを事前トレーニングする。
State-Aware Task-Oriented Tuningは、ランタイム状態の教師なしパーティショニングを実行し、ダウンストリームタスクに対する状態条件適応を可能にする。
論文 参考訳(メタデータ) (2026-03-23T02:35:13Z) - GraphBit: A Graph-based Agentic Framework for Non-Linear Agent Orchestration [34.588097323063074]
GraphBitは、明示的に決定的に有向非巡回グラフ(DAG)として定義するエンジンオーケストレーションフレームワークである。
インシデントオーケストレーションとは異なり、GraphBitのエージェントは型付き関数として動作し、Rustベースのエンジンはルーティング、状態遷移、ツール呼び出しを制御し、監査性を保証する。
一時的なスクラッチスペース、構造化状態、外部コネクタで構成される3層メモリアーキテクチャは、ステージ間でコンテキストを分離し、長時間実行中のパイプラインにおける推論を低下させるカスケードコンテキストを防止する。
論文 参考訳(メタデータ) (2026-03-08T18:32:28Z) - Causify DataFlow: A Framework For High-performance Machine Learning Stream Computing [0.0]
我々は、無制限の時系列データ上に機械学習システムを構築し、テストし、デプロイするための計算フレームワークであるDataFlowを紹介する。
従来のデータサイエンスは有限データセットを前提としており、バッチプロトタイプからストリーミングプロダクションシステムに移行する際には、かなりの再実装が必要である。
DataFlowは、ポイント・イン・タイムの理想性を持つ非循環グラフに基づいて、これらの問題を統一された実行モデルで解決する。
論文 参考訳(メタデータ) (2025-12-30T04:24:04Z) - DyFlow: Dynamic Workflow Framework for Agentic Reasoning [79.19799197382478]
DyFlowは動的ワークフロー生成フレームワークで、タスク要求とリアルタイム中間フィードバックに基づいて推論手順を適応的に構築し、調整する。
社会的推論,生物医学的タスク,数学的問題解決,コード生成など,さまざまな領域でDyFlowを体系的に評価する。
結果は、DyFlowが既存のベースラインを大幅に上回り、Pass@kの改善を実現し、さまざまなドメインにわたって堅牢な一般化を示すことを示した。
論文 参考訳(メタデータ) (2025-09-30T10:36:23Z) - Benchmarking Agentic Workflow Generation [80.74757493266057]
複数面シナリオと複雑なグラフワークフロー構造を備えた統合ワークフロー生成ベンチマークであるWorfBenchを紹介する。
また,サブシーケンスとサブグラフマッチングアルゴリズムを利用したシステム評価プロトコルWorfEvalを提案する。
我々は、生成されたタスクが下流のタスクを強化し、推論中により少ない時間で優れたパフォーマンスを達成することを観察する。
論文 参考訳(メタデータ) (2024-10-10T12:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。