論文の概要: Specifying and Maintaining Agentic Workflows: An Empirical Study of GitHub Agentic Workflows
- arxiv url: http://arxiv.org/abs/2609.27263v1
- Date: Wed, 23 Sep 2026 02:47:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.847394
- Title: Specifying and Maintaining Agentic Workflows: An Empirical Study of GitHub Agentic Workflows
- Title(参考訳): エージェントワークフローの特定とメンテナンス - GitHubエージェントワークフローの実証的研究
- Abstract要約: GitHub Agentic Churns(gh-aw)は、個々のタスクのためのAIエージェントのプロンプトから、エージェントが自動的に実行する繰り返し作業の定義まで、ソフトウェア開発を可能にする。
276のリポジトリから1,248のファイル、20,841のコミットファイルイベント、および294のサンプルから288の解決された命令ラベルセットを分析した。
その結果、ワークフロー命令は短いプロンプトを超えて、62.1%のファイルで556.5ワードとコードブロックが中央値であることがわかった。
- 参考スコア(独自算出の注目度): 2.9773286961673637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic workflows shift software development from prompting AI agents for individual tasks to defining recurring work that agents execute automatically. GitHub Agentic Workflows (gh-aw) enables this approach through Markdown files that combine natural-language instructions with configuration and compile into executable GitHub Actions workflows. Unlike conventional workflows that primarily prescribe scripted operations, these files delegate tasks requiring interpretation to AI agents. They also couple agent instructions with execution triggers, making those instructions operational specifications for repeated repository activities. However, how developers structure and maintain these specifications, and which execution requirements and safeguards they express, remains insufficiently understood. In this paper, we examine the structure, evolution, and instruction content of gh-aw Markdown files to inform how practitioners define and maintain agent-run work. We analyze 1,248 files from 276 repositories, 20,841 commit-file events, and 288 resolved instruction-label sets from a sample of 294 files. Our results show that workflow instructions extend beyond short prompts, with a median of 556.5 words and code blocks in 62.1% of files. Among files with at least 120 days of observed activity, 78.2% still receive updates in month 4, while size-normalized churn decreases after the first month. Tasks, outputs, constraints, and process instructions each appear in over 93% of labeled workflows, yet only 9.4% explicitly address prompt-injection defense. LLM classification achieves an F1 score of 0.818 and Cohen's Kappa of 0.715 against the resolved human labels. These findings suggest that developers should account for the evolution of workflows copied or referenced across repositories and consider adding prompt-injection defenses, resource budgets, and evidencecredibility checks where applicable.
- Abstract(参考訳): エージェントワークフローは、AIエージェントによる個々のタスクのプロンプトから、エージェントが自動的に実行する繰り返し作業の定義へと、ソフトウェア開発をシフトさせる。
GitHub Agentic Workflows(gh-aw)は、自然言語命令とコンフィギュレーションを組み合わせたMarkdownファイルを通じてこのアプローチを可能にし、実行可能なGitHub Actionsワークフローにコンパイルする。
スクリプト操作を主とする従来のワークフローとは異なり、これらのファイルはAIエージェントに解釈を必要とするタスクを委譲する。
彼らはまた、エージェント命令と実行トリガーを結合し、それらの命令を繰り返しリポジトリアクティビティの運用仕様を作成する。
しかしながら、開発者がこれらの仕様をどのように構成し、維持し、どの実行要件とそれらが表現するかは、まだ十分に理解されていない。
本稿では, gh-aw Markdownファイルの構造, 進化, 命令内容について検討し, エージェント実行作業の定義と維持方法について報告する。
276のリポジトリから1,248のファイル、20,841のコミットファイルイベント、および294のサンプルから288の解決された命令ラベルセットを分析した。
その結果、ワークフロー命令は短いプロンプトを超えて、62.1%のファイルで556.5ワードとコードブロックが中央値であることがわかった。
観測期間が120日以上あるファイルのうち、78.2%は月4で更新を受けており、サイズが正規化されたチャーンは最初の1ヶ月で減少する。
タスク、アウトプット、制約、プロセス命令はそれぞれラベル付きワークフローの93%以上に表示されるが、プロンプト・インジェクションの防御には9.4%しか対応していない。
LLM分類ではF1スコアは0.818、コーエンのKappaは0.715である。
これらの結果は、開発者はリポジトリ間でコピーまたは参照されるワークフローの進化を考慮し、迅速なインジェクションディフェンス、リソース予算、エビデンスクレダビリティチェックを追加することを検討するべきであることを示唆している。
関連論文リスト
- Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution [23.207195503032136]
Articはアーティファクト駆動のワークフローコンパイラで、自然言語ワークフローをアーティファクト駆動のワークフローに変換する。
Articによるコンパイルでは、クロスモデルや繰り返し実行設定において、32と56のパーセンテージがより一貫性があることが示される。
論文 参考訳(メタデータ) (2026-08-21T17:47:47Z) - COVENANT: Natural-Language Workflow Compilation for Aligned Agent Execution [12.755574564434788]
本稿では,ワークフロー対応エージェント実行のためのコンパイラ・アンド・インタープリタアーキテクチャであるCOVENANTを提案する。
私たちの重要な洞察は、ワークフロー命令をプロンプトではなく、ソースプログラムとして扱うことです。
COVENANTは命令をワークフロー抽象構文木(WAST)に変換し、ワークフロー制御フローグラフ(WCFG)に変換する。
論文 参考訳(メタデータ) (2026-07-28T07:59:50Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - Demystifying and Detecting Agentic Workflow Injection Vulnerabilities in GitHub Actions [13.116427545802571]
GitHub Actionsは、リポジトリ中心のタスクのためのLLMベースのエージェントのデプロイにますます使用されている。
本稿では,ワークフローレベルのインジェクション欠陥であるエージェントインジェクション(AWI)を紹介する。
我々は、実世界のAI支援行動1,033を特徴付け、AWI固有の仕様を抽出する。
これらの仕様に基づいて、信頼できないイベントコンテキストからエージェントプロンプトインプットへのフローを追跡する、テイント分析ツールであるTaintAWIを設計する。
論文 参考訳(メタデータ) (2026-05-08T02:13:04Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents? [3.2610504259514754]
実世界のタスクにコンテキストファイルが有効かどうかを検討する。
コンテクストファイルはリポジトリのコンテキストを提供しないのに比べてタスクの成功率を低下させる傾向がある。
我々は、コンテキストファイルからの不要な要求はタスクを難しくし、人間によるコンテキストファイルは最小限の要求だけを記述するべきであると結論付けている。
論文 参考訳(メタデータ) (2026-02-12T14:15:22Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding [57.39403818250357]
ここでは,レポジトリベースエージェントコーディングにおける足場認識命令のベンチマークを行うOctoBenchを紹介する。
OctoBenchは34の環境と217のタスクを3つの足場タイプでインスタンス化し、7,098の客観的チェックリストアイテムとペアリングする。
実験により、タスク解決と足場対応の体系的なギャップが明らかになり、トレーニングと評価の必要性が強調される。
論文 参考訳(メタデータ) (2026-01-15T12:36:08Z) - Agent READMEs: An Empirical Study of Context Files for Agentic Coding [8.019313057979522]
我々は1,925のリポジトリから2,303のエージェントコンテキストファイルを調べ、それらの構造、保守、およびコンテンツを特徴付ける。
これらのファイルは静的なドキュメントではなく、コンフィグレーションコードのように進化し、頻繁で小さな追加によって維持される複雑で読みにくいアーティファクトであることが分かりました。
これらの結果は、開発者がコンテキストファイルを使用してエージェントを機能させる一方で、エージェント記述コードの安全性やパフォーマンスを保証するためのガードレールはほとんど提供せず、ツールやプラクティスの改善の必要性を強調していることを示している。
論文 参考訳(メタデータ) (2025-11-17T02:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。