論文の概要: Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution
- arxiv url: http://arxiv.org/abs/2605.11229v1
- Date: Mon, 11 May 2026 20:45:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.421692
- Title: Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution
- Title(参考訳): コメントとコントロール: コンテキスト中心の進化を通じてエージェントワークフローをハイジャックする
- Authors: Neil Fendley, Zhengyu Liu, Aonan Guan, Jiacheng Zhong, Yinzhi Cao,
- Abstract要約: GitHub Actionsとn8nは、コードレビューやデータ同期といったタスクのためのLarge Language Model (LLM)エージェントを統合する。
敵は、不要なアクションのためにLLMエージェントを操作するために、GitHubイシューコメントなどの特定のインプットを制御し、作成することができる。
本稿では,エージェントランタイムプラットフォームを乗っ取るために,JAWと呼ばれる最初の検出・利用フレームワークを設計する。
- 参考スコア(独自算出の注目度): 13.979573641143212
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automation platforms such as GitHub Actions and n8n are increasingly adopting so-called agentic workflows, which integrate Large Language Model (LLM) agents for tasks such as code review and data synchronization. While bringing convenience for developers, this integration exposes a new risk: An adversary may control and craft certain inputs, such as GitHub issue comments, to manipulate the LLM agent for unwanted actions, such as credential exfiltration and arbitrary command execution. To our knowledge, no prior academic work has studied such a risk in agentic workflows. In this paper, we design the first detection and exploitation framework, called JAW, to hijack agentic workflows hosted on automation platforms via a novel approach called Context-Grounded Evolution. Our key idea is to evolve agentic workflow inputs under the contexts derived from hybrid program analysis for hijacking purposes. Specifically, JAW generates agentic workflow contexts through three analyses: (i) static path-feasibility analysis to identify feasible agent-invocation paths and the input constraints required to trigger them, (ii) dynamic prompt-provenance analysis to determine how that input is transformed and embedded into the LLM context, and (iii) capability analysis to identify the actions and restrictions available to the agent at runtime. Our evaluation of JAW on GitHub workflows and n8n templates showed that 4714 GitHub workflows and eight n8n templates can be successfully hijacked, for example, to leak user credentials. Our findings span 15 widely-used GitHub Actions, including official GitHub Actions for Claude Code, Gemini CLI, Qwen CLI, and Cursor CLI, and two official n8n nodes. We responsibly disclosed all findings to the affected vendors and received many acknowledgements, fixes, and bug bounties, notably from GitHub, Google, and Anthropic.
- Abstract(参考訳): GitHub Actionsやn8nといった自動化プラットフォームでは、コードレビューやデータ同期といったタスクにLLMエージェントを統合するいわゆるエージェントワークフローがますます採用されている。
敵はGitHubのイシューコメントのような特定のインプットをコントロールし、作成して、クレデンシャルの消去や任意のコマンド実行といった不要なアクションのためにLLMエージェントを操作することができます。
我々の知る限りでは、エージェントワークフローにおけるそのようなリスクについて、これまでの学術研究は研究されていない。
本稿では,自動化プラットフォーム上でホストされるエージェントワークフローを,コンテキスト・グラウンドド・エボリューション(Context-Grounded Evolution)と呼ばれる新しいアプローチによってハイジャックする,JAWと呼ばれる最初の検出・利用フレームワークを設計する。
私たちのキーとなるアイデアは、ハイジャックのためのハイブリッドプログラム分析から派生したコンテキスト下でのエージェントワークフロー入力を進化させることです。
具体的には、JAWは3つの分析を通してエージェントワークフローコンテキストを生成する。
i) 実行可能なエージェント呼び出しパスとそれらをトリガーするために必要な入力制約を特定する静的パス実行可能性分析。
(ii)動的プロンプトプロパガンス解析により、その入力がどのようにLLMコンテキストに変換され、組み込まれているかを決定し、
3) 実行時にエージェントが利用可能なアクションと制限を識別する機能解析。
GitHubのワークフローとn8nテンプレートに対するJAWの評価は、4714のGitHubワークフローと8のn8nテンプレートをハイジャックして、ユーザ認証を漏洩させることに成功した。
私たちの発見には、Claude Codeの公式GitHub Actions、Gemini CLI、Qwen CLI、Cursor CLI、および2つの公式n8nノードを含む15の広く使用されているGitHub Actionsが含まれています。
影響を受けるベンダに対するすべての発見を責任を持って公開し、GitHub、Google、Anthropicなど、多くの承認、修正、バグ報奨金を受け取りました。
関連論文リスト
- Demystifying and Detecting Agentic Workflow Injection Vulnerabilities in GitHub Actions [13.116427545802571]
GitHub Actionsは、リポジトリ中心のタスクのためのLLMベースのエージェントのデプロイにますます使用されている。
本稿では,ワークフローレベルのインジェクション欠陥であるエージェントインジェクション(AWI)を紹介する。
我々は、実世界のAI支援行動1,033を特徴付け、AWI固有の仕様を抽出する。
これらの仕様に基づいて、信頼できないイベントコンテキストからエージェントプロンプトインプットへのフローを追跡する、テイント分析ツールであるTaintAWIを設計する。
論文 参考訳(メタデータ) (2026-05-08T02:13:04Z) - From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions [5.590965631053725]
SWE-MIMIC-Benchは生のGitHubディスカッションから生成された課題トラジェクトリデータセットである。
単純な要約とは異なり、このパイプラインはクローズドソース LLM のグループを使用して、きめ細かいタスクを実行する。
我々は,SWE-Bench-Pro,SWE-Bench-Multilingual,SWE-Bench-Verifiedデータセットから抽出した実世界のGitHub問題800件について評価を行った。
論文 参考訳(メタデータ) (2026-04-28T17:21:46Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - LLM-Augmented Release Intelligence: Automated Change Summarization and Impact Analysis in Cloud-Native CI/CD Pipelines [0.0]
クラウドネイティブなソフトウェアデリバリプラットフォームは、数十の独立したバージョン管理タスクで構成される複雑なマルチステージパイプラインを通じて、リリースをオーケストレーションする。
このようなリリースコミュニケーションのマニュアル準備は遅く、一貫性がなく、特にリポジトリではエラーが発生します。
1) 自動コミット収集とセマンティックフィルタリングを併用して,定期的なメンテナンスを抑えながら実体的変化を表面化する,(2) 階層化された大規模言語モデル要約による分類,利害関係者指向のプロモーションレポートの生成,(3) 修正タスクを参加者が参加するパイプライン毎にマップする静的タスク-パイプライン依存性分析, そして各変更のブラスト半径を定量化する,という3つの機能を組み合わせたAI強化リリースインテリジェンスのためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-15T21:30:52Z) - Unpacking Security Scanners for GitHub Actions Workflows [2.046588369793562]
GitHub Actionsは広く使われているプラットフォームで、開発者はプロジェクトのビルドとデプロイを自動化することができる。
プラットフォームの人気が高まり続けており、近年のソフトウェアサプライチェーン攻撃のターゲットとなっている。
GitHub Actionsの強化を支援するために、いくつかのセキュリティスキャナが登場した。
論文 参考訳(メタデータ) (2026-01-20T20:25:11Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z) - Automatic Categorization of GitHub Actions with Transformers and Few-shot Learning [12.254055731378045]
GitHub Actions(GHA)は、開発者がパイプラインを作成してメンテナンスするための実用的なツールを提供するために考案されたものだ。
検索エンジンにアクションを公開するために、GitHubは開発者がそれらを1つ以上のカテゴリに手動で割り当てることを可能にする。
私たちはGitHubでアクションの可視性を高めるための実用的なソリューションであるGavelを提案する。
論文 参考訳(メタデータ) (2024-07-24T02:27:36Z) - Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration [64.19431011897515]
本稿では,問題解決のためにソフトウェアリポジトリ全体を包括的に理解し,活用するために設計された,新しいソフトウェアエンジニアリング手法であるAlibaba LingmaAgentを提案する。
提案手法では,重要なリポジトリ情報を知識グラフに凝縮し,複雑さを低減し,モンテカルロ木探索に基づく戦略を採用する。
Alibaba Cloudの製品展開と評価において、LingmaAgentは、開発エンジニアが直面した社内問題の16.9%を自動で解決し、手作業による介入で43.3%の問題を解決した。
論文 参考訳(メタデータ) (2024-06-03T15:20:06Z) - ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code [76.84199699772903]
ML-Benchは、既存のコードリポジトリを利用してタスクを実行する現実世界のプログラミングアプリケーションに根ざしたベンチマークである。
LLM(Large Language Model)とAIエージェントの両方を評価するために、事前に定義されたデプロイメント環境でLLMのテキスト-コード変換を評価するML-LLM-Benchと、Linuxサンドボックス環境でエンドツーエンドのタスク実行で自律エージェントをテストするML-Agent-Benchの2つの設定が採用されている。
論文 参考訳(メタデータ) (2023-11-16T12:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。