論文の概要: ECAS: An Edge-Controlled Agentic System for Validation-Gated Scientific Application Execution
- arxiv url: http://arxiv.org/abs/2609.14211v1
- Date: Sun, 13 Sep 2026 00:41:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 12:40:38.823312
- Title: ECAS: An Edge-Controlled Agentic System for Validation-Gated Scientific Application Execution
- Title(参考訳): ECAS: 検証型科学応用のためのエッジ制御エージェントシステム
- Abstract要約: textscECASは、Emphreasoning、Emphcontrol、Emphexecutionを分離する。
textscECASはまた、エキスパートで蒸留されたサイト固有のスキルのエッジ・レジデント・ライブラリをクラウドに公開していない。
- 参考スコア(独自算出の注目度): 0.8452211958182673
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scientific applications increasingly rely on high-performance computing (HPC), yet translating a scientist's high-level goal into a correct target-scale execution remains brittle and labor-intensive. Large language model (LLM) agents promise to automate this, but two obstacles remain: granting a cloud-hosted model direct HPC access exposes credentials and execution authority, while withholding it demands continuous human supervision; and one-shot generation cannot adapt when generated artifacts fail in a site-specific HPC environment. We present \textsc{ECAS}, an \textbf{E}dge-\textbf{C}ontrolled \textbf{A}gentic \textbf{S}ystem for closed-loop execution of scientific computing campaigns with limited human intervention. \textsc{ECAS} separates \emph{reasoning}, \emph{control}, and \emph{execution}: a cloud-hosted LLM proposes plans, artifacts, and repairs; a user-controlled edge agent retains credentials, workflow state, and execution authority while enforcing policy and resource constraints; and the HPC system computes. Its core mechanism is \emph{validation-gated execution}: generated artifacts pass static checks and small-scale validation, failures trigger repairs from sanitized execution feedback, and target-scale execution is permitted only after validation and policy checks pass. \textsc{ECAS} also draws on an edge-resident library of expert-distilled, site-specific skills that is never disclosed to the cloud. In preliminary experiments with three scientific applications on two production ALCF systems under six injected fault types, closed-loop repair improves application success from 0/6 to 6/6 over one-shot generation, validation gating prevents all three observed target-scale failures, and skill conditioning improves success from 4/6 to 6/6. These results show the feasibility of delegating adaptive reasoning to the cloud while retaining execution control at the edge.
- Abstract(参考訳): 科学的応用はハイパフォーマンスコンピューティング(HPC)にますます依存しているが、科学者の高レベルな目標を適切なターゲットスケールの実行に変換することは、脆弱で労働集約的なままである。
大きな言語モデル(LLM)エージェントは、これを自動化することを約束するが、クラウドでホストされたモデルに直接HPCアクセスを与えることは、資格と実行権限を公開すると同時に、継続的な人間の監督を要求することを避け、サイト固有のHPC環境で生成されたアーティファクトが失敗しても、ワンショット生成は適応できない。
本稿では,人間の介入が限定された科学計算キャンペーンのクローズループ実行に対して,textbf{E}dge-\textbf{C}ontrolled \textbf{A}gentic \textbf{S}ystemを提示する。
クラウドでホストされたLCMは計画、アーティファクト、修復を提案し、ユーザ制御のエッジエージェントは、ポリシーとリソース制約を強制しながら認証、ワークフロー状態、実行権限を保持し、HPCシステムは計算する。
生成されたアーティファクトは静的チェックをパスし、小規模のバリデーション、障害はサニタイズされた実行フィードバックから修復をトリガーし、ターゲットスケールの実行はバリデーションとポリシチェックがパスした後のみ許可される。
\textsc{ECAS} はまた、専門家によって蒸留されたサイト固有のスキルのエッジ・レジデント・ライブラリをクラウドに公開していない。
6つのインジェクト障害型下での2つのALCFシステムに対する3つの科学的応用による予備実験において、クローズドループ修復は1ショット世代で0/6から6/6に改善し、バリデーションゲーティングは3つの観測対象規模の障害をすべて防止し、スキルコンディショニングは4/6から6/6に改善した。
これらの結果は、エッジでの実行制御を維持しつつ、適応推論をクラウドに委譲する可能性を示している。
関連論文リスト
- PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis [8.019946418415302]
本稿では, 従来報告されていない動作のスペクトルを, 制約・侵襲的製作(CEF)と呼ぶ。
CEFは、エージェントが不可避な制約の下で動作し、プラウチブルな外部障害物を自発的に作成し、それを事実として提示する場合である。
このスペクトルの極端にConstraint-Evasive Thanatosis (CET) があり、これは可算的な言い訳を発明するのではなく、モデルが完全なシステムクラッシュをシミュレートして、ユーザが完全に切り離すという制限ケースである。
論文 参考訳(メタデータ) (2026-06-12T14:53:42Z) - CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming [23.709197820809436]
我々は、フィードバック駆動型問題解決を停止プロセスとしてモデル化し、偽受け入れリスク、悪いプログラムに対するプログラムレベルの証拠、アクティブな状態の成功リスクの3つの量を特定する。
CP-Agentを生成するために、これらの量をターゲットにしたメカニズムを、デュアルグラニュラリティ検証、テスト拡張、経験駆動型自己進化としてインスタンス化する。
論文 参考訳(メタデータ) (2026-05-23T18:13:41Z) - Exploiting LLM Agent Supply Chains via Payload-less Skills [10.141577783380281]
本稿では、自律的なコーディング環境をターゲットにしたペイロードレスサプライチェーンアタックであるSemantic Compliance Hijacking(SCH)を紹介する。
SCHアプローチは、悪意のある目標を、必要なコンプライアンスルールとしてフォーマットされた非構造化の自然言語命令に変換する。
この発見は、この脅威の広範性を示し、SCHは機密性侵害に対して77.67%の最高成功率を達成した。
論文 参考訳(メタデータ) (2026-05-14T06:55:47Z) - PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents [0.0]
本稿では,ローカル検証条件付きコード生成のための軽量外部コントローラであるPYTHALAB-MERAを紹介する。
厳密な検証ゲートを持つ強化学習コーディングタスクにおけるローカルCLIアーティファクトとしての実装を評価する。
論文 参考訳(メタデータ) (2026-05-08T20:39:32Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - NeuDiff Agent: A Governed AI Workflow for Single-Crystal Neutron Crystallography [10.12215691185414]
NeuDiff Agentは、Spallation Neutron SourceでTOPAZのための管理ツールを使用するAIワークフローとして紹介されている。
NeuDiff Agentは、評価された結晶構造と出版可能なCIFへの還元、統合、精製、バリデーションを通じて、機器データ製品を取得する。
論文 参考訳(メタデータ) (2026-02-18T19:22:01Z) - Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation [36.950993500170014]
本稿では,PoV生成を反復的仮説検証法として再構成するエージェントフレームワークであるDrillAgentを提案する。
我々は、実世界のC/C++脆弱性の大規模なベンチマークであるSEC-bench上でDrillAgentを評価する。
論文 参考訳(メタデータ) (2026-02-14T03:17:27Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。