論文の概要: ASCEND: Personal AI Agents for Autonomous Scientific Computing Across HPC Clusters and GPU Workstations
- arxiv url: http://arxiv.org/abs/2609.32868v2
- Date: Tue, 29 Sep 2026 17:32:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.625585
- Title: ASCEND: Personal AI Agents for Autonomous Scientific Computing Across HPC Clusters and GPU Workstations
- Title(参考訳): ASCEND: HPCクラスタとGPUワークステーションにまたがる自律科学コンピューティングのためのパーソナルAIエージェント
- Abstract要約: ASCEND(Autonomous Scientific Computing Engine and Novel Discovery)はAIを利用したエージェントインタフェースで、研究者自身のラップトップ上でエージェントを実行する。
各リソースのアカウントは十分であり、パブリックインストーラはユーザが自身のSlurmクラスタやワークステーションをリンクすることを可能にする。
本報告では,(1)植込み型テンソルデバイス断層の故障回復ループを閉鎖し,ジョブレベルのアーティファクトの提出,診断,修復,再提出を行い,(2)著者が公表した気象予報モデルの評価を再現した4つの事例を報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Traditional scientific computing requires researchers to translate computational intent into environment configuration, resource requests, and executable jobs, then diagnose failures from scheduler state and application logs. We present ASCEND (Autonomous Scientific Computing Engine and Novel Discovery), an AI-powered agent interface that runs the agent on the researcher's own laptop, reaching Slurm-managed clusters and a GPU workstation over a multiplexed authenticated connection, with site-specific execution policies checked by locally executed tools; the language model is hosted remotely and holds no credentials. No facility-scale service is required: an account on each resource is sufficient, and the public installer lets users link additional Slurm clusters or workstations of their own. We report four recorded cases: (1) the agent closed a failure-recovery loop on a planted tensor-device fault, submitting, diagnosing, repairing and resubmitting with job-level artifacts preserved; (2) it reproduced the published evaluation of a weather-forecasting model from the author's released forecasts, agreeing with the published curves to 2.1% (z500) and 2.4% (t850) while identifying a unit discrepancy in the paper's prose and an initialization-field discrepancy in its released data; (3) it parallelized a released 12,693-line geophysical solver under a bit-for-bit identity requirement, reducing wall-clock runtime from about twelve hours to about two; (4) that requirement exposed two instances of undefined behaviour in the published solver, both repaired and reported upstream. Separately, a pre-specified evaluation of the policy layer found the deployed validator rejected 29 of 30 constructed violations and held the remaining one for approval, while denying 3 of 14 legitimate requests. Autonomy was exercised under author supervision; an end-to-end recovery benchmark remains outstanding.
- Abstract(参考訳): 従来の科学計算では、研究者は計算意図を環境設定、リソース要求、実行可能なジョブに変換し、スケジューラの状態とアプリケーションログから障害を診断する必要がある。
ASCEND(Autonomous Scientific Computing Engine and Novel Discovery)は、研究者自身のラップトップ上でエージェントを実行するAIエージェントインターフェースで、複数の認証された接続上でSlurm管理クラスタとGPUワークステーションに到達し、ローカルに実行されるツールによってサイト固有の実行ポリシーをチェックする。
各リソースのアカウントは十分であり、パブリックインストーラはユーザが自身のSlurmクラスタやワークステーションをリンクすることを可能にする。
本報告では,(1)植込み型テンソルデバイス断層の故障回復ループを閉じ,ジョブレベルのアーティファクトを提出,診断,修復,再提出し,(2)著者の公表した予測から天気予報モデルの公開評価を再現し,論文の原文における単位の差分と初期化フィールドの差分を同定し,(3)公表したデータにおいて,12,693ラインの物理ソルバを並列化し,約12時間から約2時間に短縮し,それぞれが未定義の2つの動作を報告した。
同時に、政策レイヤの事前評価では、30件のうち29件の不正行為を却下し、残りの1件を承認し、14件の正当な要求のうち3件を否定した。
自律性は著者の監督の下で実行され、エンドツーエンドのリカバリベンチマークは未完成のままである。
関連論文リスト
- Evaluating Real-Time Voice Agents: From Component Quality to Grounded Outcomes [0.0]
リアルタイム音声エージェントは、研究プロトタイプから製品展開へと移行してきたが、それらを記述する文献は断片化されている。
本稿では, TRG (Timing-Recovery-ed) について述べる。
論文 参考訳(メタデータ) (2026-09-25T04:22:20Z) - ECAS: An Edge-Controlled Agentic System for Validation-Gated Scientific Application Execution [0.8452211958182673]
textscECASは、Emphreasoning、Emphcontrol、Emphexecutionを分離する。
textscECASはまた、エキスパートで蒸留されたサイト固有のスキルのエッジ・レジデント・ライブラリをクラウドに公開していない。
論文 参考訳(メタデータ) (2026-09-13T00:41:19Z) - Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - DeepInsight II: One Trace from Benchmark to Robot [8.388561928330978]
DeepInsight IIは、その基板を固定し、エンボディされたハーフを定量化する。
MotionBenchは、リリースされている4つのボディコントローラを1つのワークロードとメトリックコントラクトの下に配置する。
合成されたシステム2--1--0の研究は、トレースの局在を5つのエビデンスグラウンドのハンドオフラベルに拡張する。
論文 参考訳(メタデータ) (2026-08-17T13:25:24Z) - Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer [38.62073085926841]
LLMベースのコーディングエージェントはソースコードを編集したり、変更を正当化するための十分なリポジトリ証拠を調べる前にパッチを提出する。
我々は、エビデンス条件付き実行を実行するために、エージェントとレポジトリの間を介在する実行層であるECLoopを提案する。
論文 参考訳(メタデータ) (2026-07-30T20:16:35Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities [0.0]
サンドボックスアイソレーション、機能とアクセス制御、ポリシー施行、TOCTOU(Time-of-check-to-time-of-use)レース、モデルコンテキストプロトコル(MCP)脅威、アイデンティティデリゲート、実行証明、ネットワークエクスプレス制御、エージェント生成コードの静的解析は独立して公開され、ほとんど引用されない。
我々は2023年から2026年にかけて発行された39の論文を17のカテゴリに分類し、それぞれがソースに対して直接検証した。
カテゴリをまたいで読むと、5つの横断的なギャップが表面化します。
論文 参考訳(メタデータ) (2026-07-07T01:56:18Z) - Can Generalist Agents Automate Data Curation? [58.652262227632406]
トレーニングデータのキュレーションは、現代のAI開発において、もっとも重要だが労働集約的な部分のひとつだ。
一般のコーディングエージェントがこのデータキュレーションループを自動化できるかどうかを問う。
モデル、トレーニングレシピ、評価スイートを修正するエージェント中心のベンチマークである*Curation-Bench*を紹介します。
論文 参考訳(メタデータ) (2026-06-02T22:26:53Z) - OpenComputer: Verifiable Software Worlds for Computer-Use Agents [50.93029275079928]
OpenComputerは、コンピュータ利用エージェントの検証可能なソフトウェア世界を構築するための検証済みのフレームワークである。
OpenComputerは現在の形式で、ブラウザ、オフィスツール、クリエイティブソフトウェア、開発環境、ファイルマネージャ、通信アプリケーションにまたがる、33のデスクトップアプリケーションと1,000の最終的なタスクをカバーしている。
論文 参考訳(メタデータ) (2026-05-19T12:40:29Z) - OpenCLAW-P2P v6.0: Resilient Multi-Layer Persistence, Live Reference Verification, and Production-Scale Evaluation of Decentralized AI Peer Review [0.0]
OpenCLAW-P2P v6.0は分散集団知能プラットフォームの進化である。
人間のゲートキーパーなしで科学的研究論文を出版、査読、採点、反復的に改善する。
論文 参考訳(メタデータ) (2026-04-06T09:08:24Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。