論文の概要: Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
- arxiv url: http://arxiv.org/abs/2608.05144v1
- Date: Wed, 05 Aug 2026 17:58:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.075697
- Title: Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
- Title(参考訳): Argus: ロングホライゾン推論のための汎用エージェントランタイム
- Authors: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng,
- Abstract要約: Argusは永続的で自己進化的なランタイムで、マネージャ、プランナー、エンジニア、レビューアが耐久性のあるプロジェクトステート上で有界なミッションを実行します。
Argusは、安定したユーザ意図を運用目標、制約、検証基準から切り離し、メモリ、スキル、プロシージャ、バリデーション、ルーティング決定を許可し、ロール所有のレビューと利用可能なタスクネイティブ検証の後にのみ拒否されたルートを承認する。
- 参考スコア(独自算出の注目度): 35.84433077808964
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon reasoning requires an agentic runtime that can persist when evidence supports its current approach and pivot when measurements reveal failure, hidden constraints, or a misspecified objective. We present Argus, a persistent, self-evolving runtime in which Manager, Planner, Engineer, and Reviewer execute bounded missions over durable project state. Argus separates stable user intent from operational objectives, constraints, and verification criteria, and admits memories, skills, procedures, verifiers, routing decisions, and rejected routes only after role-owned review and, when available, task-native verification. Model weights remain fixed; self-evolution occurs through persistent runtime state and control policy, with autonomous execution between operator-owned escalation points. Across seven GPT-5.5 benchmark arenas, Argus achieves about 78% on SWE-Bench Pro versus 59% for Direct Copilot while using 1.41 times the aggregate tokens. After verification-gated self-evolution, mature SWE-Bench waves use 21% fewer solve-input tokens and 15% less active workflow time per task than startup waves, while recording 34 verifier recoveries and 22 strict review-loop rescues. Argus also reaches 76.8% on AARRI-Bench and a 28.0-point gap on mathematical data synthesis, with competitive GPU-kernel and language-model-training results. Beyond benchmarks, an optimized RWKV6 kernel was merged upstream; a multi-day mathematics campaign retained falsified routes and proof-backed frontier updates; and six paper pipelines completed 254 missions with 16 stage rollbacks. These results show that a fixed-weight, self-evolving harness can revise, recover, and accumulate verified approaches while producing structured trajectories for future supervised and reinforcement learning.
- Abstract(参考訳): ロングホライゾン推論にはエージェントランタイムが必要で、エビデンスがその現在のアプローチを支持し、測定結果が失敗、隠された制約、あるいは不特定目的を明らかにすると、その方向を変えることができる。
Argusは永続的で自己進化的なランタイムで、マネージャ、プランナー、エンジニア、レビューアが耐久性のあるプロジェクトステート上で有界なミッションを実行します。
Argusは、安定したユーザ意図を運用目標、制約、検証基準から切り離し、メモリ、スキル、プロシージャ、バリデーション、ルーティング決定を許可し、ロール所有のレビューと利用可能なタスクネイティブ検証の後にのみ拒否されたルートを承認する。
自己進化は、オペレータが所有するエスカレーションポイント間の自律的な実行で、永続的なランタイム状態とコントロールポリシを通じて発生します。
7つのGPT-5.5ベンチマークアリーナで、ArgusはSWE-Bench Proでは78%、Direct Copilotでは59%、集約トークンでは1.41倍である。
検証ゲートによる自己進化の後、成熟したSWE-Bench波は、起動波よりも21%少ない解入トークンとタスク毎のアクティブなワークフロー時間を15%少なくし、34の検証器回復と22の厳格なレビューループ救助を記録している。
Argusはまた、AARRI-Benchで76.8%、数学データ合成で28.0ポイントのギャップに達し、競合するGPUカーネルと言語モデルトレーニングの結果を得た。
ベンチマーク以外では、最適化されたRWKV6カーネルが上流にマージされ、数日間の数学キャンペーンでは、ファルシフィケーションされたルートと証明されたフロンティア更新が維持され、6つの紙パイプラインが16ステージのロールバックで254のミッションを完了した。
これらの結果から, 固定重量自己進化型ハーネスは, 今後の教師付き・強化学習のための構造化軌道を創出しながら, 検証済みのアプローチを再検討し, 回収し, 蓄積できることが示唆された。
関連論文リスト
- Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? [3.9561795512466413]
現在のベンチマークは、主にエンドタスクの成功または単一フレームグラウンドを測定する。
推論、リモート入力、アプリのレンダリング、スクリーンショットキャプチャが非同期であるため、これは難しい。
オフラインのステップレベルベンチマークであるDesktop-Delta Bench (DDB)を紹介した。
論文 参考訳(メタデータ) (2026-07-28T17:49:51Z) - Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime [1.189955933770711]
物理的UAVでは、リモート推論は選択的に呼び出されるときに最も有用である。
本稿では,ミッションループと安全クリティカルな実行をローカルに保持する回復フレームワークであるPersistent Mission(PMR)を提案する。
PMRは、遠隔エージェント推論が短期ミッションの進捗を改善する可能性があることを見積もる、コンパクトな入場ゲートである学習された認知的行動価値(Learned-CVI)を導入している。
論文 参考訳(メタデータ) (2026-06-12T07:57:47Z) - ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - Argus: Evidence Assembly for Scalable Deep Research Agents [74.04848873346145]
本研究では,探索者とナビゲータが協力して,補完的な証拠からジグソーを組み立てるシステムを提案する。
我々は、強化学習でナビゲータを訓練し、検証、ディスパッチ、合成を行いながら、検索者が標準のReActエージェントのままでいられるように独立に訓練する。
サーチとナビゲータは35B-A3B MoEのバックボーン上に構築されており、Argusは1つのサーチと12.7ポイントの並列サーチと8つのベンチマークで5.5ポイントを獲得している。
論文 参考訳(メタデータ) (2026-05-15T17:29:27Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification [35.08680804423239]
CoT(Chain-of- Thought)推論は、難しいタスクにおいて大きな言語モデル(LLM)を改善するが、推論コストも高くつく。
本稿では,連続潜伏空間における有界探索を最初に行う2段階のパラダイムであるLaTERを提案する。
LaTERは入力の埋め込み空間に隠された最後の層を投影し、潜伏KVキャッシュを保持し、エントロピーとモデルネイティブのストップトーケンプローブを使用していつ切り替えるかを決定する。
論文 参考訳(メタデータ) (2026-05-08T06:23:58Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。