論文の概要: ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments
- arxiv url: http://arxiv.org/abs/2606.25207v1
- Date: Tue, 23 Jun 2026 22:00:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.161387
- Title: ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments
- Title(参考訳): ASAP: 機械学習実験のためのウォールクロック型オートHPO研究のためのエージェント・システム共同設計
- Authors: Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang,
- Abstract要約: 我々はHPOのエージェントシステムの共同設計であるASAPについて述べる。
我々は,ASAPが多種多様な帰納的バイアス付き一般化のプールを統合する方法を示し,各ラウンドで提案する提案の中から選択する。
また,ASAPがループを再構築して,残響品質を保ちながら,エンドツーエンドのウォールタイムを削減する方法も示す。
- 参考スコア(独自算出の注目度): 45.577182866886126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hyperparameter Optimization (HPO) is essential for maximizing machine learning model performance, and its core challenge is sample efficiency: finding strong configurations within a limited budget. Because every HPO tool relies on a surrogate prior that imparts its own inductive bias, individual tools struggle once problems become sufficiently diverse and drift from these priors. Motivated by the reasoning and generalization capabilities of LLMs, recent work has explored using LLMs for HPO and reports improved per-iteration performance. Yet these methods share two limitations with a common origin: they use the LLM as a single-tool replacement evaluated by iteration count. (i) Deployed in place of prior tools, the LLM is itself constrained by its pretraining objective to one family of inductive-biased proposals; this single-source setup still fails to handle the full diversity of problems. (ii) Per-iteration evaluation ignores that, in real runs, LLM inference or tool execution is paid serially on top of model evaluation every round, so iteration-count gains do not translate into end-to-end wall-clock gains. We present ASAP, an agent-system co-design that addresses both limitations. On the agent side, ASAP uses the LLM to integrate a diverse pool of inductive-biased optimizers and to select among their proposals each round. On the system side, ASAP re-architects the loop to reduce end-to-end wall-clock while preserving regret quality: a prefix-stable prompt maximizes KV-cache reuse across rounds; speculation parallelism hides the remaining LLM and tool latency under model evaluation via a relative-error accept test; and a Self-Tuner adapts the speculation threshold from execution logs off the critical path. Extensive experiments on diverse modern HPO tasks show that ASAP consistently outperforms baselines, underscoring the value of tool integration and agent-system co-design.
- Abstract(参考訳): ハイパーパラメータ最適化(HPO)は、機械学習モデルのパフォーマンスを最大化する上で不可欠である。
すべてのHPOツールは、独自の帰納バイアスを付与するサロゲートに依存しているため、問題が十分に多様になると個々のツールが苦労する。
LLMの推論と一般化能力に触発された最近の研究は,HPOにおけるLCMの使用について検討し,また,性能改善を報告している。
しかし、これらのメソッドは2つの制限を共通の起源と共有している。
i) 以前のツールに代えてデプロイされたLCMは,その事前学習目標を,帰納的バイアスのある提案の1つのファミリに限定しています。
(二)実戦において、LLM推論やツール実行は各ラウンドごとにモデル評価の上に連続して行われるので、反復数ゲインがエンドツーエンドのウォールクロックゲインに変換されないことを無視する。
両制約に対処するエージェント・システムの共同設計であるASAPを提案する。
エージェント側では、ASAPはLSMを使用して、インダクティブバイアス(inductive-biased)オプティマイザの多様なプールを統合し、各ラウンドで提案の中から選択する。
システム側でASAPはループを再構築して、繰り返しの品質を維持しながら、エンドツーエンドのウォールクロックを減らす。プレフィックス-stableプロンプトは、ラウンド全体のKV-cache再利用を最大化し、投機並列性は、相対エラー受け入れテストを介してモデル評価の下で残りのLCMとツールのレイテンシを隠蔽し、セルフチューナーは、クリティカルパスから実行ログから推測しきい値に適応する。
多様なHPOタスクに関する大規模な実験は、ASAPがツール統合とエージェントシステムの共同設計の価値を強調し、ベースラインを一貫して上回っていることを示している。
関連論文リスト
- Execution-Verified Reinforcement Learning for Optimization Modeling [49.171122807323634]
実行検証学習フレームワークは、数学的プログラミング解法を決定論的で対話的な検証器として扱う。
NL4OPT, MAMO, IndustryOR, OptiBenchをグロビ, OR-Tools, COPTで行った実験では, EVOMがプロセス管理SFTに適合または優れていた。
論文 参考訳(メタデータ) (2026-04-01T03:39:11Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Multi-Agent Tool-Integrated Policy Optimization [67.12841355267678]
大規模言語モデル(LLM)は、知識集約的かつ複雑な推論タスクに対して、多ターンツール統合計画にますます依存している。
既存の実装は通常、単一のエージェントに依存するが、コンテキスト長とノイズの多いツールレスポンスに悩まされる。
ツール統合マルチエージェントフレームワークの効果的な強化学習をサポートする方法はない。
論文 参考訳(メタデータ) (2025-10-06T10:44:04Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - IMPROVE: Iterative Model Pipeline Refinement and Optimization Leveraging LLM Experts [28.9807389592324]
機械学習のワークフローを自動化するための有望なソリューションとして、大規模言語モデル(LLM)エージェントが登場した。
LLM駆動のMLパイプライン設計のための新しい戦略であるIterative Refinementを紹介します。
実際のトレーニングフィードバックに基づいて個々のコンポーネントを体系的に更新することにより、イテレーティブリファインメントはモデル全体のパフォーマンスを改善する。
論文 参考訳(メタデータ) (2025-02-25T01:52:37Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。