論文の概要: TRACE-CASH: Trial-History-Conditioned Reinforcement Learning for Adaptive Configuration Exploration in Time-Series CASH
- arxiv url: http://arxiv.org/abs/2608.16410v1
- Date: Mon, 17 Aug 2026 11:06:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.655373
- Title: TRACE-CASH: Trial-History-Conditioned Reinforcement Learning for Adaptive Configuration Exploration in Time-Series CASH
- Title(参考訳): TRACE-CASH: 時系列CASHにおける適応的構成探索のための歴史学習の試み
- Authors: Yu-Han Huang, Yujia Wu, Vincent S. Tseng,
- Abstract要約: TRACECASHは,グループ化されたアクター・クリティックな候補生成とモデルカバレッジ,バリデーション誘導によるエクスプロイト,進行停止後の探索の固定ルールを組み合わせたタスクローカルハイブリッドである。
TRACE-CASHとランダム,ベイズ的,進化的,多目的的,言語モデル支援の6つの選択肢を比較した。
- 参考スコア(独自算出の注目度): 9.74382525298432
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Combined algorithm selection and hyperparameter optimization (CASH) searches a conditional space in which the selected model determines which hyperparameters are active. In time-series forecasting, temporal choices, chronological validation, and costly evaluations further complicate this search. Controlled comparisons of heterogeneous search methods under a shared time-series CASH (TS-CASH) evaluation protocol remain limited. Within this setting, we study TRACECASH, a task-local hybrid sequential optimizer combining grouped actor-critic candidate generation with fixed rules for model coverage, validation-guided exploitation, and exploration after stalled progress. A model actor proposes an initial forecasting model; three model-conditioned actors generate temporal, architectural, and training actions; and a modelspecific decoder constructs the configuration ultimately evaluated. We compare TRACE-CASH with six alternatives spanning random, Bayesian, evolutionary, multi-objective, and language-model-assisted search across 41 dataset-frequency task variants. TRACE-CASH has the lowest mean rank on both MASE and WQL. Descriptively, it also has the lowest window-averaged test-MASE rank in the predefined full and late windows. These results support the complete TRACECASH procedure as competitive among the evaluated methods.
- Abstract(参考訳): アルゴリズム選択とハイパーパラメータ最適化(CASH)を組み合わせることで、選択したモデルがどのハイパーパラメータがアクティブかを決定する条件空間を探索する。
時系列予測では、時間的選択、時間的検証、時間的検証、コスト的な評価により、この探索はさらに複雑になる。
共有時系列CASH(TS-CASH)評価プロトコルにおける異種探索手法の制御された比較は限定的のままである。
本設定では,グループ化されたアクター批判候補生成とモデルカバレッジ,検証誘導による評価,進行停止後の探索の固定ルールを組み合わせたタスクローカルハイブリッドシーケンシャルオプティマイザであるTRACECASHについて検討する。
モデルアクターは、初期予測モデルを提案し、3つのモデル条件アクターは、時間的、建築的、および訓練的なアクションを生成し、モデル固有のデコーダは、最終的に評価された構成を構成する。
TRACE-CASHとランダム,ベイズ的,進化的,多目的的,言語モデル支援の6つの選択肢を比較した。
TRACE-CASHは、MASEとWQLの両方で最低ランクである。
説明的に言えば、事前定義されたフルウィンドウとレイトウィンドウでは、ウィンドウ平均テスト-MASEランクが最低である。
これらの結果は, TRACECASHの完全手順を, 評価方法の競争力として支持するものである。
関連論文リスト
- Deciding When to Switch: E-Processes for Adaptive Minimax Training for Generative Adversarial Nets [8.044490027380872]
我々は,e-process-based Adaptive training procedure for adversarial networkを開発した。
我々は、新しい経験的・潜伏的な条件付きe-値が、e-プロセスに蓄積可能な収率条件付きe-値を引き出すことを証明した。
合成分布と画像ベンチマークデータセット全体にわたって、提案手法は最適な固定比ベースラインに適合または性能を向上する。
論文 参考訳(メタデータ) (2026-08-10T18:07:48Z) - StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling [13.71352763893512]
本稿では,MCTSとTest-Time Reinforcement Learningを結合した探索適応フレームワークであるStarORを提案する。
StarORはモデリングプロセスを4段階に分解し、各非終端ノードでGRPOを介して一時的なLoRAアダプタを更新する。
5つのベンチマークで実験したところ、StarORは4Bバックボーンでも最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-06-13T08:46:13Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration [81.45763823762682]
本研究の目的は,マルチエージェントサンプリングによるデータ合成の問題を調べることでギャップを埋めることである。
逐次サンプリングプロセス中にワークフローが反復的に進化する木探索に基づくオーケストレーションエージェント(TOA)を紹介する。
アライメント、機械翻訳、数学的推論に関する実験は、マルチエージェントサンプリングが推論計算スケールとしてシングルエージェントサンプリングを著しく上回ることを示した。
論文 参考訳(メタデータ) (2024-12-22T15:16:44Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。