論文の概要: Lighthouse RL: Sample-Efficient Circuit Optimization via Strategic Reset Points
- arxiv url: http://arxiv.org/abs/2607.14008v1
- Date: Wed, 15 Jul 2026 16:37:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.834057
- Title: Lighthouse RL: Sample-Efficient Circuit Optimization via Strategic Reset Points
- Title(参考訳): 灯台RL:戦略リセット点を用いた試料効率の良い回路最適化
- Abstract要約: 我々は、アナログ回路サイズ化のためのサンプル効率強化学習(RL)アプローチであるLighthouseを紹介する。
本稿では,2次元ベンチマーク問題と2つのアナログ回路に対するアプローチの有効性を示す。
我々のリセット戦略は、任意の RL ベースの最適化手法のプラグ・アンド・プレイ・エンハンスメントとして利用することができる。
- 参考スコア(独自算出の注目度): 5.713714247838241
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we introduce Lighthouse RL, a sample-efficient reinforcement learning (RL) approach for analog circuit sizing. Traditional methods lack generalization across different performance targets, while standard RL approaches waste resources exploring unpromising regions. Our method addresses these inefficiencies through a strategic reset strategy that initializes episodes from high-performing configurations discovered during training, called "lighthouses". These states, which are closer to the target objectives, guide exploration toward promising regions. When compared to RL and Bayesian optimization methods from the literature, we demonstrate the effectiveness of our approach on a 2D benchmark problem and on two analog circuits, showing significant improvements in sample efficiency (up to 1.72x faster), optimization performance (100% vs. 0-87% success rate), generalization (75% vs. 0-50% extrapolation success), and objective maximization. This efficiency is particularly valuable for computationally expensive black-box optimization problems, and our reset strategy can be used as a plug-and-play enhancement for any RL-based optimization approach.
- Abstract(参考訳): 本稿では、アナログ回路サイズ化のためのサンプル効率強化学習(RL)アプローチであるLighthouse RLを紹介する。
従来の手法では、異なるパフォーマンス目標をまたいだ一般化が欠如しており、標準のRLは未成熟の領域を探索する無駄なリソースにアプローチしている。
本手法は,トレーニング中に発見された「灯台」と呼ばれる高性能な構成からエピソードを初期化する戦略的リセット戦略により,これらの非効率性に対処する。
目標に近いこれらの州は、将来有望な地域への探検をガイドしている。
文献から得られたRLおよびベイズ最適化手法と比較して,2次元ベンチマーク問題と2つのアナログ回路に対するアプローチの有効性を実証し,試料効率(最大1.72倍高速),最適化性能(100%対0-87%成功率),一般化(75%対0-50%外挿成功),客観最大化に有意な改善が認められた。
この効率性は計算コストのかかるブラックボックス最適化問題に特に有用であり、我々のリセット戦略はRLベースの最適化手法のプラグ・アンド・プレイ・エンハンスメントとして利用できる。
関連論文リスト
- Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR [53.27792011950384]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を改善するためのスケーラブルなパラダイムとして登場した。
我々は、RLVRにおける構造化及び多様性駆動探索のためのフレームワークであるNudgeRLを提案する。
当社のアプローチでは,各ロールアウトを,軽量で戦略レベルのコンテキストに設定するストラテジーナッジを導入しています。
論文 参考訳(メタデータ) (2026-05-15T08:22:59Z) - Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations [98.44542103979735]
勾配勾配降下法(SGD)とアダム(Adam)による1次勾配勾配降下法は、現代の訓練パイプラインの基礎となる。
大規模モデルトレーニング、厳格なプライバシ要件、分散学習パラダイムは、プライバシ保護とメモリ効率に関する従来のアプローチにおける重要な制限を明らかにする。
深層学習最適化アルゴリズムの進化軌道を振り返って分析し、様々なモデルアーキテクチャやトレーニングシナリオの主流を包括的に評価する。
我々は、重要な新興トレンドと基本設計のトレードオフを抽出し、将来の研究の有望な方向性を示唆する。
論文 参考訳(メタデータ) (2026-04-14T17:01:36Z) - A New Trajectory-Oriented Approach to Enhancing Comprehensive Crowd Navigation Performance [28.07757592239467]
群集のナビゲーションは近年、かなりの研究の関心を集めている。
現在のDRLアプローチは一般的に効率と快適さを優先している。
本稿では,軌道曲率最適化を明確に強調する新たな報酬形成戦略を提案する。
論文 参考訳(メタデータ) (2025-12-07T00:52:07Z) - Sample-efficient LLM Optimization with Reset Replay [13.739451157239756]
Reset Replay (LoRR) は、任意の好みベースの最適化フレームワークにおいて、サンプリング効率を高めるために設計されたプラグインである。
LoRRは、ネットワークの可塑性を保存する初期データを再利用する定期的なリセット戦略を取り入れている。
実験により,LoRRは数学的および一般的な推論ベンチマークにおいて,様々な選好最適化手法の性能を著しく向上させることが示された。
論文 参考訳(メタデータ) (2025-08-08T15:56:49Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Preference Optimization for Combinatorial Optimization Problems [54.87466279363487]
強化学習(Reinforcement Learning, RL)は、ニューラルネットワーク最適化のための強力なツールとして登場した。
大幅な進歩にもかかわらず、既存のRLアプローチは報酬信号の減少や大規模な行動空間における非効率な探索といった課題に直面している。
統計的比較モデルを用いて定量的報酬信号を定性的選好信号に変換する新しい手法であるPreference Optimizationを提案する。
論文 参考訳(メタデータ) (2025-05-13T16:47:00Z) - Scattered Forest Search: Smarter Code Space Exploration with LLMs [55.71665969800222]
進化的探索において,解の多様性を向上し,フィードバックを有効活用する新しい手法であるSCATTERED FOREST SEARCH(SFS)を提案する。
本手法は,木探索,線探索,繰り返しサンプリングなど,既存の探索手法よりも効率よくスケールする。
論文 参考訳(メタデータ) (2024-10-22T01:58:29Z) - Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning [17.245293915129942]
最適目的は強化学習(RL)の基本的側面である
総リターンは理想的であるが、割引リターンはその安定性のために現実的な目的である。
目的を整合させる2つの方法を提案する。
論文 参考訳(メタデータ) (2024-07-18T08:33:10Z) - Optimal Goal-Reaching Reinforcement Learning via Quasimetric Learning [73.80728148866906]
準メトリック強化学習(QRL)は、準メトリックモデルを用いて最適な値関数を学習する新しいRL法である。
オフラインおよびオンラインの目標達成ベンチマークでは、QRLはサンプル効率とパフォーマンスが改善されている。
論文 参考訳(メタデータ) (2023-04-03T17:59:58Z) - Deep Black-Box Reinforcement Learning with Movement Primitives [15.184283143878488]
深部強化学習のための新しいアルゴリズムを提案する。
これは、政治的に成功したディープRLアルゴリズムである、微分可能な信頼領域層に基づいている。
複雑なロボット制御タスクにおいて,ERLアルゴリズムと最先端のステップベースアルゴリズムを比較した。
論文 参考訳(メタデータ) (2022-10-18T06:34:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。