論文の概要: ORACLE: A Multi-Objective Reinforcement Learning-Based Analog Circuit Design Optimizer with Large Language Models-Guided Exploration
- arxiv url: http://arxiv.org/abs/2608.04999v1
- Date: Wed, 05 Aug 2026 16:09:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.981679
- Title: ORACLE: A Multi-Objective Reinforcement Learning-Based Analog Circuit Design Optimizer with Large Language Models-Guided Exploration
- Title(参考訳): ORACLE:大規模言語モデルを用いた多目的強化学習に基づくアナログ回路設計最適化
- Authors: Osei Brempong, Mohammed Ayman Habib, Vivan Poddar, Morteza Fayazi,
- Abstract要約: 本稿では,ベクトル値の優先条件付きアナログ回路設計のためのオープンソースのRLベースのフレームワークORACLEを提案する。
その結果,2000のテストケースを持つ複数の回路トポロジにおいて,ORACLEは最先端のアプローチと比較して,ランタイムを20.4x - 104.4x削減することがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Analog circuit design automation using reinforcement learning (RL) has emerged as a promising approach for reducing manual effort. However, many existing RL-based methods focus on single-objective optimization. Even methods designed for multi-objective (MO) problems often reduce multiple design specifications to a single scalar reward. This simplification limits the ability to capture the true Pareto trade-off among competing objectives and often leads to suboptimal designs. Moreover, requiring the model to be retrained from scratch whenever the desired MO specifications change remains a key limitation. To address these challenges, we present ORACLE, an open-source RL-based framework for MO analog circuit design optimization that replaces scalar reward optimization with vector-valued learning and preference-aware conditioning. ORACLE represents a true MO analog circuit design optimizer that uses a preference vector to specify the relative weights of multiple objectives, enabling a single trained model to generate designs across diverse trade-off settings without retraining. We further propose two preference-guidance strategies, namely normalized-weight guidance and cosine-aligned guidance, to improve convergence. In addition, we incorporate a large language model (LLM)-guided action selection mechanism to filter actions that are likely to lead to suboptimal designs or increased runtime. Our results show that, on multiple circuit topologies with 2,000 test cases, ORACLE reduces runtime by 20.4x - 104.4x compared to state-of-the-art approaches. It also meets 99.9% of the 2,000 target specifications, and achieves 5.1x - 318.6x better figure of merit in the resulting output specs.
- Abstract(参考訳): 強化学習(RL)を用いたアナログ回路設計の自動化が,手作業の削減に期待できるアプローチとして浮上している。
しかし、既存のRL法の多くは単目的最適化に重点を置いている。
マルチオブジェクト(MO)問題のために設計されたメソッドでさえ、複数の設計仕様を単一のスカラー報酬に還元することが多い。
この単純化により、競合する目的間の真のパレートのトレードオフを捕捉する能力が制限され、しばしば準最適設計につながる。
さらに、望まれるMO仕様の変更が重要な制限である場合、モデルをスクラッチから再トレーニングする必要がある。
これらの課題に対処するため、我々はMOアナログ回路設計最適化のためのオープンソースのRLベースのフレームワークORACLEを提案し、スカラー報酬最適化をベクトル値学習と優先条件付けに置き換える。
ORACLEは真のMOアナログ回路設計オプティマイザであり、複数の目的の相対的な重み付けを優先ベクトルを用いて指定し、訓練された1つのモデルが再トレーニングすることなく、様々なトレードオフ設定にまたがって設計を生成できる。
さらに、コンバージェンスを改善するために、正規化ウェイトガイダンスとコサインアライメントガイダンスという2つの選好誘導戦略を提案する。
さらに,大規模言語モデル (LLM) に誘導される行動選択機構を組み込んで,最適でない設計や実行時間の増加につながる可能性のある動作をフィルタリングする。
その結果,2000のテストケースを持つ複数の回路トポロジにおいて,ORACLEは最先端のアプローチと比較して,ランタイムを20.4x - 104.4x削減することがわかった。
また2000の仕様の99.9%を満たし、5.1倍から318.6倍の精度で出力仕様を達成している。
関連論文リスト
- AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents [4.28109763423665]
AutoSizerは、回路理解、適応的な検索空間の構築、クローズドループでの最適化オーケストレーションを統合するメタ最適化フレームワークである。
実験により、様々な回路困難に対して、より高い溶液品質、より高速な収束、高い成功率を達成できる。
論文 参考訳(メタデータ) (2026-02-02T21:51:55Z) - Tiny-R1V: Lightweight Multimodal Unified Reasoning Model via Model Merging [34.0419616643477]
Tiny-R1Vは2段階最適化により高速な推論と高精度を実現する軽量3Bモデルである。
最初の段階では、Tiny-R1Vは、新しい強化学習法であるLength-Informed Relative Policy Optimization (LIPO)を導入した。
第2段階では、トレーニング不要なモデルマージ手法である適応モデルマージ(AMM)を提案する。
論文 参考訳(メタデータ) (2025-10-10T04:14:57Z) - Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization [13.271737599933147]
本稿では,エントロピー強化フレームワークであるEntroPOを紹介し,既存の優先最適化アルゴリズムをマルチターンツール支援設定に適用する。
EntroPOは、さまざまな家族やサイズのモデル群を微調整することで検証する。
swebenchのリーダーボードでは、オープンウェイトモデルの間で、新しい最先端の結果が確立される。
論文 参考訳(メタデータ) (2025-09-15T20:36:19Z) - CORE: Constraint-Aware One-Step Reinforcement Learning for Simulation-Guided Neural Network Accelerator Design [3.549422886703227]
COREはシミュレーション誘導DSEのための制約対応一段階強化学習法である。
ニューラルネットワークアクセラレーターのハードウェアマッピング共同設計のためのCOREをインスタンス化する。
論文 参考訳(メタデータ) (2025-06-04T01:08:34Z) - Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models [48.15777554876988]
伝統的なアライメント手法では、しばしば大きな事前訓練されたモデルを再訓練する必要がある。
本稿では,アライメント処理を重要サンプリングの一種として形式化する新しいtextitResidual Alignment Model (textitRAM) を提案する。
本稿では,トークンレベルの復号化を反復的に行う再サンプリングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-05-26T08:53:02Z) - UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality [52.49062565901046]
Reinforcement Learning from Human Feedback (RLHF) は、大きな言語モデルと人間の価値を整合させる基盤となっている。
既存のアプローチは、人間の好みの多次元、分布的なニュアンスを捉えるのに苦労している。
本稿では,これらの制約を克服する新しいフレームワークであるUtility-Conditioned Multi-Objective Alignment (UC-MOA)を紹介する。
論文 参考訳(メタデータ) (2025-03-10T09:52:42Z) - Multi-Reference Preference Optimization for Large Language Models [56.84730239046117]
複数の参照モデルを用いた直接選好最適化のための新しいクローズドフォームの定式化を提案する。
得られたアルゴリズムであるMulti-Reference Preference Optimization (MRPO)は、様々な参照モデルからより広範な事前知識を活用する。
MRPOを微調整したLLMは,データ不足や多量性に関わらず,様々な嗜好データにおいてより一般化されていることを示す。
論文 参考訳(メタデータ) (2024-05-26T00:29:04Z) - Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization [76.09576643028362]
複数のアライメント目的に対してMODPO(Multi-Objective Direct Preference Optimization)を提案する。
MODPOは、言語モデリングを直接報酬モデルに折り畳み、暗黙の集団報酬モデルとして言語モデルを訓練する。
理論的には MORLHF と同じ最適解が得られるが、実質的にはより安定で効率的である。
論文 参考訳(メタデータ) (2023-10-05T17:35:26Z) - When to Update Your Model: Constrained Model-based Reinforcement
Learning [50.74369835934703]
モデルベースRL(MBRL)の非遅延性能保証のための新規で一般的な理論スキームを提案する。
続いて導いた境界は、モデルシフトとパフォーマンス改善の関係を明らかにします。
さらなる例では、動的に変化する探索からの学習モデルが、最終的なリターンの恩恵をもたらすことが示されている。
論文 参考訳(メタデータ) (2022-10-15T17:57:43Z) - Analog Circuit Design with Dyna-Style Reinforcement Learning [12.232323973906773]
本稿では,アナログ回路設計における学習に基づくアプローチを提案する。
まず、ニューラルネットワークによって近似された性能の代理モデル(英語版)を学習し、必要なシミュレーション数の削減を図る。
第2に、制約を満たす多様なソリューション空間を探索するためにポリシージェネレータを使用し、その結果、ポリシーをトレーニングするために20,000の回路シミュレーションで適用されたモデルフリー手法と比較して、DynaOptは、わずか500のシミュレーションでスクラッチから学習することで、さらに優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2020-11-16T00:19:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。