論文の概要: ProDVI: Programmatic Dynamics Priors for Value Network Initialization
- arxiv url: http://arxiv.org/abs/2608.06015v1
- Date: Thu, 06 Aug 2026 13:19:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.767379
- Title: ProDVI: Programmatic Dynamics Priors for Value Network Initialization
- Title(参考訳): ProDVI:バリューネットワークの初期化に先立つプログラムダイナミクス
- Authors: Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen,
- Abstract要約: 深層強化学習(英: Deep Reinforcement Learning, RL)は、非効率なサンプルである。
既存のアプローチは、事前にコンパイルされたデータセット、高忠実度シミュレータ、関連するタスクに対するメタ学習を通じて情報を得る。
提案するProDVIは,大規模言語モデルに符号化されたコモンセンスとドメイン知識を活用して,これらのリソースに頼ることなくRLエージェントを初期化するフレームワークである。
- 参考スコア(独自算出の注目度): 10.054153317469096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep Reinforcement Learning (RL) is notoriously sample inefficient. One contributing factor is that RL agents are typically initialized from scratch, forcing them to acquire task-relevant knowledge through online interaction. Existing approaches obtain informative initializations through pre-collected datasets, high-fidelity simulators, or meta-learning over related tasks, but these prerequisites may be difficult to access or even unavailable. In this paper, we propose Programmatic Dynamics Priors for Value Network Initialization (ProDVI), a framework that leverages the commonsense and domain knowledge encoded in large language models to initialize RL agents without relying on these resources. Specifically, ProDVI prompts a code-generating language model to produce executable Python functions that encode coarse hypotheses about environment dynamics. These functions are then used to generate synthetic transitions. Based on these transitions, we construct an auxiliary dynamics prediction objective to pretrain the state-action encoder of the value network in an actor-critic framework. The learned representation provides dynamics-aware inductive biases before online RL begins. Importantly, the generated programs are used only for representation pretraining and are not required to faithfully simulate the target environment. While the generated programs may be inaccurate, their induced initialization can be corrected through online learning from real transitions and rewards. Experiments on OpenAI Gym and DeepMind Control Suite tasks show that ProDVI can effectively improve the sample efficiency of model-free RL algorithms.
- Abstract(参考訳): 深層強化学習(英: Deep Reinforcement Learning, RL)は、非効率なサンプルである。
RLエージェントは通常、スクラッチから初期化され、オンラインインタラクションを通じてタスク関連知識を取得することを余儀なくされる。
既存のアプローチでは、事前にコンパイルされたデータセット、高忠実度シミュレータ、あるいは関連するタスクに対するメタラーニングを通じて情報的な初期化が得られるが、これらの前提条件はアクセスしにくいか、あるいは利用できないかもしれない。
本稿では,大規模言語モデルに符号化されたコモンセンスとドメイン知識を活用して,これらのリソースを依存せずにRLエージェントを初期化する,ProDVI(Programmatic Dynamics Priors for Value Network Initialization)を提案する。
具体的には、ProDVIはコード生成言語モデルに、環境力学に関する粗い仮説をエンコードする実行可能なPython関数を生成するよう促す。
これらの関数は合成遷移を生成するために使われる。
これらの遷移に基づいて,アクター・クリティカル・フレームワークにおける値ネットワークの状態-作用エンコーダの事前学習を行うための補助動的予測目標を構築した。
学習された表現は、オンラインRLが始まる前に動的に認識される帰納バイアスを提供する。
重要なことは、生成されたプログラムは事前学習のためにのみ使用され、ターゲット環境を忠実にシミュレートする必要はない。
生成されたプログラムは不正確な場合もありますが、実際の移行や報酬からオンライン学習を通じて初期化を修正できます。
OpenAI GymとDeepMind Control Suiteタスクの実験は、ProDVIがモデルフリーRLアルゴリズムのサンプル効率を効果的に改善できることを示している。
関連論文リスト
- Re:Form -- Reducing Human Priors in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny [78.1575956773948]
強化学習(RL)で訓練された大規模言語モデル(LLM)は、信頼性も拡張性もない、という大きな課題に直面している。
有望だが、ほとんど報われていない代替手段は、フォーマルな言語ベースの推論である。
生成モデルが形式言語空間(例えばダフニー)で機能する厳密な形式体系におけるLLMの接地は、それらの推論プロセスと結果の自動的かつ数学的に証明可能な検証を可能にする。
論文 参考訳(メタデータ) (2025-07-22T08:13:01Z) - Reinforcement Learning with Physics-Informed Symbolic Program Priors for Zero-Shot Wireless Indoor Navigation [4.159053490516698]
物理をエンコードする誘導バイアスは、トレーニング中のサンプル効率を改善し、テストの一般化を高めるのに役立つ。
これらの有用な物理インフォームドインダクティブバイアスを組み込む現在のプラクティスは、必然的に、重要な手作業やドメインの専門知識に結びついています。
この研究は、物理学でインフォームドされた誘導バイアスを人間可読で自然に説明可能なRLエージェントに蒸留するシンボリックアプローチを探求する。
論文 参考訳(メタデータ) (2025-06-27T16:26:29Z) - Modulating Reservoir Dynamics via Reinforcement Learning for Efficient Robot Skill Synthesis [0.0]
貯水池と呼ばれるランダムなリカレントニューラルネットワークは、コンテキスト入力で条件付けられたロボットの動きを学習するために使用することができる。
本稿では,新しいRCベースのLearning from Demonstration(LfD)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-17T07:25:54Z) - Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning [62.984693936073974]
価値に基づく強化学習は、幅広いマルチターン問題に対する効果的なポリシーを学ぶことができる。
現在の値ベースのRL法は、特に大規模な言語モデルの設定にスケールすることが困難であることが証明されている。
本稿では,これらの欠点に対処する新しいオフラインRLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-11-07T21:36:52Z) - Latent Action Priors for Locomotion with Deep Reinforcement Learning [42.642008092347986]
深層強化学習(DRL)は、ロボットが環境との相互作用を通じて複雑な行動を学ぶことを可能にする。
本稿では,特にトルク制御に有用な移動学習のための帰納バイアスを提案する。
エージェントは実演の報酬レベルに制限されず、転送タスクの性能は大幅に向上する。
論文 参考訳(メタデータ) (2024-10-04T09:10:56Z) - Zero-Shot Code Representation Learning via Prompt Tuning [6.40875582886359]
コード表現を学習するためのゼロショットアプローチであるZecolerを提案する。
Zecolerは、事前訓練されたプログラミング言語モデルの上に構築されている。
我々はZecolerを,コードクローン検出,コード検索,メソッド名予測,コード要約,コード生成を含む5つのコードインテリジェンスタスクで評価する。
論文 参考訳(メタデータ) (2024-04-13T09:47:07Z) - CodeRL: Mastering Code Generation through Pretrained Models and Deep
Reinforcement Learning [92.36705236706678]
CodeRLは、事前訓練されたLMと深層強化学習によるプログラム合成タスクのための新しいフレームワークである。
推論中、我々は重要なサンプリング戦略を持つ新しい生成手順を導入する。
モデルバックボーンについては,CodeT5のエンコーダデコーダアーキテクチャを拡張し,学習目標を拡張した。
論文 参考訳(メタデータ) (2022-07-05T02:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。