論文の概要: Using Common Random Numbers for Simulation-based Planning with Rollouts
- arxiv url: http://arxiv.org/abs/2605.04732v1
- Date: Wed, 06 May 2026 10:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.772505
- Title: Using Common Random Numbers for Simulation-based Planning with Rollouts
- Title(参考訳): ロールアウトを考慮したシミュレーションベース計画における共通乱数の利用
- Abstract要約: ロールアウトによるシミュレーションベースのプランニングは、環境における意思決定のための広くデプロイされたテクニックである。
本稿では,シミュレーションプロセスにおける共通乱数の利用効果について検討する。
シミュレーションがロールアウトポリシーをある程度の深さ以上で実行した場合、相対効用量の分散を(確実に)低減するための簡単なレシピを得る。
- 参考スコア(独自算出の注目度): 3.285499181338201
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Simulation-based planning with rollouts is a widely-deployed technique for decision making in stochastic environments. The primary instrument of simulation-based planning is a sampling model, which is repeatedly called to generate trajectories and estimate the utilities of available actions. Among the actions thus explored, one with the maximum estimated utility is then executed. In this paper, we examine the effect of using common random numbers in the simulation process. We obtain a simple recipe for (provably) reducing variance in relative utility when simulations invoke a rollout policy beyond some depth. Experiments on synthetic tasks confirm that our scheme improves task performance. The broader significance of our innovation is apparent from two practical applications: (1) single-step lookahead planning in a pension-disbursement task, and (2) a deployment of the well-known UCT algorithm for the game of Ludo.
- Abstract(参考訳): ロールアウトによるシミュレーションベースのプランニングは、確率的環境における意思決定のための広くデプロイされたテクニックである。
シミュレーションに基づく計画の主要な手段はサンプリングモデルであり、これは繰り返し呼ばれ、軌道を生成し、利用可能なアクションのユーティリティを推定する。
そこで検討したアクションの中で、最大推定ユーティリティを持つアクションが実行されます。
本稿では,シミュレーションプロセスにおける共通乱数の利用効果について検討する。
シミュレーションがロールアウトポリシーをある程度の深さ以上で実行した場合、相対効用量の分散を(確実に)低減するための簡単なレシピを得る。
合成タスクの実験により,本手法がタスク性能を向上させることが確認された。
イノベーションのより広範な重要性は,(1)年金支払い作業における単一段階のルックアヘッド計画,(2)ゲームにおけるよく知られたUCTアルゴリズムの展開,の2つの実践的応用から明らかである。
関連論文リスト
- TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation [61.35569005726248]
既存の具体的制御研究は、トレーニングデータとモデルサイズをスケールすることで、顕著なパフォーマンス向上を示す。
拡散や自己回帰モデルのような非決定論的生成モデルは、エンボディドコントロールの分野で広く採用されている。
推測時間サンプリングのためのプラグイン・アンド・プレイフレームワークである textbfTapSampling を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:03:31Z) - Autonomous Vehicle Path Planning by Searching With Differentiable Simulation [55.46735086899153]
計画では、エージェントが現実世界で実行する前に、アクションを安全に洗練することができる。
自動運転では、衝突を避け、複雑な密集した交通シナリオをナビゲートすることが不可欠である。
本稿では、微分可能シミュレータWaymaxを次の状態予測と批判の両方として活用するフレームワークである、微分可能探索シミュレーション(DSS)を提案する。
論文 参考訳(メタデータ) (2025-11-14T07:56:34Z) - Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search [62.1546099504045]
本稿では、推論を計画と実行に分離する二相テストタイムスケーリングフレームワークを提案する。
具体的には、推論軌跡を分解し、各フェーズの報酬モデルを構築し、探索者が個別に計画と実行を探索、実行できるようにする。
数学的推論とコード生成ベンチマークの両方の実験により、我々の手法は計算の冗長性を低減しつつ、常に精度を向上することを示した。
論文 参考訳(メタデータ) (2025-09-29T19:27:23Z) - Active Sequential Posterior Estimation for Sample-Efficient Simulation-Based Inference [12.019504660711231]
逐次的神経後部推定(ASNPE)を導入する。
ASNPEは、シミュレーションパラメータ候補の効用を基礎となる確率モデルに推定するために、推論ループにアクティブな学習スキームをもたらす。
提案手法は,大規模実世界の交通ネットワークにおいて,高度に調整されたベンチマークと最先端の後方推定手法より優れる。
論文 参考訳(メタデータ) (2024-12-07T08:57:26Z) - Experiment Planning with Function Approximation [49.50254688629728]
本研究では,文脈的帯域幅問題における関数近似を用いた実験計画の問題点について検討する。
本稿では,関数近似に適合する2つの実験計画戦略を提案する。
そこで, 均一サンプリング器は, 動作数が少ない設定において, 競合最適性を達成できることを示す。
論文 参考訳(メタデータ) (2024-01-10T14:40:23Z) - Optimal simulation-based Bayesian decisions [0.0]
難解な確率下での最適ベイズ決定の効率的な計算のための枠組みを提案する。
パラメータと行動空間のどの位置をシミュレートするかを選択するための能動的学習手法を開発した。
結果として生じるフレームワークは極めて効率的なシミュレーションであり、一般的に、関連する後部推論タスクのみよりもモデル呼び出しを少なくする。
論文 参考訳(メタデータ) (2023-11-09T20:59:52Z) - On efficient computation in active inference [1.1470070927586016]
計算量を大幅に減らした有限時間地平線に対する新しい計画アルゴリズムを提案する。
また、新規かつ既存のアクティブな推論計画スキームに対して適切な目標分布を設定するプロセスを簡単にする。
論文 参考訳(メタデータ) (2023-07-02T07:38:56Z) - Maximize to Explore: One Objective Function Fusing Estimation, Planning,
and Exploration [87.53543137162488]
我々はtextttMEX というオンライン強化学習(オンラインRL)フレームワークを提案する。
textttMEXは、自動的に探索エクスプロイトのバランスをとりながら、見積もりと計画コンポーネントを統合する。
様々な MuJoCo 環境では,ベースラインを安定的なマージンで上回り,十分な報酬を得られる。
論文 参考訳(メタデータ) (2023-05-29T17:25:26Z) - Sample Efficient Deep Reinforcement Learning via Local Planning [21.420851589712626]
本研究は,シミュレータを用いた試料効率深部強化学習(RL)に焦点を当てる。
本稿では,この特性を利用した不確実性優先ローカルプランニング(UFLP)というアルゴリズムフレームワークを提案する。
本研究では,この簡単な手法により,難解な探索作業において,いくつかのベースラインRLアルゴリズムのサンプルコストを劇的に向上させることができることを示す。
論文 参考訳(メタデータ) (2023-01-29T23:17:26Z) - Simulation-efficient marginal posterior estimation with swyft: stop
wasting your precious time [5.533353383316288]
本研究では,ネスト型ニューラル・サイエンス・ツー・エビデンス比推定とシミュレーションの再利用のためのアルゴリズムを提案する。
これらのアルゴリズムが組み合わさって、縁部および関節後部の自動的および極端にシミュレーターによる効率的な推定を可能にする。
論文 参考訳(メタデータ) (2020-11-27T19:00:07Z) - A User's Guide to Calibrating Robotics Simulators [54.85241102329546]
本稿では,シミュレーションで学習したモデルやポリシーを現実世界に伝達することを目的とした,様々なアルゴリズムの研究のためのベンチマークとフレームワークを提案する。
我々は、様々なアルゴリズムの性能に関する洞察を特徴付け、提供するために、広く知られたシミュレーション環境の実験を行う。
我々の分析は、この分野の実践者にとって有用であり、sim-to-realアルゴリズムの動作と主特性について、より深い選択をすることができる。
論文 参考訳(メタデータ) (2020-11-17T22:24:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。