論文の概要: Exact Fast Batch Simulation for Tabular Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.04746v1
- Date: Sat, 03 Oct 2026 20:22:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:12:10.417879
- Title: Exact Fast Batch Simulation for Tabular Reinforcement Learning
- Title(参考訳): 語彙強化学習のためのエクササイズ高速バッチシミュレーション
- Abstract要約: 有限水平タブ状マルコフ決定過程の正確な高速シミュレーションフレームワークを開発する。
このフレームワークはシミュレータベース、オフライン、オンラインバッチ、あるいはステージベースの強化学習に広く適用される。
- 参考スコア(独自算出の注目度): 13.370933509246568
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Simulation is a fundamental computational primitive in reinforcement learning (RL), yet conventional simulation explicitly generates individual trajectories even when downstream procedures use only aggregate statistics. To address this, we develop an exact fast-simulation framework for finite-horizon tabular Markov decision processes. Our framework has two complementary modes. In direct batch simulation, a batch is represented by its aggregate Markov flow. With sufficient parallel simulation resources, this flow can be obtained by trajectory aggregation; when such simulation is unavailable or costly but the initial state and transition distributions are directly accessible, we instead generate an identically distributed flow through forward Markov-flow sampling without materializing individual trajectories. The latter reduces the simulator-side computational dependence on batch size $m$ from $O(m)$ to $O(1)$. In adaptive batch simulation, when batch length is determined by a data-dependent condition, exact multivariate-hypergeometric splitting recursively refines a candidate Markov flow while preserving the conditional law, reducing the cost dependence on $m$ from $O(m)$ to $O(\log m)$. Together, these modes accelerate simulation by keeping trajectories aggregated whenever possible and refining flows only when required to locate data-dependent boundaries. The framework applies broadly across simulator-based, offline, and online batch or stage-based RL, as illustrated with representative algorithms from each setting.
- Abstract(参考訳): シミュレーションは強化学習(RL)における基本的な計算プリミティブであるが、従来のシミュレーションでは、下流の手順が集計統計のみを使用する場合であっても、個々のトラジェクトリを明示的に生成する。
これを解決するために、有限水平タブ状マルコフ決定プロセスのための正確な高速シミュレーションフレームワークを開発する。
私たちのフレームワークには2つの補完モードがあります。
直接バッチシミュレーションでは、バッチはその集合マルコフフローによって表現される。
十分な並列シミュレーション資源により、この流れは軌道集約によって得ることができ、そのようなシミュレーションが利用できない場合やコストがかかる場合、初期状態と遷移分布は直接アクセス可能であり、代わりに個々の軌道を具体化せずに前方マルコフ-フローサンプリングを通じて同一に分散した流れを生成する。
後者は、バッチサイズ$m$のシミュレータ側の計算依存を$O(m)$から$O(1)$に減らす。
適応型バッチシミュレーションでは、バッチ長がデータ依存条件で決定された場合、正確な多変量・ハイパーメトリクス分割は条件法則を保ちながらマルコフフローを再帰的に洗練し、$m$を$O(m)$から$O(\log m)$に還元する。
これらのモードは、可能な限りトラジェクトリを集約し、データ依存境界を見つける必要のある場合にのみフローを精製することにより、シミュレーションを加速する。
このフレームワークはシミュレータベース、オフライン、オンラインバッチ、ステージベースのRLで広く適用され、各設定から代表的なアルゴリズムで示される。
関連論文リスト
- Computational regimes in matrix-product-state-based quantum trajectory simulations [4.187966512170651]
本稿では, トラジェクトリ毎のメモリ, トラジェクトリ毎のランタイム, サンプリング作業に総コストを分割する, 量子トラジェクトリシミュレーションのためのコスト解決フレームワークを提案する。
同じリンドブラッド力学の物理的に等価な解法は、必ずしも総コストを減少させるのではなく、軌跡複雑性と統計的収束の間のコストを再分配することを示した。
論文 参考訳(メタデータ) (2026-06-11T18:00:02Z) - Riemannian MeanFlow for One-Step Generation on Manifolds [54.09734511705173]
フローマッチングは、生成モデルのシミュレーション不要なトレーニングを可能にする。
平均フローは、位置依存接空間に速度が存在する多様体値生成に拡張することができる。
球面, トーリ, SO(3)における実験は, 品質・効率のトレードオフを改善し, サンプリングコストを大幅に削減して, 競争力のある一段階サンプリングを実証した。
論文 参考訳(メタデータ) (2026-03-11T12:41:46Z) - Parallel Simulation for Log-concave Sampling and Score-based Diffusion Models [55.07411490538404]
本稿では,次元$d$の適応的複雑性依存性を改善する並列サンプリング手法を提案する。
我々の手法は科学計算による並列シミュレーション技術に基づいている。
論文 参考訳(メタデータ) (2024-12-10T11:50:46Z) - Compositional simulation-based inference for time series [21.9975782468709]
シミュレーションデータに基づいてニューラルネットワークをトレーニングし、ベイズ推論を実行する方法。
シミュレータは、時間とともに何千もの単一状態遷移を通して現実世界のダイナミクスをエミュレートする。
本研究では,個々の状態遷移に整合したパラメータを局所的に同定することで,マルコフシミュレータを活用できるSBI手法を提案する。
論文 参考訳(メタデータ) (2024-11-05T01:55:07Z) - Learning to Simulate: Generative Metamodeling via Quantile Regression [2.0613075946076904]
従来のメタモデリング技術は、シミュレータ入力と単一出力要約統計量の間の関係を学習する。
生成メタモデリングという新しい概念を提案する。
生成メタモデルは、入力仕様に基づいて多数のランダム出力を高速に生成することができる。
論文 参考訳(メタデータ) (2023-11-29T16:46:24Z) - Simulation-free Schr\"odinger bridges via score and flow matching [89.4231207928885]
シミュレーションフリースコアとフローマッチング([SF]$2$M)を提案する。
本手法は,拡散モデルのトレーニングに使用するスコアマッチング損失と,連続流のトレーニングに使用されるフローマッチング損失の両方を一般化する。
特に、[SF]$2$Mは、高次元の細胞動態を正確にモデル化し、既知の遺伝子制御ネットワークをシミュレートする最初の方法である。
論文 参考訳(メタデータ) (2023-07-07T15:42:35Z) - Recurrent convolutional neural network for the surrogate modeling of
subsurface flow simulation [0.0]
本稿では,数値フローシミュレーションの代理モデルとして,SegNetとConvLSTM層を組み合わせることを提案する。
その結果,シミュレーションの出力が時系列データである場合,SegNetに基づくサロゲートモデルの性能が著しく向上することが示唆された。
論文 参考訳(メタデータ) (2020-10-08T09:34:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。