論文の概要: PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
- arxiv url: http://arxiv.org/abs/2605.08982v1
- Date: Sat, 09 May 2026 14:54:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.005078
- Title: PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
- Title(参考訳): PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
- Abstract要約: 我々は、ニューラルネットワークの評価に適し、公式なポリシー改善保証を維持できる第一原理の並列MCTSアルゴリズムであるParticle MCTS(PMCTS)を紹介した。
PMCTSは並列計算とうまくスケールし、一般的なニューラルネットワークのベースラインをドメイン間で大幅に上回る。
- 参考スコア(独自算出の注目度): 8.751986657630017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monte Carlo Tree Search (MCTS) is a widely used approach for policy improvement through search with increasing popularity for real world applications. Due to the sequential and deterministic nature of its search, runtime-scaling of MCTS with parallel compute remains a major challenge. We introduce Particle MCTS (PMCTS), to our knowledge the first principled parallel MCTS algorithm which is suited for neural network evaluations and can preserve formal policy improvement guarantees. Empirically, PMCTS scales well with parallel compute and significantly outperforms the popular heuristic-based baselines across domains.
- Abstract(参考訳): Monte Carlo Tree Search (MCTS) は、現実世界のアプリケーションで人気を博し、検索を通じて政策改善のための広く使われているアプローチである。
探索の逐次的および決定論的性質から、並列計算によるMCTSの実行時スケーリングは依然として大きな課題である。
我々は、ニューラルネットワークの評価に適し、公式なポリシー改善保証を維持できる第一原理の並列MCTSアルゴリズム、Particle MCTS(PMCTS)を紹介した。
実証的には、PMCTSは並列計算とうまくスケールし、ドメイン間の一般的なヒューリスティックベースのベースラインを著しく上回っている。
関連論文リスト
- Parallelizing Tree Search with Twice Sequential Monte Carlo [7.863528049670872]
我々はモンテカルロ木探索 (MCTS) アルゴリズムの代替として, TSMCTS (Twice Sequential Monte Carlo Tree Search) を提案する。
TSMCTSは並列化が容易で、GPUアクセラレーションに適している。
TSMCTSは,SMCの並列化を自然にする特性を維持しつつ,逐次計算と良好にスケール可能であることを示す。
論文 参考訳(メタデータ) (2025-11-18T07:54:29Z) - Partially Observable Monte-Carlo Graph Search [15.40087235187116]
大規模なPOMDPをオフラインで解くために,新しいサンプリングベースアルゴリズムである部分的に観測可能なモンテカルログラフ探索(POMCGS)を提案する。
POMCGSはこのサーチツリーをオンザフライで折り畳み、ポリシーグラフを構築することで、計算を大幅に削減することができる。
我々は,POMCGSが従来のオフラインアルゴリズムでは計算できない,最も困難なPOMDPのポリシーを生成できることを実証した。
論文 参考訳(メタデータ) (2025-07-28T16:02:36Z) - Trust-Region Twisted Policy Improvement [8.73717644648873]
モンテカルロ木探索(MCTS)は、近年の深層強化学習(RL)におけるブレークスルーを招いている。
我々は、制約された動作サンプリングと明示的な端末状態ハンドリングを通じて、プランナー内のデータ生成を改善することにより、RLに特化したモンテカルロプランナーをカスタマイズする。
これによってTrust-Region Twisted SMC (TRT-SMC) が実現し,個別ドメインと連続ドメインの両方において,ベースラインMCTSおよびSMCメソッドのランタイムおよびサンプル効率が改善された。
論文 参考訳(メタデータ) (2025-04-08T13:47:07Z) - LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning [56.273799410256075]
このフレームワークはMonte Carlo Tree Search (MCTS)と反復的なSelf-Refineを組み合わせて推論パスを最適化する。
このフレームワークは、一般的なベンチマークと高度なベンチマークでテストされており、探索効率と問題解決能力の点で優れた性能を示している。
論文 参考訳(メタデータ) (2024-10-03T18:12:29Z) - Optimized Monte Carlo Tree Search for Enhanced Decision Making in the FrozenLake Environment [0.0]
Monte Carlo Tree Search (MCTS) は複雑な意思決定問題を解決する強力なアルゴリズムである。
本稿では,古典的強化学習課題であるFrozenLake環境に適用したMCTS実装を提案する。
論文 参考訳(メタデータ) (2024-09-25T05:04:53Z) - Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding [104.77043794433777]
PPO(Proximal Policy Optimization)に基づいて自然言語テキストを生成する場合、推論時探索アルゴリズムは不要に思えるかもしれない
本稿では,モンテカルロ木探索 (MCTS) を統合することで,PPOから余分な距離を得ることが可能であることを実証する。
提案するPPO-MCTSは,PPOから値ネットワークを統合することで,推論時生成時のポリシネットワークと密接に連携する。
論文 参考訳(メタデータ) (2023-09-26T15:57:57Z) - Learning Logic Specifications for Soft Policy Guidance in POMCP [71.69251176275638]
部分観測可能なモンテカルロ計画(POMCP)は部分観測可能なマルコフ決定過程(POMDP)の効率的な解法である
POMCPはスパース報酬機能、すなわち最終ゴールに達するときのみ得られる報酬に悩まされる。
本稿では,POMCP実行のトレースから論理仕様を学習するために帰納的論理プログラミングを用いる。
論文 参考訳(メタデータ) (2023-03-16T09:37:10Z) - Continuous Monte Carlo Graph Search [61.11769232283621]
連続モンテカルログラフサーチ(Continuous Monte Carlo Graph Search, CMCGS)は、モンテカルログラフサーチ(MCTS)のオンラインプランニングへの拡張である。
CMCGSは、計画中、複数の州で同じ行動方針を共有することで高いパフォーマンスが得られるという洞察を生かしている。
並列化によってスケールアップすることができ、学習力学モデルによる連続制御においてクロスエントロピー法(CEM)よりも優れている。
論文 参考訳(メタデータ) (2022-10-04T07:34:06Z) - Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes [3.9311044240639568]
政策勾配 (PG) は、勾配上昇を用いたパラメータ化政策モデルを最適化する強化学習 (RL) アプローチである。
PGは非マルコフ環境でもうまく機能するが、高原やピークネスの問題に遭遇することがある。
本稿では、まず、オンラインRLのためのMCTSの適応であるモンテカルロ木学習(MCTL)を紹介し、その強みを活用するためにPGとMCTLの政策アプローチについて検討する。
論文 参考訳(メタデータ) (2022-06-02T12:21:40Z) - Monte Carlo Tree Search for high precision manufacturing [55.60116686945561]
我々は、専門家ベースのシミュレータを使用し、MCTSのデフォルトポリシーを適用して製造プロセスに対処する。
一般的な理由は、プロセスの効率的なシミュレータが存在しないことや、MCTSをプロセスの複雑な規則に適用する際の問題があることである。
論文 参考訳(メタデータ) (2021-07-28T14:56:17Z) - On Effective Parallelization of Monte Carlo Tree Search [51.15940034629022]
モンテカルロ木探索(MCTS)は、探索木を構築するためにかなりの数のロールアウトを必要とするため、計算コストがかかる。
効果的な並列MCTSアルゴリズムを設計する方法は、体系的に研究されておらず、まだよく分かっていない。
我々は,より効率的な並列MCTSアルゴリズムの設計に,提案する必要条件をどのように適用できるかを実証する。
論文 参考訳(メタデータ) (2020-06-15T21:36:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。