論文の概要: Finding the Time to Think: Learning Planning Budgets in Real-Time RL
- arxiv url: http://arxiv.org/abs/2606.26463v1
- Date: Wed, 24 Jun 2026 23:55:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.115239
- Title: Finding the Time to Think: Learning Planning Budgets in Real-Time RL
- Title(参考訳): リアルタイムRLにおける計画予算の学習
- Authors: Aneesh Muppidi, Firas Darwish, Dylan Cope, João F. Henriques, Jakob Nicolaus Foerster,
- Abstract要約: 本研究では,エージェントのアクションを待ちながら環境が進行するリアルタイムRL環境について検討する。
リアルタイムのパックマン、テトリス、スネーク、スピードヘックス、スピードゴーをまたいで、ゲーティングポリシーは固定予算とベースラインを上回ります。
- 参考スコア(独自算出の注目度): 37.26357552182201
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deliberating takes time. In real-time settings, that time is not free. Standard reinforcement learning (RL) sidesteps this as the environment waits indefinitely for the agent's decision. Instead, we study real-time RL environments where the environment progresses while waiting for the agent's action. Building on prior real-time formalizations, we introduce variable-delay real-time RL, where the agent chooses how long to deliberate at each decision point since the environment progresses. For the planning agents we use, the right delay is state-dependent, and naively planning how long to plan can paralyze the agent. We instead approach this setting by training a lightweight gating policy on top of a planner to select state-dependent planning budgets. Across real-time Pac-Man, Tetris, Snake, Speed Hex, and Speed Go, our gating policy outperforms fixed-budget and heuristic baselines, and transfers to a real-time setup where the environment and agent run on two different GPUs.
- Abstract(参考訳): 熟考には時間がかかる。
リアルタイム設定では、その時間は無料ではありません。
標準強化学習(RL)は、エージェントの決定を無期限に待つ環境として、これを後押しする。
その代わり,エージェントのアクションを待ちながら環境が進行するリアルタイムRL環境について検討する。
事前のリアルタイムの形式化に基づいて,変数遅延リアルタイムRLを導入する。
私たちが使っているプランニングエージェントにとって、適切な遅延は状態依存であり、計画がエージェントを麻痺させるのにどれくらい時間がかかるかをナビゲート的に計画します。
代わりに、プランナーの上に軽量のゲーティングポリシーをトレーニングして、州に依存した計画予算を選択することで、この設定にアプローチします。
リアルタイムPac-Man、Tetris、Snake、Speed Hex、Speed Goなど、当社のゲーティングポリシは固定予算ベースラインとヒューリスティックベースラインを上回り、環境とエージェントが2つの異なるGPU上で動作するリアルタイムセットアップに転送します。
関連論文リスト
- When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning [1.2526963688768455]
強化学習 (Reinforcement Learning, RL) の方針は、明示的な熟考が欠如しているため、よく馴染みのない環境では劣化する。
高速でリアクティブなRLポリシと低速で検討可能なSLM(Small Language Model)プランナを組み合わせたハイブリッドアーキテクチャであるPlan,Align,Commit,Think(PACT)を提案する。
論文 参考訳(メタデータ) (2026-06-15T17:31:22Z) - ProAct: Agentic Lookahead in Interactive Environments [56.50613398808361]
ProActは、2段階のトレーニングパラダイムを通じて、エージェントが正確なルックアヘッド推論を内部化することを可能にするフレームワークである。
そこでは,環境に基づく探索から得られたトラジェクトリの微調整をエージェントが行うGLAD(Grounded LookAhead Distillation)を紹介する。
また,政策段階のアルゴリズムを改良する補助値推定器であるモンテカルロ批判(MC-Critic)を提案する。
論文 参考訳(メタデータ) (2026-02-05T05:45:16Z) - Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic [72.97800570813175]
ウォールタイムとしてテスト時間を再定義するTimely Machineを提案する。
我々は、高頻度ツールコール、低周波ツールコール、時間制約推論にまたがるベンチマークであるTimely-Evalを紹介する。
より小さなモデルでは、より多くのインタラクションを通じて高速なフィードバックが得られ、大きなモデルでは、より優れたインタラクション品質によって、高レイテンシ設定が支配される。
論文 参考訳(メタデータ) (2026-01-23T06:28:52Z) - Budget Allocation Policies for Real-Time Multi-Agent Path Finding [11.050047263054985]
リアルタイムMAPFは、計画と実行がインターリーブされる現実的なMAPFセットアップを具現化する。
RT-MAPFの既存のソリューションは、計画期間毎にMAPFアルゴリズムのウィンドウバージョンを反復的に呼び出す。
標準MAPFアルゴリズムのウィンドウ化バージョンにおける計画予算の配分について検討する。
論文 参考訳(メタデータ) (2025-07-22T08:32:55Z) - AI planning in the imagination: High-level planning on learned abstract
search spaces [68.75684174531962]
我々は,エージェントが訓練中に学習する抽象的な検索空間において,エージェントが計画することを可能にする,PiZeroと呼ばれる新しい手法を提案する。
本研究では,旅行セールスマン問題,ソコバン問題,2048年,施設立地問題,パックマン問題など,複数の分野で評価を行った。
論文 参考訳(メタデータ) (2023-08-16T22:47:16Z) - Agents Explore the Environment Beyond Good Actions to Improve Their
Model for Better Decisions [0.0]
MuZeroのエージェントは、ネットワークモデルによる予測と、予測を用いた木探索による計画を組み合わせる。
我々は、エージェントに、そうでなければ探索しない環境における決定木の一部を探索させるために、これを衝動として使用します。
シンプルなボードゲームTic-Tac-Toeは、このアプローチがエージェントの意思決定能力をどのように改善するかを説明するために使用される。
論文 参考訳(メタデータ) (2023-06-06T05:11:58Z) - AI Planning Annotation for Sample Efficient Reinforcement Learning [39.4624736757278]
我々は、強化学習(RL)の効率を向上させるために、適切に定義された計画モデルを用いることができることを示す。
本実験では, 従来のRL環境よりも, 様々なRL環境において, サンプル効率が向上したことを示す。
論文 参考訳(メタデータ) (2022-03-01T18:38:41Z) - Acting in Delayed Environments with Non-Stationary Markov Policies [57.52103323209643]
本稿では,MDPにおける学習と計画のためのフレームワークについて紹介する。
実行が遅れると、元の状態空間における決定論的マルコフポリシーは最大報酬を得るのに十分であるが、非定常である必要があることを証明します。
我々は、状態拡張に頼らずに遅延実行タスクを解く非定常Q学習スタイルのモデルベースアルゴリズムを考案した。
論文 参考訳(メタデータ) (2021-01-28T13:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。