論文の概要: DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum
- arxiv url: http://arxiv.org/abs/2609.19801v2
- Date: Wed, 23 Sep 2026 11:40:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.640318
- Title: DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum
- Title(参考訳): DeliveryGym:適応型カリキュラムを用いた長距離エージェント計画のためのRL環境
- Abstract要約: 本研究では,連続的クーリエシフトにおけるエージェントの評価とトレーニングを行う3D環境であるDeliveryGymを紹介する。
永続的な世界力学とマルチモーダルツールの相互作用を結合し、シミュレータイベントからの軌道報酬を計算する。
また、政策の観察された弱点に将来的なトレーニングのシフトを適応させ、評価を一定に保ちます。
- 参考スコア(独自算出の注目度): 6.162129642161123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Executable environments enable LLM agents to learn from the consequences of their actions. For embodied agents, those consequences extend beyond whether the current task succeeds: completing a delivery can consume the time, energy, or money needed for later work. Learning to plan therefore requires environments that preserve these dependencies and turn them into feedback across a complete trajectory. We introduce DeliveryGym, a 3D environment for evaluating and training agents on continuous courier shifts. It couples multimodal tool interaction with persistent world dynamics and computes trajectory rewards from simulator events, making the costs of an agent's decisions available for reinforcement learning (RL). The environment also adapts future training shifts to the policy's observed weaknesses while keeping evaluation fixed. Across six models and 13 city maps, evaluation exposes a gap between reliably executing assigned deliveries and choosing and sequencing work over a shift. On the unseen-city test set, RL improves Qwen3-VL-4B's net income by 54.3%, showing that learning from complete shifts improves performance under these coupled constraints. Adapting the training environment improves evaluation income by 18% over uniform sampling at 100 updates, indicating that which situations an agent practices also matters. DeliveryGym provides an executable setting for studying how agents learn to coordinate deliveries and preserve resources for later orders within an episode.
- Abstract(参考訳): 実行可能な環境により、LLMエージェントはアクションの結果から学習することができる。
実施エージェントの場合、これらの結果は現在のタスクが成功するかどうかを超える。
そのため、計画を学ぶには、これらの依存関係を保持し、完全な軌道を越えてフィードバックする環境が必要です。
本研究では,連続的クーリエシフトにおけるエージェントの評価とトレーニングを行う3D環境であるDeliveryGymを紹介する。
永続的世界力学とマルチモーダルツールの相互作用を結合し、シミュレータイベントからの軌道報酬を計算し、エージェントの決定のコストを強化学習(RL)に充てる。
環境はまた、評価を一定に保ちつつ、政策の観察された弱点に将来のトレーニングシフトを適用する。
6つのモデルと13の都市マップにまたがって評価は、確実に割り当てられた配送と、シフトによる作業の選択とシークエンシングのギャップを露呈する。
予期せぬシティテストセットでは、RLはQwen3-VL-4Bの純利益を54.3%改善し、完全なシフトからの学習がこれらの制約の下でパフォーマンスを向上させることを示した。
トレーニング環境への適応は、100回の更新で一様サンプリングよりも18%向上し、エージェントの実践する状況も重要であることを示す。
DeliveryGymは、エージェントが納品を調整し、後続の注文に対してリソースを保存する方法を学ぶための実行可能な設定を提供する。
関連論文リスト
- Cross-Benchmark Generalization in Long-Horizon Agents [1.0742728354283815]
我々は,27のカテゴリにわたる363の長距離モデルコンテキストプロトコル(MCP)タスク上で,オープンウェイト・ミックス・オブ・エキスパート・モデルを構築した。
トレーニングには外部ベンチマークタスクやグレーダが入らず、報酬、ハイパーパラメータのトレーニング、トレーニングされたチェックポイントの選択、停止を外部スコアが知らせなかった。
両方のソフトウェアベンチマークは、ソフトウェアエンジニアリングタスクを含まないトレーニングコレクションにもかかわらず改善されている。
論文 参考訳(メタデータ) (2026-07-31T18:05:36Z) - SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - SEAL: Synergistic Co-Evolution of Agents and Learning Environments [11.720414165425256]
大きな言語モデル(LLM)エージェントは、インタラクションによってますます改善されている。
ほとんどの自己進化的手法は、政策または学習環境を独立に適応させる。
対話型ツール利用エージェントのためのクローズドループ共進化フレームワークSEALを提案する。
論文 参考訳(メタデータ) (2026-05-23T06:41:31Z) - Can RL Improve Generalization of LLM Agents? An Empirical Study [68.19349692042341]
Reinforcement Fine-tuning (RFT) は環境フィードバックに基づいてマルチターン意思決定を行うための LLM エージェントの訓練を約束している。
現実世界のデプロイメントでは、エージェントは異なるバックグラウンド知識を持つ見えない環境で動作することができる。
RFTは環境内のタスクの難易度でよく一般化されるが、見えない環境へのより弱い移動を示す。
論文 参考訳(メタデータ) (2026-03-12T14:54:59Z) - Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Fast Adaptation with Behavioral Foundation Models [82.34700481726951]
教師なしゼロショット強化学習は、行動基礎モデルの事前学習のための強力なパラダイムとして登場した。
有望な結果にもかかわらず、ゼロショットポリシーは、教師なしのトレーニングプロセスによって引き起こされるエラーにより、しばしば準最適である。
本稿では,事前訓練されたBFMの低次元タスク埋め込み空間を探索し,ゼロショットポリシーの性能を急速に向上させる高速適応手法を提案する。
論文 参考訳(メタデータ) (2025-04-10T16:14:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。