論文の概要: Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models
- arxiv url: http://arxiv.org/abs/2606.24962v1
- Date: Tue, 23 Jun 2026 09:13:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.07221
- Title: Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models
- Title(参考訳): 大規模決定モデルを用いたスケーラブルなマルチタスク強化学習に向けて
- Authors: Thibaut Kulak,
- Abstract要約: マルチタスク・マルチモーダルトランスフォーメーションである LDM-v0 を導入し,複数のドメインとモダリティにまたがる数千の環境から収集したトラジェクトリをオフラインでトレーニングした。
本研究では,ロボット工学,自律運転,在庫管理,サイバーセキュリティ,トレーディング,ビデオゲームなど,約1,000の環境において,個別に訓練されたタスク固有参照ポリシーの性能に一致した1つの事前訓練モデルを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in large-scale sequence modeling has shown that a single model can learn useful representations across highly diverse data distributions. Inspired by these advances, we investigate whether a unified transformer policy can be trained across large collections of heterogeneous reinforcement learning environments. We introduce LDM-v0, a Large Decision Model trained offline on trajectories collected from thousands of environments spanning multiple domains and modalities. LDM-v0 is a multi-task, multi-modal transformer policy conditioned on histories of observations, actions, rewards, and termination signals, and trained through supervised next-action prediction over offline trajectories. We describe the environment infrastructure, automated data generation pipeline, model architecture, and training methodology used to build LDM-v0, and evaluate its performance across diverse environments. We show that a single pretrained model matches the performance of independently trained task-specific reference policies on approximately 1,000 environments including robotics, autonomous driving, inventory management, cybersecurity, trading, and video games. These results demonstrate the feasibility of large-scale offline pretraining across heterogeneous reinforcement learning environments using a single transformer policy.
- Abstract(参考訳): 大規模シーケンスモデリングの最近の進歩は、単一のモデルが高度に多様なデータ分布にまたがる有用な表現を学習できることを示してきた。
これらの進歩に触発されて、異種強化学習環境の多種集合にまたがって、統一的なトランスフォーマーポリシーを訓練できるかどうかを検討する。
LDM-v0(Large Decision Model)は、複数のドメインとモダリティにまたがる数千の環境から収集された軌道上で、オフラインでトレーニングされた大規模決定モデルである。
LDM-v0は、観測、行動、報酬、終了信号の履歴に基づいて条件付きマルチタスクのマルチモーダルトランスフォーマーポリシーであり、オフライン軌道上の教師付き次アクション予測によって訓練される。
環境インフラ、自動データ生成パイプライン、モデルアーキテクチャ、LDM-v0を構築するのに使用されるトレーニング方法論を説明し、その性能を様々な環境にわたって評価する。
本研究では,ロボット工学,自律運転,在庫管理,サイバーセキュリティ,トレーディング,ビデオゲームなど,約1,000の環境において,個別に訓練されたタスク固有参照ポリシーの性能に一致した1つの事前訓練モデルを示す。
これらの結果から,一変圧器ポリシを用いた多種強化学習環境における大規模オフライン事前学習の実現可能性を示した。
関連論文リスト
- MultiMAE Meets Earth Observation: Pre-training Multi-modal Multi-task Masked Autoencoders for Earth Observation Tasks [11.359741665798195]
本稿では,地球観測(EO)データに対する,より柔軟なマルチモーダル・マルチタスク事前学習戦略について検討する。
具体的には,マルチモーダルなマルチタスク・マスケッド・オートエンコーダ(MultiMAE)を採用し,多様な入力モダリティを再構成することによって事前学習を行う。
提案手法は,モダリティ固有の事前学習モデルを必要とせず,多様な入力構成を処理し,高い柔軟性を示す。
論文 参考訳(メタデータ) (2025-05-20T22:24:36Z) - From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons [85.99268361356832]
一般身体エージェント(GEA)にMLLMを適用するプロセスを紹介する。
GEAは、多体アクショントークンーザを通じて、さまざまなドメインにまたがって自分自身をグラウンド化できる単一の統一モデルである。
本研究は,汎用エージェント構築のためのクロスドメインデータとオンラインRLを用いたトレーニングの重要性を明らかにした。
論文 参考訳(メタデータ) (2024-12-11T15:06:25Z) - An Interactive Agent Foundation Model [49.77861810045509]
本稿では,AIエージェントを訓練するための新しいマルチタスクエージェントトレーニングパラダイムを用いた対話型エージェント基礎モデルを提案する。
トレーニングパラダイムは、視覚マスク付きオートエンコーダ、言語モデリング、次世代の予測など、多様な事前学習戦略を統一する。
私たちは、ロボティクス、ゲームAI、ヘルスケアという3つの異なる領域でフレームワークのパフォーマンスを実演します。
論文 参考訳(メタデータ) (2024-02-08T18:58:02Z) - PASTA: Pretrained Action-State Transformer Agents [10.654719072766495]
自己教師型学習は、様々なコンピューティング領域において革命的なパラダイムシフトをもたらした。
最近のアプローチでは、大量のラベルのないデータに基づいて、トランスフォーマーモデルを事前訓練する。
強化学習において、研究者は最近これらのアプローチに適応し、専門家の軌道で事前訓練されたモデルを開発した。
論文 参考訳(メタデータ) (2023-07-20T15:09:06Z) - Model-Based Reinforcement Learning with Multi-Task Offline Pretraining [59.82457030180094]
本稿では,オフラインデータから新しいタスクへ,潜在的に有用なダイナミックスや動作デモを伝達するモデルベースRL法を提案する。
主な考え方は、世界モデルを行動学習のシミュレーターとしてだけでなく、タスクの関連性を測定するツールとして使うことである。
本稿では,Meta-WorldとDeepMind Control Suiteの最先端手法と比較して,我々のアプローチの利点を実証する。
論文 参考訳(メタデータ) (2023-06-06T02:24:41Z) - Emergent Agentic Transformer from Chain of Hindsight Experience [96.56164427726203]
簡単なトランスフォーマーベースモデルが時間差と模倣学習に基づくアプローチの両方と競合することを示す。
単純なトランスフォーマーベースのモデルが時間差と模倣学習ベースのアプローチの両方で競合するのはこれが初めてである。
論文 参考訳(メタデータ) (2023-05-26T00:43:02Z) - Multitask Adaptation by Retrospective Exploration with Learned World
Models [77.34726150561087]
本稿では,タスク非依存ストレージから取得したMBRLエージェントのトレーニングサンプルを提供するRAMaというメタ学習型アドレッシングモデルを提案する。
このモデルは、期待されるエージェントのパフォーマンスを最大化するために、ストレージから事前のタスクを解く有望な軌道を選択することで訓練される。
論文 参考訳(メタデータ) (2021-10-25T20:02:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。