論文の概要: Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- arxiv url: http://arxiv.org/abs/2607.16204v1
- Date: Thu, 07 May 2026 00:40:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.030553
- Title: Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- Title(参考訳): エージェントRLのためのマスケ拡散言語モデルは強力で安定なテキストベース世界モデルである
- Abstract要約: 我々は、テキストベースの世界モデリングを、初期状態に分解可能な遷移力学問題として定式化する。
我々は、9つのオープンソース環境と12のフロンティアモデルファミリーにまたがる239,403の基底状態行動軌跡をキュレートする。
我々は,決定論的状態チェックを備えたGRPOトレーニングフレームワークを導入し,3つのOOD環境上でゼロショット転送処理を行う。
- 参考スコア(独自算出の注目度): 0.8546394944138487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent growth in reinforcement learning (RL) has surfaced a need for diverse, specialized training environments. Hand-curated environments with fixed task and reward difficulties become ineffective signals as model performance improves, and sparse rewards over long horizons induce mode collapse on specific workflows or tool structures. World models that simulate environment states have matched pure rollout performance, making them promising for scaling diversity on-demand. However, autoregressive (AR) world models suffer from a left-to-right bias preventing conditioning on globally interdependent state anchors such as tool schemas, prior turns, and expected outcomes. We (i) formalize text-based world modeling as a steerable transition-dynamics problem decomposed into initial state, task context, tool schemas, domain rules, and steering directives, and (ii) curate 239,403 grounded state-action trajectories spanning nine open-source environments and twelve frontier model families. We compare AR LMs and masked diffusion language models (MDLMs), showing MDLMs, via bidirectional anchor-aware denoising, achieve better coherence, groundedness, and empirically validated rollout diversity than LLMs over 4x their parameter size, at comparable inference latency. We introduce a plug-and-play GRPO training framework with deterministic state checks, and perform zero-shot transfer ablations on three OOD environments (ScienceWorld, ALFWorld, AppWorld) across three 1.2B-7B agent backbones (LFM2.5, Qwen3, Mistral), achieving up to 47% absolute gains over baselines without environment-specific fine-tuning. We further conduct behavioral analysis of failure modes under adversarial scenarios and human evaluation on realism, outcome correctness, and training utility. We open-source our work to encourage research in this direction.
- Abstract(参考訳): 近年の強化学習(RL)は,多様な専門訓練環境の必要性が表面化している。
モデルの性能が向上するにつれて、一定のタスクや報酬の困難を伴う手作り環境は効果の低い信号となり、長い水平線上の報酬は特定のワークフローやツール構造にモード崩壊を引き起こす。
環境状態をシミュレートする世界モデルは、純粋なロールアウト性能と一致しており、オンデマンドで多様性をスケーリングすることを約束している。
しかし、自己回帰(AR)世界モデルは、ツールスキーマ、事前のターン、期待される結果など、グローバルな相互依存状態アンカーの条件付けを左右にバイアスする。
我が家
一 テキストベースの世界モデリングを、初期状態、タスクコンテキスト、ツールスキーマ、ドメインルール、ステアリングディレクティブに分解可能な遷移力学問題として定式化する。
(i)9つのオープンソース環境と12のフロンティアモデルファミリーにまたがる239,403の接地状態-作用軌道をキュレートする。
我々は,AR LM とマスク拡散言語モデル (MDLM) を比較し,MDLM を双方向アンカー認識デノベーションにより,パラメータの 4 倍のパラメータサイズでのLPM よりも優れたコヒーレンス,グラウンドドネス,および経験的に検証されたロールアウト多様性を実現する。
我々は、決定論的状態チェックを備えたGRPOトレーニングフレームワークを導入し、3つのOOD環境(ScienceWorld, ALFWorld, AppWorld)上で、1.2B-7Bエージェントバックボーン(LFM2.5, Qwen3, Mistral)をまたいだゼロショット転送処理を行い、環境固有の微調整なしで、ベースラインよりも最大47%の絶対的なゲインを達成する。
さらに、敵シナリオ下での障害モードの行動分析と、現実主義、結果の正しさ、トレーニングユーティリティに関する人間による評価を行う。
この方向の研究を促進するために,当社の作業をオープンソースとして公開しています。
関連論文リスト
- Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation [10.364779390403337]
世界モデルは、環境がどのように進化するかを予測する学習された生成モデルであり、サンプル効率のよいロボット学習のための有望なツールとなっている。
本研究では,視覚に基づく四角形ナビゲーションをテストベッド問題とし,環境ランダム性の異なるDreamerV3ベースの世界モデルを訓練する。
そして、すべての世界モデルと関連するナビゲーションポリシーを、すべてのセンサーが切断される前に実際の感覚入力を2.5秒だけ受信するオープンループランなど、目に見えない環境で実際の四角形に展開します。
以上の結果から,SSL事前トレーニング中の世界モデルロバスト性はsim-to-realの強い予測因子であることが示された。
論文 参考訳(メタデータ) (2026-06-03T15:38:36Z) - LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Reinforcement World Model Learning for LLM-based Agents [60.65003139516272]
強化世界モデル学習(Reinforcement World Model Learning, RWML)は、LDMをベースとしたエージェントのための行動教師付き世界モデルを学ぶ自己条件付き手法である。
本手法は, モデルが生成したシミュレーションされた次の状態と, 環境から観測された次の状態とを一致させる。
本手法をALFWorldと2ドルのBenchで評価し,完全に自己管理されているにもかかわらず,ベースモデルに対する大幅な利得を観測した。
論文 参考訳(メタデータ) (2026-02-05T16:30:08Z) - Aligning Agentic World Models via Knowledgeable Experience Learning [68.85843641222186]
環境フィードバックをシンセサイザー化したWorld Knowledge Repositoryを構築するフレームワークであるWorldMindを紹介する。
WorldMindは、優れたクロスモデルとクロス環境転送性を備えたベースラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-19T17:33:31Z) - Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback [51.22403664895878]
Agent2Worldは、強力な推論時ワールドモデル生成を実現するツール拡張マルチエージェントフレームワークである。
また、マルチエージェントフィードバックの生成を基盤にすることで、教師付き微調整のためのデータエンジンとしても機能する。
論文 参考訳(メタデータ) (2025-12-26T18:54:14Z) - From Word to World: Can Large Language Models be Implicit Text-based World Models? [82.47317196099907]
エージェント強化学習は、経験駆動のスケーリングにますます依存している。
世界モデルは、シミュレートされた経験を通して学習効率を改善する潜在的方法を提供する。
大規模言語モデルがこの役割を確実に果たせるか,どのような条件でエージェントに有意義な利益をもたらすかを検討する。
論文 参考訳(メタデータ) (2025-12-21T17:28:42Z) - Internalizing World Models via Self-Play Finetuning for Agentic RL [65.96875390986655]
エージェントとしての大規模言語モデル(LLM)は、しばしばアウト・オブ・ディストリビューション(OOD)のシナリオで苦労する。
状態表現と遷移モデリングという2つのコンポーネントに分解することで、この世界モデルをエンコードする方法を示す。
SPAは,世界モデルを学習するために,セルフプレイ指導による微調整段階を通じてポリシーを冷やし始める,シンプルな強化学習フレームワークである。
論文 参考訳(メタデータ) (2025-10-16T18:03:39Z) - Reinforcement Learning for Machine Learning Model Deployment: Evaluating Multi-Armed Bandits in ML Ops Environments [0.0]
本稿では,強化学習(RL)に基づくモデル管理が,展開決定をより効果的に管理できるかどうかを検討する。
当社のアプローチは、デプロイされたモデルを継続的に評価し、パフォーマンスの低いモデルをリアルタイムでロールバックすることで、より適応的な運用環境を実現する。
この結果から,RLベースのモデル管理は,自動化を向上し,手作業による介入への依存を軽減し,デプロイ後のモデル障害に伴うリスクを軽減することが示唆された。
論文 参考訳(メタデータ) (2025-03-28T16:42:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。