論文の概要: Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
- arxiv url: http://arxiv.org/abs/2609.08404v1
- Date: Tue, 08 Sep 2026 08:14:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.61569
- Title: Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
- Title(参考訳): スキャフォールドとしての環境:長期タスクにおけるブートストラップ型自己進化エージェントへのフィードバック
- Abstract要約: 大規模言語モデルは静的推論において顕著な習熟性を示す。
長期作業のための強化学習(Reinforcement Learning, RL)を通じて自律的なエージェントとして訓練することは、しばしば深刻な報酬の分散によって妨げられる。
textbfFeedback-textbfEnriched textbfFEEsを構築することにより、テキスト環境側適応へのパラダイムシフトを提案する。
- 参考スコア(独自算出の注目度): 19.050938256251367
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models demonstrate remarkable proficiency in static reasoning, yet training them as autonomous agents through Reinforcement Learning (RL) for long-horizon tasks is often hindered by severe reward sparsity. While conventional \textit{agent-side warming} up via supervised fine-tuning (SFT) can alleviate this, it is frequently limited by data scarcity and constrained exploration. To address this, we propose a paradigm shift to \textit{environment-side adaptation} by constructing \textbf{F}eedback-\textbf{E}nriched \textbf{E}nvironments (\textbf{FEEs}). Through a pilot study, we establish a feedback design strategy that reformulates environments by transitioning from action guidance to observation enrichment during the later stages of both intra-episode exploration and inter-episode evolution. Large-scale experiments on SciWorld and BFCL benchmarks using various Qwen3 model scales and RL algorithms such as GRPO, GSPO, and DAPO demonstrate that FEEs consistently yield performance improvements over standard settings. Furthermore, our analysis reveals that training with FEEs \textbf{(1)} stabilizes training dynamics by reducing entropy volatility, \textbf{(2)} facilitates proactive state-space exploration in difficult tasks, \textbf{(3) }ensures the internalization of environmental guidance into policy weights rather than acting as a mere inference-time prior, and \textbf{(4) }identifies intra-group feedback consistency as a critical boundary for stable optimization.
- Abstract(参考訳): 大規模言語モデルは静的推論において顕著な習熟度を示すが、強化学習(Reinforcement Learning, RL)による自律的なエージェントとしての訓練は、しばしば深刻な報酬の分散によって妨げられる。
従来の「textit{agent-side warming}」は、教師付き微調整(SFT)によってこれを緩和できるが、データ不足と制限された探索によってしばしば制限される。
そこで本研究では, \textbf{F}eedback-\textbf{E}nriched \textbf{E}nvironments (\textbf{FEEs})を構築することにより, \textit{environment-side adaptation}へのパラダイムシフトを提案する。
パイロットスタディを通じて,エポソード内探査とエポソード間進化の後期において,アクションガイダンスから観測エンリッチメントへの移行によって環境を再構築するフィードバック設計戦略を確立する。
様々なQwen3モデルスケールとGRPO、GSPO、DAPOといったRLアルゴリズムを用いたSciWorldとBFCLベンチマークの大規模な実験は、FEEが標準設定よりも一貫してパフォーマンス改善をもたらすことを示した。
さらに、FEEs \textbf{(1)} によるトレーニングは、エントロピーのボラティリティを低減し、トレーニングダイナミクスを安定化させ、 \textbf{(2)} は、困難なタスクにおける積極的な状態空間探索を促進し、 \textbf{(3) } は、単なる推論時間としてではなく、環境ガイダンスを政策重みに内部化すること、 \textbf{(4) } は、グループ内フィードバックの一貫性を安定最適化の重要な境界として特定することを明らかにする。
関連論文リスト
- Making Every Step Count: Spatio-Temporal Information Allocation for Imaging Inverse Problems [63.904793414062816]
スペクトルベーススケジューリング(SAS)と計測分割アテンション(MPA)の2つの補完的およびトレーニング不要なコンポーネントを紹介する。
SASは、利用可能なNFEを、スペクトルおよびlogSNR幾何に従ってフロータイムに分散し、セマンティック探索と詳細精細化のバランスを良くする。
MPAは情報を弱い制約のある領域へ誘導し、意味的および構造的忠実性を高める。
論文 参考訳(メタデータ) (2026-08-12T07:39:22Z) - Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - Embedding-perturbed Exploration Preference Optimization for Flow Models [23.146684617048674]
本稿では,埋め込みレベルの摂動による最適化を実現する新しいフレームワークを提案する。
提案手法は, 試料群内における構造的, 埋め込みレベルの摂動を導入し, 安定な分散を保証している。
我々のアプローチは最先端のベースラインを大きく上回っている。
論文 参考訳(メタデータ) (2026-05-15T09:56:40Z) - AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning [13.755500788361815]
強化学習(RL)は、大規模言語モデル(LLM)エージェントが環境と相互作用し、マルチターンタスクを解く能力を大幅に改善した。
既存のアプローチは、プロセス報酬モデルや補助的な自己監督信号など、密集した中間監視を導入することが多い。
本稿では、RLトレーニング中にエントロピーダイナミクスを適応的に調整し、探索・探索トレードオフを改善するための監督不要な信用割当手法であるAEMを提案する。
論文 参考訳(メタデータ) (2026-05-01T05:54:37Z) - LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions [0.0]
本稿では,非マルコフ決定プロセスと古典的強化学習アーキテクチャのギャップを埋める新しいフレームワークである予測強化学習(ARL)を紹介する。
ジャンプ拡散と構造破壊によって特徴づけられる環境では、伝統的な状態に基づく手法は、正確なフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアフォアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホアホ
論文 参考訳(メタデータ) (2026-04-06T13:15:44Z) - Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments [38.97818584066075]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、長期にわたる人間のインタラクションから複雑な推論を学ぶためのエージェントである。
現在のトレーニングパラダイムは、一般化能力、エラー回復、トレーニング安定性のバランスをとるのに苦労しています。
本稿では,不完全な軌跡から厳密な監視を抽出するためのフレームワークである,ステップアウェアコントラストアライメント(SACA)を紹介する。
論文 参考訳(メタデータ) (2026-03-10T14:45:50Z) - GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler [54.10960908347221]
我々は、学習可能な密度から条件付きサンプリングとして潜在思考探索をモデル化し、このアイデアをガウス思想サンプリング(GTS)としてインスタンス化する。
GTSは、連続的推論状態における文脈依存摂動分布を予測し、バックボーンを凍結させながらGRPOスタイルのポリシー最適化を訓練する。
論文 参考訳(メタデータ) (2026-02-15T09:57:47Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Rediscovering Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning [55.59724323303857]
本稿では,3つのコンポーネントによる探索と利用のバランスをとるフレームワークを提案する。
複数の数学的推論ベンチマークの実験は、AERが一貫してベースラインを上回り、推論精度と探索能力の両方を改善していることを示している。
論文 参考訳(メタデータ) (2025-10-13T03:10:26Z) - Don't Just Fine-tune the Agent, Tune the Environment [25.7349297100143]
合成データの微調整の監督は、過度な適合につながる。
標準的な強化学習は、重要なコールドスタート問題とトレーニング不安定性に苦慮している。
本研究は,静的軌道の教師付き微調整から動的環境探索へのパラダイムシフトを示す。
論文 参考訳(メタデータ) (2025-10-11T12:35:15Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。