論文の概要: In-Context Reinforcement Learning under Non-Stationarity: A Survey
- arxiv url: http://arxiv.org/abs/2607.11906v1
- Date: Wed, 01 Jul 2026 12:55:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.402173
- Title: In-Context Reinforcement Learning under Non-Stationarity: A Survey
- Title(参考訳): 非定常環境下でのインテクスト強化学習に関する調査
- Authors: A Run, Ziluo Ding,
- Abstract要約: インコンテキスト強化学習(In-context reinforcement learning)は、訓練済みまたは微調整された決定モデルが潜在タスクルールを推論する能力である。
環境の変化において、蓄積されたコンテキストは、固定されたタスクに関する単なる証拠ではない。
我々は、非定常ICRLを、配置されたポリシーパラメータが固定されたまま、コンテキストを通した適応の問題として調査する。
- 参考スコア(独自算出の注目度): 7.522032549330931
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The development of decision-pretrained transformers, algorithm distillation, long-context meta-RL, and retrieval-augmented agents has renewed interest in in-context reinforcement learning (ICRL): the ability of a pretrained or fine-tuned decision model to infer latent task rules and improve future behavior from interaction context, without test-time parameter updates. This line of work asks when trial-and-error evidence, rewards, transitions, demonstrations, feedback, or retrieved experience can make learning-like computation happen inside the context window. However, existing surveys of ICRL mainly organize the field around pretraining objectives, architectures, context formats, evaluation protocols, and theoretical mechanisms, while the non-stationary setting remains comparatively underexamined. In changing environments, accumulated context is not merely more evidence about a fixed task: the reward specification, transition kernel, observation channel, action interface, constraint model, or demonstration and memory distribution can fall out of alignment with the current regime. Previously useful context can therefore become stale, misleading, or useful again when an old regime returns. We survey non-stationary ICRL as the problem of adapting through context while deployed policy parameters remain fixed: the policy must infer both the current decision rule and which parts of its accumulated evidence still support that rule. We define non-stationary ICRL, relate it to meta-RL, decision sequence modeling, retrieval-augmented RL, value- and model-aware ICRL, and reward-feedback agents, and organize the literature along three questions: what changes, how the change unfolds, and how observable the change is to the agent.
- Abstract(参考訳): 意思決定事前変換器,アルゴリズム蒸留,長文メタRL,検索強化エージェントの開発は,テキスト内強化学習(ICRL:In-context reinforcement learning)に新たな関心を寄せている。
この一連の作業は、試行錯誤のエビデンス、報酬、トランジション、デモ、フィードバック、あるいは検索されたエクスペリエンスが、コンテキストウィンドウ内で学習のような計算を行うことができるかどうかを問うものだ。
しかし、ICRLの既存の調査は、主に事前学習対象、アーキテクチャ、コンテキストフォーマット、評価プロトコル、理論メカニズムに関する分野を整理しているが、非定常設定は比較的過小評価されている。
環境の変化において、蓄積されたコンテキストは固定されたタスクに関する単なる証拠ではない。報酬仕様、トランジションカーネル、観察チャネル、アクションインターフェース、制約モデル、あるいはデモとメモリの分散は現在の状態と一致しない可能性がある。
これまでの有用なコンテキストは、古いレシエーションが戻ると、陳腐化、誤解を招く、あるいは再び有用になる可能性がある。
我々は,非定常ICRLを,配置された政策パラメータが固定されているままの状況に適応する問題として調査し,その決定ルールと蓄積された証拠のどの部分がまだそのルールを支持しているのかを推測しなければならない。
我々は、非定常ICRLを定義し、メタRL、決定シーケンスモデリング、検索強化RL、値およびモデル認識ICRL、報酬フィードバックエージェントを関連づけ、どのような変化、どのように変化が展開され、どのように変化がエージェントに観測されるかという3つの質問に沿って、文献を整理する。
関連論文リスト
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning [65.67266333751569]
現在のLRM(Large Reasoning Models)は、空間推論タスクにおいて顕著な汎用性を示すが、性能は著しく劣る。
本研究では,内的推論プロセスを対象とした自己指導型強化学習フレームワークを提案する。
このラベルのない整合性トレーニングは,地道的な監督によって訓練されたモデルの精度にアプローチし,多様なタスクやデータ領域にまたがる同様の一般化を実現することを示す。
論文 参考訳(メタデータ) (2026-06-10T10:50:06Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - Towards Monotonic Improvement in In-Context Reinforcement Learning [18.67894044930047]
In-Context Reinforcement Learning (ICRL)は、新しいタスクに迅速に適応できるエージェントを開発するための有望なパラダイムとして登場した。
最近のアプローチでは、オンラインRLからモノトニックポリシー改善データに関する大規模なシーケンスモデルをトレーニングしており、テスト時間のパフォーマンスを継続的に改善することを目指している。
学習時間とテスト時間の両方でコンテキスト値を推定する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-09-27T09:42:19Z) - Observations Meet Actions: Learning Control-Sufficient Representations for Robust Policy Generalization [6.408943565801689]
潜時変化("contexts")をキャプチャすることは、強化学習(RL)エージェントをトレーニング体制を越えて展開する上で鍵となる。
我々は、コンテキストベースのRLを二重推論制御問題として再認識し、2つの特性とその階層を正式に特徴付ける。
我々は,表現学習と政策学習をきれいに分離する,ELBOスタイルの文脈的エビデンスを導出する。
論文 参考訳(メタデータ) (2025-07-25T17:08:16Z) - Continual Task Learning through Adaptive Policy Self-Composition [54.95680427960524]
CompoFormerは構造ベースの連続トランスフォーマーモデルであり、メタポリシックネットワークを介して、以前のポリシーを適応的に構成する。
実験の結果,CompoFormerは従来の継続学習法(CL)よりも優れており,特にタスクシーケンスが長いことが判明した。
論文 参考訳(メタデータ) (2024-11-18T08:20:21Z) - Dynamics-Adaptive Continual Reinforcement Learning via Progressive
Contextualization [29.61829620717385]
動的環境におけるCRL(Continuous reinforcement Learning)の鍵となる課題は、環境が生涯にわたって変化するにつれて、RLエージェントの挙動を迅速に適応させることである。
DaCoRLは、進行的文脈化を用いた文脈条件付きポリシーを学習する。
DaCoRLは、安定性、全体的な性能、一般化能力の観点から、既存の方法よりも一貫した優位性を特徴としている。
論文 参考訳(メタデータ) (2022-09-01T10:26:58Z) - Contextualize Me -- The Case for Context in Reinforcement Learning [49.794253971446416]
文脈強化学習(cRL)は、このような変化を原則的にモデル化するためのフレームワークを提供する。
我々は,cRLが有意義なベンチマークや一般化タスクに関する構造化推論を通じて,RLのゼロショット一般化の改善にどのように貢献するかを示す。
論文 参考訳(メタデータ) (2022-02-09T15:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。