論文の概要: Contextual Intelligence The Next Leap for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.02348v1
- Date: Tue, 17 Feb 2026 11:12:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.320911
- Title: Contextual Intelligence The Next Leap for Reinforcement Learning
- Title(参考訳): 強化学習におけるコンテキストインテリジェンス
- Authors: André Biedenkapp,
- Abstract要約: 強化学習(Reinforcement Learning、RL)は、ゲーム、ロボティクス、継続的な制御において素晴らしい成果を上げている。
コンテキスト的RL(cRL)に関する最近の研究は、環境特性(コンテキスト)にエージェントを露出させることで、ゼロショット転送が改善されていることを示している。
本稿では,アロゲン(環境影響)と自律的(エージェント駆動)因子を分離する文脈の新たな分類法を提案する。
- 参考スコア(独自算出の注目度): 4.1558950738080105
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has produced spectacular results in games, robotics, and continuous control. Yet, despite these successes, learned policies often fail to generalize beyond their training distribution, limiting real-world impact. Recent work on contextual RL (cRL) shows that exposing agents to environment characteristics -- contexts -- can improve zero-shot transfer. So far, the community has treated context as a monolithic, static observable, an approach that constrains the generalization capabilities of RL agents. To achieve contextual intelligence we first propose a novel taxonomy of contexts that separates allogenic (environment-imposed) from autogenic (agent-driven) factors. We identify three fundamental research directions that must be addressed to promote truly contextual intelligence: (1) Learning with heterogeneous contexts to explicitly exploit the taxonomy levels so agents can reason about their influence on the world and vice versa; (2) Multi-time-scale modeling to recognize that allogenic variables evolve slowly or remain static, whereas autogenic variables may change within an episode, potentially requiring different learning mechanisms; (3) Integration of abstract, high-level contexts to incorporate roles, resource & regulatory regimes, uncertainties, and other non-physical descriptors that crucially influence behavior. We envision context as a first-class modeling primitive, empowering agents to reason about who they are, what the world permits, and how both evolve over time. By doing so, we aim to catalyze a new generation of context-aware agents that can be deployed safely and efficiently in the real world.
- Abstract(参考訳): 強化学習(Reinforcement Learning、RL)は、ゲーム、ロボティクス、継続的な制御において素晴らしい成果を上げている。
しかし、これらの成功にもかかわらず、学習されたポリシーはトレーニングディストリビューションを超えて一般化することができず、現実世界への影響を制限します。
コンテキスト的RL(cRL)に関する最近の研究は、環境特性(コンテキスト)にエージェントを露出させることで、ゼロショット転送が改善されていることを示している。
これまでのところ、コミュニティはコンテキストをモノリシックで静的な観測可能なものとして扱い、RLエージェントの一般化能力を制限している。
コンテキストインテリジェンスを達成するために、我々はまず、アロゲン(環境影響)を自動生成(エージェント駆動)因子から分離するコンテキストの新たな分類法を提案する。
本研究は, 真に文脈的知性を促進するために対処すべき3つの基本的な研究方向を同定する。(1) 異質な文脈を用いて学習することで, エージェントが世界への影響を解明し, その逆も受けられるように, 1) 異質な変数がゆっくりと進化するか, 静的に保たれているかを認識するマルチ・タイム・スケール・モデリング, 3) 異なる学習メカニズムを必要とする可能性がある, (3) 役割, 資源, 規制体制, 不確実性, および行動に決定的な影響を及ぼす他の非物理的記述物を統合するための抽象的, 高レベルなコンテキストの統合。
我々は、コンテキストを第一級のモデリングプリミティブとして想定し、エージェントにそれらが誰であるか、世界が許すものは何か、そして両者が時間とともにどのように進化するかを判断する権限を与える。
そこで本研究では,リアルタイムに安全かつ効率的に展開可能な,次世代のコンテキスト対応エージェントの触媒化を目指す。
関連論文リスト
- The Landscape of Agentic Reinforcement Learning for LLMs: A Survey [103.32591749156416]
エージェント強化学習(Agentic RL)の出現は、大規模言語モデル(LLM RL)に適用された従来の強化学習からパラダイムシフトを示している。
本研究では, LLM-RLの縮退した単段階マルコフ決定過程(MDPs)と, エージェントRLを定義する部分可観測マルコフ決定過程(POMDPs)とを対比することにより, この概念シフトを定式化する。
論文 参考訳(メタデータ) (2025-09-02T17:46:26Z) - A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence [87.08051686357206]
大きな言語モデル(LLM)は強力な能力を示しているが、基本的に静的である。
LLMはますますオープンでインタラクティブな環境にデプロイされているため、この静的な性質は重要なボトルネックとなっている。
この調査は、自己進化エージェントの体系的で包括的なレビューを初めて提供する。
論文 参考訳(メタデータ) (2025-07-28T17:59:05Z) - Mind the Gap: Towards Generalizable Autonomous Penetration Testing via Domain Randomization and Meta-Reinforcement Learning [15.619925926862235]
GAPは汎用的な自律型ペンテスティングフレームワークである。
現実的な環境で効率的な政策トレーニングを実現することを目的としている。
また、あるインスタンスから他のケースについて推論できるエージェントを訓練する。
論文 参考訳(メタデータ) (2024-12-05T11:24:27Z) - Towards Generalizable Reinforcement Learning via Causality-Guided Self-Adaptive Representations [22.6449779859417]
汎用インテリジェンスには、タスク間の迅速な適応が必要です。
本稿では,分布だけでなく,環境空間も変化するシナリオを幅広く検討する。
我々はCSRと呼ばれる因果性誘導型自己適応表現に基づく手法を導入し、エージェントを効果的に一般化させる。
論文 参考訳(メタデータ) (2024-07-30T08:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。