論文の概要: Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos
- arxiv url: http://arxiv.org/abs/2610.02012v1
- Date: Thu, 01 Oct 2026 16:38:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.292816
- Title: Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos
- Title(参考訳): Bellman氏とLyapunov氏:マスタリングカオスによる教師なし強化学習
- Abstract要約: 本稿では,制御可能情報生産(CIP)目標のRLネイティブな定式化であるForward CIP(F-CIP)を紹介する。
我々は、F-CIPがRLと互換性があることを証明し、既存のアルゴリズムでその効果を実証する。
- 参考スコア(独自算出の注目度): 1.8540341223394285
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) is a powerful paradigm for training agents, yet its success rests on domain expertise of human engineers who design informative reward signals for every new task. Unsupervised RL aims to reduce this engineering with intrinsic motivation (IM): reward signals that emerge from the agent environment interaction itself. Existing IM objectives, however, involve the selection of information variables, which re-introduces domain expertise the field has sought to eliminate. We introduce Forward CIP (F-CIP), an RL-native formulation of the Controllable Information Production (CIP) objective, which is defined by the system's dynamics alone and requires no such selection. We prove that F-CIP is compatible with RL and demonstrate its effectiveness with existing algorithms. Training agents with F-CIP results in unsupervised discovery of primitive behaviors such as balancing and maintaining controllability, which are essential for more complex robot behaviors. Paired with a simple forward-velocity reward, our method produces coordinated gaits such as hopping and running which otherwise require reward engineering to learn.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、訓練エージェントの強力なパラダイムであるが、その成功は、新しいタスクごとに情報的な報奨信号を設計するヒューマンエンジニアの専門知識に依存している。
教師なしRLは、エージェント環境の相互作用そのものから生じる報酬信号(intrinsic motivation:IM)によって、この工学を減らすことを目的としている。
しかし、既存のIMの目的には情報変数の選択が含まれており、フィールドが排除しようとしている分野の専門知識を再導入する。
本稿では,制御可能情報生産(CIP)目標の RL ネイティブな定式化である Forward CIP (F-CIP) を紹介する。
我々は、F-CIPがRLと互換性があることを証明し、既存のアルゴリズムでその効果を実証する。
F-CIPのトレーニングエージェントは、より複雑なロボットの動作に不可欠なバランスや制御可能性の維持といった原始的な振る舞いを教師なしで発見する。
簡単な前方移動報酬を付与して、ホッピングやランニングなどの協調歩行を生成し、それ以外は学習に報奨工学を必要とする。
関連論文リスト
- Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Differentiable Evolutionary Reinforcement Learning [41.96953381133274]
本稿では,最適な報酬信号の自律的発見を可能にする二段階フレームワークであるDerL(Deriable Evolutionary Reinforcement Learning)を提案する。
DERLはメタ最適化において微分可能であり、内部ループ検証性能を強化学習を通じてメタrを更新する信号として扱う。
実験結果から,ALFWorldとScienceWorldにおけるDerLの最先端性能は,報酬に依存した手法よりも優れていた。
論文 参考訳(メタデータ) (2025-12-15T14:50:08Z) - Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control [0.0]
非侵襲脳波(EEG)信号を利用した暗黙のフィードバック(RLIHF)フレームワークによる新しい強化学習を提案する。
我々は,Kinova Gen2ロボットアームを用いて,MuJoCo物理エンジン上に構築したシミュレーション環境におけるアプローチを評価した。
結果は、デコードされた脳波フィードバックで訓練されたエージェントが、密集した手作業による報酬で訓練されたエージェントに匹敵するパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2025-11-18T22:50:32Z) - CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards [80.78748457530718]
自己進化(Self-evolution)は、大規模言語モデル(LLM)ベースのエージェントが事前トレーニング後の能力を継続的に改善できるようにする上で、中心的な研究トピックである。
エージェントがエージェント間相互作用から学習することで自律的に改善できる新しいフレームワークであるCo-Evolving Multi-Agent Systems (CoMAS)を紹介する。
論文 参考訳(メタデータ) (2025-10-09T17:50:26Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Application of LLM Guided Reinforcement Learning in Formation Control with Collision Avoidance [1.1718316049475228]
マルチエージェントシステム(Multi-Agent Systems、MAS)は、個々のエージェントの協調作業を通じて複雑な目的を達成する。
本稿では,効果的な報酬関数を設計する上での課題を克服する新しい枠組みを提案する。
タスクの優先順位付けにおいて,大規模言語モデル(LLM)を付与することにより,オンライン上で動的に調整可能な報酬関数を生成する。
論文 参考訳(メタデータ) (2025-07-22T09:26:00Z) - PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement [16.768912344111946]
本稿では,タスクに依存しない報酬関数をビデオから学習するフレームワークであるProgESSORを提案する。
ProGRESSORは、ロボットが外部の監督なしに複雑な動作を学習できるようにする。
論文 参考訳(メタデータ) (2024-11-26T04:17:51Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Explore and Control with Adversarial Surprise [78.41972292110967]
強化学習(Reinforcement Learning, RL)は、目標指向のポリシーを学習するためのフレームワークである。
本稿では,RLエージェントが経験した驚きの量と競合する2つのポリシーを相殺する対戦ゲームに基づく,新しい教師なしRL手法を提案する。
本手法は, 明確な相転移を示すことによって, 複雑なスキルの出現につながることを示す。
論文 参考訳(メタデータ) (2021-07-12T17:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。