論文の概要: Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance
- arxiv url: http://arxiv.org/abs/2607.26040v1
- Date: Tue, 28 Jul 2026 17:49:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.953347
- Title: Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance
- Title(参考訳): Reinformed Dreamer:非対称な世界モデル
- Abstract要約: 非対称学習が観察表現および特権情報表現に与える影響について検討する。
本稿では,非対称な非対称表現学習目標を潜在ガイダンスを用いて提案し,新しいアルゴリズムであるReinformed Dreamerを提案する。
- 参考スコア(独自算出の注目度): 1.226598527858578
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Much like humans benefit from guidance while learning, reinforcement learning algorithms may benefit from additional supervision beyond rewards. Leveraging additional information during training to learn better representations and behaviors has been the focus of asymmetric reinforcement learning. This learning paradigm has proven effective under partial observability when additional state information is available, but also under full observability when more refined state information is available. Focusing on model-based reinforcement learning, we study the effect of asymmetric learning on observation representations and on privileged information representations. First, we identify a limitation in the privileged information representations learned by an asymmetric model-based algorithm known as the Informed Dreamer. Then, we propose a novel asymmetric representation learning objective using latent guidance, resulting in a new algorithm called the Reinformed Dreamer. Experiments across several benchmarks show a more consistent improvement over Dreamer than previous asymmetric approaches.
- Abstract(参考訳): 人間が学習中に指導を受けるのと同様に、強化学習アルゴリズムは報酬を超える追加の監督の恩恵を受けるかもしれない。
より良い表現と行動を学ぶためにトレーニング中に追加情報を活用することは、非対称的な強化学習の焦点となっている。
この学習パラダイムは、追加の状態情報が利用可能であれば部分的可観測性の下で有効であるだけでなく、より洗練された状態情報が利用可能であれば完全な可観測性の下でも有効であることが証明されている。
モデルに基づく強化学習に着目し,非対称学習が観察表現や特権情報表現に与える影響について検討する。
まず、非対称なモデルベースアルゴリズムであるInformed Dreamerによって学習された特権情報表現の制限を特定する。
そこで我々は遅延誘導を用いた新しい非対称表現学習目標を提案し,その結果,Reinformed Dreamerと呼ばれる新しいアルゴリズムが得られた。
いくつかのベンチマークの実験では、以前の非対称なアプローチよりもドリーマーよりも一貫した改善が見られた。
関連論文リスト
- Mutual Information guided Visual Contrastive Learning [8.058961687401627]
本研究では,実世界の分布から計算した相互情報に基づいて,学習データを選択する可能性を検討する。
提案手法は,複数の最先端表現学習フレームワークにまたがって,複数のベンチマークに対して提案した相互情報インフォームドデータ拡張手法を評価する。
論文 参考訳(メタデータ) (2025-10-26T20:43:29Z) - A Probabilistic Model Behind Self-Supervised Learning [53.64989127914936]
自己教師付き学習(SSL)では、アノテートラベルなしで補助的なタスクを通じて表現が学習される。
自己教師型学習のための生成潜在変数モデルを提案する。
対照的な方法を含む識別的SSLのいくつかのファミリーは、表現に匹敵する分布を誘導することを示した。
論文 参考訳(メタデータ) (2024-02-02T13:31:17Z) - Revisiting Self-supervised Learning of Speech Representation from a
Mutual Information Perspective [68.20531518525273]
我々は、情報理論の観点から、既存の自己教師型音声の手法を詳しく検討する。
我々は線形プローブを用いて、対象情報と学習された表現の間の相互情報を推定する。
我々は、ラベルを使わずに、データの異なる部分間の相互情報を見積もる自己教師型の表現を評価する可能性を探る。
論文 参考訳(メタデータ) (2024-01-16T21:13:22Z) - Self-Supervised Image Representation Learning: Transcending Masking with
Paired Image Overlay [10.715255809531268]
本稿では,自己教師型学習には適用されていない画像のオーバーレイ化という,新たな画像強調手法を提案する。
提案手法は,ダウンストリームタスクにおいて確固とした性能を示す自己教師付き学習手法であるコントラスト学習を用いて評価する。
論文 参考訳(メタデータ) (2023-01-23T07:00:04Z) - Understanding Self-Predictive Learning for Reinforcement Learning [61.62067048348786]
強化学習のための自己予測学習の学習ダイナミクスについて検討する。
本稿では,2つの表現を同時に学習する新しい自己予測アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-12-06T20:43:37Z) - ReSSL: Relational Self-Supervised Learning with Weak Augmentation [68.47096022526927]
自己教師付き学習は、データアノテーションなしで視覚表現を学ぶことに成功しました。
本稿では,異なるインスタンス間の関係をモデル化して表現を学習する新しいリレーショナルSSLパラダイムを提案する。
提案したReSSLは,性能とトレーニング効率の両面で,従来の最先端アルゴリズムよりも大幅に優れています。
論文 参考訳(メタデータ) (2021-07-20T06:53:07Z) - Distill on the Go: Online knowledge distillation in self-supervised
learning [1.1470070927586016]
最近の研究では、より広範でより深いモデルは、小さなモデルよりも自己監督学習の恩恵を受けることが示されている。
単段階オンライン知識蒸留を用いた自己指導型学習パラダイムであるDistill-on-the-Go(DoGo)を提案する。
以上の結果から,ノイズラベルや限定ラベルの存在下でのパフォーマンス向上がみられた。
論文 参考訳(メタデータ) (2021-04-20T09:59:23Z) - Self-supervised Co-training for Video Representation Learning [103.69904379356413]
実例に基づく情報ノイズコントラスト推定訓練に意味クラス正の付加を施すことの利点について検討する。
本稿では,インフォネッションNCEの損失を改善するための,自己指導型協調学習手法を提案する。
本研究では,2つの下流タスク(行動認識とビデオ検索)における学習表現の質を評価する。
論文 参考訳(メタデータ) (2020-10-19T17:59:01Z) - Explainable Recommender Systems via Resolving Learning Representations [57.24565012731325]
説明はユーザー体験を改善し、システムの欠陥を発見するのに役立つ。
本稿では,表現学習プロセスの透明性を向上させることによって,説明可能な新しい推薦モデルを提案する。
論文 参考訳(メタデータ) (2020-08-21T05:30:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。