論文の概要: Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization
- arxiv url: http://arxiv.org/abs/2607.00796v1
- Date: Wed, 01 Jul 2026 11:26:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.869789
- Title: Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization
- Title(参考訳): 視覚強化学習一般化のためのタスク関連表現デカップリング
- Abstract要約: 視覚強化学習(VRL)のための自己教師付きタスク関連表現デカップリング(T2RD)アルゴリズムを提案する。
T2RDは、DeepMind Control SuiteとRobotic Manipulationタスクにおいて、ステートオフ・ザ・アーツ(SOTA)の一般化性能とサンプル効率を達成する。
- 参考スコア(独自算出の注目度): 36.5713429464476
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual Reinforcement Learning (VRL) has achieved considerable success in solving control tasks. However, generalizing learned policies to new environments remains a major challenge, as agents often overfit to task-irrelevant features in the training environment. To solve this problem, we introduce the concept of decoupling observations into task-relevant and task-irrelevant representations. Building on this idea, we propose a self-supervised Task-Relevant Representation Decoupling (T2RD) algorithm for VRL. This algorithm consists of three components: task-relevant representation consistency, cross-reconstruction, and cross-dynamic prediction. The first two components achieve the decoupling of content and style features, but the resulting content representations are not necessarily task-relevant. To further refine task-relevant features from content representations, we design the third component that introduces dynamic prediction. T2RD achieves State-Of-The-Art (SOTA) generalization performance and sample efficiency in the DeepMind Control Suite and Robotic Manipulation tasks.
- Abstract(参考訳): 視覚強化学習(VRL)は制御タスクの解法において大きな成功を収めた。
しかし、学習したポリシーを新しい環境に一般化することは大きな課題であり、エージェントはしばしば訓練環境におけるタスク非関連機能に過度に適合する。
この問題を解決するために,タスク関連表現とタスク関連表現に観察を分離する概念を導入する。
このアイデアに基づいて,VRLのための自己教師型タスク関連表現デカップリング(T2RD)アルゴリズムを提案する。
このアルゴリズムは,タスク関連表現整合性,クロスコンストラクション,およびクロスダイナミック予測という3つのコンポーネントから構成される。
最初の2つのコンポーネントはコンテンツとスタイルの特徴の分離を実現するが、結果のコンテンツ表現は必ずしもタスク関連ではない。
コンテンツ表現からタスク関連機能を更に洗練するために,動的予測を導入した第3のコンポーネントを設計する。
T2RDは、DeepMind Control SuiteとRobotic Manipulationタスクにおいて、ステートオフ・ザ・アーツ(SOTA)の一般化性能とサンプル効率を達成する。
関連論文リスト
- MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization [52.149337961205624]
手術用三重項認識のためのタスク間最適化とタスク内最適化を両立する枠組みを提案する。
タスク間最適化のために、タスク共有およびタスク固有コンポーネントに表現を分解する共有特徴分散学習スキーム(S$2$D)を導入する。
タスク内最適化競合に対して,正負の曖昧さを識別・再バランスするコーディネート・グラディエント・ラーニング(CGL)戦略を開発する。
論文 参考訳(メタデータ) (2025-09-16T09:48:52Z) - QuIIL at T3 challenge: Towards Automation in Life-Saving Intervention Procedures from First-Person View [2.3982875575861677]
そこで我々は,Trauma THOMPSON (T3) Challengeにおける省力化介入手順における,多種多様な自動化タスクに対する解決策を提案する。
動作認識と予測のために,複数の入力を1つの画像にサンプリング・縫合する前処理戦略を提案する。
トレーニングのために,アクション辞書誘導型設計を提案する。
論文 参考訳(メタデータ) (2024-07-18T06:55:26Z) - TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection [23.73648235283315]
タスク指向オブジェクト検出は、特定のタスクを達成するのに適したオブジェクトを見つけることを目的としている。
最近のソリューションは主にオールインワンモデルです。
汎用オブジェクト検出とタスク誘導オブジェクト選択からなるより自然な2段階設計であるTaskCLIPを提案する。
論文 参考訳(メタデータ) (2024-03-12T22:33:02Z) - A Dynamic Feature Interaction Framework for Multi-task Visual Perception [100.98434079696268]
複数の共通認識課題を解決するための効率的な統合フレームワークを考案する。
これらのタスクには、インスタンスセグメンテーション、セマンティックセグメンテーション、モノクル3D検出、深さ推定が含まれる。
提案するフレームワークはD2BNetと呼ばれ,マルチタスク認識のためのパラメータ効率予測に一意なアプローチを示す。
論文 参考訳(メタデータ) (2023-06-08T09:24:46Z) - Zero-Shot Policy Transfer with Disentangled Task Representation of
Meta-Reinforcement Learning [30.633075584454275]
本研究では,タスク構成性を活用して,強化学習(RL)エージェントのゼロショットポリシーの一般化を実現することを目的とする。
提案手法は,タスクの異なる側面を明示的に符号化した,切り離されたタスク表現を持つメタRLアルゴリズムである。
政策一般化は、得られた不整合を通して、目に見えない構成的タスク表現を推測することによって行われる。
論文 参考訳(メタデータ) (2022-10-01T19:31:46Z) - Task-Agnostic Continual Reinforcement Learning: Gaining Insights and
Overcoming Challenges [27.474011433615317]
連続学習(CL)は、一連のタスクから学習するモデルやエージェントの開発を可能にする。
タスクに依存しないCLとマルチタスク(MTL)エージェントのパフォーマンス差に寄与する要因について検討する。
論文 参考訳(メタデータ) (2022-05-28T17:59:00Z) - Fast Inference and Transfer of Compositional Task Structures for
Few-shot Task Generalization [101.72755769194677]
本稿では,タスクがサブタスクグラフによって特徴づけられる,数発の強化学習問題として定式化する。
我々のマルチタスクサブタスクグラフ推論器(MTSGI)は、トレーニングタスクから、まず、サブタスクグラフの観点から、一般的なハイレベルなタスク構造を推測する。
提案手法は,2次元グリッドワールドおよび複雑なWebナビゲーション領域において,タスクの共通基盤構造を学習し,活用し,未知のタスクへの適応を高速化する。
論文 参考訳(メタデータ) (2022-05-25T10:44:25Z) - Learning Task-relevant Representations for Generalization via
Characteristic Functions of Reward Sequence Distributions [63.773813221460614]
同じタスクで異なる環境にまたがる一般化は、視覚的強化学習の成功に不可欠である。
本稿では,タスク関連情報を抽出する手法として,特徴逆列予測(CRESP)を提案する。
実験により、CRESPは目に見えない環境での一般化性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2022-05-20T14:52:03Z) - Learning to Relate Depth and Semantics for Unsupervised Domain
Adaptation [87.1188556802942]
教師なしドメイン適応(UDA)設定において,視覚的タスク関係を符号化してモデル性能を向上させる手法を提案する。
本稿では,意味的および深さ的予測のタスク依存性を符号化する新しいクロスタスク関係層(ctrl)を提案する。
さらに、セマンティック擬似ラベルを利用してターゲットドメインを監督する反復自己学習(ISL)トレーニングスキームを提案する。
論文 参考訳(メタデータ) (2021-05-17T13:42:09Z) - Reinforcement Learning for Sparse-Reward Object-Interaction Tasks in a
First-person Simulated 3D Environment [73.9469267445146]
高忠実な3Dシミュレーション環境において、AI2Thorのような一対一のオブジェクトインタラクションタスクは、強化学習エージェントに顕著なサンプル効率の課題をもたらす。
補助的なタスクとして注意的オブジェクトモデルを学ぶことで、監督なしに、ゼロからオブジェクトインタラクションタスクを学習できることが示される。
論文 参考訳(メタデータ) (2020-10-28T19:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。