論文の概要: Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2512.14057v2
- Date: Wed, 17 Dec 2025 07:40:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:40.368996
- Title: Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning
- Title(参考訳): メタ強化学習のための行動自由変換器エンコーダデコーダによる文脈表現
- Abstract要約: 本稿では,Action Free Transformer encoder decoder (CRAFT)によるコンテキスト表現を提案する。
CRAFTは、状態と報酬のシーケンスのみからタスク表現を推論する。
回転位置埋め込みを備えたトランスフォーマーエンコーダデコーダ上に構築され、長い時間的依存関係をキャプチャし、パラメトリックおよび非適応タスクのバリエーションを堅牢にエンコードする。
- 参考スコア(独自算出の注目度): 6.927922840261954
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) enables robots to operate in uncertain environments, but standard approaches often struggle with poor generalization to unseen tasks. Context-adaptive meta reinforcement learning addresses these limitations by conditioning on the task representation, yet they mostly rely on complete action information in the experience making task inference tightly coupled to a specific policy. This paper introduces Context Representation via Action Free Transformer encoder decoder (CRAFT), a belief model that infers task representations solely from sequences of states and rewards. By removing the dependence on actions, CRAFT decouples task inference from policy optimization, supports modular training, and leverages amortized variational inference for scalable belief updates. Built on a transformer encoder decoder with rotary positional embeddings, the model captures long range temporal dependencies and robustly encodes both parametric and non-parametric task variations. Experiments on the MetaWorld ML-10 robotic manipulation benchmark show that CRAFT achieves faster adaptation, improved generalization, and more effective exploration compared to context adaptive meta--RL baselines. These findings highlight the potential of action-free inference as a foundation for scalable RL in robotic control.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、ロボットが不確実な環境で動作できるようにする。
コンテキスト適応型メタ強化学習は、タスク表現を条件付けすることでこれらの制限に対処するが、主に特定のポリシーと密結合したタスク推論を行う経験において、完全なアクション情報に依存する。
本稿では,Action Free Transformer encoder decoder (CRAFT)によるコンテキスト表現について述べる。
アクションへの依存を取り除くことで、CRAFTはポリシー最適化からタスク推論を分離し、モジュラートレーニングをサポートし、スケーラブルな信条更新に償却された変分推論を活用する。
回転位置埋め込みを備えたトランスフォーマーエンコーダデコーダ上に構築され、長い時間的依存関係をキャプチャし、パラメトリックタスクと非パラメトリックタスクの両方を堅牢にエンコードする。
MetaWorld ML-10ロボット操作ベンチマークの実験では、CRAFTは文脈適応型メタ-RLベースラインよりも高速な適応、一般化の改善、より効率的な探索を実現している。
これらの結果は、ロボット制御におけるスケーラブルなRLの基礎として、アクションフリー推論の可能性を強調している。
関連論文リスト
- MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Language-Conditioned Mixture-of-Experts Transformers [3.890941830250993]
双方向操作のための軽量なマルチタスク模倣学習フレームワークを提案する。
MoE-ACTは、Sparse Mixture-of-Experts (MoE)モジュールをACTのTransformerエンコーダに統合する。
MoE-ACTはマルチタスク性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-03-16T13:33:59Z) - Beyond Quantity: Trajectory Diversity Scaling for Code Agents [51.71414642763219]
Trajectory Diversity Scalingは、コードエージェントのためのデータ合成フレームワークである。
TDScalingは、(1)実際のサービスの論理的依存関係をキャプチャするBusiness Clusterメカニズム、(2)軌道コヒーレンスを強制するブループリント駆動のマルチエージェントパラダイム、(3)ロングテールシナリオを指向する適応的な進化メカニズムの4つの革新を統合しています。
論文 参考訳(メタデータ) (2026-02-03T07:43:03Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning [1.8791091507292152]
Heuristic Transformer (HT) はコンテキスト内強化学習アプローチであり、より優れた意思決定を実現するために、報酬に対する信念分布でコンテキスト内データセットを増強する。
HTは、有効性と一般化の両方の観点から、同等のベースラインを一貫して超越していることが示される。
提案手法は,信念に基づく拡張とトランスフォーマーに基づく意思決定のギャップを埋める,有望な方向を示す。
論文 参考訳(メタデータ) (2025-11-13T12:32:36Z) - Mental Accounts for Actions: EWA-Inspired Attention in Decision Transformers [2.9385229328767983]
オンライン決定変換器(EWA-VQ-ODT)のためのベクトル量子化を用いた経験量アトラクションを提案する。
EWA-VQ-ODTは、最近の成功と失敗をまとめた、アクションごとのメンタルアカウントを保持する軽量モジュールである。
標準の連続制御ベンチマークでは、EWA-VQ-ODTはサンプル効率とODTに対する平均リターンを改善している。
論文 参考訳(メタデータ) (2025-09-19T00:33:22Z) - Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence [131.41894248194995]
タスク認識方式でアダプタを初期化する新しい手法であるコンテキスト指向分解適応(CorDA)を提案する。
本手法は,タスク認識により,知識保存モード (KPM) と命令レビューモード (IPM) の2つのオプション適応モードを実現する。
論文 参考訳(メタデータ) (2025-06-16T07:55:14Z) - ReaCritic: Large Reasoning Transformer-based DRL Critic-model Scaling For Heterogeneous Networks [4.931691794637798]
ヘテロジニアスネットワーク(HetNets)は、多様なユーザ要件と時間変化のある無線条件のために、インテリジェント管理において重要な課題を提起する。
本稿では,ReaCriticを提案する。ReaCriticは,Deep Reinforcement Learningに推論能力をもたらす,大きな推論変換に基づく批判モデルスケーリングスキームである。
幅広い値ベースおよびアクタークリティカルなDRLアルゴリズムと互換性があり、動的無線環境における一般化を促進する。
論文 参考訳(メタデータ) (2025-05-16T08:42:08Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - End-to-End Meta-Bayesian Optimisation with Transformer Neural Processes [52.818579746354665]
本稿では,ニューラルネットワークを一般化し,トランスフォーマーアーキテクチャを用いて獲得関数を学習する,エンド・ツー・エンドの差別化可能な最初のメタBOフレームワークを提案する。
我々は、この強化学習(RL)によるエンドツーエンドのフレームワークを、ラベル付き取得データの欠如に対処できるようにします。
論文 参考訳(メタデータ) (2023-05-25T10:58:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。