論文の概要: Linear Recurrent Memory Suffices to Distil a World-Model Policy for Robot Air Hockey
- arxiv url: http://arxiv.org/abs/2609.39151v1
- Date: Wed, 30 Sep 2026 07:17:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.355662
- Title: Linear Recurrent Memory Suffices to Distil a World-Model Policy for Robot Air Hockey
- Title(参考訳): ロボットエアホッケーの世界モデルポリシーを廃止するリニアリカレントメモリ
- Abstract要約: パックトラッキングの一時的喪失下でのエアホッケー防御のシミュレーションについて検討した。
DreamerV3の教師は、追跡損失下で記憶のないポリシーを上回ります。
- 参考スコア(独自算出の注目度): 1.0312968200748118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Does memory-dependent control need nonlinear recurrent dynamics? We study simulated air-hockey defence under temporary loss of puck tracking. A DreamerV3 teacher outperforms a memoryless policy under tracking loss, while resetting the teacher's recurrent state sharply reduces performance, which demonstrates that the task requires memory. We distil this teacher into compact recurrent policies with a 64 dimensional state, with a combination of a diagonal linear recurrence and an optional rank-$k$ nonlinear innovation while retaining nonlinear observation encoders and action heads. Across five matched seeds, the purely linear recurrent model ($k=0$) matches both the GRU baseline and the teacher throughout the tested range of tracking loss. Increasing nonlinear innovation rank providing no measured benefits. This result is obtained on a fresh test split, which will be only opened after all models and analyses are frozen. The linear model requires fewer recurrent parameters and less computation than GRU, but performs comparably. These results suggest that, for this memory dependent control task, nonlinear representation learning around a simple linear memory mechanism can be sufficient, and that nonlinear recurrent dynamics are not necessarily required. These conclusions are limited to the simulated task, teacher, state dimension, and blackout horizon considered here, and to policies whose observation encoder and action head remain nonlinear.
- Abstract(参考訳): メモリ依存制御は非線形リカレントダイナミクスを必要とするか?
パックトラッキングの一時的喪失下でのエアホッケー防御のシミュレーションについて検討した。
DreamerV3の教師は、追跡損失下でメモリレスポリシーを上回り、教師の繰り返し状態をリセットすると、パフォーマンスが大幅に低下し、タスクがメモリを必要とすることを示す。
我々は,この教師を64次元状態のコンパクトなリカレントポリシーに分解し,非線形観察エンコーダとアクションヘッドを維持しつつ,対角線リカレンスとオプションのランク=k$非線形イノベーションを組み合わせた。
5つのマッチした種子のうち、純粋に線形リカレントモデル(k=0$)はGRUベースラインと教師の両方に一致する。
非線形イノベーションのランクの上昇は、測定された利益を提供しない。
この結果は、全てのモデルと解析が凍結された後にのみ開放される新しいテストスプリットで得られる。
線形モデルは、GRUよりもリカレントパラメータが少なく、計算量も少ないが、相容れない。
これらの結果は、このメモリ依存制御タスクでは、単純な線形メモリ機構に関する非線形表現学習が十分であり、非線形リカレントダイナミクスが必ずしも必要ではないことを示唆している。
これらの結論は、ここで考慮されたシミュレートされたタスク、教師、状態次元、ブラックアウト水平線、および観察エンコーダとアクションヘッドが非線形であるポリシーに限られる。
関連論文リスト
- Analytic Drift Resister for Non-Exemplar Continual Graph Learning [23.86709351309769]
Non-Exemplar Continual Graph Learning (NECGL)は、リハーサルベースのパラダイムに固有のプライバシーリスクを取り除くことを目的としている。
NECGLフレームワークであるADR(Analytic Drift Resister)を提案する。
ADRは反復的バックプロパゲーションを利用して、凍結した事前訓練された制約から解放する。
論文 参考訳(メタデータ) (2026-04-03T01:58:11Z) - More is Better in Modern Machine Learning: when Infinite Overparameterization is Optimal and Overfitting is Obligatory [12.689249854199982]
RF劣化試験のリスクは特徴数とサンプル数の両方で単調に低下することを示した。
次に、パワーロー固有構造を特徴とするタスクの大規模なクラスにおいて、ほぼゼロに近いトレーニング損失に対するトレーニングが義務付けられていることを示す。
論文 参考訳(メタデータ) (2023-11-24T18:27:41Z) - Learning Bayesian Sparse Networks with Full Experience Replay for
Continual Learning [54.7584721943286]
継続学習(CL)手法は、機械学習モデルが、以前にマスターされたタスクを壊滅的に忘れることなく、新しいタスクを学習できるようにすることを目的としている。
既存のCLアプローチは、しばしば、事前に確認されたサンプルのバッファを保持し、知識蒸留を行い、あるいはこの目標に向けて正規化技術を使用する。
我々は,現在および過去のタスクを任意の段階で学習するために,スパースニューロンのみを活性化し,選択することを提案する。
論文 参考訳(メタデータ) (2022-02-21T13:25:03Z) - Memory-Efficient Backpropagation through Large Linear Layers [107.20037639738433]
Transformersのような現代のニューラルネットワークでは、線形層は後方通過時にアクティベーションを保持するために大きなメモリを必要とする。
本研究では,線形層によるバックプロパゲーションを実現するためのメモリ削減手法を提案する。
論文 参考訳(メタデータ) (2022-01-31T13:02:41Z) - Learning the Linear Quadratic Regulator from Nonlinear Observations [135.66883119468707]
我々は、LQR with Rich Observations(RichLQR)と呼ばれる連続制御のための新しい問題設定を導入する。
本設定では, 線形力学と二次的コストを有する低次元連続潜伏状態によって環境を要約する。
本結果は,システムモデルと一般関数近似における未知の非線形性を持つ連続制御のための,最初の証明可能なサンプル複雑性保証である。
論文 参考訳(メタデータ) (2020-10-08T07:02:47Z) - Automatic Recall Machines: Internal Replay, Continual Learning and the
Brain [104.38824285741248]
ニューラルネットワークのリプレイには、記憶されたサンプルを使ってシーケンシャルなデータのトレーニングが含まれる。
本研究では,これらの補助サンプルをフライ時に生成する手法を提案する。
代わりに、評価されたモデル自体内の学習したサンプルの暗黙の記憶が利用されます。
論文 参考訳(メタデータ) (2020-06-22T15:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。