論文の概要: Memory Merge DQN: Sensitivity Weighted Target Updates for Stable Value Learning
- arxiv url: http://arxiv.org/abs/2607.19397v1
- Date: Sat, 04 Jul 2026 05:45:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.917731
- Title: Memory Merge DQN: Sensitivity Weighted Target Updates for Stable Value Learning
- Title(参考訳): メモリマージDQN: 安定価値学習のための感度重み付けターゲット更新
- Abstract要約: 本稿では,ターゲットネットワーク更新機構であるメモリマージDQNを紹介する。
近年のオンライン・ネットワークのコピーを記憶している。
Q値感度に基づいて、ネットワークパラメータをマージしてターゲットネットワークを構築する。
- 参考スコア(独自算出の注目度): 5.590064339537858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep Q-networks use target networks to stabilise bootstrapped value learning, but the standard hard copy update also introduces a tradeoff. Holding the target network fixed, improves short term stability, yet each hard update abruptly replaces the target parameters with the newest online network and discards recent parameter history. This can produce sudden changes in the bootstrap target and may remove value function structure that remains useful later in training. This paper introduces Memory Merge DQN, a target network update mechanism that maintains a short memory of recent historical online network copies and constructs the target network by merging network parameters based on the Q-value sensitivity rather than copying only the newest online network. Memory Merge gives greater influence to parameters that remain locally important for current Q-value behaviour, while using a recency prior to keep the merged target close to the latest online parameters. The method is inspired by Fisher Weight Model Merging, but uses Q-value sensitivity rather than Fisher information as the weighting signal. This paper evaluates Memory Merge DQN on Atari environments against DQN, Averaged DQN, DQN with layer normalisation, and PQN (with gradient clipping). The results show that Memory Merge DQN is highly competitive and it achieves the largest number of first place final performance results among the evaluated methods, beats DQN, Averaged DQN, and PQN (with gradient clipping), and produces substantial gains in several games where preserving useful value-function parameters appears beneficial. These findings suggest that selectively merging recent parameter weights and history can improve the stability and final performance of DQN agents, and that target network design is an important mechanism for preserving useful value function structure during long horizon value learning.
- Abstract(参考訳): ディープQ-networksは、ターゲットネットワークを使用して、ブートストラップされたバリューラーニングを安定化するが、標準のハードコピーアップデートではトレードオフも導入されている。
ターゲットネットワークを固定し、短期的な安定性を向上するが、各ハードアップデートはターゲットパラメータを最新のオンラインネットワークに突然置き換え、最近のパラメータ履歴を破棄する。
これによりブートストラップターゲットの急激な変更が発生し、後のトレーニングで有用である値関数構造が削除される可能性がある。
本稿では,最新のオンラインネットワークのみをコピーするのではなく,Q値感度に基づいてネットワークパラメータをマージすることで,最近のオンラインネットワークコピーの短期記憶を維持するターゲットネットワーク更新機構であるメモリマージDQNを紹介する。
メモリマージは、現在のQ値の振る舞いにおいて局所的に重要なパラメータに、さらに大きな影響を与える。
この方法はFisher Weight Model Mergingにインスパイアされているが、重み付け信号はFisher情報ではなくQ値感度を使用する。
本稿では,Atari環境におけるメモリマージDQNを,DQN,DQN,DQNの層正規化,PQN(勾配クリッピング)に対して評価する。
その結果、メモリマージDQNは競争力が高く、評価手法のうち最多の1位の最終結果が得られ、DQN、平均DQN、PQN(勾配クリッピング)を上回り、有用な値-関数パラメータを保存できるゲームでかなりのゲインが得られることがわかった。
これらの結果から,近年のパラメータ重みと履歴を選択的にマージすることで,DQNエージェントの安定性と最終性能が向上することが示唆された。
関連論文リスト
- Revisiting TD Target Aggregation under Uncertainty in Q-Learning [2.4908682918195804]
Deep Q-Networks(DQN)は、ブートストラップされた時間差分更新を通じて値関数を学習する。
我々は、TDターゲットの生成方法を規則化するQラーニングへの簡単なロールアウトである、textbfSuccessor Rollout textbfAggregation textbfDeep textbfQ-Network (SADQ)を提案する。
論文 参考訳(メタデータ) (2026-08-04T03:31:24Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression [53.48692193399171]
Gated KalmaNet(GKA)は、次のトークンを予測する際に、すべての過去を説明することによってギャップを低減するレイヤである。
テスト時間におけるオンラインリッジ回帰問題を一定メモリと線形計算コストで解決する。
ロングコンテキストでは、GKAは現実世界のRAGタスクとLongQAタスクを最大128kトークンまで拡張し、他の薄型メモリベースラインよりも10ドル%以上の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-11-26T03:26:37Z) - InTAct: Interval-based Task Activation Consolidation for Continual Learning [8.228364777296195]
Intactは、パラメータを凍結したり過去のデータを保存したりすることなく、共有レイヤで機能的な振舞いを保存する。
そうすることで、Intactはパラメータ値を直接制限するのではなく、重要なニューロンの機能的役割を安定化する。
さまざまなドメイン-インクリメンタルベンチマークを通じて、InTActは表現のドリフトを一貫して削減し、パフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-11-21T17:36:12Z) - Deep Q-Learning with Gradient Target Tracking [4.523535822416753]
本稿では,勾配目標追跡を用いたQ-ラーニングを提案する。
従来のハードアップデートパラダイムの代替として、学習した継続的ターゲット更新メカニズムを提供する。
論文 参考訳(メタデータ) (2025-03-20T20:46:25Z) - A Pipeline of Augmentation and Sequence Embedding for Classification of Imbalanced Network Traffic [0.0]
本稿では,頑健で正確な埋め込み手法を用いて,データセットのバランスと分類を行うパイプラインを提案する。
提案した拡張パイプラインとFS-Embeddingを組み合わせることで収束速度が向上し,モデルパラメータの数が大幅に減少することを示す。
論文 参考訳(メタデータ) (2025-02-26T07:55:24Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z) - Hyperparameter-free Continuous Learning for Domain Classification in
Natural Language Understanding [60.226644697970116]
ドメイン分類は自然言語理解(NLU)の基本課題である
既存の継続的な学習アプローチの多くは、低い精度とパフォーマンスの変動に悩まされている。
本研究では,テキストデータに対するパラメータフリー連続学習モデルを提案する。
論文 参考訳(メタデータ) (2022-01-05T02:46:16Z) - Contextual HyperNetworks for Novel Feature Adaptation [43.49619456740745]
Contextual HyperNetwork(CHN)は、ベースモデルを新機能に拡張するためのパラメータを生成する。
予測時、CHNはニューラルネットワークを通る単一のフォワードパスのみを必要とし、大幅なスピードアップをもたらす。
本システムでは,既存のインプテーションやメタラーニングベースラインよりも,新しい特徴のマイズショット学習性能が向上することを示す。
論文 参考訳(メタデータ) (2021-04-12T23:19:49Z) - GradInit: Learning to Initialize Neural Networks for Stable and
Efficient Training [59.160154997555956]
ニューラルネットワークを初期化するための自動化およびアーキテクチャ手法であるgradinitを提案する。
各ネットワーク層の分散は、SGDまたはAdamの単一ステップが最小の損失値をもたらすように調整される。
また、学習率のウォームアップを伴わずに、オリジナルのPost-LN Transformerを機械翻訳用にトレーニングすることもできる。
論文 参考訳(メタデータ) (2021-02-16T11:45:35Z) - Implicit Under-Parameterization Inhibits Data-Efficient Deep
Reinforcement Learning [97.28695683236981]
さらなる勾配更新により、現在の値ネットワークの表現性が低下する。
AtariとGymのベンチマークでは、オフラインとオンラインのRL設定の両方でこの現象を実証する。
論文 参考訳(メタデータ) (2020-10-27T17:55:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。