論文の概要: Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
- arxiv url: http://arxiv.org/abs/2607.07769v1
- Date: Wed, 08 Jul 2026 16:12:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.296458
- Title: Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
- Title(参考訳): 深層強化学習の評価と設計パラダイムの原理解析
- Authors: Ezgi Korkmaz,
- Abstract要約: 強化学習におけるスケーリング法則の理論的基礎を紹介する。
本研究では、強化学習アルゴリズムの性能が、性能ランキングとデータ登録の単調な関係を持たないことを示す。
- 参考スコア(独自算出の注目度): 16.041484242548837
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Starting from the utilization of deep neural networks to approximate the state-action value function that led to winning one of the most challenging games, to algorithmic advancements that allowed solving problems without even explicitly stating the rules of the challenge at hand, reinforcement learning research has been the center of remarkable scientific progress for the past decade. In this paper, we focus on the key ingredients of this research progress and we analyze the canonical evaluation and design paradigms in reinforcement learning. We introduce the theoretical foundations of scaling laws in reinforcement learning and show that the asymptotic performance of reinforcement learning algorithms does not have a monotone relationship between performance rankings and data-regimes. We conduct large-scale experiments and our results demonstrate that a line of reinforcement learning research under the canonical design and evaluation paradigms resulted in incorrect conclusions. Our analysis and results provide a core analysis on scaling, capacity and complexity of deep reinforcement learning.
- Abstract(参考訳): ディープニューラルネットワークの利用から、最も困難なゲームの1つに勝利した状態-行動値関数の近似に至るまで、手前の課題のルールを明確に述べなくても解決できるアルゴリズム的な進歩に至るまで、強化学習研究は過去10年間、顕著な科学的進歩の中心であった。
本稿では,本研究の進展の鍵となる要素に着目し,強化学習における標準評価と設計パラダイムを解析する。
本稿では、強化学習におけるスケーリング法則の理論的基礎を紹介し、強化学習アルゴリズムの漸近的性能が、性能ランキングとデータ登録との間に単調な関係を持たないことを示す。
本研究は大規模実験を行い,正準設計・評価パラダイムに基づく強化学習研究の行が誤った結論を導いたことを実証した。
我々の分析と結果は、深層強化学習のスケーリング、キャパシティ、複雑さに関するコア分析を提供する。
関連論文リスト
- Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges [1.8499314936771558]
本調査は,Large Language Models (LLMs) を用いた数学的推論の最近の進歩を合成する。
本研究は,約120のピアレビュー研究とプレプリントを網羅し,本研究領域の進化について検討した。
論文 参考訳(メタデータ) (2026-05-19T11:56:03Z) - Faster Predictive Coding Networks via Better Initialization [52.419343840654186]
本稿では,従来のトレーニングサンプルの反復的進捗を抑えることを目的とした,予測符号化ネットワークのための新しい手法を提案する。
本実験は,教師なし設定と教師なし設定の両方において,収束速度と最終テスト損失が大幅に改善されたことを示す。
論文 参考訳(メタデータ) (2026-01-28T08:52:19Z) - Spurious Forgetting in Continual Learning of Language Models [20.0936011355535]
大規模言語モデル(LLM)の最近の進歩は、継続学習において複雑な現象を呈している。
大規模な訓練にもかかわらず、モデルは大幅な性能低下を経験する。
本研究では,このような性能低下が,真の知識喪失よりもタスクアライメントの低下を反映していることが示唆された。
論文 参考訳(メタデータ) (2025-01-23T08:09:54Z) - Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity [51.40558987254471]
強化学習の現実的な応用は、エージェントが複雑な高次元の観察を行う環境を含むことが多い。
本稿では,統計的・アルゴリズム的な観点から,textit General$ latent dynamicsの下での強化学習の課題に対処する。
論文 参考訳(メタデータ) (2024-10-23T14:22:49Z) - Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning [74.67655210734338]
ほとんどの実世界の強化学習アプリケーションでは、状態情報は部分的にしか観測できないため、マルコフ決定プロセスの仮定を破る。
我々は、部分的な観察から実践的な強化学習のためのコヒーレントな枠組みと抽出可能なアルゴリズムアプローチへと導く表現に基づく視点を開発する。
提案アルゴリズムは,様々なベンチマークで部分的な観察を行い,最先端の性能を超えることができることを実証的に実証した。
論文 参考訳(メタデータ) (2023-11-20T23:56:58Z) - Dynamical Isometry based Rigorous Fair Neural Architecture Search [2.7850218655824803]
動的アイソメトリに基づくニューラルアーキテクチャ探索アルゴリズムを提案する。
well-conditioned Jacobian を用いて全加群の一般化誤差を推定することにより、我々の加群選択戦略が厳密な公正であることを証明する。
論文 参考訳(メタデータ) (2023-07-05T13:01:21Z) - Evaluation Methods and Measures for Causal Learning Algorithms [33.07234268724662]
我々は2つの基本的な因果推論タスクと因果認識機械学習タスクに焦点を当てる。
この調査は、公開可能なベンチマークの開発と、観察データによる因果学習評価のためのコンセンサス標準の策定の緊急性に先んじることを目指している。
論文 参考訳(メタデータ) (2022-02-07T00:24:34Z) - Deep Active Learning by Leveraging Training Dynamics [57.95155565319465]
本稿では,学習力学を最大化するためにサンプルを選択する理論駆動型深層能動学習法(Dynamical)を提案する。
動的学習は、他のベースラインを一貫して上回るだけでなく、大規模なディープラーニングモデルでもうまくスケール可能であることを示す。
論文 参考訳(メタデータ) (2021-10-16T16:51:05Z) - Nonparametric Estimation of Heterogeneous Treatment Effects: From Theory
to Learning Algorithms [91.3755431537592]
プラグイン推定と擬似出力回帰に依存する4つの幅広いメタ学習戦略を解析する。
この理論的推論を用いて、アルゴリズム設計の原則を導出し、分析を実践に翻訳する方法について強調する。
論文 参考訳(メタデータ) (2021-01-26T17:11:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。