論文の概要: Emergent Sparsity in Frozen Random CNN Feature Extractors for Deep Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.26059v1
- Date: Fri, 15 May 2026 00:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.083419
- Title: Emergent Sparsity in Frozen Random CNN Feature Extractors for Deep Reinforcement Learning
- Title(参考訳): 深部強化学習のための凍結ランダムCNN特徴量エクストラクタの創発的疎結合性
- Abstract要約: 凍結した無作為なCNN特徴抽出器で訓練された深層強化学習エージェントは、極端に疎結合な表現を自発的に発達させる。
第1の完全連結層では、エージェントは、決定論的ポンのために64から1-3ニューロンまでタスク関連情報を圧縮する。
トレーニング可能なCNNは、一致した条件下で55-64ニューロンを活性化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We report a striking phenomenon: deep reinforcement learning agents trained with frozen, randomly initialized CNN feature extractors spontaneously develop extremely sparse fully-connected representations, without any sparsity-inducing objective. In the first fully-connected layer (FC1, $3{,}136 \to 64$), agents compress task-relevant information through as few as 1-3 neurons out of 64 for deterministic Pong (5-11 for stochastic Pong), while trainable CNNs activate 55-64 neurons under matched conditions. We establish four principal findings. First, FC1 sparsity scales with task complexity: 1-11 for Pong, 19-26 for Breakout, and $\sim$42 for Space Invaders. Width-scaling confirms this reflects task structure rather than a fixed capacity fraction. Second, within-game scaling emerges: three identical Pong seeds produce 5, 7, and 11 active neurons. The 5-neuron seed plateaus at $+14$ reward, while the others reach expert performance ($+18.4$, $+18.7$), suggesting the random projection's usable dimensionality bounds achievable performance. Third, ablation confirms necessity: removing these active neurons crashes performance across two PPO implementations and four games. Fourth, the information bottleneck commits early: a sweep shows the active set locks by 15-30M steps, while reward turns positive 35-105M steps later. A complementary finding in Breakout shows frozen and trainable CNNs reach competitive rewards via structurally different bottlenecks: frozen agents use 17-25 active neurons (participation ratio $\sim$10-14), while trainable agents use 51 (participation ratio $\sim$3.6). Finally, wherever input dimensionality dwarfs intrinsic task dimensionality, gradient descent on a frozen random projection may reveal the effective rank of the underlying problem without explicit sparsity machinery.
- Abstract(参考訳): 凍結・無作為初期化CNN特徴抽出器で訓練された深層強化学習エージェントは, 空間性誘導目的を伴わずに, 極めて疎結合な表現を自発的に発達させる。
最初の完全連結層(FC1, $3{,}136 \to 64$)では、エージェントは64の決定論的Pong(5-11は確率論的Pong)のうち1-3のニューロンでタスク関連情報を圧縮し、訓練可能なCNNは一致した条件下で55-64ニューロンを活性化する。
主な発見は4つある。
ひとつは、Pongの1-11、Breakoutの19-26、Space Invaderの42ドルだ。
幅スケーリングでは、これは固定容量率ではなくタスク構造を反映している。
第二に、ゲーム内スケーリングが出現し、3つの同一のPongシードが5, 7, 11の活性ニューロンを発生させる。
5-neuronのシードプラトーは+14$で、他は専門家のパフォーマンス(+18.4$, $+18.7$)に達する。
第3に、アクティヴニューロンの除去は、2つのPPO実装と4つのゲームでパフォーマンスをクラッシュさせる。
第4に、情報ボトルネックは早期にコミットする:スイープはアクティブなセットロックを15~30Mステップで表示し、報酬は35~105Mステップ後にプラスになる。
凍結剤は17-25個の活動ニューロン(参加比$\sim$10-14)、訓練剤は51個(参加比$\sim$3.6)である。
最後に、入力次元が本質的なタスク次元を内在する場合でも、凍結したランダム射影上の勾配降下は、明示的なスパーシティ機械を使わずに基礎問題の効果的なランクを明らかにすることができる。
関連論文リスト
- An Embedded RISC-V Evaluation of Kolmogorov--Arnold Networks in Hard-Constrained Recurrent Physics-Informed Models [0.0]
Kolmogorov--Arnold Networks (KAN) は多層パーセプトロン (MLP) の効率的な代替として提案されている。
本稿では,パラメータ効率がデプロイに有効かどうかを問う。
論文 参考訳(メタデータ) (2026-08-01T16:20:24Z) - The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary [13.891522069967507]
拡張連鎖推論は決定論的状態追跡タスクのパフォーマンスを低下させる。
ツール統合推論がニューラル・チェーン・オブ・シントを一貫して上回ることを示す。
本研究は, エージェントシステムにおいて, 純粋なニューラル推論がハイブリッドアプローチにいつ適用されるべきかについて, 基本的ガイダンスを提供する。
論文 参考訳(メタデータ) (2026-05-29T21:35:23Z) - Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization [58.14514930760722]
参加者が協力して大規模なニューラルネットワークを訓練し、提供する分散セットアップを検討する。
このセットアップでは、フルウェイトセットがどの参加者にも利用できないような、非機械的なウェイトの可能性を探る。
我々は、シャードモデルセットアップを利用するトレーニングおよび推論フレームワーク、Unextractable Protocol Models (UPMs)を紹介する。
論文 参考訳(メタデータ) (2026-05-22T10:24:57Z) - Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse [7.167095059974211]
本研究では, 可変オートエンコーダ-スパースオートエンコーダアーキテクチャにおける重大容量制約下での機能生存について検討する。
本稿では,活動ニューロンを500から50以上の訓練エポックに段階的に減少させる適応的空間性スケジューリングフレームワークを提案する。
グローバルな表現の質は安定しているが、局所的な特徴解釈可能性は体系的に崩壊する。
論文 参考訳(メタデータ) (2026-03-18T00:16:38Z) - Anatomy of Capability Emergence: Scale-Invariant Representation Collapse and Top-Down Reorganization in Neural Networks [1.5567685129899713]
5つのモデルスケールで5つの幾何測度をトラックする。
トレーニングは、タスク固有のフロアへの普遍的な表現の崩壊から始まります。
ピキアでは、グローバルな幾何学的パターンが再現されるが、タスクごとの前兆信号は再現しない。
論文 参考訳(メタデータ) (2026-02-17T20:39:02Z) - Time Is All It Takes: Spike-Retiming Attacks on Event-Driven Spiking Neural Networks [87.16809558673403]
スパイキングニューラルネットワーク(SNN)は離散スパイクで計算し、時間構造を利用する。
イベント駆動SNNにおけるスパイク数と振幅を保存しながら、既存のスパイクを繰り返すタイミングのみの敵について検討する。
論文 参考訳(メタデータ) (2026-02-03T09:06:53Z) - Parallel Training in Spiking Neural Networks [47.43408320628711]
スパイキングニューロンのバイオインスピレーションによる統合発火機構はスパイキングニューラルネットワーク(SNN)の効率的な処理の基礎となる
大規模モデルの最近の進歩は、スパイキングニューロンが現代的なGPU上で効率的にスケールするために高い並列計算をサポートすることを要求している。
本研究は、並列スパイキングニューロンを設計するための一般的なガイダンスを提供する、新しい機能的視点を提案する。
論文 参考訳(メタデータ) (2026-02-01T10:10:47Z) - Diffused Redundancy in Pre-trained Representations [98.55546694886819]
事前訓練された表現で機能がどのようにコード化されているか、より詳しく見ていきます。
与えられた層における学習された表現は拡散冗長性を示す。
我々の発見は、事前訓練されたディープニューラルネットワークによって学習された表現の性質に光を当てた。
論文 参考訳(メタデータ) (2023-05-31T21:00:50Z) - Expand-and-Cluster: Parameter Recovery of Neural Networks [9.497862562614666]
それぞれのニューロンの重みベクトルは,活性化関数に応じて,サインやスケーリングが可能であることを示す。
提案手法は, 一般的に使用されるすべてのアクティベーション関数に対して, 対象ネットワークの重みを同定する。
論文 参考訳(メタデータ) (2023-04-25T13:14:20Z) - Predicting the Stability of Hierarchical Triple Systems with
Convolutional Neural Networks [68.8204255655161]
本稿では,階層型三重項の安定性を予測する畳み込みニューラルネットワークモデルを提案する。
すべてのトレーニングされたモデルは公開されており、純粋な$N$-bodyメソッドよりも200ドルの速さで階層的な3重システムの安定性を予測することができる。
論文 参考訳(メタデータ) (2022-06-24T17:58:13Z) - The Unreasonable Effectiveness of Random Pruning: Return of the Most
Naive Baseline for Sparse Training [111.15069968583042]
ランダムプルーニングは、ニューラルネットワークのスパーシティを実現する最も単純な方法であることは間違いないが、トレーニング後のプルーニングやスパーストレーニングでは非競争的であると見なされている。
我々は、スクラッチからランダムに切断されたネットワークをスクラッチからスクラッチ的に訓練することで、その密度の高い等価性の性能に一致することを実証的に実証した。
以上の結果から,大規模なスパーストレーニングを行う余地はより大きいことが示唆され,スポーシティのメリットは慎重に設計されたプルーニングを超えて普遍的である可能性が示唆された。
論文 参考訳(メタデータ) (2022-02-05T21:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。