論文の概要: Compressed Computation under $L^4$ Loss is likely Computation in Superposition
- arxiv url: http://arxiv.org/abs/2607.04800v1
- Date: Mon, 06 Jul 2026 08:33:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.088007
- Title: Compressed Computation under $L^4$ Loss is likely Computation in Superposition
- Title(参考訳): L^4$ロスの圧縮計算は重ね合わせの計算である
- Authors: Francisco Ferreira da Silva, Stefan Heimersheim,
- Abstract要約: 本稿では,50個のニューロンを持つ単層ReLUネットワークを用いた重ね合わせ計算モデルについて検討する。
損失$L4$でトレーニングすると、重ね合わせですべての機能を計算しているように見えるソリューションが生まれる。
ネットワークは、各特徴をニューロン上にスパースバイナリコードワードを割り当て、それをエンコーダの擬似逆数で復号する。
- 参考スコア(独自算出の注目度): 0.7128080962281788
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural networks are thought to represent concepts as directions in their activation space, and superposition lets them encode more concepts than they have dimensions. It is natural to ask whether they can also compute more functions than they have neurons, i.e., perform computation in superposition. In this regime many functions of sparse inputs are evaluated by a layer with fewer neurons than there are functions to compute. Representation in superposition is by now fairly well understood, but computation in superposition is not, and there are few toy models of it arising through training rather than being hand designed. As a toy model of computation in superposition we study the compressed-computation setup: a single-hidden-layer ReLU network with 50 neurons that must compute the ReLU of each of 100 sparse input features. We show that training it under an $L^4$ loss (the mean fourth power of the error), rather than the usual $L^2$, elicits a solution that appears to compute all features in superposition. We then reverse-engineer this solution. We find that the network assigns each feature a sparse binary codeword over neurons and decodes it with a pseudoinverse of the encoder. Given these codewords, a description with only three scalars recovers most of the network's performance, and we validate it by building equivalent networks from hand-designed codes.
- Abstract(参考訳): ニューラルネットワークは、その活性化空間における方向として概念を表現すると考えられており、重ね合わせにより、次元よりも多くの概念をエンコードすることができる。
ニューロンよりも多くの関数を計算できるかどうか、すなわち重ね合わせで計算できるかどうかを問うのは自然である。
この体制では、スパース入力の多くの関数は、計算する関数よりも少ないニューロンの層によって評価される。
重ね合わせの表現は現在ではかなりよく理解されているが、重ね合わせの計算はそうではない。
重ね合わせにおける計算のおもちゃモデルとして,100個のスパース入力特徴のReLUを計算しなければならない50個のニューロンからなる1層ReLUネットワークの圧縮計算設定について検討した。
通常の$L^2$ではなく、$L^4$損失(誤差の平均4番目のパワー)の下でのトレーニングは、重ね合わせのすべての特徴を計算しているように見える解を与える。
そして、この解決策をリバースエンジニアリングします。
ネットワークは、各特徴をニューロン上にスパースバイナリコードワードを割り当て、それをエンコーダの擬似逆数で復号する。
これらのコードワードを考えると、3つのスカラーしか持たない記述がネットワークの性能の大部分を回復し、手書きのコードから等価なネットワークを構築することによって検証する。
関連論文リスト
- Language Model Circuits Are Sparse in the Neuron Basis [50.460651620833055]
その結果, textbfMLP ニューロンは SAE と同様の機能的基盤であることがわかった。
この作業は、追加のトレーニングコストなしで言語モデルの自動解釈可能性を向上させる。
論文 参考訳(メタデータ) (2026-01-30T05:41:19Z) - On the Complexity of Neural Computation in Superposition [3.9803704378699103]
ニューラルネットワークがニューロンよりも多くの特徴を表現する能力である重ね合わせは、大規模モデルの効率の鍵であると考えられている。
本稿では、重ね合わせにおける計算の理論的基礎を考察し、明示的で証明可能な正しいアルゴリズムの複雑性境界を確立する。
論文 参考訳(メタデータ) (2024-09-05T18:58:59Z) - Mathematical Models of Computation in Superposition [0.9374652839580183]
重ね合わせは、現在のAIシステムを機械的に解釈する上で深刻な課題となる。
重ね合わせにおけるエンフン計算の数学的モデルを提案し, 重ね合わせはタスクを効率的に遂行するのに有効である。
我々は、重ね合わせで計算を実装するニューラルネットワークを解釈する研究の潜在的な応用について、結論付けている。
論文 参考訳(メタデータ) (2024-08-10T06:11:48Z) - Memorization Capacity of Neural Networks with Conditional Computation [14.048989759890475]
我々は,$O(sqrtn)$ニューロンを用いたニューラルネットワークを用いて,$n$の入力出力関係の集合を記憶できることを実証した。
条件付きReLUネットワークを用いて,入力あたりのO(log n)$演算のみを用いて同じタスクを実現できることを示す。
論文 参考訳(メタデータ) (2023-03-20T16:33:17Z) - Variable Bitrate Neural Fields [75.24672452527795]
本稿では,特徴格子を圧縮し,メモリ消費を最大100倍に削減する辞書手法を提案する。
辞書の最適化をベクトル量子化オートデコーダ問題として定式化し、直接監督できない空間において、エンドツーエンドの離散神経表現を学習する。
論文 参考訳(メタデータ) (2022-06-15T17:58:34Z) - Neural network approaches to point lattice decoding [6.025026882312586]
voronoi-reduced基底は二元集合への解の空間を制限するために導入された。
CPWL復号関数におけるアフィンの個数を数え、復号問題の複雑さを特徴づける。
論文 参考訳(メタデータ) (2020-12-13T10:53:34Z) - Towards Understanding Hierarchical Learning: Benefits of Neural
Representations [160.33479656108926]
この研究で、中間的神経表現がニューラルネットワークにさらなる柔軟性をもたらすことを実証する。
提案手法は, 生の入力と比較して, サンプルの複雑度を向上できることを示す。
この結果から, 深度が深層学習においてなぜ重要かという新たな視点が得られた。
論文 参考訳(メタデータ) (2020-06-24T02:44:54Z) - Deep Polynomial Neural Networks [77.70761658507507]
$Pi$Netsは拡張に基づいた関数近似の新しいクラスである。
$Pi$Netsは、画像生成、顔検証、および3Dメッシュ表現学習という3つの困難なタスクで、最先端の結果を生成する。
論文 参考訳(メタデータ) (2020-06-20T16:23:32Z) - Backward Feature Correction: How Deep Learning Performs Deep
(Hierarchical) Learning [66.05472746340142]
本稿では,SGD による階層的学習 _efficiently_ と _automatically_ を学習目標として,多層ニューラルネットワークがどのように行うかを分析する。
我々は、下位機能のエラーを上位層と共にトレーニングする際に自動的に修正できる"後方特徴補正"と呼ばれる新しい原則を確立する。
論文 参考訳(メタデータ) (2020-01-13T17:28:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。