論文の概要: Understanding the Parameter Space Geometry of Transformers Encoding Boolean Functions
- arxiv url: http://arxiv.org/abs/2606.08768v1
- Date: Sun, 07 Jun 2026 18:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.436679
- Title: Understanding the Parameter Space Geometry of Transformers Encoding Boolean Functions
- Title(参考訳): ブール関数を符号化した変圧器のパラメータ空間幾何学の理解
- Abstract要約: 変圧器のパラメータ空間の幾何学について検討する。
低感度文字列を持つランダムな計算関数は、証明不可能であることを示す。
- 参考スコア(独自算出の注目度): 85.5290722026859
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers consistently fail to learn certain simple functions that are provably expressible with specific parameter settings. This gap between learnability and expressivity is particularly prominent for sensitive functions -- functions whose output is likely to change if a single bit of the input is flipped -- for example, PARITY. While prior work has established that transformers exhibit a bias toward functions with low average sensitivity, the precise mechanism underlying this bias remains poorly understood. To shed light on this phenomenon, we study the geometry of transformers' parameter space. We show that sensitive functions -- even when representable -- occupy a vanishingly small region that random initialization is very likely to miss. Specifically, we shift the focus from average sensitivity to the full sensitivity profile -- the distribution of sensitivity values across all inputs -- and prove that randomly initialized transformers almost surely compute functions which have low-sensitivity strings. Consequently, any function that lacks such strings is provably unlearnable.
- Abstract(参考訳): トランスフォーマーは、特定のパラメータ設定で確実に表現可能な、ある種の単純な関数を一貫して学ばない。
学習可能性と表現性の間のこのギャップは、特にセンシティブな関数 -- 入力の1ビットが反転した場合、出力が変化しそうな関数 -- 例えばPARITY -- において顕著である。
以前の研究では、トランスフォーマーは平均感度が低い関数に対するバイアスを示すことが確立されているが、このバイアスの正確なメカニズムは理解されていない。
この現象に光を当てるために, 変圧器のパラメータ空間の幾何学について検討する。
表現可能な場合でも、センシティブな関数が、ランダムな初期化が見逃しがちな、驚くほど小さな領域を占めることを示す。
具体的には、平均感度から全感度プロファイル(全ての入力に対する感度値の分布)に焦点を移し、ランダムに初期化変換器が低感度文字列を持つ関数をほぼ確実に計算できることを証明する。
したがって、そのような文字列を持たない任意の関数は、証明不可能である。
関連論文リスト
- Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't [78.36679389968772]
パッド付き$textL$ constantprecision transformerは、表現性に対して驚くほど堅牢である。
glogd-looped constant-precision transformer reach $textFO-uniform TCd$, growing-precision transformer reach $textFO-uniform TCd$
論文 参考訳(メタデータ) (2026-05-28T19:58:43Z) - Trapped by simplicity: When Transformers fail to learn from noisy features [0.0]
ノイズのない特徴のラベルを正確に予測するターゲット関数を見つけることができるノイズの多い特徴を持つデータに対して、変換器は訓練されているか?
特に最適解の感度が目標関数の感度よりも小さい場合、トランスフォーマーはランダムな$k$-juntasのノイズロスト学習に失敗する。
論文 参考訳(メタデータ) (2026-02-09T14:14:39Z) - Provable In-Context Learning of Nonlinear Regression with Transformers [66.99048542127768]
In-context Learning (ICL) は、パラメータを更新することなくタスク固有のプロンプトを使用して見えないタスクを実行する能力である。
最近の研究はICLの背後にあるトレーニングのダイナミクスを積極的に探求しており、その多くは比較的単純なタスクに重点を置いている。
本稿では、変換器が文脈内学習能力をいかに獲得するかを明らかにすることを目的として、より複雑な非線形回帰タスクについて検討する。
論文 参考訳(メタデータ) (2025-07-28T00:09:28Z) - Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study [52.91899050612153]
自動音声認識(ASR)のためのエンコーダとして再利用された事前訓練言語モデル(PLM)内のトランスフォーマー
本研究は,事前学習したLMのトランスフォーマーを組み込んだASRタスクにおいて,文字誤り率 (CER) とワード誤り率 (WER) の顕著な改善が認められた。
このことは、事前訓練されたトランスフォーマーに埋め込まれたセマンティックな技術を活用して、ASRシステムの能力を向上させる可能性を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-09-26T11:31:18Z) - Transformers Learn Low Sensitivity Functions: Investigations and Implications [18.77893015276986]
トランスフォーマーは多くのタスクで最先端の精度と堅牢性を達成する。
入力におけるトークンのランダムな摂動に対するモデルの感度を統一計量として同定する。
我々は、CNN、CNN、ConvMixers、LSTMよりも、視覚と言語の両方のタスクにおいて、トランスフォーマーの感度が低いことを示す。
論文 参考訳(メタデータ) (2024-03-11T17:12:09Z) - Approximation and Estimation Ability of Transformers for
Sequence-to-Sequence Functions with Infinite Dimensional Input [50.83356836818667]
無限次元入力を持つシーケンス・ツー・シーケンス関数として変換器の近似と推定能力について検討する。
我々の理論的結果は、高次元データに対する変換器の実用的成功を支持する。
論文 参考訳(メタデータ) (2023-05-30T02:44:49Z) - Mapping of attention mechanisms to a generalized Potts model [50.91742043564049]
ニューラルネットワークのトレーニングは、いわゆる擬似様相法によって逆ポッツ問題を解くのと全く同じであることを示す。
また、レプリカ法を用いてモデルシナリオにおける自己意図の一般化誤差を解析的に計算する。
論文 参考訳(メタデータ) (2023-04-14T16:32:56Z) - Simplicity Bias in Transformers and their Ability to Learn Sparse
Boolean Functions [29.461559919821802]
最近の研究によると、トランスフォーマーは反復モデルと比較していくつかの形式言語をモデル化するのに苦労している。
このことは、トランスフォーマーが実際になぜうまく機能するのか、また、リカレントモデルよりも良く一般化できるプロパティがあるかどうかという疑問を提起する。
論文 参考訳(メタデータ) (2022-11-22T15:10:48Z) - Your Transformer May Not be as Powerful as You Expect [88.11364619182773]
連続列列列関数を近似できるかどうかに関して, RPE ベースの変換器のパワーを数学的に解析する。
RPEをベースとしたトランスフォーマーでは,ニューラルネットワークの深さや幅がどんなに深くても近似できない連続列列列列関数が存在することを示す。
我々は,その条件を満たす,Universal RPE-based (URPE) Attentionと呼ばれる新しいアテンションモジュールを開発する。
論文 参考訳(メタデータ) (2022-05-26T14:51:30Z) - Differentiable Subset Pruning of Transformer Heads [71.7904179689271]
差別化可能なサブセットプルーニングと呼ぶ新しいヘッドプルーニング手法を導入する。
分割可能なサブセットプルーニングは,スパーシリティレベルを正確に制御しながら,従来の作業と同等あるいは良好に動作可能であることを示す。
論文 参考訳(メタデータ) (2021-08-10T13:08:34Z) - Sensitivity as a Complexity Measure for Sequence Classification Tasks [24.246784593571626]
標準のシーケンス分類法は低感度関数の学習に偏っているため、高感度を必要とするタスクがより困難である。
15のNLPタスクで感度を推定し、単純なテキスト分類タスクよりもGLUEで収集された挑戦的なタスクで感度が高いことを発見した。
論文 参考訳(メタデータ) (2021-04-21T03:56:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。