論文の概要: Why shared attention vectors fail: a case for outcome-indexed tuning
- arxiv url: http://arxiv.org/abs/2609.08615v1
- Date: Tue, 08 Sep 2026 11:52:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.640722
- Title: Why shared attention vectors fail: a case for outcome-indexed tuning
- Title(参考訳): 共有注意ベクトルが失敗する理由--結果付きチューニングの場合
- Abstract要約: モデルが複数の結果を予測するマルチアウトカム学習では,グローバルに共有される注目ベクトルが不安定になる。
本稿では、グローバルに共有される注目度調整を結果インデックス化表現に変換する、結果インデックス付き注意度行列を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dimensional attention in learning is often implemented as a globally shared attention vector, where each stimulus dimension corresponds to a single scalar. These scalars are learned by models through gradient-descent on error, where predictive features acquire more salience. We show that under multi-outcome learning, where models predict more than one outcome, this shared vector becomes unstable; it collapses to its bounds and prevents the models from learning meaningful attentional tunings for learning and generalization. We address this by introducing an outcome-indexed attentional matrix that converts globally shared attentional tuning into an outcome-indexed representation. We present an analysis of the unstable shared vectors and derive the conditions under which it holds. Empirically, three synthetic experiments benchmark the proposed attention matrices and show that they converge to meaningful representations, something shared attention vectors fail to do. These results suggest that outcome-indexed attentional matrices are a general fix for gradient-based attentional processes, which improves models of learning under multi-outcome conditions.
- Abstract(参考訳): 学習における次元的注意はしばしばグローバルに共有される注意ベクトルとして実装され、各刺激次元は単一のスカラーに対応する。
これらのスカラーは、予測的特徴がよりサリエンスを得る誤差の勾配差によってモデルによって学習される。
モデルが複数の結果を予測するマルチアウトカム学習では、この共有ベクトルは不安定になり、その境界に崩壊し、学習と一般化のための意味のある注意的チューニングが学習されるのを防ぐ。
本稿では、グローバルに共有される注目度調整を結果インデックス化表現に変換する、結果インデックス化注目度行列を導入することで、この問題に対処する。
不安定な共有ベクトルの解析を行い、その条件を導出する。
実験的に、3つの合成実験は提案された注意行列をベンチマークし、それらが意味のある表現に収束することを示す。
これらの結果から,多出力条件下での学習モデルの改善を図った,勾配に基づく注意過程の一般的な修正法であることが示唆された。
関連論文リスト
- Deconfounding Scores and Representation Learning for Causal Effect Estimation with Weak Overlap [75.41420283374737]
オーバーラップは因果治療効果推定の鍵となる条件である。
本稿では,デコンウンディングスコア(deconfounding scores)と呼ばれる特徴表現のクラスを提案する。
このクラスでは, 予後スコアが重なり合うことを示す。
論文 参考訳(メタデータ) (2026-04-01T12:19:42Z) - Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization [15.662726701547896]
ベクトル量子化は、連続表現を離散ベクトルの集合に離散化する機械学習の技法である。
その頻度にもかかわらず、生成モデルにおけるベクトル量子化の特性と振舞いは、ほとんど未解明のままである。
本研究は,離散コードブックトークンと連続潜伏埋め込みの間で崩壊表現が観察されるベクトル量子化における崩壊問題について,系統的に検討する。
論文 参考訳(メタデータ) (2026-03-17T18:32:21Z) - InfoNCE Induces Gaussian Distribution [7.8922077372145685]
対照的なトレーニングの損失はInfoNCEとその変種である。
我々は、InfoNCEの目的が、対照的な訓練から現れる表現においてガウス構造を誘導することを示す。
ガウスモデルにより、学習された表現の原理的な分析処理が可能となり、コントラスト学習における幅広い応用を支援することが期待されている。
論文 参考訳(メタデータ) (2026-02-27T13:35:58Z) - Generalization for Least Squares Regression With Simple Spiked Covariances [3.9134031118910264]
勾配降下によって訓練された2層ニューラルネットワークの一般化特性はいまだよく分かっていない。
最近の研究は、隠れた層における特徴行列のスペクトルを記述することで進展した。
しかし、スパイク共分散を持つ線形モデルの一般化誤差は以前には決定されていない。
論文 参考訳(メタデータ) (2024-10-17T19:46:51Z) - CARLA: Self-supervised Contrastive Representation Learning for Time Series Anomaly Detection [53.83593870825628]
時系列異常検出(TSAD)の主な課題は、多くの実生活シナリオにおいてラベル付きデータの欠如である。
既存の異常検出手法の多くは、教師なしの方法で非ラベル時系列の正常な振る舞いを学習することに焦点を当てている。
本稿では,時系列異常検出のためのエンドツーエンドの自己教師型コントラアスティブ表現学習手法を提案する。
論文 参考訳(メタデータ) (2023-08-18T04:45:56Z) - Learning Graphical Factor Models with Riemannian Optimization [70.13748170371889]
本稿では,低ランク構造制約下でのグラフ学習のためのフレキシブルなアルゴリズムフレームワークを提案する。
この問題は楕円分布のペナルティ化された最大推定値として表される。
楕円モデルによく適合する正定行列と定ランクの正半定行列のジオメトリを利用する。
論文 参考訳(メタデータ) (2022-10-21T13:19:45Z) - On the Benefits of Large Learning Rates for Kernel Methods [110.03020563291788]
本稿では,カーネル手法のコンテキストにおいて,現象を正確に特徴付けることができることを示す。
分離可能なヒルベルト空間における2次対象の最小化を考慮し、早期停止の場合、学習速度の選択が得られた解のスペクトル分解に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2022-02-28T13:01:04Z) - Information-Theoretic Generalization Bounds for Iterative
Semi-Supervised Learning [81.1071978288003]
特に,情報理論の原理を用いて,反復型SSLアルゴリズムのエミュレータ一般化誤差の振る舞いを理解することを目的とする。
我々の理論的結果は、クラス条件分散があまり大きくない場合、一般化誤差の上限は反復数とともに単調に減少するが、すぐに飽和することを示している。
論文 参考訳(メタデータ) (2021-10-03T05:38:49Z) - Eigen Analysis of Self-Attention and its Reconstruction from Partial
Computation [58.80806716024701]
ドット積に基づく自己注意を用いて計算した注意点のグローバルな構造について検討する。
注意点の変動の大部分は低次元固有空間にあることがわかった。
トークンペアの部分的な部分集合に対してのみスコアを計算し、それを用いて残りのペアのスコアを推定する。
論文 参考訳(メタデータ) (2021-06-16T14:38:42Z) - Benign overfitting in ridge regression [0.0]
過度にパラメータ化されたリッジ回帰に対する漸近的でない一般化境界を提供する。
最小あるいは負の正則化が小さい一般化誤差を得るのに十分であるかどうかを同定する。
論文 参考訳(メタデータ) (2020-09-29T20:00:31Z) - Extreme Memorization via Scale of Initialization [72.78162454173803]
我々は,初期化の規模を変えることが,SGDによって誘導される暗黙の正規化に強く影響を与える実験装置を構築する。
一般化能力に影響を及ぼす範囲と方法が、使用したアクティベーションと損失関数に依存することがわかった。
均質なReLU活性化の場合、この挙動は損失関数に起因することが示される。
論文 参考訳(メタデータ) (2020-08-31T04:53:11Z) - The Slow Deterioration of the Generalization Error of the Random Feature
Model [12.865834066050427]
理論的、実験的に、作業中に動的自己補正機構があることが示される。
これにより、トレーニングプロセスを止めて、優れた一般化特性を持つソリューションを得るのに十分な時間が得られる。
論文 参考訳(メタデータ) (2020-08-13T00:35:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。