論文の概要: Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models
- arxiv url: http://arxiv.org/abs/2604.27124v1
- Date: Wed, 29 Apr 2026 19:23:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.769771
- Title: Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models
- Title(参考訳): より優れたモデル、より高速なトレーニング:単一細胞基盤モデルに対するシグモイドの注意
- Authors: Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh,
- Abstract要約: 安定した生物基盤モデルの訓練には、注意機構の再考が必要である。
ソフトマックスアテンションaの代替としてシグモイドアテンションを用いると,より優れた学習表現が得られることがわかった。
また、効率的なGPUカーネルであるTritonSigmoidをオープンソースとして実装しています。
- 参考スコア(独自算出の注目度): 3.784026537291876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training stable biological foundation models requires rethinking attention mechanisms: we find that using sigmoid attention as a drop in replacement for softmax attention a) produces better learned representations: on six diverse single-cell datasets, sigmoid achieves 25% higher cell-type separation, better cell-type cohesion metrics, and lower validation loss, b) faster training, models with sigmoid attention train up to 10% faster than their softmax counterparts, and c) more stable training by eliminating inherent sources of instability in softmax attention. We establish that sigmoid attention has globally bounded derivatives ($\leq 0.25$) as opposed to softmax, and a diagonal Jacobian structure in contrast with softmax's dense coupling, which together help alleviate training instabilities. In stress tests on 160M-parameter bidirectional attention models trained without gradient clipping on 8K-token sequences, softmax diverges catastrophically, with gradients exploding by four orders of magnitude, while sigmoid remains stable. Finally, we implement and open-source TritonSigmoid, an efficient GPU kernel that achieves 515 TFLOPS on H100 GPUs, outperforming both FlashAttention-2 and FlashSigmoid, with native padding support, which is essential for biological sequences. Our results establish sigmoid attention as both theoretically grounded and empirically superior for biological foundation models. Code is available at https://github.com/MSDLLCpapers/triton-sigmoid
- Abstract(参考訳): 安定した生体基盤モデルの訓練には注意機構の再考が必要である--ソフトマックスの注意の代替としてシグモイド・アテンションを用いた場合
a) より優れた学習された表現を生成する:6つの多様な単細胞データセットにおいて、シグモイドは25%高い細胞型分離、より良い細胞型凝集度、より低いバリデーション損失を達成する。
ロ より速く訓練し、シグモイド注意モデルにおいて、ソフトマックスよりも10%速く訓練し、
c)ソフトマックス注意における本質的な不安定性の源を排除し、より安定した訓練を行うこと。
我々は、シグモイドの注意は、ソフトマックスとは対照的に全世界的に有界な微分(\leq 0.25$)を持ち、ソフトマックスの密結合とは対照的に対角ジャコビアン構造はトレーニング不安定性を緩和する。
8K-token配列の勾配切り抜きなしで訓練された160Mパラメータ双方向アテンションモデルの応力試験では、ソフトマックスは破滅的に分岐し、勾配は4桁の規模で爆発し、シグモイドは安定している。
最後に,H100 GPU上で515 TFLOPSを達成する効率のよいGPUカーネルであるTritonSigmoidをオープンソースとして実装し,FlashAttention-2とFlashSigmoidのどちらよりも優れた性能を発揮した。
以上の結果から,シグモイドは生物学的基盤モデルにおいて理論的に優位であり,実証的に優れていると考えられる。
コードはhttps://github.com/MSDLLCpapers/triton-sigmoidで入手できる。
関連論文リスト
- Exact Discrete Stochastic Simulation with Deep-Learning-Scale Gradient Optimization [0.0]
連続時間マルコフ連鎖(CTMC)の厳密なシミュレーションは、離散性とノイズ駆動系の振る舞いにおいて不可欠であるが、ジルズピー型アルゴリズムの厳密なカテゴリー選択は勾配に基づく学習を妨げている。
我々は, この制約を, 後方微分からフォワードシミュレーションを分離することにより排除し, 厳密な分類的サンプリングにより, 連続的に並列なGumbel-Softmaxストレートスルーサロゲートを伝播する正確な軌道と勾配を生成する。
本研究により, システム生物学, 化学動力学, 物理, およびCTMCが支配する領域における高次元パラメータ推論と逆設計が可能となった。
論文 参考訳(メタデータ) (2026-02-23T12:29:43Z) - MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration [48.446476072756276]
トレーニング不安定性は、大規模言語モデルの事前トレーニングにおいて依然として重要な課題である。
我々は,5MナノGPTモデルにおけるトレーニング失敗をP$で評価した。
安定なランクを回復するために行列手演算を周期的に適用する新しいノルムであるMSignを提案する。
論文 参考訳(メタデータ) (2026-02-02T07:18:45Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Sigmoid Self-Attention has Lower Sample Complexity than Softmax Self-Attention: A Mixture-of-Experts Perspective [69.72942835553228]
本稿では,Sigmoid self-attentionがソフトマックスよりも試料効率が高いことを理論的に示す。
筆者らは, 自己注意行列を専門家の混合として表現し, シグモイドの自己注意における専門家の意識は, ソフトマックスの自己意識と同一の近似誤差を達成するために, 極めて少ないデータを必要とすることを示した。
論文 参考訳(メタデータ) (2025-02-01T02:36:14Z) - Theory, Analysis, and Best Practices for Sigmoid Self-Attention [16.73166377436999]
我々は,シグモイドの注意を再考し,詳細な理論的および経験的分析を行う。
我々は,シグモイドに着目した変換器が普遍関数近似器であることを証明した。
ハードウェア・アウェアのFLASHSIGMOIDを導入し,Sigmoid attentionをメモリ効率で実装する。
論文 参考訳(メタデータ) (2024-09-06T17:53:26Z) - A Multi-Grained Symmetric Differential Equation Model for Learning Protein-Ligand Binding Dynamics [73.35846234413611]
薬物発見において、分子動力学(MD)シミュレーションは、結合親和性を予測し、輸送特性を推定し、ポケットサイトを探索する強力なツールを提供する。
我々は,数値MDを容易にし,タンパク質-リガンド結合ダイナミクスの正確なシミュレーションを提供する,最初の機械学習サロゲートであるNeuralMDを提案する。
従来の数値MDシミュレーションと比較して1K$times$ Speedupを実現することにより,NeuralMDの有効性と有効性を示す。
論文 参考訳(メタデータ) (2024-01-26T09:35:17Z) - Branched Latent Neural Maps [0.0]
分岐潜在ニューラルネットワーク(BLNMs)は、複雑な物理過程をコードする有限次元の入出力マップを学習する。
BLNMは、小さなトレーニングデータセットと1つのプロセッサでの短いトレーニング時間で優れた一般化特性を示す。
オンラインフェーズでは、BLNMは単一のコアコンピュータ上での心臓電気生理学のリアルタイムシミュレーションを5000倍高速に行うことができる。
論文 参考訳(メタデータ) (2023-08-04T04:04:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。