論文の概要: LBI: Parallel Scan Backpropagation via Latent Bounded Interfaces
- arxiv url: http://arxiv.org/abs/2605.09204v1
- Date: Sat, 09 May 2026 22:46:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.111635
- Title: LBI: Parallel Scan Backpropagation via Latent Bounded Interfaces
- Title(参考訳): LBI:潜在境界インターフェースによる並列スキャンバックプロパゲーション
- Abstract要約: 本稿では,スキャンベースのバックプロパゲーションをトラクタブルにするアルゴリズム式であるLatent Bounded Interfaces (LBI)を紹介する。
LBIは接尾辞再帰を$r倍r$ヤコビアンに還元し、コンビネーション当たりのコストを$O(d3)$から$O(r3)$に削減する。
47-61Mブロックパラメータにおいて,LBIはモデル品質を4つのアーキテクチャ(Mamba-2,Mamba-3,Transformer,Mamba-Transformerハイブリッド)で維持することを示した。
- 参考スコア(独自算出の注目度): 1.8179911892344436
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Backpropagation is inherently sequential across depth, creating an $O(K)$-deep dependency chain that bottlenecks parallel training. While parallel-scan formulations theoretically reduce this depth to $O(\log K)$, they are computationally prohibitive for modern architectures due to the $O(d^3)$ cost of composing full-rank $d\times d$ Jacobians over the entire hidden state. We introduce Latent Bounded Interfaces (LBI), an algorithmic formulation that makes scan-based backpropagation tractable by restricting inter-region communication to a low-dimensional latent interface, $ m_k \in \mathbb{R}^{r}$, where $r \ll d$. This reduces the adjoint recursion to a suffix scan over $r \times r$ Jacobians, cutting per-combine cost from $O(d^3)$ to $O(r^3)$ while preserving exact gradients under the bounded-interface model. We demonstrate that LBI maintains model quality across four architectures (Mamba-2, Mamba-3, Transformer, and a Mamba--Transformer hybrid) at 47--61M block parameters. Interfaces of dimension $r=16$ suffice to preserve training quality within 0.16--0.35 cross entropy of dense baselines. The resulting framework provides an algorithmic foundation for region-parallel training, reducing cross-device backward communication to a single scan over $K$ fixed-size matrices, of approximately 56 KB for our experimental configurations.
- Abstract(参考訳): バックプロパゲーションは本質的に深さにわたってシーケンシャルであり、並列トレーニングのボトルネックとなる$O(K)$-deep依存性チェーンを生成する。
並列スキャンの定式化は理論的には、この深さを$O(\log K)$に縮めるが、隠された状態全体にわたってフルランクの$d\times d$ Jacobiansを構成するコストが$O(d^3)$であることから、現代の建築では計算的に禁じられている。
低次元の潜在インタフェースに領域間通信を制限することで、スキャンベースのバックプロパゲーションを可能にするアルゴリズムであるLatent bounded Interfaces (LBI)を紹介し、$m_k \in \mathbb{R}^{r}$, $r \ll d$。
これにより、接点再帰は$r \times r$ Jacobians の接尾辞スキャンに還元され、結合ごとのコストは$O(d^3)$から$O(r^3)$に削減される。
47-61Mブロックパラメータにおいて,LBIはモデル品質を4つのアーキテクチャ(Mamba-2,Mamba-3,Transformer,Mamba-Transformerハイブリッド)で維持することを示した。
寸法$r=16$のインタフェースは、密度ベースラインのクロスエントロピー0.16-0.35のトレーニング品質を維持するのに十分である。
結果として得られたフレームワークは、リージョン並列トレーニングのためのアルゴリズム基盤を提供し、デバイス間の後方通信を、実験的な構成で約56KBの固定サイズ行列で1つのスキャンに削減する。
関連論文リスト
- SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums [51.49970814177172]
データセットに対する経験的リスクは、自然に$N=nm$全サンプルに類似性を示す。
我々は悲観的な収束分析を避ける分析を提供する。
我々の成果は、既存の最先端の体制を改善した。
論文 参考訳(メタデータ) (2026-06-14T14:11:07Z) - Scaling Neural Network Verification with Tensor Parallelism and Fully Sharded Data Parallelism [0.0]
形式的ニューラルネットワーク検証は、実際にはGPUメモリによって境界付けられている。
大規模なモデルトレーニングのために開発された2つのテクニックをauto_LiRPA / $,$-CROWN 検証フレームワークに適用する。
フルシャードデータ並列(FSDP)シャードは、層ごとのAllGatherで重量行列のみをシャードし、単一GPUベースラインとビット単位で同一のバウンドを生成する。
論文 参考訳(メタデータ) (2026-06-08T11:56:29Z) - Efficient Mean Curvature Computation on High-Dimensional Data Manifolds [52.452902154360565]
高次元データセットの各点における局所的な平均曲率の推定は、機械学習アルゴリズムの重要な要素である。
本稿では,このコストを桁違いに削減する2つの補完的貢献を紹介する。
実世界のデータセットの実験では、オリジナルの実装と比較して50倍から300倍のスピードアップが確認されている。
論文 参考訳(メタデータ) (2026-06-04T16:04:31Z) - Scaling Federated Linear Contextual Bandits via Sketching [49.12000877146222]
本稿では,FSCLB(Federated Sketch Contextual Linear Bandits)を提案する。
合成と実世界の両方のデータセットの実験では、FSCLBは計算と通信のコストを90%以上削減している。
論文 参考訳(メタデータ) (2026-05-01T08:22:06Z) - Learning Hippo: Multi-attractor Dynamics and Stability Effects in a Biologically Detailed CA3 Extension of Hopfield Networks [0.0]
本稿では,CA3における古典ホップフィールド/マーの自動連想メモリモデルの拡張について述べる。
われわれは10個体群(非対称錐体サブタイプ2種,GABA作動性インターニューロンクラス8種),4つのコンパートメント,複数ルール可塑性,およびバイモーダルコリン作動性エンコーディング/コンソリデーションサイクルを実装した。
論文 参考訳(メタデータ) (2026-04-22T15:28:17Z) - Evolution Strategies at the Hyperscale [57.75314521465674]
本稿では,大集団にバックプロップフリーな最適化を拡大するための進化戦略(ES)アルゴリズムEGGROLLを紹介する。
ESは、微分不可能またはノイズの多い目的を処理できる強力なブラックボックス最適化手法のセットである。
EGGROLLはランダム行列を$Ain mathbbRmtimes r, Bin mathbbRntimes r$ with $rll min(m,n)$ とすることでこれらのボトルネックを克服し、低ランク行列摂動を$A Btop$とする。
論文 参考訳(メタデータ) (2025-11-20T18:56:05Z) - Scaling Up Liquid-Resistance Liquid-Capacitance Networks for Efficient Sequence Modeling [50.994194925685434]
LrcSSMは$textitnon-linear$リカレントモデルで、現在の線形状態空間層と同じくらい高速に長いシーケンスを処理する。
ヤコビ行列を対角線に強制することにより、全列を並列に解くことができる。
LrcSSMは、Liquid-S4のような他の入力変化系が提供しないことを保証する形式的な勾配安定性を提供する。
論文 参考訳(メタデータ) (2025-05-27T20:02:59Z) - Trading-off Accuracy and Communication Cost in Federated Learning [5.83744681136074]
我々は,34倍の通信コスト削減を実現するトレーニング・バイ・プルーニング・プロトコルを開発した。
トレーニング・バイ・サンプリングとランダム凸幾何学の新たなリンクを確立する。
論文 参考訳(メタデータ) (2025-03-18T13:35:24Z) - Demystifying Linear MDPs and Novel Dynamics Aggregation Framework [8.087699764574788]
線型 MDP において、$d$ は遷移確率を適切に表すために$S/U$ で制限される。
動的アグリゲーション(dynamics aggregate, 動的アグリゲーション)と呼ばれる動的に基づく新しい構造アグリゲーションフレームワークを提案する。
提案アルゴリズムは統計的効率を示し,$ tildeO (d_psi3/2 H3/2sqrt T)$, $d_psi$は集約されたサブMDPの特徴次元を表す。
論文 参考訳(メタデータ) (2024-10-31T16:21:41Z) - Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs [56.237917407785545]
本稿では,円滑なベルマン作用素を持つ連続空間マルコフ決定過程(MDP)の一般クラスにおいて,$varepsilon$-optimal Policyを学習する問題を考察する。
我々のソリューションの鍵となるのは、調和解析のアイデアに基づく新しい射影技術である。
我々の結果は、連続空間 MDP における2つの人気と矛盾する視点のギャップを埋めるものである。
論文 参考訳(メタデータ) (2024-05-10T09:58:47Z) - Differentially Private Exploration in Reinforcement Learning with Linear
Representation [102.17246636801649]
まず,線形混合MDP(Ayob et al., 2020)の設定(モデルベース設定)について検討し,共同・局所微分プライベート(DP)探索を統一的に分析するための枠組みを提供する。
我々はさらに、線形MDP(Jin et al., 2020)におけるプライバシー保護探索(つまりモデルフリー設定)について研究し、$widetildeO(sqrtK/epsilon)$ regret bound for $(epsilon,delta)を提供する。
論文 参考訳(メタデータ) (2021-12-02T19:59:50Z) - Deep Learning Meets Projective Clustering [66.726500395069]
NLPネットワークを圧縮するための一般的なアプローチは、埋め込み層を行列 $AinmathbbRntimes d$ としてエンコードすることである。
計算幾何学から遠射的クラスタリングに着想を得て、この部分空間を$k$部分空間の集合で置き換えることを提案する。
論文 参考訳(メタデータ) (2020-10-08T22:47:48Z) - Fixed-Support Wasserstein Barycenters: Computational Hardness and Fast
Algorithm [100.11971836788437]
固定支持ワッサーシュタインバリセンタ問題(FS-WBP)について検討する。
我々は,有望な反復的ブレグマン射影 (IBP) アルゴリズムであるtextscFastIBP の,証明可能な高速なテキスト決定論的変種を開発する。
論文 参考訳(メタデータ) (2020-02-12T03:40:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。