論文の概要: HSAP: A Hierachical Sequence-aware Parallelism for Hybrid-Context Generative Models
- arxiv url: http://arxiv.org/abs/2606.30460v1
- Date: Mon, 29 Jun 2026 15:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.313181
- Title: HSAP: A Hierachical Sequence-aware Parallelism for Hybrid-Context Generative Models
- Title(参考訳): HSAP:ハイブリッドコンテキスト生成モデルのための階層型シーケンス対応並列処理
- Abstract要約: 本稿では,集中型テンソル伝達と部分的注意計算の障害を克服する効率的なシーケンス・アウェア並列性アルゴリズムを提案する。
提案アルゴリズムはJITコンパイルを用いてNCCLレベルの全デバイスグループの通信戦略を最適化する。
さらに,Herachical Sequence-Aware Parallelismフレームワークのメモリと通信オーバーヘッドの管理について詳しく検討し,その性能を最適化する。
- 参考スコア(独自算出の注目度): 17.09673128667358
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we aim to combine the advantages of existing sequence parallelism paradigms and overcomes their drawbacks, the most serious of which is the incapability to correctly compute causal attention on the hybrid-context packed sequences, in a stronger sequence parallelism framework. The practical technique of packing sequences for efficiently pretraining and fine-tuning large language models causes cross-contamination problem in attention computation, which can be effectively solved when no parallelism in the sequence length dimension is taken. However, in sequence parallelism, existing approaches either ignore the scenario of hybrid-context sequences or conversely sacrifice and limit parallelism degree for supporting the scenario. To this end, we innovatively propose an efficient Sequence-Aware Parallelism algorithm to conquer the obstacles of intensive tensor transmission and partial attention computation across multiple device groups. Our algorithm utilizes JIT (Just-In-Time) compilation to optimize the communication strategy of all device groups in NCCL level. Further, we integrate existing sequence parallelism paradigms into a Hierachical Sequence-Aware Parallelism framework which benefits from our sequence-aware algorithm. We additionally elaborate on the memory and communication overhead management of the hierachical framework to optimize its performance. Through multiple experiments, we demonstrate that our proposed approach outperform other state-of-the-arts sequence parallelism approches in multiple metrics.
- Abstract(参考訳): 本稿では,既存のシーケンス並列化パラダイムの利点を組み合わせ,その欠点を克服することを目的としている。最も深刻なのは,より強力なシーケンス並列化フレームワークにおいて,ハイブリッドコンテキストのバンドルシーケンスに対する因果的注意を正しく計算できないことだ。
大規模言語モデルを効率よく事前学習し、微調整するための配列をパッケージングする実践的手法は、注意計算におけるクロス汚染問題を引き起こし、シーケンス長次元の並列性を取らない場合、効果的に解決できる。
しかし、シーケンス並列性では、既存のアプローチは、ハイブリッドコンテキストシーケンスのシナリオを無視したり、シナリオをサポートするために逆に犠牲にしたり、並列性を制限したりする。
この目的のために,複数のデバイス群にまたがる集中テンソル伝達と部分的注意計算の障害を克服する効率的なシーケンス認識並列化アルゴリズムを革新的に提案する。
提案アルゴリズムはJIT(Just-In-Time)コンパイルを利用して,NCCLレベルのすべてのデバイスグループの通信戦略を最適化する。
さらに、既存のシーケンス並列処理のパラダイムを、シーケンス対応アルゴリズムの利点を生かした階層型シーケンス対応並列処理フレームワークに統合する。
さらに、その性能を最適化するために、ヒエラルキーフレームワークのメモリと通信オーバーヘッドの管理について詳しく述べる。
複数の実験を通して、提案手法は、他の最先端のシーケンス並列性よりも、複数のメトリクスで優れていることを示す。
関連論文リスト
- A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems [8.810136864681994]
大規模言語モデル(LLM)駆動のマルチエージェントシステムは通常、推論中に複数のモデル呼び出しと複雑な調整を必要とする。
本稿では,マルチエージェントシステムにおける並列処理を,Replica Parallelism と Structure Parallelism の2つの異なる決定プロセスのレベルとしてモデル化する。
この2つのレベルの並列処理を統一し,それらの役割を推論プロセス内で協調する実行フレームワークであるTIPEXを提案する。
論文 参考訳(メタデータ) (2026-08-06T09:26:24Z) - Empowering Cross-Domain Sequential Recommendation with Hybrid Tokenization and Serial-Parallel Decoding [63.74998371740272]
クロスドメインシーケンシャルレコメンデーション(CDSR)は、ユーザの動的関心遷移と複数のドメインにわたるシーケンシャルパターンをモデル化することを目的としている。
我々は,CDSRの効率的かつ効率的な生成フレームワークであるGenCDSRを提案する。
我々は、GenCDSRが、最先端のベースラインと比較して平均精度を1.5パーセント向上し、平均推論遅延を85.1%削減したことを示す。
論文 参考訳(メタデータ) (2026-07-21T08:01:15Z) - PRISM: Parallel Residual Iterative Sequence Model [52.26239951489612]
我々はこの緊張を解決するためにPRISM(Parallel Residual Iterative Sequence Model)を提案する。
PRISMは、パラレル化可能な形で多段階精製の重要な構造特性を捉える、ソルバに着想を得た帰納バイアスを導入している。
この定式化が Rank-$L$ の蓄積を達成することを証明し、更新多様体を単一ステップの Rank-$1$ ボトルネックを超えて構造的に拡張する。
論文 参考訳(メタデータ) (2026-02-11T12:39:41Z) - Para-B&B: Load-Balanced Deterministic Parallelization of Solving MIP [50.917107318582715]
MIP(Mixed-integer Programming)は、連続型と整数型の両方の決定変数を組み込むことで線形プログラミングを拡張する。
本稿では,高性能MIPソルバであるHiGHSに対して,決定論的並列分岐結合の完全なオープンソース実装を初めて提案する。
本手法では,ワーカスレッド間で完全なソルバ状態を複製することにより,厳密な決定性を保証する新しいデータ並列アーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-02-10T14:17:53Z) - Learning to Share: Selective Memory for Efficient Parallel Agentic Systems [49.78267008828593]
エージェントシステムは、反復的に推論する複数のエージェントを調整することで複雑なタスクを解決し、ツールを呼び出し、中間結果を交換する。
最近のアプローチでは、さまざまな推論の軌跡を探索するために、複数のエージェントチームが並行して運用されている。
我々は並列エージェントフレームワークのための学習された共有メモリ機構であるLearning to Share (LTS)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:20:21Z) - Rethinking Dynamic Networks and Heterogeneous Computing with Automatic Parallelization [8.918295350787465]
現在の並列計画フレームワークは、ノードの不均一性と動的ネットワークトポロジの変化を同時に考慮している。
本研究では,不実現不可能な並列構成を高速に破棄するストラテジ・プルーニング手法を提案する。
予備評価では,本手法が異種ノードのトレーニング性能を向上させることが確認された。
論文 参考訳(メタデータ) (2025-06-03T12:14:17Z) - Multi Activity Sequence Alignment via Implicit Clustering [50.3168866743067]
暗黙のクラスタリングによるシーケンスアライメントによる制約を克服する新しいフレームワークを提案する。
具体的には、列内のフレームをアライメントしながら、暗黙的なクリップレベルのクラスタリングを行うという考え方です。
実験の結果,提案手法は最先端の結果よりも優れていた。
論文 参考訳(メタデータ) (2025-03-16T14:28:46Z) - FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism [33.23902060961886]
既存のシーケンス並列化法は、均質なシーケンス長(すなわち全ての入力シーケンスの長さが等しい)を仮定し、従って全ての入力シーケンスに対して単一の静的散乱戦略を利用する。
LLMトレーニングコーパスの配列長は,長い尾分布の後に大きく変動することがわかった。
この問題に対処する不均一適応列並列化法を提案する。
論文 参考訳(メタデータ) (2024-12-02T14:16:03Z) - Late Fusion Multi-view Clustering via Global and Local Alignment
Maximization [61.89218392703043]
マルチビュークラスタリング(MVC)は、異なるビューからの補完情報を最適に統合し、クラスタリング性能を改善する。
既存のアプローチの多くは、クラスタリングに最適な類似性行列を学ぶために、複数の事前定義された類似性を直接融合する。
これらの問題に対処するために、アライメントを通してレイトフュージョンMVCを提案する。
論文 参考訳(メタデータ) (2022-08-02T01:49:31Z) - Parallel Training of GRU Networks with a Multi-Grid Solver for Long
Sequences [1.9798034349981162]
本稿では,GRU(Gated Recurrent Unit)ネットワークのための並列学習手法を提案する。
MGRITはシーケンスを複数の短いサブシーケンスに分割し、異なるプロセッサ上のサブシーケンスを並列に訓練する。
HMDB51データセットにおいて、各ビデオが画像シーケンスである実験結果から、新しい並列トレーニングスキームがシリアルアプローチよりも最大6.5$times$スピードアップを達成することを示した。
論文 参考訳(メタデータ) (2022-03-07T11:32:44Z) - Randomized Block-Diagonal Preconditioning for Parallel Learning [0.0]
本研究では,プレコンディショニング行列がブロック対角形を持つ事前条件付き勾配に基づく最適化手法について検討する。
本研究の主な貢献は,これらの手法の収束性がランダム化手法によって著しく向上できることを実証することである。
論文 参考訳(メタデータ) (2020-06-24T10:12:36Z) - Iterative Algorithm Induced Deep-Unfolding Neural Networks: Precoding
Design for Multiuser MIMO Systems [59.804810122136345]
本稿では,AIIDNN(ディープ・アンフォールディング・ニューラルネット)を一般化した,ディープ・アンフォールディングのためのフレームワークを提案する。
古典的重み付き最小二乗誤差(WMMSE)反復アルゴリズムの構造に基づく効率的なIAIDNNを提案する。
提案したIAIDNNは,計算複雑性を低減した反復WMMSEアルゴリズムの性能を効率よく向上することを示す。
論文 参考訳(メタデータ) (2020-06-15T02:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。