Fugu-MT 論文翻訳(概要): jaxsgp4: GPU-accelerated mega-constellation propagation with batch parallelism

論文の概要: jaxsgp4: GPU-accelerated mega-constellation propagation with batch parallelism

arxiv url: http://arxiv.org/abs/2603.27830v1
Date: Sun, 29 Mar 2026 19:39:05 GMT
ステータス: 翻訳完了
システム内更新日: 2026-03-31 23:18:45.136229
Title: jaxsgp4: GPU-accelerated mega-constellation propagation with batch parallelism
Title（参考訳）: jaxsgp4: バッチ並列処理によるGPUアクセラレーションによるメガコンステレーション伝播
Authors: Charlotte Priestley, Will Handley,
Abstract要約: 本稿では、textttJAXライブラリであるSGP4のオープンソースの高性能再実装であるtextttjaxsgp4を紹介する。我々は、textttjaxsgp4がStarlink星座全体(9,341個の衛星)を1つのA100 GPU上で4ms以下で1000の時間ステップで伝播できることを実証した。
参考スコア（独自算出の注目度）: 0.5461938536945722
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: As the population of anthropogenic space objects transitions from sparse clusters to mega-constellations exceeding 100,000 satellites, traditional orbital propagation techniques face a critical bottleneck. Standard CPU-bound implementations of the Simplified General Perturbations 4 (SGP4) algorithm are less well suited to handle the requisite scale of collision avoidance and Space Situational Awareness (SSA) tasks. This paper introduces \texttt{jaxsgp4}, an open-source high-performance reimplementation of SGP4 utilising the \texttt{JAX} library. \texttt{JAX} has gained traction in the landscape of computational research, offering an easy mechanism for Just-In-Time (JIT) compilation, automatic vectorisation and automatic optimisation of code for CPU, GPU and TPU hardware modalities. By refactoring the algorithm into a pure functional paradigm, we leverage these transformations to execute massively parallel propagations on modern GPUs. We demonstrate that \texttt{jaxsgp4} can propagate the entire Starlink constellation (9,341 satellites) each to 1,000 future time steps in under 4 ms on a single A100 GPU, representing a speedup of $1500\times$ over traditional C++ baselines. Furthermore, we argue that the use of 32-bit precision for SGP4 propagation tasks offers a principled trade-off, sacrificing negligible precision loss for a substantial gain in throughput on hardware accelerators.
Abstract（参考訳）: 宇宙天体の人口がスパース星団から10万個を超える巨星星へと移行するにつれ、従来の軌道伝搬技術は重要なボトルネックに直面している。 SGP4(Simplified General Perturbations 4)アルゴリズムの標準CPUバウンド実装は、衝突回避の必要なスケールと空間状況認識(SSA)タスクを扱うのにはあまり適していない。本稿では,SGP4 のオープンソース実装である \texttt{jaxsgp4} について紹介する。 JIT(Just-In-Time)コンパイル、自動ベクトル化、CPU、GPU、TPUハードウェアの最適化などの簡単なメカニズムを提供する。アルゴリズムを純粋機能パラダイムにリファクタリングすることにより、これらの変換を活用して、現代的なGPU上で大規模な並列伝搬を実行する。我々は,従来のC++ベースラインよりも1,500\times$のスピードアップを示す1つのA100 GPU上で,Starlinkコンステレーション全体(9,341個の衛星)を,1つのA100 GPU上で4ms以下で,1,000の将来のタイムステップで伝搬できることを実証した。さらに、SGP4伝搬タスクに32ビット精度を用いることは、ハードウェアアクセラレーターのスループットを大幅に向上させるため、無視可能な精度損失を犠牲にする、原則的なトレードオフをもたらすと論じる。

関連論文リスト

Real-Time Semantic Segmentation on FPGA for Autonomous Vehicles Using LMIINet with the CGRA4ML Framework [0.0]
本稿では,CGRA4MLハードウェアフレームワークを用いたFPGAによるリアルタイムセマンティックセマンティックセマンティクスの実装について述べる。実装は,ZCU104 FPGA基板上で50.1msのレイテンシで,20フレーム/秒(FPS)でリアルタイムに動作している平均45%,約90%の画素精度を実現している。
論文参考訳（メタデータ） (2025-10-25T10:16:22Z)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。 MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文参考訳（メタデータ） (2025-09-27T09:22:21Z)
COMET: Towards Partical W4A4KV4 LLMs Serving [37.30529940231099]
量子化は、端末デバイスやクラウドデータセンターで大規模言語モデル(LLM)を提供するオーバーヘッドを低減するための圧縮技術である。本稿では,ほとんどのアクティベーションを4ビットに圧縮し,精度損失を無視できる新しい混合精度量子化アルゴリズム(FMPQ)を提案する。我々は、最適化されたW4Axカーネルを推論フレームワークCOMETに統合し、人気のあるLLMをサポートするための効率的な管理を提供する。
論文参考訳（メタデータ） (2024-10-16T02:16:53Z)
MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。 MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文参考訳（メタデータ） (2024-08-21T16:10:41Z)
Closing the Gap Between SGP4 and High-Precision Propagation via Differentiable Programming [4.868863044142366]
本研究では、PyTorchを用いて実装されたSGP4の新しい微分可能バージョンであるdSGP4を提案する。 SGP4を識別可能にすることで、dSGP4は宇宙船の軌道決定を含む様々な宇宙関連の応用を促進する。本稿では,ニューラルネットを軌道伝搬器に統合した新しい軌道伝搬パラダイムML-dSGP4を提案する。
論文参考訳（メタデータ） (2024-02-07T13:26:10Z)
QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models [57.04178959678024]
重み付けとアクティベーションの両方を4ビットにキャストすることで、大きな生成モデルに対する推論計算の大部分が実行可能であることを示す。これをQUIKと呼ばれるハイブリッド量子化戦略により実現し、重みとアクティベーションの大部分を4ビットに圧縮する。我々は、QUIKフォーマットを高効率なレイヤワイドランタイムに適合させるGPUカーネルを提供し、これにより、エンドツーエンドのスループットが3.4倍に向上する。
論文参考訳（メタデータ） (2023-10-13T17:15:05Z)
Adaptable Butterfly Accelerator for Attention-based NNs via Hardware and Algorithm Co-design [66.39546326221176]
多くのAIタスクにおいて、注意に基づくニューラルネットワークが普及している。注意機構とフィードフォワードネットワーク(FFN)の使用は、過剰な計算とメモリ資源を必要とする。本稿では,注目機構とFFNの両方を近似するために,バタフライの分散パターンを統一したハードウェアフレンドリーな変種を提案する。
論文参考訳（メタデータ） (2022-09-20T09:28:26Z)
VersaGNN: a Versatile accelerator for Graph neural networks [81.1667080640009]
我々は,超効率的なサイストリックアレイベースの多用途ハードウェアアクセラレータである textitVersaGNN を提案する。 textitVersaGNNは平均3712$times$ speedup with 1301.25$times$ energy reduction on CPU、35.4$times$ speedup with 17.66$times$ energy reduction on GPUを達成している。
論文参考訳（メタデータ） (2021-05-04T04:10:48Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。