論文の概要: Memory-efficient GPU pipelines for real-time non-line-of-sight reconstruction
- arxiv url: http://arxiv.org/abs/2608.28183v1
- Date: Fri, 28 Aug 2026 10:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.294158
- Title: Memory-efficient GPU pipelines for real-time non-line-of-sight reconstruction
- Title(参考訳): リアルタイム非視線再構成のためのメモリ効率GPUパイプライン
- Abstract要約: 非視線画像(NLOS)は、一光子アバランシェダイオード(SPAD)によって記録された間接光から、隅々に隠れたシーンを再構成する
何十億もの光子タイムスタンプを結合し、メモリを移動し、変換し、反転させる必要がある。
ストリーミング処理とオフライン処理の両方において、f-kマイグレーションとファサーフィールドという2つの確立されたウェーブベースアルゴリズムの実行を再構築する。
- 参考スコア(独自算出の注目度): 0.30556942817031457
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Non-line-of-sight (NLOS) imaging reconstructs scenes hidden around a corner from indirect light recorded by a single-photon avalanche diode (SPAD). A single reconstruction is a large inverse problem: billions of photon timestamps must be binned, moved through memory, transformed and inverted. As SPAD arrays raise acquisition throughput, reconstruction becomes the limiting stage. We rebuild the GPU execution of two established wave-based algorithms, f-k migration and phasor-fields, for both streaming and offline processing. On the phasor-fields side we assemble the ring-and-radius kernels of previous work once and offline, using the analytic Fourier transform of a ring, so the propagation kernel never exists in dense form at runtime, reducing the memory and bandwidth. We reorganize the pipeline of both algorithms with fused kernels, warp-level photon binning, batched transforms, CUDA graph replay, and FP16 storage applied only where it reduces the actual bottleneck. Our implementations are up to 42x faster than the reference streaming pipeline and up to 14x faster than the fastest published GPU baseline, all while using a fraction of the memory (down to 2.5%), enabling vastly larger and finer reconstructions on the same hardware, or comparable ones within a much lower memory budget. We report an ablation of each implementation choice and propose three denoising strategies enabled by the resulting frame budget for next-generation NLOS video processing.
- Abstract(参考訳): 非視線画像(NLOS)は、一光子アバランシェダイオード(SPAD)によって記録された間接的な光から、隅々に隠れたシーンを再構成する。
何十億もの光子タイムスタンプを結合し、メモリを移動し、変換し、反転させる必要がある。
SPADアレイが取得スループットを上げると、再構築が制限段階となる。
ストリーミング処理とオフライン処理の両方において、f-kマイグレーションとfsor-fieldという2つの確立されたウェーブベースアルゴリズムのGPU実行を再構築する。
ファサー・フィールド側では、リングの分析フーリエ変換を用いて、前処理のリング・アンド・ラディウス核を一度、オフラインで組み立てる。
両アルゴリズムのパイプラインを、融合カーネル、ワープレベル光子バイニング、バッチ変換、CUDAグラフ再生、FP16ストレージで再編成し、実際のボトルネックを軽減する。
私たちの実装は、参照ストリーミングパイプラインよりも42倍高速で、最も高速に公開されたGPUベースラインよりも14倍高速です。
提案手法は,次世代NLOSビデオ処理のフレーム予算によって実現された3つのデノベーション戦略である。
関連論文リスト
- A CPU+DCU Heterogeneous Parallel Framework for Post-Processing Reconstruction in Quantum Circuit Cutting [5.31141365536699]
本稿では,回路切断後再構成のためのCPU+DCUヘテロジニアス並列フレームワークを提案する。
ヘテロジニアスなCPU+DCU実行と、64ビットを超えるグローバル基底状態インデックスのためのハイ/ローワード整数表現を組み合わせる。
Songshanスーパーコンピュータの実験では、このフレームワークは高い再現性を維持している。
論文 参考訳(メタデータ) (2026-07-30T09:53:27Z) - LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation [84.86814271505109]
LongLive-2.0は、長いビデオ生成の完全なトレーニングと推論ワークフロー全体を通じて、NVFP4ベースの並列インフラストラクチャである。
トレーニングには,quence-parallel autoregressive (AR) トレーニングを導入する。
実験ではトレーニングで2.15倍、推論で1.84倍のスピードアップを示す。
論文 参考訳(メタデータ) (2026-05-18T17:57:03Z) - Fast Log-Domain Sinkhorn Optimal Transport with Warp-Level GPU Reductions [1.6679662639178268]
我々は、log-domain Sinkhornアルゴリズムの軽量でネイティブな実装であるFastSinkhornを提案する。
我々の解法はログドメインで完全に動作し、標準ドメインメソッドが失敗するepsilon = 10-4のように、正規化パラメータの計算を可能にする。
画像色変換, 3次元点雲マッチング, 収束解析について検証し, 注意深い数値処理を施したネイティブカーネルが, 大規模最適輸送のための実用的で効率的な基盤となることを示した。
論文 参考訳(メタデータ) (2026-04-04T16:06:27Z) - Spava: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention [63.69228529380251]
Spavaはシーケンス並列フレームワークで、ロングビデオ推論に最適化されている。
Spavaは、FlashAttn、ZigZagRing、APBで12.72x、1.70x、1.18xのスピードアップを提供する。
論文 参考訳(メタデータ) (2026-01-29T09:23:13Z) - GSPN-2: Efficient Parallel Sequence Modeling [101.33780567131716]
一般化空間伝搬ネットワーク(GSPN)は2次自己アテンションを直線走査型伝搬方式に置き換えることでこの問題に対処する。
GSPN-2は、視覚アプリケーションにおけるグローバル空間コンテキストをモデル化するための新しい効率フロンティアを確立する。
論文 参考訳(メタデータ) (2025-11-28T07:26:45Z) - PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling [18.079843329153412]
拡散トランス (DiT) ベースのモデルでは、マーク可能な能力が実証されている。
しかし、彼らの実践的なデプロイメントは、推論速度の遅いことと、メモリ消費の増大によって妨げられている。
ビデオ生成を高速化するために,PipeDiTという新しいパイプラインフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-15T06:46:40Z) - Minute-Long Videos with Dual Parallelisms [57.22737565366549]
Diffusion Transformer (DiT)ベースのビデオ拡散モデルは、大規模に高品質なビデオを生成するが、長いビデオの処理遅延とメモリコストは禁じられている。
我々はDualParalと呼ばれる新しい分散推論戦略を提案する。
1つのGPUでビデオ全体を生成する代わりに、時間フレームとモデルレイヤの両方をGPU間で並列化します。
論文 参考訳(メタデータ) (2025-05-27T11:55:22Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - ReBotNet: Fast Real-time Video Enhancement [59.08038313427057]
ほとんどの復元ネットワークは遅く、高い計算ボトルネックがあり、リアルタイムビデオ拡張には使用できない。
本研究では,ライブビデオ通話やビデオストリームなどの実用的なユースケースをリアルタイムに拡張するための,効率的かつ高速なフレームワークを設計する。
提案手法を評価するために,実世界のビデオ通話とストリーミングのシナリオを示す2つの新しいデータセットをエミュレートし,ReBotNetがより少ない計算,メモリ要求の低減,より高速な推論時間で既存手法より優れていることを示す。
論文 参考訳(メタデータ) (2023-03-23T17:58:05Z) - GPU-Accelerated Primal Learning for Extremely Fast Large-Scale
Classification [10.66048003460524]
ロジスティック回帰や線形サポートベクターマシン(SVM)分類などのL2正規化原始問題を解く最も効率的な方法の1つは、広く使われている信頼領域ニュートンアルゴリズムであるTRONである。
我々は、GPU最適化の法則を用いて、異なる損失と特徴表現に対するTRONトレーニング時間を劇的に短縮できることを示した。
論文 参考訳(メタデータ) (2020-08-08T03:40:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。