論文の概要: Rendering 3D Gaussians on a Graph Processor
- arxiv url: http://arxiv.org/abs/2607.15951v1
- Date: Fri, 17 Jul 2026 13:36:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.857033
- Title: Rendering 3D Gaussians on a Graph Processor
- Title(参考訳): グラフプロセッサ上で3Dガウスアンをレンダリングする
- Abstract要約: インテリジェンス処理ユニット(IPU)における3次元ガウスの初実装
1,472個の独立タイルはオンチップのみであり、効率的なセンサプロセッサアーキテクチャの近似特性に制約がある。
これらの制約がパフォーマンスやレンダリング品質にどのように影響するかを評価する。
- 参考スコア(独自算出の注目度): 26.271402958805766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present the first implementation of a 3D Gaussian renderer on an Intelligence Processing Unit (IPU), comprising 1,472 independent tiles with only on-chip SRAM; constraints that approximate properties of efficient sensor-processor architectures. Our input scenes are 3D Gaussian maps from real-world sequences. Each tile 'owns' a screen-space region of the framebuffer; Gaussian primitives are routed to destination tiles via Manhattan-distance hops on a north-east-west-south (NEWS) grid, then distributed to overlapping neighbours in an expanding tree pattern. Computation follows the IPU's Bulk Synchronous Parallel (BSP) model, with inter-tile communication defined at compile time. We show this hardware allows us to exploit spatial and temporal locality by enabling local data transfer between cores. We evaluate the bottlenecks in this SRAM-only implementation: inter-tile bandwidth, per-tile SRAM capacity, and workload imbalance from non-uniform Gaussian density. We analyse how these constraints affect performance and render quality. This exploration raises broader questions for conventional GPUs and 3D representations, suggesting that direct inter-SM (streaming multiprocessor) communication might offer ways to reduce DRAM access in GPU kernels. We discuss these implications for the future of on-sensor and DRAM-free architectures. Project page: https://nmjfry.github.io/ipu-3dgs/
- Abstract(参考訳): 本稿では,1,472個の独立タイルをオンチップSRAMのみで構成するインテリジェンス処理ユニット(IPU)上での3Dガウスレンダラーの実装について述べる。
入力シーンは実世界からの3次元ガウス写像である。
それぞれのタイルはフレームバッファのスクリーンスペース領域であり、ガウスのプリミティブはマンハッタン・ディスタンス・ホップを経由して北東から南西(NEWS)のグリッドで目的地のタイルにルートされ、拡大するツリーパターンで隣人に分配される。
計算は IPU の Bulk Synchronous Parallel (BSP) モデルに従っており、コンパイル時にタイル間通信が定義される。
このハードウェアは、コア間の局所データ転送を可能にすることで、空間的および時間的局所性を活用できることを示します。
我々は、このSRAMのみの実装におけるボトルネックとして、タイル間帯域幅、タイル間SRAM容量、非一様ガウス密度からのワークロード不均衡を評価した。
これらの制約がパフォーマンスやレンダリング品質にどのように影響するかを分析します。
この調査は、従来のGPUと3D表現に対する広範な疑問を提起し、直接SM間通信はGPUカーネルにおけるDRAMアクセスを減らす手段を提供するかもしれないことを示唆している。
オンセンサーとDRAMフリーアーキテクチャの将来について論じる。
プロジェクトページ:https://nmjfry.github.io/ipu-3dgs/
関連論文リスト
- Local-GS: Accelerating 3D Gaussian Splatting via Tile-Local Warp Coherence [31.001161060131622]
3D Gaussian Splatting (3DGS)は、シーンを異方性3D Gaussianプリミティブの密集体として表現することにより、リアルタイムなノベルビュー計算を著しく進歩させた。
シーン幾何学よりもSIMT(Single Instruction, Multiple Threads)の実行境界に関してガウス的プリミティブを整理するワープコヒーレントレンダリングパラダイムであるLocal-GSを提案する。
プラグ・アンド・プレイの最適化として、全てのテストベースラインにさらなるパフォーマンス向上をもたらし、Deep Blendingのシーンで7.76Times$のスピードアップが達成された。
論文 参考訳(メタデータ) (2026-06-15T11:08:10Z) - Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices [18.428868416628017]
本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-13T13:38:27Z) - Radiant Foam Rendering on a Graph Processor [25.181643235594734]
多くのコアアクセラレーターは、単一の大きなデバイスメモリを数百から数千の軽量コアで置き換える。
この組織は、高い集約帯域幅を提供しているが、多くの技術の背後にある重要な仮定を破っている。
我々は,Graphcore Mk2 IPU上でのRadiant Foam Voronoiセルボリューム表現のために配布された,完全なレンダリングSRAMを提案する。
我々のシステムは640x480で約1fpsのスループットを実現し、元のGPUベースのRadiant Foam実装に近い画像と深度マップの品質を実現した。
論文 参考訳(メタデータ) (2026-01-07T20:44:04Z) - Quantile Rendering: Efficiently Embedding High-dimensional Feature on 3D Gaussian Splatting [52.18697134979677]
コンピュータビジョンの最近の進歩は、3Dガウススプラッティング(3D-GS)を活用して、OVS(Open-vocabulary segmentation)を3Dドメインに拡張することに成功している。
既存の方法はコードブックや特徴圧縮を採用しており、情報損失を引き起こし、セグメンテーションの品質が低下する。
本稿では,高忠実度を維持しながら高次元特徴を効率的に処理する3次元ガウスの新たなレンダリング戦略であるQuantile Rendering(Q-Render)を紹介する。
本フレームワークは,512次元特徴写像上での43.7倍の高速化でリアルタイムレンダリングを実現するとともに,最先端の手法よりも優れる。
論文 参考訳(メタデータ) (2025-12-24T04:16:18Z) - LODGE: Level-of-Detail Large-Scale Gaussian Splatting with Efficient Rendering [75.67501939005119]
メモリ制約デバイス上での3次元ガウススプラッティングのための新しいレベル・オブ・ディーテール(LOD)法を提案する。
カメラ距離に基づいてガウスの最適部分集合を反復的に選択する。
本手法は,屋外(階層型3DGS)と屋内(Zip-NeRF)の両方で最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-05-29T06:50:57Z) - GaussRender: Learning 3D Occupancy with Gaussian Rendering [86.89653628311565]
GaussRenderは、投影的一貫性を強制することによって3D占有学習を改善するモジュールである。
提案手法は,不整合な2次元プロジェクションを生成する3次元構成をペナライズすることにより,より一貫性のある3次元構造を実現する。
論文 参考訳(メタデータ) (2025-02-07T16:07:51Z) - Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading [2.8231000588510757]
トランスフォーマーと大規模言語モデル(LLM)は、すべてのドメインで急速に採用されている。
変圧器の訓練は非常に高価で、しばしば記憶壁にぶつかる」
本稿では,LLMをCPUまたはGPU上で更新フェーズをスケジュールしたサブグループに分割する手法を提案する。
論文 参考訳(メタデータ) (2024-10-26T00:43:59Z) - SplatLoc: 3D Gaussian Splatting-based Visual Localization for Augmented Reality [50.179377002092416]
より少ないパラメータで高品質なレンダリングが可能な効率的なビジュアルローカライズ手法を提案する。
提案手法は,最先端の暗黙的視覚的ローカライゼーションアプローチに対して,より優れた,あるいは同等なレンダリングとローカライゼーション性能を実現する。
論文 参考訳(メタデータ) (2024-09-21T08:46:16Z) - Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors [11.127604539303373]
微調整の大型言語モデル(LLM)は大きなメモリを必要とし、1つのGPUの容量を超えることが多い。
このメモリ課題の一般的な解決策は、計算とデータをGPUからCPUにオフロードすることだ。
本稿では,コモディティハードウェア上でのLLMの微調整を可能にするオフロードフレームワーク LSP-Offload を提案する。
論文 参考訳(メタデータ) (2024-06-14T16:59:11Z) - SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM [48.190398577764284]
SplaTAMは、単一のRGB-Dカメラからの高忠実度再構成を可能にするアプローチである。
基礎となるガウス表現に合わせて、単純なオンライントラッキングとマッピングシステムを採用している。
実験により,SplaTAMはカメラポーズ推定,マップ構築,既存手法に対する新規ビュー合成において最大2倍の性能を発揮することが示された。
論文 参考訳(メタデータ) (2023-12-04T18:53:24Z) - INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order
Gradient Computations in Implicit Neural Representation Processing [66.00729477511219]
計算グラフとして表される関数を考えると、従来のアーキテクチャはn階勾配を効率的に計算する上で困難に直面している。
InR-Archは,n階勾配の計算グラフをハードウェア最適化データフローアーキテクチャに変換するフレームワークである。
1.8-4.8x と 1.5-3.6x の高速化を CPU と GPU のベースラインと比較した結果を示す。
論文 参考訳(メタデータ) (2023-08-11T04:24:39Z) - Mesh Convolution with Continuous Filters for 3D Surface Parsing [101.25796935464648]
本稿では、3次元トライアングルメッシュから効果的な幾何学的特徴学習のための一連のモジュラー演算を提案する。
メッシュ畳み込みは球面調和を正規直交基底として利用し、連続畳み込みフィルタを生成する。
さらに,PicassoNet++という3次元表面の知覚解析のための新しい階層型ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2021-12-03T09:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。