論文の概要: SP-TransientBench: A Real-Captured Single Photon Perception Benchmark
- arxiv url: http://arxiv.org/abs/2606.18952v1
- Date: Tue, 16 Jun 2026 17:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:51.134003
- Title: SP-TransientBench: A Real-Captured Single Photon Perception Benchmark
- Title(参考訳): SP-TransientBench: 実際にキャプチャされた単一光子知覚ベンチマーク
- Authors: Hongzhou Dong, Zili Zhang, Ziting Wen, Yiheng Qiang, Runrong Deng, Wenle Dong, Ziwen Jiang, Xinyang Li, Rui Lu, Shuoyao Sun, Wenyu Wang, Ziyi Xia, Haitao Zheng, Guodong Shi, Xiaoqiang Ren,
- Abstract要約: SP-TransientBench(SP-TransientBench)は、単一光子知覚のためのマルチタスクのリアルタイムベンチマークである。
STBは10の多彩なシーンと10,297のビューで構成され、ソリッドステートの単光子LiDARを256Times192$解像度で撮影する。
- 参考スコア(独自算出の注目度): 28.962976557292865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Single-photon LiDAR (SPL) based on single-photon avalanche diode (SPAD) sensing enables time-resolved photon measurements with extreme sensitivity, offering unique potential for active 3D perception in photon-starved scenarios.However, real-world single photon perception remains fundamentally challenging due to unique measurement noise and complex multi-return transient phenomena, which jointly complicate geometric reconstruction and semantic scene understanding. Despite growing interest in SPAD-based sensing, existing studies are largely limited to simulated data or small-scale controlled captures. As a result, systematic evaluation of real-world single photon perception across depth estimation, multi-view reconstruction, and 3D semantic understanding remains underexplored. To bridge this gap, we introduce SP-TransientBench (STB), a real-captured multi-task benchmark for single photon perception. SP-TransientBenc comprises 10 diverse scenes and 10,297 views captured using a solid-state single-photon LiDAR at $256\times192$ resolution. Each view provides full time-of-flight histograms with multi-return behavior,standardized metadata, and calibrated camera poses for multi-view evaluation. We further provide 13-class 3D semantic annotations for selected scenes. By providing dedicated data splits and evaluation protocols for each task, STB enables consistent and reproducible benchmarking of real-world single photon perception across multiple 3D vision problems. The dataset and code will be released upon acceptance.
- Abstract(参考訳): 単一光子アバランシェダイオード(SPAD)検出に基づく単光子LiDAR(SPL)は、極端感度で時間分解された光子計測を可能にし、光子スターベッドのシナリオにおけるアクティブな3次元知覚にユニークなポテンシャルを提供する。
SPADに基づくセンシングへの関心は高まっているが、既存の研究はシミュレーションデータや小さな制御されたキャプチャに限られている。
その結果, 深度推定, マルチビュー再構成, および3次元意味理解における実世界の単一光子知覚の体系的評価はいまだに未検討である。
このギャップを埋めるために、単一光子知覚のためのマルチタスクのリアルタイムベンチマークであるSP-TransientBench (STB)を導入する。
SP-TransientBencは10の多様なシーンと10,297のビューで構成され、ソリッドステートの単光子LiDARを256\times192$解像度で撮影する。
各ビューは、マルチリターン動作、標準化されたメタデータ、マルチビュー評価のためのキャリブレーションされたカメラポーズを備えたフルタイム・オブ・フライヒストグラムを提供する。
さらに、選択したシーンに対して13クラスの3Dセマンティックアノテーションを提供する。
各タスクに専用のデータ分割と評価プロトコルを提供することで、STBは複数の3次元視覚問題にまたがる実世界の単一光子知覚の一貫性と再現可能なベンチマークを可能にする。
データセットとコードは受け入れ次第リリースされる。
関連論文リスト
- DP-SfM: Dual-Pixel Structure-from-Motion without Scale Ambiguity [25.991973883422677]
マルチビュー3D再構成は、シーンに既知の大きさの参照オブジェクトが存在しない限り、未知のスケールの曖昧さに悩まされる。
デュアルピクセル(DP)センサを用いて撮像したマルチビュー画像は,そのスケールのあいまいさを自動的に解消できることを示す。
論文 参考訳(メタデータ) (2026-05-03T12:45:17Z) - ViewMorpher3D: A 3D-aware Diffusion Framework for Multi-Camera Novel View Synthesis in Autonomous Driving [20.935790354765604]
画像拡散モデルに基づく多視点画像拡張フレームワークであるViewMorpher3Dを紹介する。
シングルビューのアプローチとは異なり、ViewMorpher3Dはカメラのポーズに条件付けされた一連のレンダリングビュー、幾何学的先行3D、時間的に隣接または空間的に重複する参照ビューを共同で処理する。
我々のフレームワークは、様々なカメラとフレキシブルな参照/ターゲットビュー構成に対応しており、多様なセンサー設定に適応できる。
論文 参考訳(メタデータ) (2026-01-12T13:44:14Z) - Accelerating 3D Photoacoustic Computed Tomography with End-to-End Physics-Aware Neural Operators [74.65171736966131]
光音響計算トモグラフィ(PACT)は、光コントラストと超音波分解能を組み合わせることで、光拡散限界を超える深部像を実現する。
現在の実装では、高密度トランスデューサアレイと長い取得時間を必要とし、臨床翻訳を制限している。
本研究では,センサ計測からボリューム再構成まで,逆音響マッピングを直接学習する物理認識モデルであるPanoを紹介する。
論文 参考訳(メタデータ) (2025-09-11T23:12:55Z) - OccNeRF: Advancing 3D Occupancy Prediction in LiDAR-Free Environments [77.0399450848749]
本稿では,OccNeRF法を用いて,3次元監視なしで占有ネットワークを訓練する手法を提案する。
我々は、再構成された占有領域をパラメータ化し、サンプリング戦略を再編成し、カメラの無限知覚範囲に合わせる。
意味的占有予測のために,事前学習した開語彙2Dセグメンテーションモデルの出力をフィルタリングし,プロンプトを洗練するためのいくつかの戦略を設計する。
論文 参考訳(メタデータ) (2023-12-14T18:58:52Z) - Progressive Multi-view Human Mesh Recovery with Self-Supervision [68.60019434498703]
既存のソリューションは通常、新しい設定への一般化性能の低下に悩まされる。
マルチビューヒューマンメッシュリカバリのためのシミュレーションに基づく新しいトレーニングパイプラインを提案する。
論文 参考訳(メタデータ) (2022-12-10T06:28:29Z) - Weakly Supervised 3D Multi-person Pose Estimation for Large-scale Scenes
based on Monocular Camera and Single LiDAR [41.39277657279448]
大規模シーンにおける3次元多人数ポーズ推定のためのモノクロカメラとLiDARによる単一手法を提案する。
具体的には,画像や点クラウドを含むマルチモーダル入力データを活用するための効果的な融合戦略を設計する。
本手法は, 点雲の固有な幾何学的制約を自己監督のために利用し, 画像上の2次元キーポイントを弱監督のために利用する。
論文 参考訳(メタデータ) (2022-11-30T12:50:40Z) - Facial Depth and Normal Estimation using Single Dual-Pixel Camera [81.02680586859105]
DP指向のDepth/Normalネットワークを導入し,3次元顔形状を再構成する。
これは、メートル法スケールでの深度マップと表面正規を含む、対応する地上3次元モデルを含んでいる。
近年のDPベース深度/正規推定法で最先端の性能を実現している。
論文 参考訳(メタデータ) (2021-11-25T05:59:27Z) - Neural Radiance Fields Approach to Deep Multi-View Photometric Stereo [103.08512487830669]
多視点測光ステレオ問題(MVPS)に対する現代的な解法を提案する。
我々は、光度ステレオ(PS)画像形成モデルを用いて表面配向を取得し、それを多視点のニューラルラディアンス場表現とブレンドして物体の表面形状を復元する。
本手法は,多視点画像のニューラルレンダリングを行い,深部光度ステレオネットワークによって推定される表面の正規性を活用している。
論文 参考訳(メタデータ) (2021-10-11T20:20:03Z) - Multi-View Photometric Stereo: A Robust Solution and Benchmark Dataset
for Spatially Varying Isotropic Materials [65.95928593628128]
多視点光度ステレオ技術を用いて3次元形状と空間的に異なる反射率の両方をキャプチャする手法を提案する。
我々のアルゴリズムは、遠近点光源と遠近点光源に適している。
論文 参考訳(メタデータ) (2020-01-18T12:26:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。