論文の概要: DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis
- arxiv url: http://arxiv.org/abs/2604.13416v1
- Date: Wed, 15 Apr 2026 02:33:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 20:38:32.357004
- Title: DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis
- Title(参考訳): DF3DV-1K:大規模データセットとディトラクタフリー新規ビュー合成のためのベンチマーク
- Authors: Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin,
- Abstract要約: DF3DV-1Kは1,048のシーンからなる大規模な実世界のデータセットであり、それぞれがベンチマークのためにクリーンで散らかった画像セットを提供する。
データセットには、カジュアルなキャプチャを模倣するためにコンシューマーカメラを使用して撮影した89,924枚の画像が含まれている。
DF3DV-41という41のシーンのキュレートされたサブセットは、散逸のない放射場法のロバスト性を評価するために体系的に設計されている。
- 参考スコア(独自算出の注目度): 24.91192063476988
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Advances in radiance fields have enabled photorealistic novel view synthesis. In several domains, large-scale real-world datasets have been developed to support comprehensive benchmarking and to facilitate progress beyond scene-specific reconstruction. However, for distractor-free radiance fields, a large-scale dataset with clean and cluttered images per scene remains lacking, limiting the development. To address this gap, we introduce DF3DV-1K, a large-scale real-world dataset comprising 1,048 scenes, each providing clean and cluttered image sets for benchmarking. In total, the dataset contains 89,924 images captured using consumer cameras to mimic casual capture, spanning 128 distractor types and 161 scene themes across indoor and outdoor environments. A curated subset of 41 scenes, DF3DV-41, is systematically designed to evaluate the robustness of distractor-free radiance field methods under challenging scenarios. Using DF3DV-1K, we benchmark nine recent distractor-free radiance field methods and 3D Gaussian Splatting, identifying the most robust methods and the most challenging scenarios. Beyond benchmarking, we demonstrate an application of DF3DV-1K by fine-tuning a diffusion-based 2D enhancer to improve radiance field methods, achieving average improvements of 0.96 dB PSNR and 0.057 LPIPS on the held-out set (e.g., DF3DV-41) and the On-the-go dataset. We hope DF3DV-1K facilitates the development of distractor-free vision and promotes progress beyond scene-specific approaches.
- Abstract(参考訳): 放射界の進歩により、光リアリスティックな新規なビュー合成が可能になった。
いくつかのドメインでは、包括的なベンチマークをサポートし、シーン固有の再構築を超えて進展を促進するために、大規模な実世界のデータセットが開発されている。
しかし、散逸のない放射場では、シーンごとにきれいで散らばった画像を持つ大規模なデータセットが不足しており、開発が制限されている。
DF3DV-1Kは1048のシーンからなる大規模な実世界のデータセットであり、それぞれがクリーンで散在した画像集合をベンチマーク用に提供している。
このデータセットには、消費者カメラで撮影した89,924枚の画像が含まれており、カジュアルキャプチャーを模倣し、128種類の気を散らすタイプと161のシーンテーマが屋内と屋外に散らばっている。
DF3DV-41という41のシーンのキュレートされたサブセットは、難解なシナリオ下での無散乱放射場法の堅牢性を評価するために体系的に設計されている。
DF3DV-1Kを用いて、最近の9つの乱れのない放射場法と3Dガウススプラッティングをベンチマークし、最も堅牢な手法と最も困難なシナリオを特定した。
DF3DV-1Kを用いて拡散型2Dエンハンサーを微調整して放射場法を改良し、ホールドアウトセット(例:DF3DV-41)とOn-the-goデータセット上で0.96dB PSNRと0.057LPIPSの平均的な改善を実現した。
DF3DV-1Kは、邪魔のない視覚の発達を促進し、シーン固有のアプローチを超えて進歩を促進することを願っている。
関連論文リスト
- EvLight++: Low-Light Video Enhancement with an Event Camera: A Large-Scale Real-World Dataset, Novel Method, and More [7.974102031202597]
EvLight++は、現実のシナリオで堅牢なパフォーマンスのために設計された、イベント誘導型低照度ビデオ拡張アプローチである。
EvLight++は1.37dBと3.71dBの2つのイメージベースとビデオベースの両方で大幅に性能が向上した。
論文 参考訳(メタデータ) (2024-08-29T04:30:31Z) - RoScenes: A Large-scale Multi-view 3D Dataset for Roadside Perception [98.76525636842177]
RoScenesは、最大規模のマルチビューロードサイド認識データセットである。
私たちのデータセットは、驚くべき21.13Mの3Dアノテーションを64,000$m2$で達成しています。
論文 参考訳(メタデータ) (2024-05-16T08:06:52Z) - CLONeR: Camera-Lidar Fusion for Occupancy Grid-aided Neural
Representations [77.90883737693325]
本稿では,スパース入力センサビューから観測される大規模な屋外運転シーンをモデル化することで,NeRFを大幅に改善するCLONeRを提案する。
これは、NeRFフレームワーク内の占有率と色学習を、それぞれLiDARとカメラデータを用いてトレーニングされた個別のMulti-Layer Perceptron(MLP)に分離することで実現される。
さらに,NeRFモデルと平行に3D Occupancy Grid Maps(OGM)を構築する手法を提案し,この占有グリッドを利用して距離空間のレンダリングのために線に沿った点のサンプリングを改善する。
論文 参考訳(メタデータ) (2022-09-02T17:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。