論文の概要: Video Generation Models Are Inherent Lighting Estimators
- arxiv url: http://arxiv.org/abs/2607.04674v1
- Date: Mon, 06 Jul 2026 04:59:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.044239
- Title: Video Generation Models Are Inherent Lighting Estimators
- Title(参考訳): ビデオ生成モデルが本物の照明推定器になる
- Abstract要約: 近年のモデルでは、複雑な照明を持つシーンが作り出され、自然に照明を理解している。
V-LITE(ビデオ生成モデルは固有の照明推定器)を導入し,その内部知識を再フレーミング推定により解き放つ。
LDRネイティブモデルからHDRドメインへのギャップを埋めるために、我々はHDR対応のVAEを設計し、効率的なLoRAベースの微調整戦略を採用する。
- 参考スコア(独自算出の注目度): 54.44164570819254
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recovering dynamic environment maps from a single in-the-wild video is crucial for photorealistic rendering, yet remains a challenge. Recent video generation models can produce photorealistic scenes with complex lighting, possessing an inherent understanding of lighting. In this paper, we introduce V-LITE (Video generation models are inherent lighting estimators), a framework that unlocks this internal knowledge by reframing lighting estimation as a guided video inpainting task. Inspired by VFX industry practices, we insert a synthetic chrome ball into the scene to compel the model to generate physically plausible reflections from the surrounding spatio-temporal context. To bridge the gap from LDR-native models to the HDR domain, we design an HDR-aware VAE and employ an efficient LoRA-based fine-tuning strategy. We then construct a mixed dataset comprising high-fidelity HDR images to provide realistic HDR priors, and in-the-wild HDR videos to provide dynamic spatio-temporal context. Extensive experiments demonstrate that V-LITE produces temporally coherent HDR environment maps, revealing that modern video diffusion models are not merely synthesizers but also powerful, inherently capable estimators of physical scene lighting.
- Abstract(参考訳): ワンシーンのビデオからダイナミックな環境マップを復元することは、フォトリアリスティックなレンダリングには不可欠だが、それでも課題だ。
最近のビデオ生成モデルは、複雑な照明を持つ光現実的なシーンを生成でき、光の本質的な理解を持っている。
本稿では,映像生成モデルが固有の照明推定装置であるV-LITE(V-LITE)について紹介する。
VFX産業の実践に触発されて合成クロムボールがシーンに挿入され、周囲の時空間から物理的に可視な反射を生成する。
LDRネイティブモデルからHDRドメインへのギャップを埋めるために、我々はHDR対応のVAEを設計し、効率的なLoRAベースの微調整戦略を採用する。
そこで我々は,高忠実度HDR画像からなる混合データセットを構築し,現実的なHDR先行情報と,動的時空間の時空間情報を提供するための時間内HDRビデオを構築した。
広汎な実験により、V-LITEは時間的コヒーレントなHDR環境マップを生成することが示され、現代のビデオ拡散モデルは単にシンセサイザーだけでなく、物理的照明の本質的に有能な推定器でもあることが明らかになった。
関連論文リスト
- HDR Video Generation via Latent Alignment with Logarithmic Encoding [41.63873187838369]
適応最小限の事前学習ビデオモデルを用いて,高品質なHDRビデオ生成を実演する。
その結果,HDRは画像形成機構が根本的に異なるにもかかわらず,生成モデルを再設計することなく効果的に処理できることが示唆された。
論文 参考訳(メタデータ) (2026-04-13T17:55:02Z) - DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models [35.73610036182625]
Diff はビデオ拡散モデルの潜在空間内で LDR-to-generative conversion を定式化するフレームワークである。
さらに本フレームワークでは,テキストや参照画像でガイドされる制御可能なLDR-to-video変換を可能にする。
論文 参考訳(メタデータ) (2026-04-07T17:56:18Z) - Physically Inspired Gaussian Splatting for HDR Novel View Synthesis [40.99906396910274]
高ダイナミックレンジノベルビュー合成 (biased-NVS) は、マルチ露光低ダイナミックレンジ(LDR)ビューを融合することにより、ダイナミックディテールでシーンを再構築する。
トーンマップ結果の制約による暗黙的なHDR含量は,異常なHDR値の補正に失敗し,非露出領域におけるガウスの勾配が制限される。
本稿では,HDR-NVSフレームワークであるPhys-GSを紹介する。
論文 参考訳(メタデータ) (2026-03-30T04:27:39Z) - Dynamic Novel View Synthesis in High Dynamic Range [78.72910306733607]
現在の手法は主に静的なシーンに焦点を当てており、すべてのシーン要素が静止していて生きていないことを暗黙的に仮定している。
HDR-4DGSは,革新的な動的トーンマッピングモジュールを備えたガウススプラッティング方式のアーキテクチャである。
実験により、HDR-4DGSは、定量的性能と視覚的忠実度の両方において、既存の最先端手法を超越していることが示された。
論文 参考訳(メタデータ) (2025-09-26T04:29:22Z) - LuxDiT: Lighting Estimation with Video Diffusion Transformer [66.60450792095901]
単一の画像やビデオからシーンライティングを推定することは、コンピュータビジョンとグラフィックスにおいて長年の課題である。
本稿では,映像拡散変換器を微調整し,視覚入力を前提としたHDR環境マップを生成するLuxDiTを提案する。
論文 参考訳(メタデータ) (2025-09-03T19:59:20Z) - LEDiff: Latent Exposure Diffusion for HDR Generation [11.669442066168244]
LEDiffは、遅延空間露光融合技術により、HDRコンテンツを生成する生成モデルを実現する方法である。
また、LDR-to-fusionコンバータとしても機能し、既存の低ダイナミックレンジ画像のダイナミックレンジを拡張する。
論文 参考訳(メタデータ) (2024-12-19T02:15:55Z) - Cinematic Gaussians: Real-Time HDR Radiance Fields with Depth of Field [23.92087253022495]
放射場法は、多視点写真から複雑なシーンを再構成する際の技法の状態を表現している。
ピンホールカメラモデルへの依存は、すべてのシーン要素が入力画像に集中していると仮定し、実用的な課題を提示し、新規な視点合成において再焦点を複雑にする。
様々な露光時間,開口の放射率,焦点距離を多視点LDR画像を用いて高ダイナミックレンジシーンを再構成する3Dガウススメッティングに基づく軽量解析手法を提案する。
論文 参考訳(メタデータ) (2024-06-11T15:00:24Z) - Spatiotemporally Consistent HDR Indoor Lighting Estimation [66.26786775252592]
本研究では,屋内照明推定問題を解決するための物理動機付きディープラーニングフレームワークを提案する。
深度マップを用いた1枚のLDR画像から,任意の画像位置における空間的に一貫した照明を予測できる。
我々のフレームワークは、最先端の単一画像やビデオベースの手法と比較して、高画質で光リアリスティック照明予測を実現する。
論文 参考訳(メタデータ) (2023-05-07T20:36:29Z) - GlowGAN: Unsupervised Learning of HDR Images from LDR Images in the Wild [74.52723408793648]
そこで本研究では,HDR画像の生成モデルを構築するための第1の手法について述べる。
鍵となる考え方は、GAN(Generative Adversarial Network)を訓練して、様々な露光下でLDRに投影された場合、実際のLDR画像と区別できないHDR画像を生成することである。
実験の結果,GlowGANはランドスケープ,雷,窓など多くの難題において,光現実的HDR画像を合成できることがわかった。
論文 参考訳(メタデータ) (2022-11-22T15:42:08Z) - StyleLight: HDR Panorama Generation for Lighting Estimation and Editing [98.20167223076756]
単一視野(LFOV)画像から高ダイナミックレンジ(GAN)屋内パノラマ光を生成するための新しい照明推定・編集フレームワークを提案する。
本フレームワークは室内照明推定における最先端手法よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2022-07-29T17:58:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。