論文の概要: ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
- arxiv url: http://arxiv.org/abs/2607.01677v1
- Date: Thu, 02 Jul 2026 04:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.657059
- Title: ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
- Title(参考訳): ICDepth:インコンテキスト・コンディショニングによるビデオ深度推定のためのビデオ拡散モデルの作成
- Authors: Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen,
- Abstract要約: ビデオ深度推定には時間的一貫性、幾何学的精度、様々なシナリオでの一般化が必要である。
In-Context Conditioning による映像深度推定のために,事前学習したテキスト・ビデオ拡散変換器を適応させるフレームワーク textbfICDepth を導入する。
- 参考スコア(独自算出の注目度): 48.25349086337865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular video depth estimation requires temporal consistency, geometric accuracy, and generalization across diverse scenarios, yet existing methods struggle to achieve all three simultaneously. Discriminative models excel at per-frame accuracy but suffer from temporal drift due to limited context windows, while generative methods improve consistency and generalization at the cost of extensive training data (10M+ samples) and lack of geometric precision. In response to these issues, we introduce \textbf{ICDepth}, a framework that adapts pre-trained text-to-video diffusion transformers for video depth estimation via In-Context Conditioning (ICC), leveraging their rich spatial-temporal priors. To address key challenges in transferring ICC from generation to dense prediction, we propose: (1)~\textbf{SAND-Attention}, which ensures precise spatial-temporal alignment via shared RoPE and enforces unidirectional attention to prevent noise contamination; (2)~\textbf{SRFM}, which injects DINOv2 semantic and resolution priors to enhance geometric precision. ICDepth achieves state-of-the-art results on multiple benchmarks with remarkable data efficiency, trained on only 0.8M frames ($6$--$13\times$ less than competing generative methods), while demonstrating strong zero-shot generalization to diverse domains.
- Abstract(参考訳): 単眼ビデオ深度推定には時間的整合性、幾何的精度、様々なシナリオの一般化が必要であるが、既存の手法は3つ全てを同時に達成するのに苦労している。
識別モデルはフレーム単位の精度で優れるが、コンテキストウインドウの制限による時間的ドリフトに悩まされる一方、生成法は、広範囲なトレーニングデータ(10M+サンプル)と幾何学的精度の欠如により、一貫性と一般化を改善している。
In-Context Conditioning (ICC) による映像深度推定に事前学習したテキスト・ビデオ拡散トランスフォーマを適応させるフレームワークである \textbf{ICDepth} を導入する。
生成から密接な予測へのICCの転送における重要な課題に対処するため,(1)-\textbf{SAND-Attention},(2)-\textbf{SRFM},(2)-\textbf{SAND-Attention},(2)-\textbf{SRFM},(2)-\textbf{SAND-Attention}を提案する。
ICDepthは、0.8Mフレーム($6$--$13\times$)でトレーニングされ、さまざまな領域に強いゼロショットの一般化を示しながら、優れたデータ効率を持つ複数のベンチマークで最先端の結果を達成している。
関連論文リスト
- DVD: Deterministic Video Depth Estimation with Generative Priors [87.46576463137801]
DVDは、事前訓練されたビデオ拡散モデルをシングルパス深度回帰器に適応させる最初のフレームワークである。
DVDは、最先端のゼロショットのパフォーマンスをベンチマークで達成する。
私たちはパイプラインを完全にリリースし、オープンソースコミュニティに利益をもたらすために、SOTAビデオ深度推定のためのトレーニングスイート全体を提供しています。
論文 参考訳(メタデータ) (2026-03-12T17:58:06Z) - UCM: Unifying Camera Control and Memory with Time-aware Positional Encoding Warping for World Models [54.564740558030245]
UCMは、長期記憶と正確なカメラ制御をタイムアウェアな位置符号化変換機構を介して統合する新しいフレームワークである。
我々はまた、ポイントクラウドベースのレンダリングを利用したスケーラブルなデータキュレーション戦略を導入し、シーンの再考をシミュレートする。
論文 参考訳(メタデータ) (2026-02-26T12:54:46Z) - StableDPT: Temporal Stable Monocular Video Depth Estimation [14.453483279783908]
本稿では,最新の画像ベース(深度)推定モデルをビデオ処理に適用する手法を提案する。
我々のアーキテクチャは、市販のViTエンコーダ上に構築され、Dense Prediction Transformer (DPT) ヘッドが強化されている。
複数のベンチマークデータセットに対する評価では、リアルタイムシナリオにおける時間的一貫性の向上、最先端のパフォーマンスの競争力、および上位2倍高速な処理が示されている。
論文 参考訳(メタデータ) (2026-01-06T08:02:14Z) - Adapformer: Adaptive Channel Management for Multivariate Time Series Forecasting [49.40321003932633]
Adapformerは、効果的なチャネル管理を通じてCIとCD方法論のメリットをマージする、トランスフォーマーベースの高度なフレームワークである。
Adapformerは既存のモデルよりも優れた性能を実現し、予測精度と計算効率の両方を向上させる。
論文 参考訳(メタデータ) (2025-11-18T16:24:05Z) - Multi-modal Deepfake Detection and Localization with FPN-Transformer [21.022230340898556]
FPN変換器(Feature Pyramid-Transformer)に基づくマルチモーダルディープフェイク検出およびローカライゼーションフレームワークを提案する。
マルチスケールな特徴ピラミッドは、R-TLMブロックと局所的な注意機構によって構築され、コンテキスト間の時間的依存関係の結合解析を可能にする。
我々は,IJCAI'25 DDL-AVベンチマークの試験セットに対するアプローチを評価し,最終スコア0.7535で良好な性能を示した。
論文 参考訳(メタデータ) (2025-11-11T09:33:39Z) - Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency [60.74505433956616]
連続時間一貫性モデル(sCM)は理論的に原理化され、学術規模の拡散を加速するために実証的に強力である。
まず並列性互換なFlashAttention-2 JVPカーネルを開発し、100億以上のパラメータと高次元ビデオタスクを持つモデル上でsCMトレーニングを可能にする。
本稿では, スコア蒸留を長軸正則化器として組み込んだスコア規則化連続時間一貫性モデル(rCM)を提案する。
論文 参考訳(メタデータ) (2025-10-09T16:45:30Z) - UnLoc: Leveraging Depth Uncertainties for Floorplan Localization [80.55849461031879]
UnLocはフロアプラン内のシーケンシャルカメラローカライゼーションのための効率的なデータ駆動ソリューションである。
本研究では,不確実性推定を組み込んだ新しい確率モデルを導入し,深度予測を明示的な確率分布としてモデル化する。
我々はUnLocを大規模合成および実世界のデータセット上で評価し、精度とロバスト性の観点から大幅に改善したことを示す。
論文 参考訳(メタデータ) (2025-09-14T14:45:43Z) - H3R: Hybrid Multi-view Correspondence for Generalizable 3D Reconstruction [39.22287224290769]
H3Rは、潜在融合と注目に基づく機能集約を統合するハイブリッドフレームワークである。
両パラダイムを統合することで,既存手法よりも2$times$高速に収束しながら,一般化が促進される。
本手法は,ロバストなクロスデータセットの一般化を実証しながら,可変数および高分解能な入力ビューをサポートする。
論文 参考訳(メタデータ) (2025-08-05T05:56:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。