論文の概要: ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning
- arxiv url: http://arxiv.org/abs/2607.12433v1
- Date: Tue, 14 Jul 2026 07:06:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.05978
- Title: ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning
- Title(参考訳): ARDepth:プログレッシブ・ビジュアル・コンディショニングによる自動回帰単眼深度推定
- Authors: Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li,
- Abstract要約: 拡散モデルは、反復的妄想を通して、世界規模で滑らかな場として深度を復元できると仮定する。
本稿では,構造的自己回帰生成として深度推定を定式化するARDepthを提案する。
提案手法は高い性能を達成し,スケールにわたって構造的に一貫した深度予測を実現する。
- 参考スコア(独自算出の注目度): 66.42476564611607
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion models have recently become the dominant paradigm for monocular depth estimation (MDE). However, they implicitly assume that depth can be recovered as a globally smooth field through iterative denoising, which does not explicitly reflect the piecewise and scale-dependent organization of scene geometry. In practice, geometric structure emerges progressively across spatial scales, where coarse layout, surfaces, and boundaries are constructed in a hierarchical manner. Motivated by this observation, we introduce ARDepth, which formulates depth estimation as structured auto-regressive generation. Instead of recovering depth through global refinement, ARDepth progressively constructs depth representations as spatial resolution increases. To support this generative process, we introduce Scale-Progressive Conditioning (SPC) to inject multi-scale visual features at each generation stage, and Semantic-Aware Guidance (SAG) to provide scene-level semantic priors that enhance global structural consistency. Together, these designs enable the model to capture fine-grained local details while maintaining coherent global geometry. Empirical results demonstrate that our approach achieves strong performance and produces structurally consistent depth predictions across scales, validating auto-regressive generation as a promising alternative paradigm for geometric modeling.
- Abstract(参考訳): 近年,拡散モデルが単分子深度推定(MDE)の主要なパラダイムとなっている。
しかし、彼らは暗黙的に、シーン幾何学の断片的かつスケール依存的な組織を明示的に反映しない反復的妄想によって、深さは世界規模で滑らかな場として復元できると仮定している。
実際には、幾何学的構造は、粗いレイアウト、表面、境界が階層的に構築される空間的規模で徐々に現れる。
そこで本研究では,自己回帰生成の構造化として深度推定を定式化するARDepthを導入する。
大域的な精錬によって深度を回復させる代わりに、カルデプスは空間分解能が増大するにつれて深度表現を徐々に構築する。
この生成プロセスを支援するために,世代毎に複数の視覚的特徴を注入するスケール・プログレッシブ・コンディショニング(SPC)と,グローバルな構造整合性を高めるシーンレベルのセマンティック・アウェア・ガイダンス(SAG)を導入する。
これらの設計により、モデルはコヒーレントなグローバル幾何を維持しながら、きめ細かい局所的な詳細を捉えることができる。
実験により,本手法は高い性能を達成し,構造的に一貫した深度予測を実現し,自動回帰生成を幾何モデリングの有望な代替パラダイムとして検証した。
関連論文リスト
- Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Any to Full: Prompting Depth Anything for Depth Completion in One Stage [23.09070498141459]
既存のRGBDフューズド・ディープ・コンプリート法は、トレーニングRGB分布と特定のディープ・パターンを併用した事前条件を学習する。
近年の取り組みでは、単分子深度推定モデルを活用して、領域一般幾何学的前提を導入する。
本稿では,1段階,ドメイン一般,パターンに依存しないフレームワークであるAny2Fullについて述べる。
論文 参考訳(メタデータ) (2026-03-05T22:08:40Z) - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models [98.72926158261937]
本稿では,Visual AutoRegressive モデルのためのトレーニングフリートークン解析フレームワークを提案する。
我々は局所的なテクスチャの詳細を捉えるために軽量なハイパスフィルタを使用し、グローバルな構造情報を保存するために主成分分析(PCA)を活用している。
スパーストークンの下で有効な次世代の予測を維持するために,近接した特徴伝達戦略を導入する。
論文 参考訳(メタデータ) (2026-03-02T11:35:05Z) - ObjSplat: Geometry-Aware Gaussian Surfels for Active Object Reconstruction [2.8012387812933035]
Splatは、外観と正確な幾何学の両方でオブジェクトを再構築する活発な再構築フレームワークである。
Splatは、物理的に一貫した完全性を数分で生成し、最先端のアプローチと比較して、再現精度と表面完全性に優れる。
論文 参考訳(メタデータ) (2026-01-11T17:14:33Z) - GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding [14.436063587920005]
地理空間領域に適した初めての拡散型視覚言語モデルであるGeoDiTを紹介する。
画像キャプション、視覚的接地、多物体検出において大きな進歩を遂げる。
本研究は, 複雑な地理空間解析において, 生成過程とデータ固有の構造との整合性が, 優れた性能の鍵となることを検証する。
論文 参考訳(メタデータ) (2025-12-02T07:59:46Z) - PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction [87.33016661440202]
自動回帰ポイントクラウド生成は、長い間、拡散ベースの品質アプローチに遅れを取ってきた。
低解像度で大域的な形状を保った粗大な生成フレームワークであるPointNSPを提案する。
ShapeNetの実験によると、PointNSPは自己回帰パラダイムの中で初めて、最先端(SOTA)生成品質を確立している。
論文 参考訳(メタデータ) (2025-10-07T06:31:02Z) - DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion [59.25479674775212]
DepRは深度誘導のシングルビューシーン再構築フレームワークである。
個々のオブジェクトを生成し、それらをコヒーレントな3Dレイアウトに構成する。
限られた合成データで訓練されているにもかかわらず、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-30T16:40:46Z) - PacGDC: Label-Efficient Generalizable Depth Completion with Projection Ambiguity and Consistency [63.74016242995453]
PacGDCは、一般化可能な深度補完のための最小限のアノテーションでデータ多様性を向上させるラベル効率のよい手法である。
本稿では,複数の深度基礎モデルをスケールマニピュレータとして利用する新しいデータ合成パイプラインを提案する。
実験により、PacGDCは複数のベンチマークで顕著に一般化可能であることが示された。
論文 参考訳(メタデータ) (2025-07-10T01:56:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。