論文の概要: Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention
- arxiv url: http://arxiv.org/abs/2608.30129v1
- Date: Mon, 31 Aug 2026 01:27:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.193375
- Title: Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention
- Title(参考訳): 線形アテンションを用いた画素空間拡散による効率良く高品質な深度推定
- Authors: Bingde Liu, Wu Ran, Jinglei Zhang, Huanhuan Yuan, Chao Ma,
- Abstract要約: ラピス(Lapis)は、1段階拡散による効率的かつ高忠実な深さ推定を実現する生成フレームワークである。
粗い階層構造によってこれらの制限を修正します。
最新のSOTA(State-of-the-art)の精度と境界シャープネスを様々な解像度で一貫して達成する。
- 参考スコア(独自算出の注目度): 10.565261122171906
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work presents $\textbf{Lapis}$, a $\textbf{l}$inear-$\textbf{a}$ttention-based $\textbf{pi}$xel-$\textbf{s}$pace generative framework that achieves efficient and high-fidelity depth estimation with one-step diffusion. While generative frameworks have significantly advanced monocular depth estimation with superior detail fidelity, the $\mathcal{O}(N^2)$ complexity of standard attention and the multi-step denoising process introduce prohibitive computational costs when scaling them to high-resolution image applications. Although linear attention and one-step prediction are intuitively viable, directly applying them leads to poor structural consistency, detail loss, and noise. Lapis rectifies these limitations through a coarse-to-fine hierarchy. Specifically, a Patch-level Consistency Module restores structural coherence by integrating semantic and spatial priors. Subsequently, a Pixel-level Refinement Module recovers sharp geometric boundaries via skip-connection-based pixel correspondence. Furthermore, to mitigate sampling noise inherent in one-step diffusion, we leverage the manifold assumption and adopt a direct $\mathbf{x}$-prediction strategy to target the clean data manifold. Extensive evaluations on multiple benchmarks demonstrate that Lapis consistently achieves state-of-the-art (SOTA) accuracy and boundary sharpness across various resolutions, reducing inference latency by up to 7.6$\times$ at 1080P and 10.9$\times$ at 1440P resolution compared to previous SOTA generative models.
- Abstract(参考訳): この研究は、一段階拡散による効率的かつ高忠実な深さ推定を実現する、$\textbf{Lapis}$, a $\textbf{l}$inear-$\textbf{a}$ttention-based $\textbf{pi}$xel-$\textbf{s}$pace生成フレームワークを提示する。
生成フレームワークは、高精細な忠実度で非常に高度な単眼深度推定を行うが、$\mathcal{O}(N^2)$標準注意の複雑さと、高精細画像アプリケーションにスケールする際には、多段階のデノナイジングプロセスが禁忌的な計算コストをもたらす。
線形注意と一段階予測は直感的に可能であるが、直接適用することで構造的整合性、詳細損失、ノイズが低下する。
Lapisは粗い階層によってこれらの制限を修正します。
特に、パッチレベルの一貫性モジュールは、セマンティックと空間的事前を統合することで構造的コヒーレンスを復元する。
その後、Pixelレベルリファインメントモジュールは、スキップ接続ベースのピクセル対応によってシャープな幾何学的境界を回復する。
さらに、一段階拡散に固有のサンプリングノイズを軽減するために、この多様体の仮定を利用して、クリーンなデータ多様体をターゲットとする直接$\mathbf{x}$-prediction戦略を採用する。
複数のベンチマークでの広範囲な評価により、Lapisは様々な解像度にわたる最先端(SOTA)の精度と境界のシャープさを一貫して達成し、推論遅延を1080Pで7.6$\times$、10.9$\times$以前のSOTA生成モデルと比較して最大1440Pで削減している。
関連論文リスト
- PXDepth: Pixel-Space Modeling for Structure Preserving Monocular Depth Estimation [102.98521307122452]
PXDepthは,画素レベルの深度予測から大域的コンテキストモデリングを分離する識別単眼深度モデルである。
具体的には、大容量のViTがグローバルシーンコンテキストをキャプチャし、Context-Modulated Pixel Transformerブロックからなる画素空間予測器が高解像度空間表現を保持する。
この設計は、世界深度一貫性を犠牲にすることなく、微細な構造と鋭い境界を保っている。
論文 参考訳(メタデータ) (2026-08-17T18:00:02Z) - Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee [14.954293251332894]
Federated Learning (FL)は、クライアントが生データを共有せずにモデルを協調的にトレーニングすることを可能にするが、ビザンティン攻撃に対して非常に脆弱である。
既存の堅牢なアプローチはこれらの脅威を中和するが、かなりの計算オーバーヘッドを発生させる。
ベクトルレベル距離に基づくロバストアグリゲータのための普遍加速度フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-27T11:39:47Z) - Reflected diffusion models adapt to low-dimensional data [1.4273866043218157]
本稿では、超キューブ$[0,1]D$が$d$次元線型部分空間上でサポートされている場合の反射拡散モデルの統計的解析を行う。
簡単に実装可能な遷移密度の無限級数展開を利用することで、スコア関数とその近似をスパースReLUネットワークで束縛する解析ツールを開発する。
論文 参考訳(メタデータ) (2026-03-25T16:37:33Z) - $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - Online Federated Learning via Non-Stationary Detection and Adaptation
amidst Concept Drift [39.12903814606534]
フェデレート・ラーニング(Federated Learning、FL)は、人工知能研究の幅広い文脈における新興分野である。
FLの既存の文献は、主に定常的なデータ生成過程を前提としている。
我々は,textitFedAvgとtextitFedOMDアルゴリズムの理論的保証をほぼ定常的に組み合わせた,マルチスケールのアルゴリズムフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-22T20:45:48Z) - Normalized/Clipped SGD with Perturbation for Differentially Private
Non-Convex Optimization [94.06564567766475]
DP-SGDとDP-NSGDは、センシティブなトレーニングデータを記憶する大規模モデルのリスクを軽減する。
DP-NSGD は DP-SGD よりも比較的チューニングが比較的容易であるのに対して,これらの2つのアルゴリズムは同様の精度を実現する。
論文 参考訳(メタデータ) (2022-06-27T03:45:02Z) - $\texttt{FedBC}$: Calibrating Global and Local Models via Federated
Learning Beyond Consensus [66.62731854746856]
フェデレートラーニング(FL)では、デバイス全体にわたるモデル更新の集約を通じて、グローバルモデルを協調的に学習する目的は、ローカル情報を通じたパーソナライズという目標に反対する傾向にある。
本研究では,このトレードオフを多基準最適化により定量的にキャリブレーションする。
私たちは、$texttFedBC$が、スイートデータセット間でグローバルおよびローカルモデルのテスト精度のメトリクスのバランスをとることを実証しています。
論文 参考訳(メタデータ) (2022-06-22T02:42:04Z) - Settling the Sample Complexity of Model-Based Offline Reinforcement
Learning [50.5790774201146]
オフライン強化学習(RL)は、事前収集されたデータを用いて、さらなる探索を行わずに学習する。
事前のアルゴリズムや分析は、最適なサンプルの複雑さに悩まされるか、サンプルの最適性に到達するために高いバーンインコストがかかるかのいずれかである。
モデルベース(あるいは"プラグイン")アプローチは,バーンインコストを伴わずに,最小限のサンプル複雑性を実現することを実証する。
論文 参考訳(メタデータ) (2022-04-11T17:26:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。