論文の概要: DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- arxiv url: http://arxiv.org/abs/2603.03744v1
- Date: Wed, 04 Mar 2026 05:29:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-05 21:29:15.188412
- Title: DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- Title(参考訳): DAGE: 効率的かつ微細な幾何推定のためのデュアルストリームアーキテクチャ
- Abstract要約: DAGEは、グローバルコヒーレンスを細部から切り離すデュアルストリームトランスフォーマーである。
低解像度ストリームは、フレーム/言語的注意を交互に交互に付加したアグレッシブなダウンサンプリングフレームで動作し、ビュー一貫性表現を構築する。
高解像度のストリームは、フレーム毎に元のイメージを処理し、シャープな境界と小さな構造を保存する。
この設計は、解像度とクリップ長を独立にスケールし、2Kまでの入力をサポートし、実用的な推論コストを維持する。
- 参考スコア(独自算出の注目度): 72.89376712495464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Estimating accurate, view-consistent geometry and camera poses from uncalibrated multi-view/video inputs remains challenging - especially at high spatial resolutions and over long sequences. We present DAGE, a dual-stream transformer whose main novelty is to disentangle global coherence from fine detail. A low-resolution stream operates on aggressively downsampled frames with alternating frame/global attention to build a view-consistent representation and estimate cameras efficiently, while a high-resolution stream processes the original images per-frame to preserve sharp boundaries and small structures. A lightweight adapter fuses these streams via cross-attention, injecting global context without disturbing the pretrained single-frame pathway. This design scales resolution and clip length independently, supports inputs up to 2K, and maintains practical inference cost. DAGE delivers sharp depth/pointmaps, strong cross-view consistency, and accurate poses, establishing new state-of-the-art results for video geometry estimation and multi-view reconstruction.
- Abstract(参考訳): 精度が高く、視界に一貫性のある幾何学とカメラのポーズを、未調整のマルチビュー/ビデオ入力から推定することは、特に高解像度の空間解像度と長いシーケンスで難しいままである。
本稿では,大域的コヒーレンスを細部から切り離すことが主な特徴であるDAGEについて述べる。
低解像度ストリームは、フレーム/球面的注目を交互に交互に集めて、視野一貫性のある表現と推定カメラを効率的に構築すると共に、高解像度ストリームはフレームごとのオリジナル画像を処理し、シャープな境界と小さな構造を保存する。
軽量アダプタは、これらのストリームをクロスアテンションを通じて融合させ、事前訓練された単一フレームの経路を邪魔することなく、グローバルなコンテキストを注入する。
この設計は、解像度とクリップ長を独立にスケールし、2Kまでの入力をサポートし、実用的な推論コストを維持する。
DAGEは、シャープな深度/ポイントマップ、強いクロスビュー整合性、そして正確なポーズを提供し、ビデオ幾何推定とマルチビュー再構成のための新しい最先端の結果を確立する。
関連論文リスト
- FFVO: A Feedforward Pose Decoder for Long-Horizon Visual Odometry [31.83986431141471]
本稿では,効率的かつ時間的に安定なカメラ位置推定のための共同再構成アーキテクチャのポーズ特化適応であるFeedforward Visual Odometry (FFVO)を提案する。
FFVOは、(i) 時間的アグリゲーションを計算的に効率的に行うためのコンパクトなカメラトーケン表現、(ii) 階層的局所-言語的時間的デコーダ、(iii) 時間的安定性を促進する中間軌道監督を使用する。
論文 参考訳(メタデータ) (2026-09-12T05:56:52Z) - OmniPoint: Universal Monocular Metric Pointcloud from Any Camera [79.24417597712802]
OmniPointは、様々な画像センサにまたがるメートル法再構成を一般化するために設計された統合されたフレームワークである。
射影剛性を克服するため、OmniPointは従来の平面深度回帰を放棄する。
代わりに、分離された訓練目標とともに、分離された光線と距離の表現を採用する。
論文 参考訳(メタデータ) (2026-09-08T19:45:58Z) - CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images [2.12833538322985]
自由視点の3Dシーンメディアは没入型アプリケーションではますます重要になっているが、現実的なキャプチャは視野の空間性や動きのぼかしに悩まされることが多い。
CasDeblurGSは,局所的な2D対応からグローバルな3Dガイダンスまで,信頼性の高いクロスビュー情報を段階的に復元するフレームワークである。
実世界のDeblur-NeRFシーンと合成されたDeblur-NeRFシーンの実験では、強いベースラインよりも一貫したゲインを示し、PSNRをそれぞれ1.19dBと2.11dB改善した。
論文 参考訳(メタデータ) (2026-08-11T01:13:21Z) - Sphere-VIO: Fast and Robust Visual-Inertial Odometry via Unified Spherical Representation for Heterogeneous Multi-Camera Systems [11.777651307702174]
マルチカメラ・ビジュアル・慣性オドメトリー(VIO)は、視野を広げることによって純粋な視覚系の固有の限界を克服する。
ヘテロジニアスマルチカメラシステムのための球面表現を統一した軽量フィルタベースのVIOフレームワークであるSphere-VIOを提案する。
Sphere-VIOは, 精度, 堅牢性, 効率, クロスカメラの汎用性とのトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2026-06-29T07:46:08Z) - CalibAnyView: Beyond Single-View Camera Calibration in the Wild [59.66873936532375]
カメラキャリブレーションは、信頼性の高い幾何学的知覚の基本的な前提条件である。
近年の学習に基づく手法では、単一ビューの校正には有望な結果が得られたが、本質的に複数のビューにまたがる幾何的整合性は無視されている。
任意の数の入力ビューをサポートする統一的な定式化であるCalibAnyViewを紹介します。
論文 参考訳(メタデータ) (2026-05-14T09:32:12Z) - Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors [48.033666517340464]
ScrollScapeは、EAR画像合成を連続的なビデオ生成プロセスに変換する新しいフレームワークである。
また,ScrollScapeは,高度に局所化されたアーティファクトを除去することにより,既存の画像拡散ベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-03-25T13:03:02Z) - UCM: Unifying Camera Control and Memory with Time-aware Positional Encoding Warping for World Models [54.564740558030245]
UCMは、長期記憶と正確なカメラ制御をタイムアウェアな位置符号化変換機構を介して統合する新しいフレームワークである。
我々はまた、ポイントクラウドベースのレンダリングを利用したスケーラブルなデータキュレーション戦略を導入し、シーンの再考をシミュレートする。
論文 参考訳(メタデータ) (2026-02-26T12:54:46Z) - StableDPT: Temporal Stable Monocular Video Depth Estimation [14.453483279783908]
本稿では,最新の画像ベース(深度)推定モデルをビデオ処理に適用する手法を提案する。
我々のアーキテクチャは、市販のViTエンコーダ上に構築され、Dense Prediction Transformer (DPT) ヘッドが強化されている。
複数のベンチマークデータセットに対する評価では、リアルタイムシナリオにおける時間的一貫性の向上、最先端のパフォーマンスの競争力、および上位2倍高速な処理が示されている。
論文 参考訳(メタデータ) (2026-01-06T08:02:14Z) - Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer [40.778996326009185]
初期核融合機構による多視点空間統合を行う最初のビジュアルローカライゼーションフレームワークを提案する。
我々のフレームワークはVGGTのバックボーン上に構築されており、多視点3D形状を符号化している。
本研究では,グローバルアテンションの2次複雑さを回避し,計算コストを削減する新しいスパースマスクアテンション戦略を提案する。
論文 参考訳(メタデータ) (2025-12-26T06:12:17Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer [7.19764062839405]
ビデオにおける多人数2Dポーズ推定のためのエンドツーエンドフレームワークを提案する。
鍵となる課題は、複雑な時間軌道と重なり合う時間軌道の下で、個人をフレーム全体で関連付けることである。
本稿では,フレーム内関係と時間デコーダのポーズをモデル化するための空間エンコーダを備えた新しいPose-Aware VideoErEr Network(PAVE-Net)を提案する。
論文 参考訳(メタデータ) (2025-11-17T10:19:35Z) - Visual Odometry with Transformers [68.453547770334]
特徴抽出により単眼フレームのシーケンスを処理するビジュアル・オドメトリ・トランスフォーマ(VoT)を導入する。
従来の方法とは異なり、VoTは密度の高い幾何学を推定することなくカメラの動きを直接予測し、監視のためにカメラのポーズのみに依存する。
VoTは、より大きなデータセットで効果的にスケールし、より強力なトレーニング済みバックボーンの恩恵を受け、多様なカメラモーションとキャリブレーション設定を一般化し、従来のメソッドよりも3倍以上高速に動作しながらパフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-10-02T17:00:14Z) - Pixel-Aligned Multi-View Generation with Depth Guided Decoder [86.1813201212539]
画素レベルの画像・マルチビュー生成のための新しい手法を提案する。
従来の作業とは異なり、潜伏映像拡散モデルのVAEデコーダにマルチビュー画像にアテンション層を組み込む。
本モデルにより,マルチビュー画像間の画素アライメントが向上する。
論文 参考訳(メタデータ) (2024-08-26T04:56:41Z) - Continuous Space-Time Video Super-Resolution Utilizing Long-Range
Temporal Information [48.20843501171717]
本稿では,任意のフレームレートと空間解像度に変換可能な連続ST-VSR(CSTVSR)手法を提案する。
本稿では,提案アルゴリズムの柔軟性が向上し,各種データセットの性能が向上することを示す。
論文 参考訳(メタデータ) (2023-02-26T08:02:39Z) - Multi-View Multi-Person 3D Pose Estimation with Plane Sweep Stereo [71.59494156155309]
既存のマルチビュー3Dポーズ推定手法は、複数のカメラビューからグループ2Dポーズ検出に対するクロスビュー対応を明確に確立する。
平面スイープステレオに基づくマルチビュー3Dポーズ推定手法を提案し、クロスビュー融合と3Dポーズ再構築を1ショットで共同で解決します。
論文 参考訳(メタデータ) (2021-04-06T03:49:35Z) - DFVS: Deep Flow Guided Scene Agnostic Image Based Visual Servoing [11.000164408890635]
既存のディープラーニングベースのビジュアルサーボアプローチは、画像間の相対カメラのポーズを後退させる。
我々は、深層ニューラルネットワークを用いて予測される視覚的特徴として光学的流れを考察する。
2cm以下と1度以下の正確な位置を維持しながら3m以上40度以上の収束性を示した。
論文 参考訳(メタデータ) (2020-03-08T11:42:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。