論文の概要: Diversity-aware View Partitioning for Scalable VGGT
- arxiv url: http://arxiv.org/abs/2607.01885v2
- Date: Sat, 04 Jul 2026 12:43:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.938854
- Title: Diversity-aware View Partitioning for Scalable VGGT
- Title(参考訳): スケーラブルなVGGTのための多様性を考慮したビュー分割
- Authors: Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son,
- Abstract要約: VGGTは、グローバルな注目を集めた複数のビューを共同で推論することで、強力なパフォーマンスを達成する。
本稿では,多様性を意識したバランスの取れたチャンクにビューを整理する,トレーニングフリーでプラグアンドプレイな推論フレームワークを提案する。
我々のフレームワークは既存のVGGTの変種を補完し、幾何学的忠実さを犠牲にすることなくスケーラブルな多視点再構成を可能にする。
- 参考スコア(独自算出の注目度): 48.654660686945526
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Geometry transformers such as VGGT achieve strong performance by jointly reasoning over multiple views with global attention. However, scaling them to large view collections remains challenging due to the quadratic cost of attention. Moreover, our empirical analysis reveals that the reconstruction quality in VGGT is sensitive to the distribution of viewpoints. Simply increasing the number of views without sufficient viewpoint diversity can even degrade performance, as redundant views introduce highly similar tokens that dilute informative geometric signals in the attention mechanism. Motivated by this observation, we propose a training-free and plug-and-play VGGT inference framework that organizes views into diversity-aware balanced chunks. The chunks are constructed through combinatorial graph partitioning over visual dissimilarity and spatial dispersion. This view organization allows the transformer to focus attention on geometrically informative views while reducing redundant attention interactions. To estimate spatial dispersion without full pose estimation, we approximate spatial relationships via a soft pose propagation strategy based on visual similarity from a small set of seed frames. Extensive experiments demonstrate improved performance in camera pose estimation, multi-view depth prediction, and 3D reconstruction while reducing memory usage and inference latency. Our framework also complements existing VGGT variants, enabling scalable multi-view reconstruction without sacrificing geometric fidelity.
- Abstract(参考訳): VGGTのような幾何変換器は、グローバルな注目を集めた複数のビューを共同で推論することで、強い性能を達成する。
しかし、注意の二次的なコストのため、大規模なビューコレクションにスケールすることは依然として困難である。
さらに,本研究では,VGGTの再構成品質が視点分布に敏感であることを実証分析により明らかにした。
十分な視点の多様性のないビューの数を増やすだけで、冗長なビューは、注意機構における情報的幾何学的信号を希薄化する非常に類似したトークンを導入するため、パフォーマンスが低下する可能性がある。
そこで本研究では,多様性を考慮したバランスの取れたチャンクに対するビューを整理する,トレーニングフリーでプラグアンドプレイなVGGT推論フレームワークを提案する。
チャンクは、視覚的相似性と空間的分散性にまたがる組合せグラフ分割によって構成される。
このビュー組織により、トランスフォーマーは、冗長な注意相互作用を低減しつつ、幾何学的に情報的なビューに注意を向けることができる。
完全なポーズ推定をせずに空間分散を推定するために,小さなシードフレームの視覚的類似性に基づいて,ソフトポーズ伝搬戦略を用いて空間関係を近似した。
大規模な実験では、メモリ使用率と推論遅延を低減しつつ、カメラポーズ推定、多視点深度予測、および3次元再構成の性能向上が示されている。
我々のフレームワークは既存のVGGTの変種を補完し、幾何学的忠実さを犠牲にすることなくスケーラブルな多視点再構成を可能にする。
関連論文リスト
- VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations [47.94531550391802]
多視点視覚推論は、スパースと離散的な視点から複雑な環境を理解する必要があるインテリジェントシステムにとって不可欠である。
現実のシナリオでは、ビュー間の推論は、明示的なガイダンスなしで部分的な観察を統合する必要がある。
我々は物理基底シミュレーションを利用して、ビュー毎の正確なメタデータを持つ多種多様な高忠実な3Dシーンを構築する。
論文 参考訳(メタデータ) (2026-03-17T13:36:30Z) - Reference-Free Omnidirectional Stereo Matching via Multi-View Consistency Maximization [22.711843818785454]
フリーオムニMVSはペアの相関関係を頑健でオールニの認識とグローバルなコンセンサスに集約することができる。
可視性を考慮したコンセンサスを実現するために,相関ベクトルを適応的に融合する軽量アテンション機構を提案する。
多様なベンチマークデータセットに対する実験は、グローバルに一貫性があり、可視性があり、スケールアウェアな深さ推定のための手法の優位性を実証している。
論文 参考訳(メタデータ) (2026-03-16T09:23:23Z) - Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer [40.778996326009185]
初期核融合機構による多視点空間統合を行う最初のビジュアルローカライゼーションフレームワークを提案する。
我々のフレームワークはVGGTのバックボーン上に構築されており、多視点3D形状を符号化している。
本研究では,グローバルアテンションの2次複雑さを回避し,計算コストを削減する新しいスパースマスクアテンション戦略を提案する。
論文 参考訳(メタデータ) (2025-12-26T06:12:17Z) - Zero-P-to-3: Zero-Shot Partial-View Images to 3D Object [55.93553895520324]
そこで本研究では,局所的な高密度観測と複数ソースの事前情報を統合した学習自由手法を提案する。
本手法では, DDIMサンプリングにおいて, これらの先行情報を効果的に整合させる融合方式を導入し, 多視点一貫した画像を生成し, 見えない視界を監督する。
論文 参考訳(メタデータ) (2025-05-29T03:51:37Z) - Deep Incomplete Multi-view Clustering with Distribution Dual-Consistency Recovery Guidance [69.58609684008964]
本稿では,distriBution dUal-Consistency Recovery Guidanceを用いた不完全なマルチビュークラスタリング手法であるBURGを提案する。
我々は,各サンプルを別カテゴリとして扱い,欠落したビューの分布空間を予測するために,クロスビュー配信を行う。
信頼性の高いカテゴリ情報の欠如を補うために,隣り合った整合性によって案内されるビュー内アライメントと,プロトタイプ的な整合性によって案内されるクロスビューアライメントを含む二重整合性ガイド付きリカバリ戦略を設計する。
論文 参考訳(メタデータ) (2025-03-14T02:27:45Z) - Multi-Spectral Image Stitching via Spatial Graph Reasoning [52.27796682972484]
空間グラフ推論に基づくマルチスペクトル画像縫合法を提案する。
同一のビュー位置から複数スケールの補完機能をノードに埋め込む。
空間的・チャネル的次元に沿った長距離コヒーレンスを導入することにより、画素関係の相補性とチャネル相互依存性は、整列したマルチビュー特徴の再構築に寄与する。
論文 参考訳(メタデータ) (2023-07-31T15:04:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。