論文の概要: Déjà View: Looping Transformers for Multi-View 3D Reconstruction
- arxiv url: http://arxiv.org/abs/2605.30215v2
- Date: Fri, 29 May 2026 15:11:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 13:54:21.181772
- Title: Déjà View: Looping Transformers for Multi-View 3D Reconstruction
- Title(参考訳): Déjà View:マルチビュー3D再構成のためのループ変換器
- Abstract要約: 最近のフィードフォワード3次元再構成変換器は10億以上のパラメータに拡張されている。
モデルの深さは、部分的にイテレーションを購入し、ユニークなパラメータで非効率に支払い、代わりにアーキテクチャでそのイテレーションを明示することを示しています。
我々のモデルであるDéjViewは、1つのループ変換ブロックをK精細ステップのビュー毎の機能に繰り返し適用する。
- 参考スコア(独自算出の注目度): 109.98721386523641
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent feed-forward 3D reconstruction transformers have scaled to over a billion parameters, following the broader trend of increasing model capacity in computer vision. Yet emerging evidence suggests that contiguous transformer layers often behave like repeated applications of similar operations, and multi-view reconstruction transformers refine their predictions progressively across decoder depth. We posit that model depth partially buys iteration, paid for inefficiently in unique parameters, and instead make that iteration explicit in architecture. Our model, DéjàView, applies a single looped transformer block recurrently to per-view features for K refinement steps. Trained once, it exposes K as an inference-time compute knob, matching or outperforming substantially larger feed-forward baselines across five reconstruction benchmarks spanning indoor, outdoor, object-centric, and driving scenes, while using a fraction of their parameters and comparable or lower compute. Importantly, the same looped block formulation outperforms an otherwise identical variant with independent per-step parameters under matched training data and compute, suggesting that explicit iteration is not merely a compute-efficient substitute for capacity but a stronger inductive bias for multi-view 3D reconstruction.
- Abstract(参考訳): 最近のフィードフォワード3次元再構成変換器は、コンピュータビジョンにおけるモデル容量の増加傾向に続き、10億以上のパラメータに拡張されている。
しかし、新しい証拠は、連続したトランスフォーマー層が、しばしば同様の操作の繰り返し適用のように振る舞うことを示唆し、マルチビュー再構成トランスフォーマーはデコーダの深さを越えて徐々に予測を洗練させる。
モデルの深さは部分的にイテレーションを購入し、ユニークなパラメータで非効率に支払い、代わりにアーキテクチャでそのイテレーションを明確にします。
我々のモデルであるDéjàViewは、1つのループ変換ブロックをK精細ステップのビュー毎の機能に繰り返し適用する。
一度トレーニングすると、Kを推論時間計算ノブとして公開し、屋内、屋外、オブジェクト中心、運転シーンにまたがる5つの再構築ベンチマークにおいて、フィードフォワードベースラインをかなり大きくマッチングまたは上回る。
重要なことに、同じループブロックの定式化は、一致したトレーニングデータと計算データの下で、独立したステップ毎のパラメータを持つ他の同種の変種よりも優れており、明示的な反復は単にキャパシティの計算効率の代用ではなく、マルチビュー3D再構成のためのより強い帰納バイアスであることを示唆している。
関連論文リスト
- BA-T: An Iterative Transformer for Two-View Bundle Adjustment [53.16990349592508]
暗黙のトークン空間における繰り返し可能なレイヤとして,BAスタイルの構造化更新を実装した反復変換器であるBA-Tを提案する。
実験により、BA-Tは反復間におけるポーズと再構成の精度を徐々に改善することが示された。
BA-Tは、奥行き重心に対するコンパクトで効率的で構造的な代替手段を提供し、軽量アーキテクチャ内で正確な3D再構成を可能にする。
論文 参考訳(メタデータ) (2026-06-02T07:51:14Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Structured Multidimensional Representation Learning for Large Language Models [0.0]
トランスフォーマーアーキテクチャは、幅広いパターン認識と自然言語処理タスクで最先端のパフォーマンスを達成する。
三次元テンソルのL-積に基づく埋め込み空間の構造的スペクトル分解を導入する。
提案するL-Transformerは,少ない埋め込みで動作するp並列変換器とスペクトル的に等価であることを示す。
論文 参考訳(メタデータ) (2026-03-05T22:34:45Z) - Rethinking Vision Transformer Depth via Structural Reparameterization [16.12815682992294]
本稿では,訓練期間中に機能する分岐型構造パラメータ化手法を提案する。
提案手法では, 変圧器ブロック内の並列分岐を利用して, 合理化シングルパスモデルに体系的に統合する。
ViT-Tinyに適用した場合、このフレームワークは、ImageNet-1Kの分類精度を維持しながら、元の12層アーキテクチャを6層、4層、もしくは3層に改善する。
論文 参考訳(メタデータ) (2025-11-24T21:28:55Z) - Understanding Multi-View Transformers [18.573401296925844]
DUSt3Rのようなマルチビュートランスフォーマーは、フィードフォワード方式で3Dタスクを解くことで3Dビジョンに革命をもたらしている。
本稿では,多層変換器の残差接続から3次元表現を探索・可視化する手法を提案する。
論文 参考訳(メタデータ) (2025-10-28T19:19:35Z) - STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer [72.88105562624838]
本稿では,ポイントマップ予測をデコーダのみの変換器問題として再構成する新しい3次元再構成手法STream3Rを提案する。
大規模な3Dデータセットから幾何学的先行性を学ぶことで、STream3Rは多様で困難なシナリオにうまく一般化する。
この結果から,オンライン3次元知覚のための因果変換モデルの可能性を浮き彫りにし,ストリーミング環境におけるリアルタイム3次元理解の道を開いた。
論文 参考訳(メタデータ) (2025-08-14T17:58:05Z) - PRformer: Pyramidal Recurrent Transformer for Multivariate Time Series Forecasting [82.03373838627606]
Transformerアーキテクチャにおける自己保持機構は、時系列予測において時間順序を符号化するために位置埋め込みを必要とする。
この位置埋め込みへの依存は、トランスフォーマーの時間的シーケンスを効果的に表現する能力を制限している、と我々は主張する。
本稿では,Prepreを標準的なTransformerエンコーダと統合し,様々な実世界のデータセット上での最先端性能を示す。
論文 参考訳(メタデータ) (2024-08-20T01:56:07Z) - iTransformer: Inverted Transformers Are Effective for Time Series Forecasting [62.40166958002558]
iTransformerを提案する。これは、逆次元に注意とフィードフォワードのネットワークを単純に適用する。
iTransformerモデルは、挑戦的な現実世界のデータセットの最先端を実現する。
論文 参考訳(メタデータ) (2023-10-10T13:44:09Z) - Multi-view 3D Reconstruction with Transformer [34.756336770583154]
シーケンス・トゥ・シークエンス予測問題として,マルチビュー3D再構成を再構成する。
本稿では,3次元ボリューム変換器(VolT)という新しいフレームワークを提案する。
パラメータの少ないマルチビュー再構成で、最新鋭の精度を実現。
論文 参考訳(メタデータ) (2021-03-24T03:14:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。