論文の概要: Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison
- arxiv url: http://arxiv.org/abs/2609.01530v1
- Date: Tue, 01 Sep 2026 16:57:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.884545
- Title: Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison
- Title(参考訳): クロスビュー・コンプリートの再考:再構成誤差による自己監督事前訓練
- Authors: Thibaut Loiseau, Guillaume Bourmaud, Vincent Lepetit,
- Abstract要約: クロスビューコンプリートによる自己教師付き事前学習は、画像ペアの可視領域から3Dビジョンの強力な特徴を学習する。
我々は、この制限を有用な信号に変換するGekkoを紹介する。
Gekkoは、スクラッチからトレーニングされたネットワークで、クロスビュー補完、マスク付きオートエンコーディング、ピクセルごとの予測を共同で実行する。
- 参考スコア(独自算出の注目度): 25.854113650180736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-supervised pre-training via cross-view completion learns strong features for 3D vision from co-visible regions of image pairs. However, the reference view provides little information for reconstructing non-co-visible patches, implicitly yielding a monocular training signal in these regions. We introduce Gekko, which turns this limitation into a useful signal. The relative improvement of the cross-view reconstruction error over a masked-autoencoder error is a self-supervised proxy for co-visibility: large improvements indicate co-visible regions, negligible ones non-co-visible areas. Gekko is a network, trained from scratch, that jointly performs cross-view completion, masked autoencoding, and per-pixel prediction of this relative improvement, providing an additional binocular signal for all masked regions without any ground-truth 3D annotation. Under identical architectures and training data, Gekko consistently outperforms CroCo on zero-shot correspondence estimation, relative pose estimation, and pointmap regression, with up to 6 times higher accuracy at the strictest relative-pose threshold and a 22% drop in end-point error on ETH3D. The extra channel it learns is itself a strong co-visibility detector on unseen scenes, and Gekko's frozen features outperform released cross-view backbones of comparable or larger size. It can also be trained directly from raw videos with a simple stride-based curriculum, removing the cumbersome 3D preprocessing prior methods require while matching models trained on curated data. Code and pre-trained models are publicly available.
- Abstract(参考訳): クロスビュー・コンプリートによる自己教師付き事前学習は、画像ペアの可視領域から3Dビジョンの強力な特徴を学習する。
しかし、参照ビューは、非可視パッチを再構築するためにはほとんど情報を提供しておらず、これらの領域で暗黙的に単眼でトレーニング信号を生成する。
我々は、この制限を有用な信号に変換するGekkoを紹介する。
マスク付きオートコーダエラーに対するクロスビュー再構成誤差の相対的な改善は、コビジュアライゼーションのための自己監督的プロキシである。
Gekkoは、スクラッチからトレーニングされたネットワークで、クロスビュー補完、マスク付きオートエンコーディング、およびこの相対的な改善のピクセルごとの予測を共同で行う。
同一のアーキテクチャとトレーニングデータの下では、Gekkoはゼロショット対応推定、相対的なポーズ推定、ポイントマップ回帰においてCroCoを一貫して上回り、最も厳密な相対的位置閾値において最大6倍の精度で、ETH3D上では22%のエンドポイントエラーを減少させる。
余分なチャネルは、それ自体が目に見えないシーンの強力なコ可視性検出器であり、Gekkoの凍結した特徴は、同等かそれ以上の大きさのクロスビューバックボーンよりも優れています。
また、単純なストライドベースのカリキュラムで生のビデオから直接トレーニングすることもできる。
コードと事前訓練されたモデルが公開されている。
関連論文リスト
- From Sparse and Imperfect 2D Anchors to Consistent 3D Gaussian Street Scenes: Support-Aware Appearance [13.51195065028002]
画像先行者は、3Dガウスのストリートシーンのターゲット条件を合成できるが、独立して編集されたビューはコヒーレントな3Dターゲットを定義しない。
このギャップに対処するため、外観焼成のために教師の相対的な外観残留蒸留を導入する。
教師アンカーとオリジナルレンダリングの間の残差により、周波数分解、信頼度推定、プリミティブレベルリフトのための構造化された空間を形成する。
論文 参考訳(メタデータ) (2026-06-24T16:26:53Z) - Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself [38.95274911975506]
Free Geometryは、フィードフォワードの3D再構成モデルが3D基底の真理なしにテスト時に自己進化することを可能にするフレームワークである。
当社のアプローチは、4つのベンチマークデータセットにまたがって、Depth Anything 3やVGGTといった最先端の基礎モデルを継続的に改善しています。
論文 参考訳(メタデータ) (2026-04-15T16:24:03Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - Alligat0R: Pre-Training Through Co-Visibility Segmentation for Relative Camera Pose Regression [23.65253469577653]
我々は、クロスビュー学習を協調視認性セグメンテーションタスクとして再構成する新しい事前学習手法であるAlligat0Rを紹介する。
提案手法は,画像中の各ピクセルが第2画像において同一視可能であるか,無視されているか,視野外か(FOV)を予測する。
これをサポートするために,250万のイメージペアと高密度なコビジュアビリティアノテーションを備えた大規模データセットであるCube3を提案する。
論文 参考訳(メタデータ) (2025-03-10T17:29:48Z) - No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images [100.80376573969045]
NoPoSplatは、多視点画像から3Dガウスアンによってパラメータ化された3Dシーンを再構成できるフィードフォワードモデルである。
提案手法は,推定時にリアルタイムな3次元ガウス再構成を実現する。
この研究は、ポーズフリーの一般化可能な3次元再構成において大きな進歩をもたらし、実世界のシナリオに適用可能であることを示す。
論文 参考訳(メタデータ) (2024-10-31T17:58:22Z) - Unsupervised 3D Point Cloud Completion via Multi-view Adversarial Learning [61.14132533712537]
MAL-UPCは、領域レベルとカテゴリ固有の幾何学的類似性の両方を効果的に活用するフレームワークである。
我々のMAL-UPCは3Dの完全な監視を一切必要とせず、トレーニングセットにおける一視点部分的な観察のみを必要とする。
論文 参考訳(メタデータ) (2024-07-13T06:53:39Z) - GLACE: Global Local Accelerated Coordinate Encoding [66.87005863868181]
シーン座標回帰法は小規模なシーンでは有効であるが、大規模シーンでは重大な課題に直面している。
本研究では,事前学習したグローバルおよびローカルのエンコーディングを統合したGLACEを提案する。
提案手法は,低マップサイズモデルを用いて,大規模シーンにおける最先端結果を実現する。
論文 参考訳(メタデータ) (2024-06-06T17:59:50Z) - A Unified BEV Model for Joint Learning of 3D Local Features and Overlap
Estimation [12.499361832561634]
本稿では,3次元局所特徴の同時学習と重なり推定のための統合鳥眼ビュー(BEV)モデルを提案する。
提案手法は,特に重複の少ないシーンにおいて,重複予測における既存手法よりも優れていた。
論文 参考訳(メタデータ) (2023-02-28T12:01:16Z) - Self-Supervised Point Cloud Representation Learning with Occlusion
Auto-Encoder [63.77257588569852]
本稿では,3D Occlusion Auto-Encoder(3D-OAE)を提案する。
私たちのキーとなるアイデアは、入力ポイントクラウドのローカルパッチをランダムに排除し、隠されたパッチを復元することで監督を確立することです。
従来の手法とは対照的に、我々の3D-OAEは大量のパッチを除去し、少数の可視パッチでしか予測できない。
論文 参考訳(メタデータ) (2022-03-26T14:06:29Z) - SeCo: Exploring Sequence Supervision for Unsupervised Representation
Learning [114.58986229852489]
本稿では,空間的,シーケンシャル,時間的観点から,シーケンスの基本的および汎用的な監視について検討する。
私たちはContrastive Learning(SeCo)という特定の形式を導き出します。
SeCoは、アクション認識、未トリムアクティビティ認識、オブジェクト追跡に関する線形プロトコルにおいて、優れた結果を示す。
論文 参考訳(メタデータ) (2020-08-03T15:51:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。