論文の概要: Self-Supervised Stereo Matching with Multi-Baseline Contrastive Learning
- arxiv url: http://arxiv.org/abs/2508.10838v1
- Date: Thu, 14 Aug 2025 17:03:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-08-15 22:24:48.422743
- Title: Self-Supervised Stereo Matching with Multi-Baseline Contrastive Learning
- Title(参考訳): マルチベースラインコントラスト学習による自己教師付きステレオマッチング
- Authors: Peng Xu, Zhiyu Xiang, Jingyun Fu, Tianyu Pu, Kai Wang, Chaojie Ji, Tingming Bai, Eryun Liu,
- Abstract要約: BaCon-Stereoは、非閉塞領域と非閉塞領域の両方において、自己教師型ステレオネットワークトレーニングのための対照的な学習フレームワークである。
我々は,教師と生徒に供給されるステレオペアが同じ参照ビューを共有するが,対象ビューが異なる,マルチベースライン入力を持つ教師学生パラダイムを採用する。
実験により,BaCon-Stereoは閉塞領域と非閉塞領域の予測を改善し,強い一般化とロバスト性を実現し,KITTI 2015と2012のベンチマークにおいて,最先端の自己管理手法より優れていることが示された。
- 参考スコア(独自算出の注目度): 12.013250652191477
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current self-supervised stereo matching relies on the photometric consistency assumption, which breaks down in occluded regions due to ill-posed correspondences. To address this issue, we propose BaCon-Stereo, a simple yet effective contrastive learning framework for self-supervised stereo network training in both non-occluded and occluded regions. We adopt a teacher-student paradigm with multi-baseline inputs, in which the stereo pairs fed into the teacher and student share the same reference view but differ in target views. Geometrically, regions occluded in the student's target view are often visible in the teacher's, making it easier for the teacher to predict in these regions. The teacher's prediction is rescaled to match the student's baseline and then used to supervise the student. We also introduce an occlusion-aware attention map to better guide the student in learning occlusion completion. To support training, we synthesize a multi-baseline dataset BaCon-20k. Extensive experiments demonstrate that BaCon-Stereo improves prediction in both occluded and non-occluded regions, achieves strong generalization and robustness, and outperforms state-of-the-art self-supervised methods on both KITTI 2015 and 2012 benchmarks. Our code and dataset will be released upon paper acceptance.
- Abstract(参考訳): 現在の自己教師型ステレオマッチングは、不適切な対応により閉鎖された領域で分解される光度整合性の仮定に依存している。
この問題に対処するために,非閉塞領域と非閉塞領域の両方で自己教師付きステレオネットワークトレーニングを行うための,シンプルで効果的なコントラスト学習フレームワークBaCon-Stereoを提案する。
我々は,教師と生徒に供給されるステレオペアが同じ参照ビューを共有するが,対象ビューが異なる,マルチベースライン入力を持つ教師学生パラダイムを採用する。
幾何学的には、生徒の視界に隠された領域は、しばしば教師の目に見え、教師がこれらの領域で容易に予測できる。
教師の予測は、生徒のベースラインに合わせるために再スケールされ、その後、生徒を監督するために使用される。
また,オクルージョン・アウェア・アテンション・マップを導入し,オクルージョン・コンプリート学習の指導に役立てる。
トレーニングを支援するために,マルチベースラインデータセットBaCon-20kを合成する。
大規模な実験により、BaCon-Stereoは隠蔽領域と非隠蔽領域の両方での予測を改善し、強力な一般化と堅牢性を達成し、KITTI 2015と2012のベンチマークで最先端の自己管理手法より優れていることが示された。
私たちのコードとデータセットは、論文の受理によってリリースされます。
関連論文リスト
- "The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework [16.96094045628127]
CoT(Chain-of-Thought)推論は、大きな言語モデル(LLM)に優れた能力を与えるが、通常は禁止的なパラメータスケールを必要とする。
CoT蒸留は、推論技術をコンパクトな学生モデル(SLM)に伝達するための有望なパラダイムとして登場した。
我々は,教師の勾配を動的に重み付けすることで,教師の指導を適応的に融合させるフレームワークCompactを紹介する。
論文 参考訳(メタデータ) (2026-01-20T14:05:19Z) - Reflective Teacher: Semi-Supervised Multimodal 3D Object Detection in Bird's-Eye-View via Uncertainty Measure [5.510678909146336]
そこで我々は,学生がラベル付きデータと擬似ラベル付きデータの両方で訓練される,反射型教員という新しい概念を紹介した。
また,マルチモーダルなBEV特徴の効率的なアライメントのためのGeometry Aware BEV Fusion (GA-BEV)を提案する。
論文 参考訳(メタデータ) (2024-12-05T16:54:39Z) - Towards Distribution-Agnostic Generalized Category Discovery [51.52673017664908]
データ不均衡とオープンエンドの分布は、現実の視覚世界の本質的な特性である。
我々は,BaCon(Self-Balanced Co-Advice contrastive framework)を提案する。
BaConは、対照的な学習ブランチと擬似ラベルブランチで構成され、DA-GCDタスクを解決するためのインタラクティブな監視を提供するために協力して動作する。
論文 参考訳(メタデータ) (2023-10-02T17:39:58Z) - Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification [26.82307246813389]
本稿では、下流評価から表現の洗練を分離する2段階のアンタングル化フレームワークを提案する。
まず、モデルの埋め込み空間の幾何学的構造を明示的に改善するために「コントラストチューニング」ステージを用いる。
次に、幾何学的観点からこれらの洗練された表現の質を評価するために、双対プローブ評価プロトコルを導入する。
論文 参考訳(メタデータ) (2023-09-21T08:59:13Z) - CoNe: Contrast Your Neighbours for Supervised Image Classification [62.12074282211957]
Contrast Your Neighbours (CoNe)は、教師付き画像分類のための学習フレームワークである。
CoNeは、より適応的で洗練されたターゲットを生成するために、類似した隣人の特徴をアンカーとして採用している。
私たちのCoNeは、最近のTimトレーニングレシピを上回るResNet-50で、ImageNetの80.8%のTop-1精度を実現しています。
論文 参考訳(メタデータ) (2023-08-21T14:49:37Z) - Distantly-Supervised Named Entity Recognition with Adaptive Teacher
Learning and Fine-grained Student Ensemble [56.705249154629264]
NERモデルの堅牢性を改善するために,自己学習型教員学生フレームワークを提案する。
本稿では,2つの教員ネットワークからなる適応型教員学習を提案する。
微粒な学生アンサンブルは、教師モデルの各フラグメントを、生徒の対応するフラグメントの時間移動平均で更新し、各モデルフラグメントのノイズに対する一貫した予測を強化する。
論文 参考訳(メタデータ) (2022-12-13T12:14:09Z) - Adversarial Dual-Student with Differentiable Spatial Warping for
Semi-Supervised Semantic Segmentation [70.2166826794421]
本研究では、教師なしデータ拡張を行うために、微分可能な幾何ワープを提案する。
また,平均教師数を改善するために,新しい対角的二重学習フレームワークを提案する。
我々のソリューションは、両方のデータセットで得られるパフォーマンスと最先端の結果を大幅に改善します。
論文 参考訳(メタデータ) (2022-03-05T17:36:17Z) - Graph Consistency based Mean-Teaching for Unsupervised Domain Adaptive
Person Re-Identification [54.58165777717885]
本論文では,教師ネットワークと学生ネットワークの間にGCC(Graph Consistency Constraint)を構築するためのGCMT(Graph Consistency Based Mean-Teaching)手法を提案する。
マーケット-1501、デュークMTMCreID、MSMT17の3つのデータセットの実験により、提案されたGCMTは最先端の手法よりも明確なマージンで優れていることが示された。
論文 参考訳(メタデータ) (2021-05-11T04:09:49Z) - Reversing the cycle: self-supervised deep stereo through enhanced
monocular distillation [51.714092199995044]
多くの分野において、自己教師付き学習ソリューションは急速に進化し、教師付きアプローチでギャップを埋めている。
本稿では,両者の相互関係を逆転する自己教師型パラダイムを提案する。
深層ステレオネットワークを訓練するために,単分子完備ネットワークを通じて知識を抽出する。
論文 参考訳(メタデータ) (2020-08-17T07:40:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。