論文の概要: BINO: Encoder Centric Self Supervised Stereo With Native Pair Input
- arxiv url: http://arxiv.org/abs/2603.27904v1
- Date: Sun, 29 Mar 2026 23:26:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.168849
- Title: BINO: Encoder Centric Self Supervised Stereo With Native Pair Input
- Title(参考訳): BINO:エンコーダの自己監視ステアロにネイティブペア入力
- Authors: Haokun Zhou,
- Abstract要約: ビノは、コンパクトエンコーダの中で強い双眼鏡構造を学べるかを問う。
入力段階で修正ペアを融合させ、ステレオマイクロセルトークンを形成し、行認識パッチ位相位置符号化を使用する。
結果は、しばしば別々のリンクモジュールに割り当てられるクロスビュー推論の多くは、コンパクトで再利用可能なエンコーダ内で学習可能であることを示唆している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stereo needs features that preserve fine cross view correspondence rather than only semantic similarity. Recent self supervised vision models transfer well, but they are not built for this goal, and geometry focused methods often rely on a binocular decoder or another explicit linkage module during pretraining. BINO asks whether strong binocular structure can instead be learned inside a compact encoder. It does this by fusing the rectified pair at the input stage, forming stereo micro cell tokens, and using a row aware patch phase positional encoding. Training uses one view masked token only distillation together with occlusion and view specific appearance mismatch. In a strict low resource setting with pretraining only on KITTI object, BINO gives the best frozen descriptor results under a no linkage probe among all compared baselines on proxy dense stereo, hard negative retrieval, and KITTI Stereo~2012 disparity. With the same lightweight stereo head for every encoder, it stays near CroCo~v2 while using a much smaller encoder. Supplementary transfer experiments on KITTI Stereo~2015 show the same qualitative trend. These results suggest that much of the cross view reasoning often assigned to a separate linkage module can be learned inside a compact and reusable encoder.
- Abstract(参考訳): Stereoは、セマンティックな類似性だけでなく、微妙なクロスビュー対応を維持する機能を必要としている。
近年の自己監督型視覚モデルはよく伝達されているが、この目的のために構築されていないため、幾何学に焦点を当てた手法は、事前訓練中に双眼鏡デコーダまたは他の明示的なリンクモジュールに依存することが多い。
ビノは、代わりに強力な双眼鏡構造をコンパクトエンコーダ内で学べるかを問う。
入力段階で修正ペアを融合させ、ステレオマイクロセルトークンを形成し、行認識パッチ位相位置符号化を使用する。
トレーニングでは、1つのビューマスク付きトークンのみを排他的に蒸留し、特定の外観ミスマッチを見る。
KITTIオブジェクトのみを事前訓練した厳密な低リソース設定では、BINOはプロキシ高密度ステレオ、ハード負の検索、2012 年の KITTI Stereo の相違について比較したすべてのベースラインの中で、リンク無しで最高の凍結ディスクリプタ結果を与える。
エンコーダごとに同じ軽量ステレオヘッドを使用すると、より小さなエンコーダを使用しながら、CroCo~v2付近に留まる。
KITTI Stereo〜2015の補助移動実験は、同じ定性的傾向を示した。
これらの結果は、しばしば別々のリンクモジュールに割り当てられるクロスビュー推論の多くは、コンパクトで再利用可能なエンコーダ内で学習可能であることを示唆している。
関連論文リスト
- A Mixed Diet Makes DINO An Omnivorous Vision Encoder [47.339404281319474]
DINOv2のような事前訓練された視覚エンコーダは、単調なタスクで例外的な性能を示した。
我々は,モダリティに依存しない特徴空間を学習する新しいフレームワークであるOmnivorous Visionを提案する。
このアプローチは、元の基盤モデルの非ネイティブなセマンティクスを維持しながら、堅牢なクロスモーダル理解を可能にする。
論文 参考訳(メタデータ) (2026-02-27T17:03:45Z) - Stereo Anything: Unifying Zero-shot Stereo Matching with Large-Scale Mixed Data [77.27700893908012]
ステレオマッチングは3次元視覚の基盤として機能し、深度回復のためのステレオ画像対間の画素ワイド対応を確立することを目的としている。
現在のモデルは、目に見えないドメインにデプロイすると、しばしば深刻なパフォーマンス劣化を示す。
データ中心のフレームワークであるStereoAnythingを導入し、既存のステレオモデルのゼロショット一般化能力を大幅に強化する。
論文 参考訳(メタデータ) (2024-11-21T11:59:04Z) - The Conformer Encoder May Reverse the Time Dimension [53.9351497436903]
我々は,デコーダのクロスアテンション機構の初期動作を分析し,コンバータエンコーダの自己アテンションを促進する。
本稿では,このフリップを回避する方法とアイデアを提案し,ラベル・フレーム配置アライメントを得るための新しい手法について検討する。
論文 参考訳(メタデータ) (2024-10-01T13:39:05Z) - Rethinking Patch Dependence for Masked Autoencoders [89.02576415930963]
マスク付きオートエンコーダ(MAE)のデコーダにおけるパッチ間の依存関係が表現学習に与える影響について検討する。
クロスアテンションマスク付きオートエンコーダ(CrossMAE)の簡易な視覚前訓練フレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-25T18:49:57Z) - Masked Autoencoders that Listen [79.99280830830854]
本稿では,画像ベースMasked Autoencoders(MAE)の音声スペクトログラムからの自己教師型表現学習への簡単な拡張について検討する。
MAEにおけるTransformer encoder-decoderの設計に続いて、Audio-MAEはまず、ハイマスキング比でオーディオスペクトログラムパッチを符号化し、エンコーダ層を介して非マスキングトークンのみを供給します。
次にデコーダは、入力スペクトログラムを再構築するために、マスクトークンでパッドされたエンコードされたコンテキストを再注文し、デコードする。
論文 参考訳(メタデータ) (2022-07-13T17:59:55Z) - LoopITR: Combining Dual and Cross Encoder Architectures for Image-Text
Retrieval [117.15862403330121]
共同学習のためのネットワークにおいて,デュアルエンコーダとクロスエンコーダを組み合わせたLoopITRを提案する。
具体的には、二重エンコーダをクロスエンコーダに強陰性を与え、より識別性の高いクロスエンコーダを用いてその予測を二重エンコーダに戻す。
論文 参考訳(メタデータ) (2022-03-10T16:41:12Z) - ChiTransformer:Towards Reliable Stereo from Cues [10.756828396434033]
現在のステレオマッチング技術は、制限された探索空間、隠蔽領域、およびせん断サイズによって挑戦される。
本稿では,光学機構にインスパイアされた自己監督型両眼深度推定法を提案する。
ChiTransformerアーキテクチャは、最先端の自己教師型ステレオアプローチよりも11%大幅に改善されている。
論文 参考訳(メタデータ) (2022-03-09T07:19:58Z) - Reversing the cycle: self-supervised deep stereo through enhanced
monocular distillation [51.714092199995044]
多くの分野において、自己教師付き学習ソリューションは急速に進化し、教師付きアプローチでギャップを埋めている。
本稿では,両者の相互関係を逆転する自己教師型パラダイムを提案する。
深層ステレオネットワークを訓練するために,単分子完備ネットワークを通じて知識を抽出する。
論文 参考訳(メタデータ) (2020-08-17T07:40:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。