論文の概要: Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo
- arxiv url: http://arxiv.org/abs/2607.11097v1
- Date: Mon, 13 Jul 2026 05:09:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.33603
- Title: Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo
- Title(参考訳): ワイドベースライン全方位ステレオにおけるマッチング応答とスプープ特徴量の再検討
- Abstract要約: 3Dエンコーダデコーダブロックによって生成されたマッチング応答を解釈し、それらの期待値が本質的な信頼信号を提供することを示す。
そこで本手法は,補助ヘッドやマルチパス推論,追加モジュールを使わずに,不明瞭な応答を直接ペナライズする。
提案手法は,自律型モビリティアプリケーションにおけるデプロイの実用性を維持しつつ,信頼度推定と表面正規予測を両立させる。
- 参考スコア(独自算出の注目度): 6.048550735813691
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In this paper, we propose a training strategy for confidence estimation in omnidirectional stereo, targeting the ambiguous matches that frequently occur in wide-baseline setups. Reinterpreting the matching responses produced by the 3D encoder decoder block, we show that their expectation values provide intrinsic confidence signals. Building on this, our method directly penalizes ambiguous responses without auxiliary heads, multi-pass inference, or additional modules, resulting in more efficient and generalized predictions. Beyond confidence, we introduce swept feature volume resampling, where response features produced by 3D CNNs are resampled using regressed positive matching indices and then processed by 2D CNNs to predict meta-information such as surface normals. This joint learning introduces auxiliary geometric regularization and improves depth coherence by leveraging additional contextual cues during response aggregation stage. Experimental results demonstrate that our approach enhances both confidence estimation and surface normal prediction while maintaining deployment practicality for autonomous mobility applications.
- Abstract(参考訳): 本稿では,全方位ステレオにおける信頼度推定のためのトレーニング戦略を提案する。
3Dエンコーダデコーダブロックによって生成されたマッチング応答を解釈し、それらの期待値が本質的な信頼信号を提供することを示す。
提案手法は,補助ヘッドやマルチパス推論,追加モジュールを使わずに,不明瞭な応答を直接ペナルティ化し,より効率的で一般化された予測を行う。
そこでは3次元CNNが生成する応答特徴を、回帰正のマッチング指標を用いて再サンプリングし、2次元CNNで処理し、表面正規化などのメタ情報を予測する。
この共同学習は、補助的な幾何学的正則化を導入し、応答集約段階における追加の文脈的手がかりを活用することにより、深さコヒーレンスを改善する。
実験結果から,本手法は自律移動型アプリケーションにおけるデプロイの実用性を維持しつつ,信頼度推定と表面正規予測の両方を向上することが示された。
関連論文リスト
- Robustifying Vision-Language Models via Test-Time Prompt Adaptation [23.05168102474528]
サンプルレベルの推定から分布レベルのアライメントに移行するテストtImeプロンプト・タダプテーションフレームワークであるRITAを提案する。
特に、RITAは、拡張視覚特徴の分布をテキストプロトタイプと整合させ、敵対的外乱を緩和し、モーダルな意味的不一致を是正するために最適なトランスポートを使用する。
論文 参考訳(メタデータ) (2026-07-10T14:19:42Z) - PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning [80.94559742826083]
Reinforcement Learning with Verifiable Rewards (RLVR) は伝統的に、粗末で結果に基づく信号に依存している。
近年の研究では,高コストな外部モデルを必要としないステップレベルのガイダンスを提供することで,詳細なモデル固有の信号を提供することで,言語推論のトレーニングを効果的に向上することが示された。
一助文には有効であるが,この大域的な報酬を視覚言語推論(V-L)に適用することは準最適戦略である。
本稿では、報酬構造とタスクの不均一な性質を整合させることにより、この問題を解決するフレームワークであるパーセプション分解信頼回復(PDCR:Perception-Decomposed Confidence Reward)を提案する。
論文 参考訳(メタデータ) (2026-05-13T12:55:18Z) - SUG-Occ: An Explicit Semantics and Uncertainty Guided Sparse Learning Framework for Real-Time 3D Occupancy Prediction [5.730573889498275]
SuG-Occは明示的なセマンティックスと不確実性ガイドによるスパース学習を可能とした3D職業予測フレームワークである。
まず、ビュー変換時の自由空間からの射影を抑えるために、意味的および不確実性事前を利用する。
次に、幾何整合性を高めるために明示的な符号なし距離符号化を用い、構造的に一貫したスパース3D表現を生成する。
論文 参考訳(メタデータ) (2026-01-16T16:07:38Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - Double-Shot 3D Shape Measurement with a Dual-Branch Network for Structured Light Projection Profilometry [14.749887303860717]
我々は、異なる構造光(SL)変調を処理するために、デュアルブランチ畳み込みニューラルネットワーク(CNN)-トランスフォーマーネットワーク(PDCNet)を提案する。
PDCNet内では、Transformerブランチを使用してフリンジイメージのグローバルな認識をキャプチャし、CNNブランチはスペックルイメージのローカル詳細を収集するように設計されている。
提案手法は, 自己生成データセット上で高精度な結果が得られる一方で, フランジオーダーの曖昧さを低減できる。
論文 参考訳(メタデータ) (2024-07-19T10:49:26Z) - IPoD: Implicit Field Learning with Point Diffusion for Generalizable 3D Object Reconstruction from Single RGB-D Images [50.4538089115248]
シングルビューRGB-D画像からの3Dオブジェクトの汎用化は依然として難しい課題である。
本稿では,暗黙の場学習と点拡散を調和させる新しい手法IPoDを提案する。
CO3D-v2データセットによる実験では、IPoDの優位性が確認され、Fスコアは7.8%、チャンファー距離は28.6%向上した。
論文 参考訳(メタデータ) (2024-03-30T07:17:37Z) - Cameras as Rays: Pose Estimation via Ray Diffusion [54.098613859015856]
カメラのポーズを推定することは3D再構成の基本的な課題であり、まばらにサンプリングされたビューを考えると依然として困難である。
本稿では,カメラを光束として扱うカメラポーズの分散表現を提案する。
提案手法は回帰法と拡散法の両方で,CO3Dのカメラポーズ推定における最先端性能を示す。
論文 参考訳(メタデータ) (2024-02-22T18:59:56Z) - Dynamic Iterative Refinement for Efficient 3D Hand Pose Estimation [87.54604263202941]
本稿では,従来の推定値の修正に部分的レイヤを反復的に活用する,小さなディープニューラルネットワークを提案する。
学習したゲーティング基準を用いて、ウェイトシェアリングループから抜け出すかどうかを判断し、モデルにサンプルごとの適応を可能にする。
提案手法は,広く使用されているベンチマークの精度と効率の両面から,最先端の2D/3Dハンドポーズ推定手法より一貫して優れている。
論文 参考訳(メタデータ) (2021-11-11T23:31:34Z) - PDC-Net+: Enhanced Probabilistic Dense Correspondence Network [161.76275845530964]
高度確率密度対応ネットワーク(PDC-Net+)は、精度の高い高密度対応を推定できる。
我々は、堅牢で一般化可能な不確実性予測に適したアーキテクチャと強化されたトレーニング戦略を開発する。
提案手法は,複数の挑戦的幾何マッチングと光学的フローデータセットに対して,最先端の結果を得る。
論文 参考訳(メタデータ) (2021-09-28T17:56:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。