論文の概要: A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention
- arxiv url: http://arxiv.org/abs/2606.25962v1
- Date: Wed, 24 Jun 2026 15:34:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.385916
- Title: A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention
- Title(参考訳): 身体的, 極性的に拘束された交差注意を伴う異種ステレオ検査のベンチマーク
- Abstract要約: ヘテロジニアス・ステレオ・デブロアリングのための専用フレームワークを提案する。
身体的および極性に制約された横断的注意(PECA)を提案する。
PECAは、視線由来の異方性上界で区切られたエピポーラ探索ウィンドウに、クロスビューマッチングを制限している。
- 参考スコア(独自算出の注目度): 3.373984146148716
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern stereo-capable smartphones enable immersive XR content capture. However, hardware heterogeneity across camera modules often causes severe asymmetric blur artifacts. Existing methods and benchmarks largely assume homogeneous stereo setups and therefore do not explicitly address such asymmetric degradation. To bridge this gap, we present a dedicated framework for heterogeneous stereo deblurring. First, we introduce the heterogeneous stereo deblurring (HSD) dataset, constructed from real smartphone stereo captures via multi-frame integration. Second, we propose physically- and epipolar-constrained cross attention (PECA), a lightweight module that restricts cross-view matching to an epipolar search window bounded by a optics-derived disparity upper bound. By enforcing physically valid disparity constraints, PECA enables efficient and reliable cross-view feature fusion. Moreover, our confidence-weighted attention with residual fusion emphasizes cross-guided deblurring when correspondences are reliable, while naturally falling back to self-deblurring in occluded or unreliable regions. PECA is architecture-agnostic and consistently improves CNN-, Transformer-, and NAFNet-based baselines. Extensive experiments on HSD show that PECA-enhanced models achieve improved restoration performance with favorable efficiency.
- Abstract(参考訳): 最新のステレオ対応スマートフォンは没入型XRコンテンツキャプチャを可能にする。
しかし、カメラモジュール間のハードウェアの不均一性は、しばしば深刻な非対称な曖昧なアーティファクトを引き起こす。
既存の方法やベンチマークは、主に均質なステレオセットアップを前提としており、したがってそのような非対称な分解に明示的に対処しない。
このギャップを埋めるために、異種立体劣化のための専用フレームワークを提案する。
まず,マルチフレーム統合による実スマートフォンステレオキャプチャから構築したヘテロジニアスステレオデブロアリング(HSD)データセットを紹介する。
第2に,光導波路上界に有界なエピポーラ探索窓に対するクロスビューマッチングを制限する軽量モジュールPECAを提案する。
物理的に有効な不均一性制約を強制することにより、PECAは効率的で信頼性の高いクロスビュー特徴融合を可能にする。
さらに, 残存核融合による信頼度重み付けは, 通信が信頼できる場合のクロスガイド型脱臭を強調する一方で, 閉鎖領域や信頼できない地域では自然に自己退色に回帰する。
PECAはアーキテクチャに依存しないため、CNN-、Transformer-、NAFNetベースのベースラインを一貫して改善している。
HSDの広範囲な実験により,PECA強化モデルにより改善された修復性能を良好な効率で達成できることが示されている。
関連論文リスト
- Isotropic Embedding Perturbations for Robust Vision Language Encoders [73.92626712781859]
Aetherは、拡散型ランダム摂動を制御されたアルファミキシングを介して埋め込み空間に応用する単純なプラグイン法である。
言語モデルにおける特徴空間摂動と生成前訓練における画像劣化に触発され、エーターは軽度だが効果的な摂動を誘導する。
Aetherは、CutMix、Mixup、DropPath、RandAugを組み合わせた高度なレシピに対して、一貫した利益を提供している。
論文 参考訳(メタデータ) (2026-09-09T15:08:05Z) - PhasorNet: Learning Structure from Frequency for Real-Time Stereo Matching [21.209111801863546]
PhasorNetは、周波数領域キューによる幾何学的識別を促進する強力なフレームワークである。
PhasorNetは5.3Mのパラメータしか持たず、挑戦的なETH3Dベンチマークで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-08-30T14:41:36Z) - BenthicDINO: Physics-Informed Self-Distillation for View-Invariant Side-Scan Sonar Representations [0.0]
本稿では,データ効率を最大化するために,ConvNeXt-v2-Tinyバックボーンを用いてDINOv3アーキテクチャ上に構築した物理インフォームド自己蒸留フレームワークを提案する。
本研究では,4つのネットワークステージにまたがる,密集した階層的特徴融合戦略を提案する。
論文 参考訳(メタデータ) (2026-08-24T13:11:22Z) - Cross-Spectral Stereo Inertial Odometry [6.602180427145135]
本稿では,高次状態推定から高遅延深度マッチングを時間的に分離する非同期リアルタイム・クロススペクトル・サーマル・慣性(VTI)システムを提案する。
我々のシステムはスペクトルの冗長性を克服し、目視劣化した環境における堅牢性を確保しつつ、名目日光での精度を向上する。
論文 参考訳(メタデータ) (2026-06-29T04:00:59Z) - H-OmniStereo: Zero-Shot Omnidirectional Stereo Matching with Heading-Aligned Normal Priors [39.6437115448559]
H-OmniStereoはゼロショット全方位ステレオマッチングフレームワークである。
我々は280万以上のトップボトム等方形ステレオペアからなる高品質な合成データセットを構築した。
提案手法はドメイン外データセットの既存手法よりも精度が高い。
論文 参考訳(メタデータ) (2026-05-14T15:30:22Z) - Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder [34.73963627819185]
高分解能光合成開口レーダ(SAR)プレトレーニングは、単一ソース表現を相互に強化するために、モダリティの相乗効果を求める。
我々は、アライメントの少ないテキスト・ベッター・シナジーの先駆者であるCoDe-MAEを提案する。
CoDe-MAEは、表現の劣化を防ぎ、多様な単一および双方向の下流タスクにまたがる新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-04-18T10:23:00Z) - Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo [54.58078274676216]
イベントカメラは、そのような制限を伴わない高ダイナミックレンジの代替視覚表現を提供する。
本稿では, Bi-CMPStereoについて紹介する。
提案手法は,対象の標準空間内のステレオ表現を微調整し,各モダリティをイベント領域とフレーム領域の両方に投影することにより相補表現を統合する。
論文 参考訳(メタデータ) (2026-04-16T17:59:58Z) - Stereo World Model: Camera-Guided Stereo Video Generation [52.3922115596956]
本稿では、ステレオビデオ生成のための外観と両眼形状を共同で学習するカメラコンディショニングステレオワールドモデルであるStereoWorldを紹介する。
単分子RGBやRGBDのアプローチとは異なり、StereoWorldはRGBモードでのみ動作する。
論文 参考訳(メタデータ) (2026-03-18T05:42:22Z) - Rotation Equivariant Arbitrary-scale Image Super-Resolution [62.41329042683779]
任意のスケールの超解像(ASISR)は、低解像度の入力画像から任意のスケールの高分解能回復を実現することを目的としている。
本研究では, 回転同変ASISR法の構築に尽力する。
論文 参考訳(メタデータ) (2025-08-07T08:51:03Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Stereo Anywhere: Robust Zero-Shot Deep Stereo Matching Even Where Either Stereo or Mono Fail [37.90622613373521]
我々はStereo Anywhereを紹介した。これは、幾何学的制約と単眼深度視覚基礎モデル(VFM)の頑健な先行性を組み合わせた新しいステレオマッチングフレームワークである。
合成専用学習モデルでは, ゼロショットの一般化が実現し, 既存の解よりも優れていた。
論文 参考訳(メタデータ) (2024-12-05T18:59:58Z) - AdaStereo: An Efficient Domain-Adaptive Stereo Matching Approach [50.855679274530615]
本稿では,AdaStereoというドメイン適応型アプローチを提案する。
我々のモデルは、KITTI、Middlebury、ETH3D、DrivingStereoなど、複数のベンチマークで最先端のクロスドメイン性能を実現している。
提案手法は,様々なドメイン適応設定に対して堅牢であり,迅速な適応アプリケーションシナリオや実環境展開に容易に組み込むことができる。
論文 参考訳(メタデータ) (2021-12-09T15:10:47Z) - SMD-Nets: Stereo Mixture Density Networks [68.56947049719936]
SMD-Nets(Stereo Mixture Density Networks)は、幅広い2Dおよび3Dアーキテクチャに対応したシンプルで効果的な学習フレームワークです。
具体的には,バイモーダル混合密度を出力表現として活用し,不連続近傍の鋭く正確な不一致推定を可能にすることを示す。
我々は8Mpx解像度のステレオペアと現実世界のステレオデータセットからなる、新しい高解像度でリアルな合成ステレオデータセットに関する包括的な実験を行う。
論文 参考訳(メタデータ) (2021-04-08T16:15:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。