論文の概要: WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching
- arxiv url: http://arxiv.org/abs/2603.24836v1
- Date: Wed, 25 Mar 2026 22:07:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.000011
- Title: WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching
- Title(参考訳): WAFT-Stereo:ステレオマッチングのためのウォーピング・アローンフィールド変換
- Abstract要約: WAFT-Stereoはステレオマッチングのためのワーピング方式である。
ETH3D、KITTI、および公開ベンチマークで第1位である。
- 参考スコア(独自算出の注目度): 36.58978128337916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce WAFT-Stereo, a simple and effective warping-based method for stereo matching. WAFT-Stereo demonstrates that cost volumes, a common design used in many leading methods, are not necessary for strong performance and can be replaced by warping with improved efficiency. WAFT-Stereo ranks first on ETH3D, KITTI and Middlebury public benchmarks, reducing the zero-shot error by 81% on ETH3D benchmark, while being 1.8-6.7x faster than competitive methods. Code and model weights are available at https://github.com/princeton-vl/WAFT-Stereo.
- Abstract(参考訳): 本稿では,ステレオマッチングのための簡易かつ効果的なワーピング手法WAFT-Stereoを紹介する。
WAFT-Stereoは、多くの主要な手法で使用される一般的な設計であるコストボリュームは、高い性能には必要がなく、効率を向上したワープによって置き換えることができることを示した。
WAFT-StereoはETH3D、KITTI、ミドルベリーの公開ベンチマークで第1位となり、ゼロショットエラーをETH3Dベンチマークで81%削減した。
コードとモデルの重み付けはhttps://github.com/princeton-vl/WAFT-Stereoで確認できる。
関連論文リスト
- LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization [21.209111801863546]
高価な3D畳み込みを伴わずに強力なゼロショット一般化を実現する軽量ステレオマッチングフレームワークである textitLiteMatch を提案する。
LiteMatchは、グローバルなクロスビューインタラクションをキャプチャするクロスビュー対応(CVCE)と、FFTベースの周波数キューを通じて微細構造の詳細を強化するハイ周波数駆動(HFE)という2つの補完的なエンコーダを使用している。
3.36Mから9.58Mパラメータの柔軟な設計により、LiteMatchは例外的なゼロショットの一般化を実現し、Scene Flow、KITTI、Middlebury、ETH3Dと競合するEPEとD1のパフォーマンスを提供する。
論文 参考訳(メタデータ) (2026-06-30T13:20:08Z) - Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching [96.63979376005277]
Lite Any Stereo V2は、効率的なゼロショットステレオマッチング用に設計された超高速モデルシリーズである。
LAS2はアーキテクチャとトレーニングの両方の観点から開発されている。
LAS2-Hは、反復的なFast-FoundationStereoよりも、全体的なゼロショットのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-06-23T11:45:09Z) - Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency [61.68376148916503]
FDB-v3 (Full-Duplex-Bench-v3) は、自然言語条件下での音声モデルの評価と多段階ツールの使用のためのベンチマークである。
以前の作業とは異なり、データセットは5つのディスフルカテゴリにアノテートされた実際の人間のオーディオで構成されており、4つのタスクドメインにチェーンされたAPI呼び出しを必要とするシナリオとペアリングされています。
GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7、従来のカスケードパイプライン(Whisper$rightarrow$rightarrow$TTS)の6つのモデル構成を精度、レイテンシ、ターンで評価した。
論文 参考訳(メタデータ) (2026-04-06T16:46:52Z) - WAFT: Warping-Alone Field Transforms for Optical Flow [36.58978128337916]
我々は,光流の簡易かつ効率的な方法であるウォーピング・アロン場変換(WAFT)を紹介する。
WAFTはRAFTと似ているが、コストを高解像度のワープに置き換え、メモリコストの低減を図っている。
論文 参考訳(メタデータ) (2025-06-26T17:47:59Z) - LightStereo: Channel Boost Is All You Need for Efficient 2D Cost Aggregation [27.00836175513738]
LightStereoは、マッチングプロセスを加速するために作られた最先端のステレオマッチングネットワークである。
私たちのブレークスルーは、3Dコストボリュームのチャネル次元に特化してパフォーマンスを向上させることです。
LightStereoは、SceneFlowデータセットで競合するEPEメトリックを達成し、最低でも22GFLOPと17msのランタイムを必要とする。
論文 参考訳(メタデータ) (2024-06-28T11:11:24Z) - RomniStereo: Recurrent Omnidirectional Stereo Matching [6.153793254880079]
本稿では,全方向ステレオマッチング (RomniStereo) アルゴリズムを提案する。
我々の最良のモデルは、以前のSOTAベースラインよりも平均MAE値が40.7%向上する。
結果の可視化では, 合成例と実例の両方において, 明らかな優位性を示す。
論文 参考訳(メタデータ) (2024-01-09T04:06:01Z) - Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation [73.31524865643709]
本稿では,Hourglass Tokenizer (HoT) と呼ばれるプラグアンドプレイのプルーニング・アンド・リカバリフレームワークを提案する。
私たちのHoDTは、冗長なフレームのポーズトークンのプルーニングから始まり、フル長のトークンを復元することで終了します。
提案手法は,従来のVPTモデルと比較して高い効率性と推定精度を両立させることができる。
論文 参考訳(メタデータ) (2023-11-20T18:59:51Z) - Uncertainty Guided Adaptive Warping for Robust and Efficient Stereo
Matching [77.133400999703]
相関に基づくステレオマッチングは優れた性能を達成した。
固定モデルによる現在のメソッドは、さまざまなデータセットで均一に動作しない。
本稿では,ロバストなステレオマッチングのための相関を動的に計算する新しい視点を提案する。
論文 参考訳(メタデータ) (2023-07-26T09:47:37Z) - RAFT-Stereo: Multilevel Recurrent Field Transforms for Stereo Matching [60.44903340167672]
RAFT-Stereoは,光学フローネットワークRAFTをベースとした修正ステレオのための新しい深層アーキテクチャである。
画像間でより効率的に情報を伝達する多レベル畳み込みGRUを導入する。
RAFT-Stereoの修正版は正確なリアルタイム推論を行うことができる。
論文 参考訳(メタデータ) (2021-09-15T19:27:31Z) - VATT: Transformers for Multimodal Self-Supervised Learning from Raw
Video, Audio and Text [60.97904439526213]
video-audio-text transformer (vatt) は生の信号を入力として取り、様々な下流タスクに役立つほどリッチなマルチモーダル表現を抽出する。
マルチモーダルなコントラスト損失を用いて,vattのエンドツーエンドをスクラッチからトレーニングし,映像動作認識,音声イベント分類,画像分類,テキストからビデオへの検索といった下流タスクによってその性能を評価する。
論文 参考訳(メタデータ) (2021-04-22T17:07:41Z) - Towards Fast, Accurate and Stable 3D Dense Face Alignment [73.01620081047336]
本稿では,速度,精度,安定性のバランスをとる3DDFA-V2という新しい回帰フレームワークを提案する。
本研究では,静止画を平面内と面外の動きを取り入れた映像に変換する仮想合成法を提案する。
論文 参考訳(メタデータ) (2020-09-21T15:37:37Z) - AdaStereo: A Simple and Efficient Approach for Adaptive Stereo Matching [50.06646151004375]
AdaStereoと呼ばれる新しいドメイン適応パイプラインは、ディープステレオマッチングネットワークにマルチレベル表現をアライメントすることを目的としている。
我々のAdaStereoモデルは、KITTI、Middlebury、ETH3D、DrivingStereoなど、複数のステレオベンチマークで最先端のクロスドメインパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2020-04-09T16:15:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。