論文の概要: WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing
- arxiv url: http://arxiv.org/abs/2607.25234v2
- Date: Wed, 29 Jul 2026 03:10:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.721441
- Title: WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing
- Title(参考訳): WHTMix:Walsh-Hadamardトケミキシングによる効率的なステレオ深さ推定
- Authors: Prathyush Sajith, Emadeldeen Hamdan, Ahmet Enis Cetin,
- Abstract要約: ステレオトランスの自己保持段階をデータ非依存のWalsh-Hadamardトークンミキサーに置き換えることができることを示す。
合成駆動データにおいて、ミキサーは、モデル計算を2.46倍に削減しつつ、終点誤差で注目基準線と一致させる。
複雑性解析により、その利点は、シーケンス長とチャネル幅の比によって支配されることを示す。
- 参考スコア(独自算出の注目度): 0.688204255655161
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Stereo depth estimation for driving, robotics and augmented reality must run at high resolution under tight latency budgets, yet in transformer-based matchers the global self-attention that aggregates scene context grows quadratically with the number of pixels and comes to dominate runtime. We show that the joint self-attention stage of a stereo transformer, whose role is to spread context across both views, can be replaced by a data-independent Walsh-Hadamard token mixer that mixes tokens globally in the transform domain at log-linear cost, while the data-dependent cross-attention that performs left-right correspondence is retained. On synthetic driving data the mixer matches the attention baseline in end-point error while reducing model compute by a factor of 2.46 and single-image inference latency by a factor of 2.65. A complexity analysis shows the benefit is governed by the ratio of sequence length to channel width, which explains why high-resolution stereo matching is a particularly favorable setting and why classification transformers are not; we confirm this token-to-channel scaling on non-stereo long-sequence benchmarks. Furthermore, we introduce a hybrid log-disparity loss function designed to up-weight small-disparity pixels corresponding to long-range objects. This approach reduces the error on distant objects without incurring any additional computational overhead.
- Abstract(参考訳): 運転、ロボティクス、拡張現実のステレオ深度推定は、タイトな遅延予算の下で高解像度で実行する必要があるが、トランスフォーマーベースのマーカでは、シーンコンテキストを集約するグローバルな自己アテンションは、ピクセル数と4倍に増加し、実行時に支配的になる。
両ビューにコンテキストを広げる役割を持つステレオトランスの連立自己保持段階は,データ非依存のウォルシュ・アダマールトークンミキサーに置き換えられることを示す。
合成駆動データにおいて、ミキサーは、モデル計算を2.46倍、単画像推論遅延を2.65倍に減らしながら、終点誤差の注意基準線と一致させる。
複雑性解析により, 高分解能ステレオマッチングが特に好ましい設定であること, 分類変換器がそうでない理由が説明できる。
さらに,長距離オブジェクトに対応する高重小分散画素を対象としたハイブリッド対数分散損失関数を提案する。
このアプローチは、余分な計算オーバーヘッドを発生させずに、遠方のオブジェクトのエラーを低減する。
関連論文リスト
- TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution [52.96050253456634]
TRaM-VSRは、コンテキスト対応のビデオプリエントとネットワークレベルを用いた適応トークンアロケーションのためのフレームワークである。
その結果、TRaM-VSRは、最先端の復元品質と頑健な時間的整合性を維持しつつ、推論を著しく加速することがわかった。
論文 参考訳(メタデータ) (2026-07-24T11:57:26Z) - DUET -- Dual User Embedding Transformers for Offsite Conversion Prediction [8.972672149050627]
計算レコメンデーションシステムにおいて,オフサイト変換率(OCVR)予測は重要なランキング問題である。
このタスクは、クリック信号が豊富で、短い時間的水平線を示すのに対して、変換信号は本質的に疎く、長い遅延があり、しばしば未配布である。
ユーザ行動データを2つのドメインコヒーレントなストリーム – クリックと変換 – に明示的に分割するフレームワークであるDUETを提案する。
論文 参考訳(メタデータ) (2026-06-08T23:13:58Z) - N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation [68.47358899451255]
N-vium (N-vium) は、標準ハードウェア上での計算を部分的に並列化する変圧器である。
N-Viumは複数の深さで予測ヘッドを付加し、次のトーケン分布をこれらの出口上の学習混合物として定義する。
論文 参考訳(メタデータ) (2026-05-13T08:46:17Z) - EqDeepRx: Learning a Scalable MIMO Receiver [6.732584013520367]
本稿では,実践的な深層学習支援マルチインプットマルチアウトプット(MIMO)受信機であるEqDeepRxについて述べる。
レシーバモデルのコアは、各空間ストリームまたは層で独立して動作する共有重み検出NNである。
5G/6G準拠のエンドツーエンドシミュレーションでは,複数チャネルシナリオ,パイロットパターン,セル間干渉条件が改善し,スペクトル効率が向上した。
論文 参考訳(メタデータ) (2026-02-12T11:22:30Z) - EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding [18.199202388702144]
ほとんどの周波数領域のニューラルコーデックは位相情報を無視するか、2つの独立した実数値チャネルとして符号化し、空間的忠実度を制限する。
これは、収束速度と訓練安定性を犠牲にして、敵対的差別者を導入する必要がある。
本研究では,解析量子化合成パイプライン全体にわたる大域的位相結合を保存する,終端から終端までの複雑なRVQ-VAEオーディオを紹介する。
論文 参考訳(メタデータ) (2026-01-24T16:34:07Z) - Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators [83.48423407316713]
本稿では,クエリとキーを別々に扱うために,追加の仲介者トークンを組み込んだ新しい拡散トランスフォーマーフレームワークを提案する。
本モデルでは, 正確な非曖昧な段階を呈し, 詳細に富んだ段階へと徐々に遷移する。
本手法は,最近のSiTと統合した場合に,最先端のFIDスコア2.01を達成する。
論文 参考訳(メタデータ) (2024-08-11T07:01:39Z) - TransXNet: Learning Both Global and Local Dynamics with a Dual Dynamic Token Mixer for Visual Recognition [63.93802691275012]
グローバル・ローカル・ダイナミクスを同時に学習するための軽量なデュアル・ダイナミック・トケン・ミキサー(D-Mixer)を提案する。
我々は、新しいハイブリッドCNN-TransformerビジョンバックボーンネットワークであるTransXNetを設計するために、基本的なビルディングブロックとしてD-Mixerを使用している。
ImageNet-1K分類では、TransXNet-TはSwin-Tを0.3%上回り、計算コストの半分以下である。
論文 参考訳(メタデータ) (2023-10-30T09:35:56Z) - Diffuser: Efficient Transformers with Multi-hop Attention Diffusion for
Long Sequences [16.066338004414092]
textitDiffuserはシーケンシャル・ツー・シーケンス・モデリングのための新しい効率的なトランスフォーマーである。
低い計算とメモリコストを維持しながら、すべてのトークンインタラクションを1つの注意層に組み込む。
スペクトルの観点からグラフ展開特性を解析することにより、全アテンションを近似する能力を示す。
論文 参考訳(メタデータ) (2022-10-21T08:13:34Z) - Adaptive Fourier Neural Operators: Efficient Token Mixers for
Transformers [55.90468016961356]
本稿では,Fourierドメインのミキシングを学習する効率的なトークンミキサーを提案する。
AFNOは、演算子学習の原則的基礎に基づいている。
65kのシーケンスサイズを処理でき、他の効率的な自己認識機構より優れている。
論文 参考訳(メタデータ) (2021-11-24T05:44:31Z) - AdaStereo: A Simple and Efficient Approach for Adaptive Stereo Matching [50.06646151004375]
AdaStereoと呼ばれる新しいドメイン適応パイプラインは、ディープステレオマッチングネットワークにマルチレベル表現をアライメントすることを目的としている。
我々のAdaStereoモデルは、KITTI、Middlebury、ETH3D、DrivingStereoなど、複数のステレオベンチマークで最先端のクロスドメインパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2020-04-09T16:15:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。