論文の概要: Investigating Spatiotemporal Redundancy in Video Transformer for Collision Anticipation
- arxiv url: http://arxiv.org/abs/2610.04727v1
- Date: Sat, 03 Oct 2026 19:30:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:23:41.410474
- Title: Investigating Spatiotemporal Redundancy in Video Transformer for Collision Anticipation
- Title(参考訳): 衝突予測のためのビデオトランスにおける時空間冗長性の検討
- Abstract要約: 本研究では,確立されたビデオトランス内での計算が冗長であり,性能を劣化させることなく冗長性を除去できるかどうかを検討する。
Nexar Collision Prediction データセット上の VideoMAEv2-Base を用いて、まず、衝突関連情報がネットワークの深さにわたってどのように進化するかを検証し、2つの相補的な冗長性について検討する。
これを実行すると、時間トークンのマージは計算を356.99から178.50 GFLOPsに、レイテンシを12.69から7.21msに、スピードアップを1.76倍、平均精度を0.7478から0.7443に短縮する。
- 参考スコア(独自算出の注目度): 1.5229257192293202
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In worker-equipment proximity monitoring, video transformers are widely used for collision anticipation and have demonstrated strong performance. However, their accuracy comes with substantial computational demands, creating a tension with the need for low-latency inference on mobile robots and the pursuit of lower-carbon computation in construction. To address this, this study investigates where computation within an established video transformer is redundant and whether that redundancy can be removed without materially degrading predictive performance. Using VideoMAEv2-Base on the Nexar Collision Prediction dataset, we first examine how collision-relevant information evolves across network depth and then investigate two complementary forms of redundancy: structured capacity redundancy in multilayer perceptrons (MLPs) and spatiotemporal redundancy in the token stream. Linear probes show that interpretable motion cues, including flow magnitude, looming, and approach versus retreat, are most accessible at intermediate layers, whereas collision-label discrimination strengthens toward the final layer. Token redundancy is axis-specific: adjacent temporal-token similarity reaches 0.970 in later layers, while spatial similarity falls to 0.297, indicating substantially greater redundancy across time than across space. Exploiting this asymmetry, temporal token merging reduces backbone computation from 356.99 to 178.50 GFLOPs and latency from 12.69 to 7.21 ms per clip, a 1.76x speedup, while mean average precision changes only from 0.7478 to 0.7443. Importance-guided retention of 50% of MLP units preserves an AUC of 0.753, compared with 0.529 under matched random retention, and reveals that pruning alters score calibration before discriminative ranking collapses. These findings establish a new pathway for pursuing faster algorithms through targeted temporal token compression and neuron pruning.
- Abstract(参考訳): 作業員の近接監視では、ビデオトランスフォーマーが衝突予測に広く使われており、高い性能を示している。
しかし、それらの精度にはかなりの計算要求が伴い、移動ロボットに対する低遅延推論の必要性と建設における低炭素計算の追求との緊張が生じる。
そこで本研究では,確立されたビデオトランス内での計算が冗長であり,その冗長性を予測性能を著しく低下させることなく除去できるかどうかを検討する。
Nexar Collision Prediction データセット上の VideoMAEv2-Base を用いて、まず、衝突関連情報がネットワーク深度にわたってどのように進化するかを調べ、次に、2つの相補的な冗長性、すなわち、多層パーセプトロン(MLP)における構造的キャパシティ冗長性とトークンストリームにおける時空間冗長性について検討する。
リニアプローブは、中間層では、流れの大きさ、浸水、接近対後退などの解釈可能な動きの手がかりが最もアクセスしやすく、一方衝突ラベルの識別は最終層に対して強くなることを示した。
後続の層では隣接時相類似性は0.970に達し、空間類似性は0.297に低下し、空間を横断するよりも時間にわたって顕著に高い冗長性を示す。
時間トークンのマージにより、バックボーンの計算量は356.99から178.50 GFLOPsに減少し、レイテンシは12.69から7.21msまで、スピードアップは1.76倍、平均精度は0.7478から0.7443に低下する。
MLPユニットの50%の重要誘導保持はAUCが0.753であり、一致したランダム保持では0.529であり、プルーニングは差別的なランキング崩壊の前にスコアのキャリブレーションを変化させることを明らかにした。
これらの知見は、時間的トークン圧縮とニューロンのプルーニングによって、より高速なアルゴリズムを追求する新たな経路を確立する。
関連論文リスト
- GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed [71.05944634852158]
GroundAnythingはブロックワイズによる正確なローカライゼーションで高速並列デコーディングを再構成する。
30のグラウンドベンチマークで、私たちの自己回帰型であるGroundAnything-VLMは、この技術の新たな全体的な状態を確立します。
エントロピー誘導復号法により、GroundAnythingは、この規模の芸術の先行状態を超越している。
論文 参考訳(メタデータ) (2026-09-30T12:20:51Z) - Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees [0.0]
低コストの商用偽装製品は、応答エンジンがリアルタイムモデル駆動のフィードバックに結びついていないという、関連する弱点を共有している。
メカニズムは、両方の欠点に対処するために、オープンに分散されたアダプティブなハニーポットプラットフォームである。
論文 参考訳(メタデータ) (2026-08-15T20:30:14Z) - Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation [0.0]
低出力エッジテンソルアクセラを備えた6Uキューブサットで推論を実行する。
低ランク適応により微調整された拡散モデルが合成マイノリティ画像を生成する。
この合成出力は、中間検出器によって自動的にアノテートされ、擬似ラベリングされ、古典的に強化されたサンプルとマージされる。
論文 参考訳(メタデータ) (2026-07-30T16:26:38Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation [68.47358899451255]
N-vium (N-vium) は、標準ハードウェア上での計算を部分的に並列化する変圧器である。
N-Viumは複数の深さで予測ヘッドを付加し、次のトーケン分布をこれらの出口上の学習混合物として定義する。
論文 参考訳(メタデータ) (2026-05-13T08:46:17Z) - TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - SPATE: Spiking-Phase Adaptive Temporal Encoding for Quantum Machine Learning [3.1061484260786014]
本稿では,時間構造を量子特徴量に組み込んだ効果的な符号化機構としてスパイクに基づくデータ表現を用いる。
新しいスパイク駆動時間符号化法が提案され、実値のタブ状特徴を漏れきりのスパイク列車に変換し、スパイク統計を量子回転にマッピングする。
階層化されたクロスバリデーションの下では、SPATEは複数のデータセットにまたがるより強力な表現をもたらす。
論文 参考訳(メタデータ) (2026-04-13T05:41:03Z) - Variational Inference for Bayesian MIDAS Regression [0.0]
線形重みパラメータージネーションを用いた回帰のための座標アセント変分推論 (CAVI) アルゴリズムを開発した。
CAVIは、107xから1,772xのスピードアップを達成しつつ、ブロックギブスサンプリングベンチマークとほぼ同一の後方手段を生成する。
重み関数パラメータは、すべてのcon gurationに対して優れたキャリブレーション(カバーは92%以上)を維持している。
論文 参考訳(メタデータ) (2026-02-23T08:51:26Z) - LiQSS: Post-Transformer Linear Quantum-Inspired State-Space Tensor Networks for Real-Time 6G [85.58816960936069]
Sixth-Generation (6G) Open Radio Access Networks (O-RAN) における能動的およびエージェント的制御は、厳密なニアタイム(Near-RT)レイテンシと計算制約の下で制御グレードの予測を必要とする。
本稿では,効率的な無線テレメトリ予測のための変圧器後パラダイムについて検討する。
本稿では、自己アテンションを安定な状態空間動的カーネルに置き換える量子インスピレーション付き状態空間テンソルネットワークを提案する。
論文 参考訳(メタデータ) (2026-01-18T12:08:38Z) - Future frame prediction in chest cine MR imaging using the PCA respiratory motion model and dynamically trained recurrent neural networks [0.0]
肺放射線治療システムは、推定腫瘍位置の不確実性や健康な組織の高照射を引き起こす遅延を受ける。
この研究は、オンライン学習アルゴリズムで訓練されたRNNを用いて、胸部ダイナミックMRIシーケンスの将来のフレーム予測に対処し、その遅延を補償する。
論文 参考訳(メタデータ) (2024-10-08T10:21:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。