論文の概要: LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation
- arxiv url: http://arxiv.org/abs/2604.18274v2
- Date: Mon, 27 Apr 2026 02:45:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 21:46:41.456592
- Title: LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation
- Title(参考訳): LiquidTAD: 並列液体誘発時間緩和による効率的な時間的行動検出
- Abstract要約: LiquidTADは、液体神経力学以前の指数緩和を並列時間演算子に蒸留するフレームワークである。
LiquidTADは、モデルフットプリントを大幅に低下させながら、強力なベースラインと競合する精度を達成する。
- 参考スコア(独自算出の注目度): 2.3837169660687123
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Temporal Action Detection (TAD) requires precise localization of action boundaries within long, untrimmed video sequences. While current high-performing methods achieve strong accuracy, they are often characterized by excessive parameter counts, substantial computational overhead, and a reliance on specialized operators that hinder deployment across diverse hardware platforms. This paper presents LiquidTAD, a framework that distills the exponential relaxation prior of liquid neural dynamics into a parallel temporal operator, rather than reproducing full Liquid Neural Network (LNN) dynamics. By introducing a Parallel Liquid-inspired Relaxation mechanism, sequential ODE solving is avoided through a fully vectorized, non-recursive formulation built entirely upon standard neural operations, enabling hardware-agnostic deployment with linear complexity with respect to the temporal length. A complementary Hierarchical Decay-Rate Sharing Strategy further adapts this relaxation prior across feature pyramid levels, stabilizing optimization and implicitly compensating for temporal compression in deeper layers. Experimental evaluations on THUMOS-14 and ActivityNet-1.3 demonstrate that LiquidTAD achieves accuracy competitive with strong baselines while substantially lowering the model footprint. Specifically, on THUMOS-14, LiquidTAD achieves 69.46\% average mAP with only 10.82M parameters and 27.17G FLOPs, reducing the parameter count by over 60\% compared with ActionFormer.
- Abstract(参考訳): 時間的行動検出(TAD)は、長い、トリミングされていないビデオシーケンス内でのアクション境界の正確な位置決めを必要とする。
現在のハイパフォーマンス手法は高い精度を達成するが、過度なパラメータ数、かなりの計算オーバーヘッド、様々なハードウェアプラットフォームへの展開を妨げる特別な演算子に依存することが特徴である。
本稿では, フルリキッドニューラルネットワーク(LNN)のダイナミクスを再現する代わりに, 液体ニューラルダイナミクスの指数緩和を並列時間演算子に蒸留するフレームワークであるLiquidTADを提案する。
Parallel Liquid-inspired Relaxation機構を導入することで、シーケンシャルODE解決は、標準の神経操作をベースとした完全にベクトル化された非再帰的な定式化によって回避される。
補完的な階層的なDecay-Rate Sharing戦略は、この機能ピラミッドレベルを越えて、この緩和に先立って適応し、最適化を安定化し、より深い層での時間的圧縮を暗黙的に補償する。
THUMOS-14とActivityNet-1.3の実験的評価により、LiquidTADは強力なベースラインと競合し、モデルのフットプリントを大幅に低下させる。
具体的にはTHUMOS-14では、LiquidTADは平均mAPを69.46 %、パラメータは10.82M、FLOPは27.17Gで、ActionFormerに比べて60 %以上減少する。
関連論文リスト
- High-fidelity Modeling of Full-scale Pressurized Water Reactor Flow Fields for Machine Learning Applications [3.8347851078346427]
本研究は, 加圧水型原子炉における高忠実度計算流体力学(CFD)および組立レベル流動特性評価のためのデータ駆動モデリングフレームワークを提案する。
ポンプ誘起スワール境界条件による過渡的シミュレーションを可能にするために, 一般に利用可能な幾何学的条件と操作条件を用いて, フルロープルおよびコア・インレット領域を構築した。
その結果, コールドレッグスワールおよびロウアープレナム輸送は, 特に下部コア付近において, 組立方向のインレットフロー分布を強く均一に生成することがわかった。
3次元畳み込み型塗装モデルによる部分観察による組立レベル質量流量の復元に成功した
論文 参考訳(メタデータ) (2026-05-23T22:50:23Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration [64.32072516882947]
拡散ポリシーは、具体的制御が優れているが、高い推論遅延と計算コストに悩まされている。
時間認識強化に基づく投機的拡散政策(TS-DP)を提案する。
TS-DPは94%以上のドラフトで最大4.17倍高速な推論を実現し、推論周波数は25Hzに達した。
論文 参考訳(メタデータ) (2025-12-13T07:53:14Z) - Periodicity-Enforced Neural Network for Designing Deterministic Lateral Displacement Devices [4.743321030941228]
本稿では, 周期層, ニューラルネットワークコンポーネントを組み込んだ周期性強化サロゲートモデリング手法を提案する。
提案手法は3つのサブネットワークを用いて, 臨界径や粒子軌道を直接予測するのではなく, 定常, 非次元速度, 圧力場を予測する。
論文 参考訳(メタデータ) (2025-11-21T20:14:16Z) - PPMStereo: Pick-and-Play Memory Construction for Consistent Dynamic Stereo Matching [51.98089287914147]
textbfPick-and-textbflay textbfMemory (PM) construction module for dynamic bfStereo matching, called bftextPPMStereo。
bftextPPMStereo と呼ばれる動的 bfStereo マッチングのための textbfPick-and-textbflay textbfMemory (PM) 構築モジュールを提案する。
論文 参考訳(メタデータ) (2025-10-23T03:52:39Z) - HAD: Hierarchical Asymmetric Distillation to Bridge Spatio-Temporal Gaps in Event-Based Object Tracking [80.07224739976911]
イベントカメラは例外的な時間分解能と範囲(モード)を提供する
RGBカメラは高解像度でリッチテクスチャを捉えるのに優れていますが、イベントカメラは例外的な時間分解能とレンジ(モダル)を提供します。
論文 参考訳(メタデータ) (2025-10-22T13:15:13Z) - Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency [60.74505433956616]
連続時間一貫性モデル(sCM)は理論的に原理化され、学術規模の拡散を加速するために実証的に強力である。
まず並列性互換なFlashAttention-2 JVPカーネルを開発し、100億以上のパラメータと高次元ビデオタスクを持つモデル上でsCMトレーニングを可能にする。
本稿では, スコア蒸留を長軸正則化器として組み込んだスコア規則化連続時間一貫性モデル(rCM)を提案する。
論文 参考訳(メタデータ) (2025-10-09T16:45:30Z) - UTAL-GNN: Unsupervised Temporal Action Localization using Graph Neural Networks [0.0]
非トリミングスポーツビデオにおける微粒なアクションローカライゼーションは、迅速かつ微妙な動き遷移のために重大な課題を呈している。
既存の教師付きおよび弱教師付きソリューションは、しばしば広範なデータセットと高容量モデルに依存し、計算集約的で現実世界のシナリオに適応できない。
提案手法では,ブロックワイドパーティションを付加したポーズ列を付加したアテンションベースの時空間グラフ畳み込みネットワーク(ASTGCN)を事前学習する。
DSVダイビングデータセット上で平均平均平均精度(mAP)82.66%、平均遅延局所化29.09msを達成する。
論文 参考訳(メタデータ) (2025-08-27T07:51:02Z) - YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception [58.06752127687312]
高精度で軽量な物体検出器YOLOv13を提案する。
ハイパーグラフに基づく適応相関強化(HyperACE)機構を提案する。
また,FullPAD(Full-Pipeline Aggregation-and-Distribution)パラダイムを提案する。
論文 参考訳(メタデータ) (2025-06-21T15:15:03Z) - MesaNet: Sequence Modeling by Locally Optimal Test-Time Training [67.45211108321203]
我々は,最近提案されたMesa層の数値的に安定かつチャンクワイズ可能な並列化版を導入する。
テストタイムの最適トレーニングにより、従来のRNNよりも言語モデリングの難易度が低く、ダウンストリームベンチマークのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2025-06-05T16:50:23Z) - Physics-informed Multiple-Input Operators for efficient dynamic response prediction of structures [0.07916635054977067]
MIONetは空間と時間の両方で連続的に構造的応答を予測する。
モデルは単純なビームとKW-51ブリッジの両方で検証され、FEMレベルの精度は数秒で達成される。
論文 参考訳(メタデータ) (2025-05-11T18:45:58Z) - Hybrid machine learning models based on physical patterns to accelerate CFD simulations: a short guide on autoregressive models [3.780691701083858]
本研究では,Long Short-Term Memory (LSTM) アーキテクチャと高次特異値分解を革新的に統合し,流体力学における低次モデリング(ROM)の複雑さに対処する。
この手法は、2次元および3次元のシリンダー流(2次元および3次元)を含む数値的および実験的なデータセットで試験される。
その結果、HOSVDは、異なるエラーメトリクスを用いて証明されたように、すべてのテストシナリオでSVDより優れていることが示された。
論文 参考訳(メタデータ) (2025-04-09T10:56:03Z) - AMR-Transformer: Enabling Efficient Long-range Interaction for Complex Neural Fluid Simulation [33.63726923336252]
本稿では,AMR-Transformerを提案する。
これは、Navier-Stokes制約を意識した高速刈取モジュールと、新しい適応メッシュリファインメントスキームを統合している。
提案手法は,ベースラインモデルよりも精度が向上する。
論文 参考訳(メタデータ) (2025-03-13T11:16:42Z) - Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints [51.83081671798784]
Diffusion Transformers (DiT) は、画像およびビデオ生成のための強力なアーキテクチャとして登場し、優れた品質とスケーラビリティを提供している。
DiTの実用アプリケーションは本質的に動的特徴不安定性に悩まされており、キャッシュされた推論中にエラーを増幅する。
我々は,Long-Skip-Connections (LSCs) で拡張された画像およびビデオ生成型DiTであるSkip-DiTを提案する。
論文 参考訳(メタデータ) (2024-11-26T17:28:10Z) - Adaptive Multi-Scale Decomposition Framework for Time Series Forecasting [26.141054975797868]
本稿では,時系列予測のための新しい適応型マルチスケール分解(AMD)フレームワークを提案する。
我々のフレームワークは時系列を複数のスケールで異なる時間パターンに分解し、MDM(Multi-Scale Decomposable Mixing)ブロックを活用する。
提案手法は,時間依存性とチャネル依存性の両方を効果的にモデル化し,マルチスケールデータ統合を改良するために自己相関を利用する。
論文 参考訳(メタデータ) (2024-06-06T05:27:33Z) - Towards Long-Term Time-Series Forecasting: Feature, Pattern, and
Distribution [57.71199089609161]
長期的時系列予測(LTTF)は、風力発電計画など、多くのアプリケーションで需要が高まっている。
トランスフォーマーモデルは、高い計算自己認識機構のため、高い予測能力を提供するために採用されている。
LTTFの既存の手法を3つの面で区別する,Conformer という,効率的なTransformer ベースモデルを提案する。
論文 参考訳(メタデータ) (2023-01-05T13:59:29Z) - Real-time simulation of parameter-dependent fluid flows through deep
learning-based reduced order models [0.2538209532048866]
還元次数モデル (ROM) はパラメータ依存の流体力学問題を高速に近似する。
ディープラーニング(DL)ベースのROMは、非線形トライアル多様体と還元力学の両方を非侵襲的に学習することで、これらの制限をすべて克服する。
得られたPOD-DL-ROMは、シリンダーベンチマークの周囲の流れ、固定された剛性ブロックに付着した弾性ビームとラミナー非圧縮性フローとの流体構造相互作用、大脳動脈瘤内の血流のほぼリアルタイムに正確な結果をもたらすことが示されている。
論文 参考訳(メタデータ) (2021-06-10T13:07:33Z) - Liquid Time-constant Networks [117.57116214802504]
本稿では,時間連続リカレントニューラルネットワークモデルについて紹介する。
暗黙の非線形性によって学習システムの力学を宣言する代わりに、線形一階力学系のネットワークを構築する。
これらのニューラルネットワークは安定かつ有界な振る舞いを示し、ニューラル常微分方程式の族の中で優れた表現性をもたらす。
論文 参考訳(メタデータ) (2020-06-08T09:53:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。