論文の概要: MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization
- arxiv url: http://arxiv.org/abs/2607.00902v1
- Date: Wed, 01 Jul 2026 13:04:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.897301
- Title: MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization
- Title(参考訳): MG-RWKV:テンポラルフォージェリーローカライゼーションのためのマルチグラインドコンテキスト対応RWKV
- Authors: Jingchen Ni, Cangjin Yu, Dan Jiang, Quan Zhang, Keyu Lv, Shannan Yan, Linyue Pan, Ke Zhang, Chun Yuan,
- Abstract要約: MG-RWKV(MG-RWKV)は、O(T)複雑性を持つ全列処理のための多言語フレームワークである。
フレームワークは,2次的オーバーヘッドを伴わない双方向の時間的コンテキストをキャプチャする双方向RWKVアーキテクチャ,2 明示的時間的受容場を動的にルーティングする多角性混合(MG-MoE),3 決定解釈性を大幅に向上させるために,偽時間に基づいて粒度を適応的に選択する,3 階層的スケールワイドペアリングと空間境界認識重み付けにより隣接する特徴ピラミッドレベルを整列するCGC(Cross-Granularity Consistency) の3つの中心的イノベーションを特徴としている。
- 参考スコア(独自算出の注目度): 43.92649543343891
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Driven by Artificial Intelligence-Generated Content (AIGC), the authenticity of audio-visual content is facing severe challenges. Temporal Forgery Localization (TFL) aims to precisely identify manipulated segments within untrimmed sequences. However, existing methods are limited by CNNs' local receptive fields or Transformers' quadratic complexity, while emerging linear models often struggle to balance global authentic context compression with local abrupt forgery perception. To address this, we propose MG-RWKV, a multi-granularity framework that leverages the data-dependent state evolution of RWKV to achieve efficient full-sequence processing with O(T) complexity. Our framework features three core innovations: (1) a Bidirectional RWKV architecture that captures bidirectional temporal contexts without quadratic overhead; (2) a Multi-Granularity Mixture of Experts (MG-MoE) that performs dynamic routing over explicit temporal receptive fields, adaptively selecting granularities based on forgery duration to significantly enhance decision interpretability; and (3) Cross-Granularity Consistency (CGC), which aligns adjacent feature pyramid levels through hierarchical scale-wise pairing and spatial boundary-aware weighting, effectively reducing false positives in authentic regions. Extensive experiments on Lav-DF, TVIL, and Psynd datasets demonstrate that MG-RWKV achieves state-of-the-art performance with low computational cost.
- Abstract(参考訳): AIGC(Artificial Intelligence-Generated Content)が主導するオーディオ視覚コンテンツの信頼性は、深刻な課題に直面している。
TFL(Temporal Forgery Localization)は、非トリミングシーケンス内の操作されたセグメントを正確に識別することを目的としている。
しかし、既存の手法はCNNの局所受容場やトランスフォーマーの二次的複雑さによって制限されている一方、新しい線形モデルは、グローバルな真正コンテキスト圧縮と局所的な偽造知覚のバランスをとるのに苦労することが多い。
MG-RWKVは、RWKVのデータ依存状態の進化を利用して、O(T)複雑性を伴う効率的な全列処理を実現する多粒度フレームワークである。
本フレームワークは,2次的オーバーヘッドを伴わずに双方向の時間的コンテキストをキャプチャする双方向RWKVアーキテクチャ,(2)明示的時間的受容領域を動的にルーティングする多角性混合(MG-MoE),(3)決定の解釈性を大幅に向上させるために,偽時間に基づく粒度を適応的に選択する,(3)階層的スケールワイドペアリングと空間境界認識重み付けにより隣接する特徴ピラミッドレベルを整列させる,といった3つの中心的イノベーションを特徴としている。
Lav-DF、TVIL、Psyndのデータセットに対する大規模な実験により、MG-RWKVは計算コストを低くして最先端のパフォーマンスを達成することを示した。
関連論文リスト
- MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection [108.36437360254605]
本稿では,マルチクラス非教師付き異常検出に適したフレームワークであるMambaADv2を提案する。
MambaADv2は、事前訓練されたエンコーダと、複数のスケールにわたるDuality-enhanced State Space (DSS)モジュールを備えたMambaインスパイアされたデコーダで構成される。
HSS(Hybrid State Space)ブロックの構造は、SSDベースのMambaラインに従って調整され、Mamba3スタイルの位置認識状態空間モデリングが組み込まれている。
論文 参考訳(メタデータ) (2026-06-22T10:14:06Z) - ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation [3.8707695363745214]
ReHARKは、グローバルな近位正規化を通じて、少数ショット適応を再解釈する、トレーニング不要のフレームワークである。
ワンショット適応のための新しい最先端技術がReHARKによって確立され、平均精度は65.83%である。
論文 参考訳(メタデータ) (2026-03-12T04:59:09Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - SDiT: Semantic Region-Adaptive for Diffusion Transformers [4.7254170106792035]
拡散変換器 (DiTs) はテキストと画像の合成において最先端の性能を達成するが、復調の反復性や世界的注目の二次的コストのため計算コストは高い。
本稿では,SDiTを提案する。SDiTは,領域の複雑さに応じて計算を割り当てるセマンティック領域適応拡散変換器である。
論文 参考訳(メタデータ) (2026-01-18T06:43:36Z) - Fourier-RWKV: A Multi-State Perception Network for Efficient Image Dehazing [26.57698394898644]
マルチステート・パーセプション・パラダイムに基づく新しい脱ハージング・フレームワークを提案する。
Fourier-RWKVはさまざまなヘイズシナリオにまたがって最先端のパフォーマンスを提供する。
論文 参考訳(メタデータ) (2025-12-09T01:35:56Z) - Scaling Implicit Fields via Hypernetwork-Driven Multiscale Coordinate Transformations [0.0]
Inlicit Neural Representations (INR)は、画像、3次元形状、符号付き距離場、放射場などの信号を表現するための強力なパラダイムとして登場した。
この研究は、ハイパーネットワークを用いて信号適応座標変換を学習することにより、表現ボトルネックを破る新しいINRのクラスであるHyper-Coordinate Implicit Neural Representations (HC-INR)を導入している。
論文 参考訳(メタデータ) (2025-11-23T10:27:04Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - TS-HTFA: Advancing Time Series Forecasting via Hierarchical Text-Free Alignment with Large Language Models [14.411646409316624]
時系列予測の新しい手法である textbfHierarchical textbfText-textbfFree textbfAlignment (textbfTS-HTFA) を導入する。
我々は、QR分解語埋め込みと学習可能なプロンプトに基づいて、ペア化されたテキストデータを適応的な仮想テキストに置き換える。
複数の時系列ベンチマークの実験は、HTFAが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2024-09-23T12:57:24Z) - Temporal Context Aggregation Network for Temporal Action Proposal
Refinement [93.03730692520999]
時間的行動提案生成はビデオ理解分野において難しいが重要な課題である。
現在の方法はまだ不正確な時間境界と検索に使用される劣った自信に苦しんでいます。
TCANet は、「ローカルおよびグローバル」な時間的コンテキストアグリゲーションを通じて、高品質のアクション提案を生成するために提案します。
論文 参考訳(メタデータ) (2021-03-24T12:34:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。