論文の概要: ByteAction: Byte-space Action Recognition Foundation Model
- arxiv url: http://arxiv.org/abs/2608.22760v1
- Date: Mon, 24 Aug 2026 03:31:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.880206
- Title: ByteAction: Byte-space Action Recognition Foundation Model
- Title(参考訳): ByteAction:Byte-space Action Recognition Foundation Model
- Authors: Fangcheng Li, Zhen Yu, Kejun Wu, Qiong Liu, You Yang,
- Abstract要約: Byte-space Action Recognition (BAR) は、圧縮された画像のビットストリームから直接人間の行動を認識することを目的としている。
劣化した画像のビットストリーム上で正確な動作認識を実現するBAR基盤モデルByteActionを提案する。
- 参考スコア(独自算出の注目度): 21.295794335147082
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Byte-space Action Recognition (BAR) aims to recognize human actions directly from compressed image bitstreams without any pixel decoding. By operating entirely in byte space, BAR is inherently independent of file integrity and pixel-level reconstruction, making it naturally applicable to privacy-sensitive scenarios and robust against bitstream corruption. In this paper, we propose ByteAction, a BAR foundation model that achieves accurate action recognition on corrupted image bitstreams. ByteAction follows a dual-view byte-level recognition framework. It constructs weakly and strongly corrupted bitstream views, which are augmented by Bitstream Pattern Augmentation (BPA) and encoded with a shared ByteFormer backbone. The model is optimized with both classification and corruption consistency objectives. Specifically, we propose Bitstream Pattern Augmentation (BPA), which reshapes one-dimensional byte sequences into two-dimensional byte matrix and applies region-level erasure to encourage the model to learn robust cross-region byte dependencies. We further propose a Corruption Consistency Training strategy that constrains the model to maintain stable predictions across different corruption severities through bidirectional KL divergence. Experiments on the image bitstream from Stanford40, PPMI, and PASCAL VOC 2012 Action demonstrate that ByteAction achieves state-of-the-art corruption robustness across all scenarios while maintaining competitive intact bitstream performance.
- Abstract(参考訳): Byte-space Action Recognition (BAR) は、圧縮された画像のビットストリームから直接人間の行動を認識することを目的としている。
完全にバイト空間で操作することで、BARは本質的にファイルの完全性とピクセルレベルの再構築とは独立しており、プライバシーに敏感なシナリオに自然に適用でき、ビットストリームの破損に対して堅牢である。
本稿では、劣化した画像のビットストリーム上で正確な動作認識を実現するBAR基盤モデルByteActionを提案する。
ByteActionはデュアルビューバイトレベルの認識フレームワークである。
Bitstream Pattern Augmentation (BPA)によって拡張され、共有ByteFormerバックボーンでエンコードされる。
このモデルは分類と腐敗の整合性の両方に最適化されている。
具体的には,ビットストリームパターン拡張(BPA)を提案し,一次元バイト列を2次元バイト行列に再設定し,領域レベルの消去を適用して,頑健なクロスリージョンバイト依存の学習を促す。
さらに,二方向KL分散による汚職重大度の安定予測の維持をモデルに制約する破壊一貫性訓練戦略を提案する。
Stanford40、PPMI、PASCAL VOC 2012 Actionによる画像ビットストリームの実験では、ByteActionは、競争力のある無傷ビットストリームのパフォーマンスを維持しながら、すべてのシナリオで最先端の破壊性を達成することを示した。
関連論文リスト
- Towards Bitstream-corrupted Harsh Visual Understanding: Through Bitstream Language Modeling as Robust Semantic Priors [14.91030843318295]
Bitstreamの崩壊したHarsh Visual Understanding (BcHVU)は、現実世界のマルチメディア通信において、ひどい劣化したビットストリームからデコードされた過酷な劣化したビデオを理解することを目的としている。
本稿では,bitstream-native semantic cues の学習と注入のためのフレームワークである Robust Semantic Priors (BLMSP) として Bitstream Language Modeling を提案する。
提案するBLMSPフレームワークは,ビットストリーム言語モデルを用いて,ビットストリームネイティブなセマンティックキューを抽出し,BcHVUタスクのオフザシェルフビジョンモデルにインジェクションすることで,それらを先行として活用する。
論文 参考訳(メタデータ) (2026-08-22T08:16:58Z) - Bitstream Action Recognition is Byte Modeling [33.87306245425509]
ストレージや送信中のビットストリームの破損は、深刻な視覚的アーティファクトやデコード障害を引き起こす可能性がある。
我々は新しいBARフレームワーク、Achoring Corrupted Embeddings (BRACE) によるビットストリーム認識を提案する。
BRACEは二重ブランチのバイトモデリングアーキテクチャで、破損したビットストリームとそれと無関係なビットストリームを、同じアクションの2つのバイト実現として扱う。
論文 参考訳(メタデータ) (2026-08-16T11:57:05Z) - Robust Promptable Video Object Segmentation [67.1533741758339]
本稿では,ロバストPVOS(RobustPVOS)の総合的研究について述べる。
まず,351本のビデオクリップと2500枚以上のオブジェクトマスクの2つの実世界評価データセットを用いて,新しい総合的ベンチマークを構築した。
メモリオブジェクト条件付きGated-rank Adaptation (MoGA) と呼ばれる新しいロバストPVOS法を提案する。
論文 参考訳(メタデータ) (2026-05-12T11:55:31Z) - Bitstream Collisions in Neural Image Compression via Adversarial Perturbations [2.0960189135529212]
本研究は、NIC-bitstream衝突における予期せぬ脆弱性を明らかにする。
この衝突の脆弱性は、特にセキュリティクリティカルなアプリケーションにおいて、NICの実用性に対する脅威となる。
単純で効果的な緩和法が提案されている。
論文 参考訳(メタデータ) (2025-03-25T16:29:17Z) - ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives [23.580848165023962]
マルチメディアファイルフラグメント分類(MFFC)は、システムメタデータなしでファイルフラグメントタイプを識別することを目的としている。
既存のMFFC法はフラグメントを1Dバイトシーケンスとして扱い、分類のために別々のバイト(バイト)の関係を強調する。
Byte2Imageは、以前見過ごされたバイト内情報をファイルのフラグメントに組み込んで、これらのフラグメントを2Dイメージとして再解釈する。
ByteNetは、浅いバイト分岐特徴抽出(BBFE)と深いイメージ分岐特徴抽出(IBFE)ネットワークを介して、生の1Dバイトシーケンスと変換された2Dイメージをフル活用する。
論文 参考訳(メタデータ) (2024-10-28T09:19:28Z) - HybridFlow: Infusing Continuity into Masked Codebook for Extreme Low-Bitrate Image Compression [51.04820313355164]
HyrbidFlowは、連続的な機能ベースのストリームとコードブックベースのストリームを組み合わせることで、極めて低い条件下で高い知覚品質と高い忠実性を実現する。
実験の結果、超低速で複数のデータセットにまたがる優れた性能が示された。
論文 参考訳(メタデータ) (2024-04-20T13:19:08Z) - IBVC: Interpolation-driven B-frame Video Compression [68.18440522300536]
Bフレームビデオ圧縮は、双方向動作推定と動き補償(MEMC)符号化をミドルフレーム再構成に適用することを目的としている。
従来の学習アプローチでは、しばしば双方向の光フロー推定に依存するニューラルネットワークのPフレームコーデックをBフレームに直接拡張する。
これらの問題に対処するために,IBVC (Interpolation-B-frame Video Compression) という単純な構造を提案する。
論文 参考訳(メタデータ) (2023-09-25T02:45:51Z) - You Can Mask More For Extremely Low-Bitrate Image Compression [80.7692466922499]
近年,学習画像圧縮(lic)法は大きな進歩を遂げている。
licメソッドは、画像圧縮に不可欠な画像構造とテクスチャコンポーネントを明示的に探索することができない。
原画像の構造とテクスチャに基づいて可視パッチをサンプリングするDA-Maskを提案する。
極めて低ビットレート圧縮のために, lic と lic のエンドツーエンドを統一する最初のフレームワークである, 単純で効果的なマスク付き圧縮モデル (MCM) を提案する。
論文 参考訳(メタデータ) (2023-06-27T15:36:22Z) - Expressive Losses for Verified Robustness via Convex Combinations [67.54357965665676]
本研究では, 過近似係数と異なる表現的損失に対する性能分布の関係について検討した。
表現性が不可欠である一方で、最悪の場合の損失のより良い近似は、必ずしも優れた堅牢性-正確性トレードオフに結びついていないことを示す。
論文 参考訳(メタデータ) (2023-05-23T12:20:29Z) - A Byte Sequence is Worth an Image: CNN for File Fragment Classification
Using Bit Shift and n-Gram Embeddings [21.14735408046021]
メモリの小さなチャンク上のファイル断片分類(FFC)は、メモリ科学とインターネットセキュリティにおいて不可欠である。
既存の方法はファイルフラグメントを1dバイトの信号として扱い、キャプチャされたバイト間の特徴を分類に利用している。
ファイルフラグメントに無視されたバイト内情報を導入し、2次元グレースケールの画像として再処理するための新しいデータ拡張手法Byte2Imageを提案する。
論文 参考訳(メタデータ) (2023-04-14T08:06:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。