論文の概要: HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams
- arxiv url: http://arxiv.org/abs/2608.02140v3
- Date: Wed, 05 Aug 2026 14:57:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.156039
- Title: HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams
- Title(参考訳): HiResNets:Foveal Residual Streamsを用いたネイティブフルHDビデオ認識
- Authors: Shivani Mall, Swarnim Jain, Joao F. Henriques,
- Abstract要約: 畳み込みブロックが対数2乗成長する残留ネットワークについて検討し、高速な高解像度ビデオ処理を可能にする。
完全な高解像度の表現は残差ストリームに構築され、眼球のササードに似ており、生物学的視覚において完全な画像を生成する。
実験により、提案したHiResNetsは人間の視覚と同じようなシーンを回避し、難易度の高いビデオ認識タスクにおいて優れた性能を発揮することが示された。
- 参考スコア(独自算出の注目度): 0.8232962021356185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Much of the recent progress in image and video recognition has come at the cost of memory: larger models, increased resolution, and longer temporal contexts. An inevitable component is the quadratic (or larger) growth of memory and compute based on image resolution, which is a property of the grid sampling used in convolutional networks and vision transformers. In this work we study residual networks whose convolutional blocks have logarithmic-square growth instead, enabling them to process very high-resolution video quickly. The key insight is to use a residual architecture's residual stream as a high-resolution buffer, to which convolutional blocks only read and write via log-polar image warp operations. Layers adaptively focus on different parts of each frame, with very high resolution only near the focus point. A complete high-resolution representation is built up in the residual stream, analogous to eye saccades creating a complete picture in biological vision, and a theoretical construction is presented that eliminates the quadratic dependency of the residual stream resolution. Experiments demonstrate that our proposed HiResNets learn to foveate around scenes similarly to human vision, and have superior performance in difficult egocentric video recognition tasks, especially egocentric video with small objects and fine-grained recognition.
- Abstract(参考訳): 画像とビデオの認識の最近の進歩の多くは、より大きなモデル、解像度の向上、時間的コンテキストの延長といったメモリのコストが伴っている。
必然的なコンポーネントは、畳み込みネットワークや視覚変換器で使用されるグリッドサンプリングの特性である画像解像度に基づくメモリと計算の二次的(あるいはより大きな)成長である。
本研究では,畳み込みブロックが対数2乗成長を持つ残差ネットワークについて検討し,高速な高解像度ビデオ処理を実現する。
キーとなる洞察は、残余アーキテクチャの残留ストリームを高解像度バッファとして使用することであり、畳み込みブロックは対数極性イメージワープ操作によってのみ読み書きされる。
レイヤは各フレームの異なる部分に適応的にフォーカスする。
残差ストリームに完全高解像度の表現が構築され、生体視における完全像を生成する眼嚢に類似し、残差ストリーム解像度の二次的依存を排除した理論的構成が提示される。
実験により、提案したHiResNetsは人間の視覚と同様のシーンを回避し、難易度の高いビデオ認識タスク、特に小さなオブジェクトを持つエゴセントリックなビデオやきめ細かな認識において優れたパフォーマンスを発揮することが示された。
関連論文リスト
- Super-Resolution Generative Adversarial Networks based Video Enhancement [0.40964539027092906]
本研究は、通常のシングルイメージSIS(SRGAN)構造を拡張して、対数データを扱うことで、ビデオ超解像への拡張アプローチを導入する。
3次元非局所ブロックを組み込んだ修正フレームワークが開発され、空間次元と時間次元の両方で関係を捉えることができる。
その結果、従来の単一画像法と比較して、時間的コヒーレンス、よりシャープなテクスチャ、視覚的アーティファクトが向上した。
論文 参考訳(メタデータ) (2025-05-14T20:16:51Z) - Pixel-Aligned Multi-View Generation with Depth Guided Decoder [86.1813201212539]
画素レベルの画像・マルチビュー生成のための新しい手法を提案する。
従来の作業とは異なり、潜伏映像拡散モデルのVAEデコーダにマルチビュー画像にアテンション層を組み込む。
本モデルにより,マルチビュー画像間の画素アライメントが向上する。
論文 参考訳(メタデータ) (2024-08-26T04:56:41Z) - Adaptive Convolutional Neural Network for Image Super-resolution [21.329826728216748]
画像超解像のための適応畳み込みニューラルネットワーク(ADSRNet)を提案する。
上層ネットワークは、コンテキスト情報、カーネルマッピングの健全な情報関係、浅い層と深い層の関連性を高めることができる。
下位のネットワークは対称アーキテクチャを使用して、異なるレイヤの関係を強化し、より構造的な情報をマイニングする。
論文 参考訳(メタデータ) (2024-02-24T03:44:06Z) - Rethinking Resolution in the Context of Efficient Video Recognition [49.957690643214576]
クロスレゾリューションKD(ResKD)は、低解像度フレームでの認識精度を高めるための単純だが効果的な方法である。
我々は,最先端アーキテクチャ,すなわち3D-CNNとビデオトランスフォーマーに対して,その効果を広く示す。
論文 参考訳(メタデータ) (2022-09-26T15:50:44Z) - Learning Enriched Features for Fast Image Restoration and Enhancement [166.17296369600774]
本稿では,ネットワーク全体を通して空間的精度の高い高解像度表現を維持することを目的とする。
我々は、高解像度の空間的詳細を同時に保存しながら、複数のスケールからの文脈情報を組み合わせた豊富な特徴集合を学習する。
提案手法は,デフォーカス・デブロアリング,画像デノイング,超解像,画像強調など,さまざまな画像処理タスクに対して,最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2022-04-19T17:59:45Z) - Restormer: Efficient Transformer for High-Resolution Image Restoration [118.9617735769827]
畳み込みニューラルネットワーク(CNN)は、大規模データから一般化可能な画像の事前学習をうまく行う。
トランスフォーマーは、自然言語とハイレベルな視覚タスクにおいて、顕著なパフォーマンス向上を示している。
我々のモデルであるRecovery Transformer (Restormer) は、いくつかの画像復元タスクにおいて最先端の結果を得る。
論文 参考訳(メタデータ) (2021-11-18T18:59:10Z) - Learning Enriched Features for Real Image Restoration and Enhancement [166.17296369600774]
畳み込みニューラルネットワーク(CNN)は、画像復元作業における従来のアプローチよりも劇的に改善されている。
ネットワーク全体を通して空間的精度の高い高解像度表現を維持することを目的とした,新しいアーキテクチャを提案する。
提案手法は,高解像度の空間的詳細を同時に保存しながら,複数のスケールからの文脈情報を組み合わせた豊富な特徴集合を学習する。
論文 参考訳(メタデータ) (2020-03-15T11:04:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。