論文の概要: Whareformer: Learning to Track What is Where in Long Egocentric Videos
- arxiv url: http://arxiv.org/abs/2607.08537v1
- Date: Thu, 09 Jul 2026 14:33:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.565452
- Title: Whareformer: Learning to Track What is Where in Long Egocentric Videos
- Title(参考訳): Whareformer:永遠のエゴセントリックビデオで何が起きているのかを学習する
- Authors: Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus,
- Abstract要約: 我々はOSNOMタスクに対する最初の学習ベースソリューションであるWhareformerを提案する。
Whareformerは2つのコンポーネントを持つトランスフォーマーベースのモデルである。
3つのデータセットから260の長いテストビデオでSOTAのパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 36.54216625885382
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The recently established 'Out of Sight, Not out of Mind' (OSNOM) task for egocentric videos focuses on tracking objects that are moved by the camera wearer, online, maintaining knowledge of instance locations throughout the video even when they leave the field of view or become heavily occluded. In this paper, we propose the first learning-based solution to the OSNOM task: Whareformer, a transformer-based model with two components: an updatable memory of established tracks and a track assignment module that associates observations with existing tracks in a feed-forward manner. Whareformer jointly reasons over evolving object appearance (what) and updated 3D location (where), and employs a dedicated New Track token to reason about novel objects. Thanks to its design choices of using relative distances and evolving track representations, Whareformer is trained on a small set of 56 videos but achieves SOTA performance on 260 long test videos from three datasets: EPIC-KITCHENS-100 (unseen videos), IT3DEgo, and HD-EPIC, with significant absolute improvements over prior work.
- Abstract(参考訳): オンライン上で、カメラ装着者が移動した物体の追跡に焦点をあて、視野を離れたり、無視されたりしても、ビデオ全体のインスタンス位置に関する知識を維持している。
本稿では,OSNOMタスクに対する最初の学習ベースのソリューションを提案する。Whareformerは,既存のトラックのアップダブルメモリと,既存のトラックをフィードフォワードで関連付けるトラック割り当てモジュールという,2つのコンポーネントを備えたトランスフォーマーベースのモデルである。
Whareformerは、進化するオブジェクトの外観(何)と更新された3D位置(場所)を共同で理由付け、新しいオブジェクトを推論するために専用のNew Trackトークンを使用している。
相対距離の使用とトラック表現の進化という設計上の選択により、Whareformerは56本のビデオの小さなセットでトレーニングされているが、EPIC-KITCHENS-100 (unseen video)、IT3DEgo、HD-EPICの3つのデータセットから260本の長いテストビデオでSOTAのパフォーマンスを達成している。
関連論文リスト
- TAPVid-360: Tracking Any Point in 360 from Narrow Field of View Video [7.009814571727852]
TAPVid-360は,ビデオシーケンスを横断するシーンポイントに対する3次元方向の予測を必要とする新しいタスクである。
我々は360度動画を監督の源として利用し、真実の方向を計算しながら視野を狭くする。
我々のベースラインはCoTracker v3に適応し、方向更新のためのポイント毎の回転を予測し、既存のTAPおよびTAPVid 3D法より優れている。
論文 参考訳(メタデータ) (2025-11-26T22:13:26Z) - VideoArtGS: Building Digital Twins of Articulated Objects from Monocular Video [60.63575135514847]
モノクロビデオから音声化されたオブジェクトのデジタルツインを構築することは、コンピュータビジョンにおいて重要な課題である。
本稿では,モノクロ映像から高忠実度デジタル双対を再構成する新しい手法であるVideoArtGSを紹介する。
VideoArtGSは、調音およびメッシュ再構成における最先端性能を示し、既存の方法に比べて約2桁の再現誤差を低減している。
論文 参考訳(メタデータ) (2025-09-22T11:52:02Z) - Fast Encoder-Based 3D from Casual Videos via Point Track Processing [22.563073026889324]
そこで我々は,カジュアルビデオから3D構造とカメラの位置を動的コンテンツから推定できる学習ベースのTracksTo4Dを提案する。
TracksTo4Dは、カジュアルなビデオのデータセットに基づいて教師なしの方法で訓練される。
実験により、TracksTo4Dは、最先端の手法に匹敵する精度で、基礎となるビデオの時間点雲とカメラの位置を再構築できることが示された。
論文 参考訳(メタデータ) (2024-04-10T15:37:00Z) - Dense Video Object Captioning from Disjoint Supervision [77.47084982558101]
本稿では,高密度ビデオオブジェクトキャプションのための新しいタスクとモデルを提案する。
このタスクは、ビデオにおける空間的および時間的局所化を統一する。
我々は、この新しいタスクの強力なベースラインにおいて、我々のモデルがどのように改善されているかを示す。
論文 参考訳(メタデータ) (2023-06-20T17:57:23Z) - EPIC Fields: Marrying 3D Geometry and Video Understanding [76.60638761589065]
EPIC Fieldsは、EPIC-KITCHENSの3Dカメラ情報の拡張である。
これは、フォトグラムを使ってカメラを再構築する複雑で高価なステップを取り除く。
EPICKITCHENSのビデオの96%を再構築し、45のキッチンで99時間に19Mフレームを登録した。
論文 参考訳(メタデータ) (2023-06-14T20:33:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。