論文の概要: OR-Action: Multi-Role Video Understanding with Fine-Grained Actions
- arxiv url: http://arxiv.org/abs/2606.13332v1
- Date: Thu, 11 Jun 2026 13:24:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.814903
- Title: OR-Action: Multi-Role Video Understanding with Fine-Grained Actions
- Title(参考訳): OR-Action:細粒度アクションによるマルチロールビデオ理解
- Authors: Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab,
- Abstract要約: 操作室(OR)の活動のきめ細かい理解はワークフロー認識の支援を可能にする。
現在のシーングラフ予測手法は時間構造をモデル化するのに苦労している。
本稿では,グラフベースの手法より優れた視覚のみの時間モデルを提案する。
- 参考スコア(独自算出の注目度): 37.96856087875045
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained understanding of operating room (OR) activity could enable workflow-aware assistance, yet remains difficult due to clutter, occlusions, and limited sensing. The prevailing approach to model this environment is scene graphs as an interpretable representation of OR interactions. Converting their frame-wise relational predictions into temporally extended, fine-grained actions however, is challenging without explicit temporal modeling. To enable a principled temporal evaluation of current OR understanding methods, we introduce the first action-centric benchmark built on a publicly available ego-exocentric OR dataset by defining a fine-grained, multi-role action taxonomy and generating dense action segments via distillation from ground-truth scene graph state changes. Experiments on this benchmark show that current scene graph prediction methods struggle to model temporal structure, even when adding explicit modeling through Graph Neural Networks. We therefore introduce a vision-only temporal model that outperforms graph-based methods significantly when using all available egocentric video as input. Building on this model we also introduce a novel multi- to single-view feature alignment strategy that improves single-view performance on multi-role action recognition, mitigating the need for extensive egocentric video capture. Benchmark and code will be released upon acceptance.
- Abstract(参考訳): 操作室(OR)の活動のきめ細かい理解はワークフロー認識の補助を可能にするが、乱雑、閉塞、限られた感覚のために依然として困難である。
この環境をモデル化するための一般的なアプローチは、OR相互作用の解釈可能な表現としてのシーングラフである。
しかし、フレームワイドな関係予測を時間的に拡張され、きめ細かな動作に変換することは、明示的な時間的モデリングなしでは困難である。
従来のOR理解手法の時間的評価を原則として実現するために,詳細なマルチロール行動分類を定義し,地中構造図の状態変化からの蒸留によって高密度な行動セグメントを生成することで,公開可能なego-exocentric ORデータセット上に構築された最初のアクション中心ベンチマークを導入する。
このベンチマークの実験では、現在のシーングラフ予測手法は、グラフニューラルネットワークを通じて明示的なモデリングを追加する場合であっても、時間構造をモデル化するのに苦労している。
そこで我々は、利用可能な全自我中心の動画を入力として使用する場合、グラフベースの手法を著しく上回る視覚のみの時間モデルを導入する。
また,このモデルに基づいて,マルチロール動作認識における単一視点の性能向上を図り,広範囲なエゴセントリックな映像キャプチャの必要性を軽減した,新しいマルチビュー機能アライメント戦略を導入する。
ベンチマークとコードは受け入れ次第リリースされる。
関連論文リスト
- InstrAct: Towards Action-Centric Understanding in Instructional Videos [12.356484522873577]
InstrActionは、インストラクショナルビデオのアクション中心表現のための事前トレーニングフレームワークである。
まず、ノイズの多いキャプションをフィルタリングし、アクション中心のハードネガティブを生成する、データ駆動型戦略を導入する。
視覚的特徴レベルでは、Action Perceiverは、冗長なビデオエンコーディングからモーション関連トークンを抽出する。
論文 参考訳(メタデータ) (2026-04-09T20:51:13Z) - Exploring the Temporal Consistency for Point-Level Weakly-Supervised Temporal Action Localization [66.80402022104074]
ポイント教師付きテンポラルアクションローカライゼーション(PTAL)は、軽快なフレームアノテートパラダイム(textiti.e.、アクションインスタンスごとに1フレームのみをラベル付けする)を採用して、教師なしビデオ内のアクションインスタンスを見つけるようモデルを訓練する。
既存のアプローチのほとんどは、アクションのフレーム間の時間的関係を明確にモデル化することなく、ポイントトリミングされたスニペットレベルの分類だけでモデルのタスクヘッドを設計する。
本稿では,行動ローカライゼーションのための時間的理解能力を高めるために,ポイントインスペクションを完全に活用するマルチタスク学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-05T14:46:21Z) - THYME: Temporal Hierarchical-Cyclic Interactivity Modeling for Video Scene Graphs in Aerial Footage [11.587822611656648]
時間的階層的周期的シーングラフ(THYME)アプローチを導入し,階層的特徴集約と周期的時間的改善を統合して限界に対処する。
THYMEは、マルチスケールの空間コンテキストを効果的にモデル化し、フレーム間の時間的一貫性を強制し、より正確で一貫性のあるシーングラフを生成する。
さらに,既存のデータセットの制約を克服する5種類の対話性を備えた新しい空中ビデオデータセットであるAeroEye-v1.0を提案する。
論文 参考訳(メタデータ) (2025-07-12T08:43:38Z) - Leveraging Foundation Models for Multimodal Graph-Based Action Recognition [2.066890710233268]
動的視覚符号化のためのビデオMAEとコンテキストテキスト埋め込みのためのBERTを統合したグラフベースのフレームワークを提案する。
提案手法は,多様なベンチマークデータセット上で,最先端のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-05-21T07:15:14Z) - TimeGraphs: Graph-based Temporal Reasoning [64.18083371645956]
TimeGraphsは階層的時間グラフとして動的相互作用を特徴付ける新しいアプローチである。
提案手法は,コンパクトなグラフベース表現を用いて相互作用をモデル化し,多種多様な時間スケールでの適応推論を可能にする。
我々は,サッカーシミュレータ,抵抗ゲーム,MOMA人間活動データセットなど,複雑でダイナミックなエージェントインタラクションを持つ複数のデータセット上でTimeGraphsを評価する。
論文 参考訳(メタデータ) (2024-01-06T06:26:49Z) - Local-Global Information Interaction Debiasing for Dynamic Scene Graph
Generation [51.92419880088668]
マルチタスク学習に基づく新しいDynSGGモデルDynSGG-MTLを提案する。
長期的人間の行動は、大域的な制約に適合する複数のシーングラフを生成するためにモデルを監督し、尾の述語を学べないモデルを避ける。
論文 参考訳(メタデータ) (2023-08-10T01:24:25Z) - EasyDGL: Encode, Train and Interpret for Continuous-time Dynamic Graph Learning [92.71579608528907]
本稿では,3つのモジュールから構成される使い勝手の良いパイプライン(EasyDGL)を設計することを目的とする。
EasyDGLは、進化するグラフデータからモデルが学習する周波数コンテンツの予測力を効果的に定量化することができる。
論文 参考訳(メタデータ) (2023-03-22T06:35:08Z) - Self-Regulated Learning for Egocentric Video Activity Anticipation [147.9783215348252]
自己制御学習(SRL)は、中間表現を連続的に制御し、現在のタイムスタンプのフレームにおける新しい情報を強調する表現を作り出すことを目的としている。
SRLは2つのエゴセントリックなビデオデータセットと2つの第三者のビデオデータセットにおいて、既存の最先端技術よりも大幅に優れています。
論文 参考訳(メタデータ) (2021-11-23T03:29:18Z) - Action Localization through Continual Predictive Learning [14.582013761620738]
本稿では,自己監督のための特徴レベルの予測を用いた連続学習に基づく新しいアプローチを提案する。
我々は、CNNエンコーダと組み合わされたLSTMのスタックと、新しいアテンション機構を用いて、ビデオ内のイベントをモデル化し、このモデルを使用して将来のフレームの高レベル機能を予測する。
この自己教師型フレームワークは他のアプローチほど複雑ではないが、ラベリングとローカライゼーションの両方で堅牢な視覚表現を学ぶのに非常に効果的である。
論文 参考訳(メタデータ) (2020-03-26T23:32:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。