論文の概要: Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?
- arxiv url: http://arxiv.org/abs/2607.08514v1
- Date: Thu, 09 Jul 2026 14:09:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.559279
- Title: Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?
- Title(参考訳): Egocentric Video-Language Models can Capture both Hand- and Object-Centric Cues?
- Abstract要約: ハンドオブジェクトインタラクション(HOI)の認識には、手操作とオブジェクト変換の両方をキャプチャする必要がある。
本稿では,手動マスクトレーニングとHOI動的認識デコーダを組み合わせた新しい学習パラダイムを提案する。
我々のトレーニング戦略は、既存のモデルよりも手書きやオブジェクト中心の情報を効果的に活用することを示します。
- 参考スコア(独自算出の注目度): 75.43540911934191
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hand-object interaction (HOI) recognition requires capturing both hand manipulations and object transformations. However, existing video-language models often fall into shortcuts by relying on spurious correlations among hands, objects, or environmental context, rather than reasoning from the appearance and dynamics of hands and objects themselves. To address this limitation, we propose a new learning paradigm that combines (i) hand-object masked training, which enables robust reasoning from partial hand or object observations, and (ii) an HOI-dynamics-aware decoder that explicitly learns hand- and object-centric embeddings through auxiliary predictions of their locations and semantics, enhancing sensitivity to both cues. To systematically evaluate such cue-specific reasoning, we introduce Cue-Isolated HOI (CI-HOI), a new evaluation that assesses models' ability to predict actions from hand- and object-related cues independently. To enable CI-HOI, we curate the DEHOI testbed, which separates hand- and object-related observations for disentangled HOI evaluation through inpainting. Using DEHOI, we demonstrate both quantitatively and qualitatively that our training strategy exploits hand- and object-centric information more effectively than existing models. Our approach improves over existing models on DEHOI, standard action recognition, object state recognition, and even robot manipulation action recognition, leading to more robust HOI understanding.
- Abstract(参考訳): ハンドオブジェクトインタラクション(HOI)の認識には、手操作とオブジェクト変換の両方をキャプチャする必要がある。
しかし、既存のビデオ言語モデルは、手やオブジェクト自体の外観やダイナミクスからではなく、手やオブジェクト、環境コンテキスト間の急激な相関に頼って、ショートカットに陥ることが多い。
この制限に対処するため,我々は新しい学習パラダイムを提案する。
一 部分的な手や物体の観察から頑健な推論を可能にする手物仮面訓練
(II) 位置や意味の補助的予測を通じて手動およびオブジェクト中心の埋め込みを明示的に学習し、両方の手がかりに対する感度を高めるHOI動的認識デコーダ。
このようなキュー固有の推論を体系的に評価するために,手動およびオブジェクト関連キューからモデルが行動を予測する能力を独立に評価するCue-Isolated HOI(CI-HOI)を導入する。
CI-HOIを有効にするために,手・物体関係の観察を分離したDEHOIテストベッドを塗布により評価する。
DEHOIを用いて、我々のトレーニング戦略が既存のモデルよりも手書きやオブジェクト中心の情報を効果的に活用できることを定量的かつ定性的に実証する。
我々のアプローチは、DEHOI、標準アクション認識、オブジェクト状態認識、さらにはロボット操作アクション認識といった既存のモデルよりも改善され、より堅牢なHOI理解につながる。
関連論文リスト
- Generalized Hand-Object Pose Estimation with Occlusion Awareness [87.10073091219066]
1枚のRGB画像から一般的な3次元手動ポーズ推定は、物体の外観や相互作用パターンに大きな変化があるため、依然として困難である。
我々は,オクルージョン認識を用いた汎用的手動ポーズ推定フレームワークであるGenHOIを提案する。
論文 参考訳(メタデータ) (2026-03-19T15:19:23Z) - UniHOPE: A Unified Approach for Hand-Only and Hand-Object Pose Estimation [82.93208597526503]
既存のメソッドは、オブジェクトと対話する素手または手に焦点を当てて、特殊化されている。
他のシナリオに適用しても、どちらのメソッドも柔軟にシナリオとパフォーマンスの低下を処理できません。
汎用的な3次元手動ポーズ推定のための統一的なアプローチであるUniHOPEを提案する。
論文 参考訳(メタデータ) (2025-03-17T15:46:43Z) - Collaborative Learning for 3D Hand-Object Reconstruction and Compositional Action Recognition from Egocentric RGB Videos Using Superquadrics [31.819336585007104]
境界ボックスに対する3次元オブジェクト表現の代替としてスーパークワッドリックを活用することを提案する。
テンプレートレスオブジェクト再構成とアクション認識の両タスクで有効性を示す。
また,動詞と名詞の訓練組み合わせがテスト分割と重複しない,より困難な課題を考慮し,行動の構成性についても検討した。
論文 参考訳(メタデータ) (2025-01-13T07:26:05Z) - CaRe-Ego: Contact-aware Relationship Modeling for Egocentric Interactive Hand-object Segmentation [14.765419467710812]
エゴセントリック・インタラクティブ・ハンドオブジェクト・セグメンテーション(EgoIHOS)は補助システムにおける人間の行動を理解する上で重要である。
従来の手法では、視覚的特徴のみに基づいて、手とオブジェクトの相互作用を別個の意味圏として認識していた。
本稿では,2つの側面から手と物体の接触を強調するCaRe-Egoを提案する。
論文 参考訳(メタデータ) (2024-07-08T03:17:10Z) - H-SAUR: Hypothesize, Simulate, Act, Update, and Repeat for Understanding
Object Articulations from Interactions [62.510951695174604]
The Hypothesize, Simulate, Act, Update, and Repeat (H-SAUR) is a probabilistic generative framework that generated hypotheses about objects articulate given input observed。
提案手法は,現在最先端のオブジェクト操作フレームワークよりも優れていることを示す。
我々は、学習に基づく視覚モデルから学習前の学習を統合することにより、H-SAURのテスト時間効率をさらに向上する。
論文 参考訳(メタデータ) (2022-10-22T18:39:33Z) - SOS! Self-supervised Learning Over Sets Of Handled Objects In Egocentric
Action Recognition [35.4163266882568]
本稿では,SOS(Self-Supervised Learning Over Sets)を導入し,OIC(ジェネリック・オブジェクト・イン・コンタクト)表現モデルを事前学習する。
OICは複数の最先端ビデオ分類モデルの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2022-04-10T23:27:19Z) - Skeleton-Based Mutually Assisted Interacted Object Localization and
Human Action Recognition [111.87412719773889]
本研究では,骨格データに基づく「相互作用対象の局所化」と「人間の行動認識」のための共同学習フレームワークを提案する。
本手法は,人間の行動認識のための最先端の手法を用いて,最高の,あるいは競争的な性能を実現する。
論文 参考訳(メタデータ) (2021-10-28T10:09:34Z) - Dynamic Modeling of Hand-Object Interactions via Tactile Sensing [133.52375730875696]
本研究では,高分解能な触覚グローブを用いて,多種多様な物体に対して4種類のインタラクティブな動作を行う。
我々は,クロスモーダル学習フレームワーク上にモデルを構築し,視覚処理パイプラインを用いてラベルを生成し,触覚モデルを監督する。
この研究は、高密度触覚センシングによる手動物体相互作用における動的モデリングの一歩を踏み出す。
論文 参考訳(メタデータ) (2021-09-09T16:04:14Z) - Zero-Shot Human-Object Interaction Recognition via Affordance Graphs [3.867143522757309]
ゼロショットヒューマンオブジェクトインタラクション認識のための新しいアプローチを提案する。
提案手法では,画像コンテンツ以外の知識をグラフ形式で活用する。
提案手法をいくつかのデータセットで評価し,現状よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-09-02T13:14:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。