論文の概要: STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition
- arxiv url: http://arxiv.org/abs/2607.17342v1
- Date: Sun, 19 Jul 2026 17:05:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.433101
- Title: STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition
- Title(参考訳): STAR:対話認識のための骨格的トークンアライメントと再配置
- Abstract要約: 人間のロボットと人間のインタラクション認識のための骨格トークンアライメントとアライメントを提案する。
対話特有のスケルトンの特徴を学習し、共有潜在空間でスケルトンとRGBビデオを調整することで視覚的手がかりを使ってそれらを豊かにする。
- 参考スコア(独自算出の注目度): 48.08498963511738
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding physical human-robot and human-human interactions is a challenging yet emerging topic in 3D vision. While most existing methods rely on skeleton sequences--effective in low-light and privacy-sensitive environment--they face two major challenges: 1) learning and effectively exploiting interaction cues from skeletal data, and 2) compensating for the lack of visual information absent in skeletons alone. To address these challenges, we propose skeletal token alignment and rearrangement (STAR) for human-robot and human-human interaction recognition. It learns interaction-specific skeleton features and enriches them using visual cues by aligning skeleton and RGB video representations in a shared latent space. Specifically, STAR consists of three key components. First, we design a skeleton encoder that captures fine-grained interdependencies using Entity Rearrangement (ER) and Interactive Spatiotemporal Tokens (ISTs). Second, we present Visual Interaction Encoding that introduces a Focus on Interactions (FoI) strategy to attend to spatiotemporal regions relevant to interactions in RGB videos. Finally, these representations are aligned via a contrastive learning objective, with a refinement head further refines predictions. During training, STAR leverages both skeleton and RGB video data to learn robust, discriminative interaction representations. At inference time, it operates on skeletons alone, retaining visual-informed benefits while preserving skeleton-only efficiency. Extensive experiments on Chico, HARPER, NTU Mutual 11 and 26 datasets consistently validate our approach by demonstrating superior performance over state-of-the-art methods. Our code is publicly available at https://github.com/Necolizer/STAR.
- Abstract(参考訳): 物理的ロボットと人間と人間の相互作用を理解することは、3Dビジョンにおいて挑戦的だが新たなトピックである。
既存のほとんどの方法はスケルトン配列に依存しているが、低照度でプライバシーに敏感な環境では有効である。
1)骨格データからインタラクションキューを学習し、効果的に活用すること。
2) 骨格のみに欠落する視覚情報の欠如を補うこと。
これらの課題に対処するために,人間のロボットと人間のインタラクション認識のための骨格トークンアライメントとアライメント(STAR)を提案する。
対話特有のスケルトンの特徴を学習し、共有潜在空間内でスケルトンとRGBビデオの表現を調整することで視覚的手がかりを用いてそれらを強化する。
具体的には、STARは3つのキーコンポーネントから構成される。
まず、Entity Rearrangement (ER) とInteractive Spatiotemporal Tokens (IST) を用いて微粒な相互依存性をキャプチャするスケルトンエンコーダを設計する。
第2に、RGBビデオにおけるインタラクションに関連する時空間への参加のためのFoI戦略を導入するビジュアルインタラクションエンコーディングを提案する。
最後に、これらの表現は対照的な学習目標を通じて整列され、洗練ヘッドは予測をさらに洗練する。
トレーニング中、STARはスケルトンとRGBのビデオデータを利用して、堅牢で差別的なインタラクション表現を学ぶ。
推測時、骨格のみに作用し、骨格のみの効率を維持しながら視覚的インフォームドの利点を維持する。
Chico、HARPER、NTU Mutual 11、26データセットの大規模な実験は、最先端の手法よりも優れた性能を示すことによって、我々のアプローチを一貫して検証している。
私たちのコードはhttps://github.com/Necolizer/STAR.comで公開されています。
関連論文リスト
- Towards Universal Skeleton-Based Action Recognition [26.447920160010515]
本研究は,開語彙を用いたヘテロジニアス骨格に基づく行動認識の問題を研究する。
本稿では, 骨格の統一表現, 骨格の移動エンコーダ, 多粒な動きテキストアライメントの3つの重要な構成要素からなるトランスフォーマーモデルを提案する。
ヘテロジニアス骨格データを用いた一般的なベンチマーク実験では,提案手法の有効性と性能が実証された。
論文 参考訳(メタデータ) (2026-04-18T14:50:46Z) - Streamlined Open-Vocabulary Human-Object Interaction Detection [25.77244663483414]
オープン・ボキャブラリ・ヒューマン・オブジェクト・インタラクション(HOI)検出は、画像内のすべてのヒューマン・オブジェクト・インタラクションをローカライズし、認識することを目的としている。
既存のアプローチは、通常、従来のHOI検出器とVLM(Vision-Language Model)の協調に頼っている。
本稿では,強力なDINOv3モデルのみをベースとした,ストリームLined Open-vocabulary HOI 検出フレームワーク SL-HOI を紹介する。
論文 参考訳(メタデータ) (2026-03-29T03:31:56Z) - Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning [20.34477942813382]
スケルトンに基づく行動表現学習は、骨格配列を符号化することで人間の行動を理解し理解することを目的としている。
クロスモーダル・コントラッシブ・ラーニングに基づく新しいスケルトンベースのトレーニング・フレームワークを提案する。
提案手法は,従来の手法より優れ,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-05-31T03:40:15Z) - SkeleTR: Towrads Skeleton-based Action Recognition in the Wild [86.03082891242698]
SkeleTRは骨格に基づく行動認識のための新しいフレームワークである。
まず、グラフ畳み込みによる各骨格配列の人体内骨格力学をモデル化する。
次に、スタック化されたTransformerエンコーダを使用して、一般的なシナリオにおけるアクション認識に重要な人物のインタラクションをキャプチャする。
論文 参考訳(メタデータ) (2023-09-20T16:22:33Z) - Learning by Aligning 2D Skeleton Sequences and Multi-Modality Fusion [8.153034573979856]
本稿では,人間の行動理解作業の微粒化に有用な,自己監督型時間的ビデオアライメントフレームワークを提案する。
3Dスケルトン座標の配列を入力として直接取り込む最先端の手法であるCASAとは対照的に、我々のキーアイデアは2Dスケルトン熱マップのシーケンスを入力として使用することである。
論文 参考訳(メタデータ) (2023-05-31T01:16:08Z) - ScanERU: Interactive 3D Visual Grounding based on Embodied Reference
Understanding [67.21613160846299]
Embodied Reference Understanding (ERU) はこの懸念に対して最初に設計されている。
ScanERUと呼ばれる新しいデータセットは、このアイデアの有効性を評価するために構築されている。
論文 参考訳(メタデータ) (2023-03-23T11:36:14Z) - Joint-bone Fusion Graph Convolutional Network for Semi-supervised
Skeleton Action Recognition [65.78703941973183]
本稿では,CD-JBF-GCNをエンコーダとし,ポーズ予測ヘッドをデコーダとして使用する新しい相関駆動型ジョイントボーン・フュージョングラフ畳み込みネットワークを提案する。
具体的には、CD-JBF-GCは、関節ストリームと骨ストリームの間の運動伝達を探索することができる。
自己教師型トレーニング段階におけるポーズ予測に基づくオートエンコーダにより、未ラベルデータから動作表現を学習することができる。
論文 参考訳(メタデータ) (2022-02-08T16:03:15Z) - Skeleton-Based Mutually Assisted Interacted Object Localization and
Human Action Recognition [111.87412719773889]
本研究では,骨格データに基づく「相互作用対象の局所化」と「人間の行動認識」のための共同学習フレームワークを提案する。
本手法は,人間の行動認識のための最先端の手法を用いて,最高の,あるいは競争的な性能を実現する。
論文 参考訳(メタデータ) (2021-10-28T10:09:34Z) - Skeleton-Contrastive 3D Action Representation Learning [35.06361753065124]
本稿では,骨格に基づく行動認識に適した特徴空間の自己教師型学習を目指す。
提案手法は,PKUデータセットとNTUデータセットのスケルトンデータからの自己教師付き学習における最先端性能を実現する。
論文 参考訳(メタデータ) (2021-08-08T14:44:59Z) - A Self-Supervised Gait Encoding Approach with Locality-Awareness for 3D
Skeleton Based Person Re-Identification [65.18004601366066]
3Dスケルトン配列内の歩行特徴による人物再識別(Re-ID)は、いくつかの利点を持つ新しい話題である。
本稿では、ラベルのない骨格データを利用して人物の歩行表現を学習できる自己教師付き歩行符号化手法を提案する。
論文 参考訳(メタデータ) (2020-09-05T16:06:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。