論文の概要: Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer
- arxiv url: http://arxiv.org/abs/2607.28394v2
- Date: Sat, 01 Aug 2026 08:11:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.183963
- Title: Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer
- Title(参考訳): 大規模ファンデーションモデルにおける手動物体の相互作用:再構築・生成・移動
- Authors: Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen,
- Abstract要約: 本調査は,手動物体相互作用における基礎モデル-モデル先行の体系的検討である。
我々は,8つの基礎モデルサブプライヤの分類を幾何学的,意味的,視覚的ファミリーに分類する。
本研究では,人-データ事前学習,人間-ロボットのスキル伝達,HOI-to-ロボットデータ生成など,HOI由来の知識がロボット学習にどのように利用されているかを検討する。
- 参考スコア(独自算出の注目度): 55.982669669569624
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hand-object interaction (HOI) modeling remains challenging because it requires joint reasoning about hand articulation, object geometry, contact, semantics, and dynamics under severe visual uncertainty. Foundation models introduce transferable prior knowledge learned from large-scale cross-domain data, offering new ways to address these challenges beyond task-specific data and models. However, the rapidly growing literature remains fragmented, and existing studies typically describe these methods simply as ``using large models'' without systematically characterizing what knowledge is introduced, where it enters the HOI pipeline, or which HOI uncertainty it helps reduce. This survey presents the first systematic review of foundation-model priors for HOI. We organize the literature into six HOI tasks spanning reconstruction and generation. More importantly, we establish a taxonomy of eight foundation-model sub-priors grouped into geometric, semantic, and visual families. Geometric priors encompass shape retrieval, shape reconstruction, and spatial reconstruction; semantic priors include semantic grounding and language reasoning; and visual priors cover visual representation, image generation, and video generation. Based on this taxonomy, we systematically analyze how different priors are represented, injected, and adapted across HOI pipelines and tasks. Beyond how foundation models empower HOI, we further examine how HOI-derived knowledge is used in robot learning, including human-data pretraining, human-to-robot skill transfer, and HOI-to-robot data generation. Finally, we summarize datasets and evaluation protocols, and discuss limitations and future directions toward more generalizable HOI systems. To support long-term progress, we curate a live repository that continuously aggregates emerging methods and benchmarks.
- Abstract(参考訳): 手-物間相互作用(HOI)モデリングは、深刻な視覚的不確実性の下で手-物間相互作用、オブジェクト形状、接触、意味論、ダイナミクスに関する共同推論を必要とするため、依然として困難なままである。
ファンデーションモデルは、大規模なクロスドメインデータから学んだトランスファー可能な事前知識を導入し、タスク固有のデータやモデルを超えた、これらの課題に対処する新しい方法を提供する。
しかし、急速に成長する文献は断片化され続けており、既存の研究では、これらの手法を「大きなモデルを使う」と記述しており、どの知識が導入されたか、どのHOIパイプラインに入るか、どのHOIの不確実性を減らすのかを体系的に特徴づけることができない。
本調査は,HOIの基盤モデル事前の体系的検討である。
文献を再構築と生成にまたがる6つのHOIタスクに整理する。
さらに重要なことは、幾何学的、意味的、視覚的な家族に分類された8つの基礎モデルサブプライアーの分類を確立したことである。
幾何学的先行は形状検索、形状再構成、空間再構成、意味的先行は意味的接地、言語推論、視覚的先行は視覚的表現、画像生成、ビデオ生成を含む。
この分類に基づいて、HOIパイプラインやタスク間で、どのように異なるプリエントが表現され、注入され、適応されるかを体系的に分析する。
基礎モデルによってHOIが強化されるだけでなく、人-データ事前学習、人間-ロボットのスキル伝達、HOI-to-ロボットのデータ生成など、HOI由来の知識がロボット学習にどのように使われているかをさらに調べる。
最後に、データセットと評価プロトコルを要約し、より一般化可能なHOIシステムに向けた制限と今後の方向性について議論する。
長期的な進歩をサポートするため、我々は新しいメソッドやベンチマークを継続的に集約するライブリポジトリをキュレートする。
関連論文リスト
- SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations [12.185380843937196]
約1,700個の事前学習された視覚モデルから抽出した潜在表現の大規模コレクションであるSEMASIAを紹介する。
個々の潜在空間の概念的構造を解析し、一貫したプロトタイプのようなクラスタリングを示す。
プレトレーニングデータの複雑性,特殊化,伝達学習,拡張,モデルスケールが,埋め込みの幾何学的および探索的特性とどのように関係しているかを,大規模回帰分析により解析する。
論文 参考訳(メタデータ) (2026-05-10T11:42:36Z) - Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective [91.23306722968509]
汎用的なフィードフォワード3D再構築は近年急速に進展している。
既存のフィードフォワードアプローチも同様に高いレベルのアーキテクチャパターンを共有している。
本稿では,出力形式に依存しないモデル設計戦略を中心とした新しい分類法を提案する。
論文 参考訳(メタデータ) (2026-04-15T16:07:18Z) - A Survey on Generative Recommendation: Data, Model, and Tasks [55.36322811257545]
ジェネレーティブ・レコメンデーションは、差別的なスコアではなく、世代としてのレコメンデーションを再認識する。
この調査は、データ、モデル、タスク次元にまたがる統合された三部構成のフレームワークを通じて包括的な調査を提供する。
世界知識の統合、自然言語理解、推論能力、スケーリング法則、創造的生成の5つの主要な利点を特定します。
論文 参考訳(メタデータ) (2025-10-31T04:02:58Z) - A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction [21.966560704390716]
我々はジェネレーティブ・モデル・アンラーニング(GenMU)に関する最近の研究についてレビューする。
本研究では,未学習目標,方法論的戦略,評価指標を分類するための統合分析フレームワークを提案する。
実世界のアプリケーションにおける非学習技術の潜在的な実用的価値を強調した。
論文 参考訳(メタデータ) (2025-07-26T09:49:57Z) - Deep Learning For Time Series Analysis With Application On Human Motion [0.0]
この論文はディープラーニングを活用し、特徴工学による分類を強化し、基礎モデルを導入し、コンパクトで最先端のアーキテクチャを開発する。
我々の貢献は、行動認識とリハビリテーションのための人間の動作分析を含む現実世界のタスクに当てはまる。
プロトタイピングのために,データ不足時の回帰モデルを支援する形状に基づく合成サンプル生成手法を提案する。
論文 参考訳(メタデータ) (2025-02-26T18:01:51Z) - Data Augmentation in Human-Centric Vision [54.97327269866757]
本研究では,人間中心型視覚タスクにおけるデータ拡張手法の包括的分析を行う。
それは、人物のReID、人間のパーシング、人間のポーズ推定、歩行者検出など、幅広い研究領域に展開している。
我々の研究は、データ拡張手法をデータ生成とデータ摂動の2つの主なタイプに分類する。
論文 参考訳(メタデータ) (2024-03-13T16:05:18Z) - Ins-HOI: Instance Aware Human-Object Interactions Recovery [44.02128629239429]
本稿では,エンド・ツー・エンドのインスタンス・アウェアなヒューマン・オブジェクト・インタラクション・リカバリ(Ins-HOI)フレームワークを提案する。
Ins-HOIはインスタンスレベルの再構築をサポートし、合理的で現実的な接触面を提供する。
我々は、現実世界の人間-椅子と手-物体の相互作用を伴う5.2kの高品質スキャンを含む、大規模で高忠実な3Dスキャンデータセットを収集します。
論文 参考訳(メタデータ) (2023-12-15T09:30:47Z) - Foundational Models Defining a New Era in Vision: A Survey and Outlook [151.49434496615427]
視覚シーンの構成的性質を観察し、推論する視覚システムは、我々の世界を理解するのに不可欠である。
モデルは、このようなモダリティと大規模なトレーニングデータとのギャップを埋めることを学び、コンテキスト推論、一般化、テスト時の迅速な機能を容易にした。
このようなモデルの出力は、例えば、バウンディングボックスを設けて特定のオブジェクトをセグメント化したり、画像や映像シーンについて質問したり、言語命令でロボットの動作を操作することで対話的な対話を行うなど、リトレーニングすることなく、人為的なプロンプトによって変更することができる。
論文 参考訳(メタデータ) (2023-07-25T17:59:18Z) - Geometric Deep Learning for Structure-Based Drug Design: A Survey [83.87489798671155]
構造に基づく薬物設計(SBDD)は、タンパク質の3次元幾何学を利用して、潜在的な薬物候補を特定する。
近年の幾何学的深層学習の進歩は、3次元幾何学的データを効果的に統合・処理し、この分野を前進させてきた。
論文 参考訳(メタデータ) (2023-06-20T14:21:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。