論文の概要: A Benchmark for Spatially Grounded Gesture Generation
- arxiv url: http://arxiv.org/abs/2610.03105v1
- Date: Fri, 02 Oct 2026 10:26:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.325646
- Title: A Benchmark for Spatially Grounded Gesture Generation
- Title(参考訳): 空間接地ジェスチャ生成のためのベンチマーク
- Abstract要約: 自然主義的VR対話から2Kのポインティング注釈付きクリップと接地型3Dレファレントを含む空間的接地ジェスチャ生成のためのベンチマークを導入する。
幾何学的接地は、知覚された自然性に何の利益も与えずに、人間の指しているものを超えることができる。
- 参考スコア(独自算出の注目度): 13.058420410053918
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Communication in shared space interweaves verbal and non-verbal signals, and pointing gestures anchor language to the environment: "put the cup on that one" is uninterpretable without the gesture that fixes the referent. Yet no common framework exists for evaluating whether generated gestures indicate their intended referent; distributional metrics reward a gesture aimed at the wrong object as long as it looks natural. We introduce a benchmark for spatially grounded gesture generation, comprising ~2K pointing-annotated clips from naturalistic VR dialogue with ground-truth 3D referents, a task in which systems must decide when, how and where to point within conversational speech, and a protocol that separates temporal alignment, spatial grounding and perceived naturalness. We also provide a flow-matching baseline, MM-Conv-Flow. Evaluating it alongside an independent retrieval-based system and captured human motion, we find that geometric grounding can exceed that of human pointing without any gain in perceived naturalness, showing that referential gesture quality must be measured along separate dimensions.
- Abstract(参考訳): 共有空間におけるコミュニケーションは、言語的信号と非言語的信号とを織り交ぜ、ジェスチャーを環境にアンカーする:「その空間にカップを置く」は、参照を固定するジェスチャーなしでは解釈できない。
しかし、生成したジェスチャーが意図した参照を示すかどうかを評価するための一般的なフレームワークは存在しない。
本稿では,3D参照者による自然主義的VR対話からの2Kのポインティング・アノテート・クリップと,対話音声の時間・場所・場所を判断するタスクと,時間的アライメント,空間的グラウンドニング,知覚自然さを分離するプロトコルとを,空間的グラウンド生成のためのベンチマークとして紹介する。
また,フローマッチングベースラインであるMM-Conv-Flowも提供する。
独立検索ベースシステムと協調して評価し,人体の動きを捉えた幾何学的接地が,自然性の獲得を伴わずに人間の指先を上回り,参照ジェスチャーの質を異なる次元で測定する必要があることを示す。
関連論文リスト
- Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models [22.823647299309712]
具体的タスクにおける言語命令に対する推論は、しばしば話者の位置から見た空間的関係を理解する必要がある。
近年の視覚言語モデル(VLM)は空間的推論が可能であるように見えるが、文脈的手がかりから話者の視点を推測する能力はいまだに不明である。
論文 参考訳(メタデータ) (2026-09-07T00:00:13Z) - Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation [1.7583726083221285]
姿勢認識型オブジェクト指向音声合成拡散モデルであるPuppeteerを提案する。
Puppeteerは従来の方法よりも多様で時間的に同期されたジェスチャーを生成する。
論文 参考訳(メタデータ) (2026-08-31T21:02:54Z) - Recognizing Co-Speech Gestures in-the-Wild [52.804383193630166]
GRW(Gesture Recognition in the Wild)データセットは156,688本のビデオクリップを手動でアノテートする。
GRWは、物理的行動、空間記述子、抽象概念の非常に多様な150ワードの分類である。
我々はGRWを利用してビデオモデルを訓練し、ジェスチャーを意味的か否かを分類し、(b)共同音声のジェスチャーに対応する単語を認識し、(c)ジェスチャーを時間的に局所化する。
論文 参考訳(メタデータ) (2026-05-29T17:55:17Z) - SECOND-Grasp: Semantic Contact-guided Dexterous Grasping [60.1519218638742]
Second-Grasp (Semantic Contact-guided Dexterous Grasping) は、ロボットハンドが意味論的推論に基づいて把握戦略を調整できる統合されたフレームワークである。
我々のアプローチは、目に見えるカテゴリーと目に見えないカテゴリの両方で成功率を上げるために、一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-13T07:37:00Z) - AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis [50.793806818677716]
AffordGraspは、物理的に安定し、セマンティックに忠実な人間の握りを高精度に生成する。
AffordGraspは、手ポーズの空きを意識した潜在表現を二重条件拡散プロセスに統合する。
AffordGraspはHO-3D, OakInk, GRAB, AffordPoseの4つの命令強化ベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-09T06:56:35Z) - SARAH: Spatially Aware Real-time Agentic Humans [58.32612596034656]
ストリーミングVRヘッドセット上に展開可能な空間認識型対話動作のための,初のリアルタイム完全因果的手法を提案する。
ユーザの位置とダイアディックな音声を考慮に入れたアプローチでは,エージェントの向きをユーザに応じて調整しながら,ジェスチャーを音声と整列させる全体動作を生成する。
実写VRシステムに対する我々のアプローチを検証し,空間認識型対話エージェントをリアルタイム展開に適用する。
論文 参考訳(メタデータ) (2026-02-20T18:59:35Z) - From Prompts to Worlds: How Users Iterate, Explore, and Make Sense of AI-Generated 3D Environments [0.0]
商業用テキスト・ツー・3Dプラットフォームの最初の実証的研究について述べる。
我々は、思考情報プロトコル、行動観察、およびユーザビリティ、プレゼンス、エンゲージメントの検証された尺度を組み合わせる。
効果的なシステムには、ハイブリッドな入力モダリティ、透過的なフィードバック、低コストなイテレーションが必要です。
論文 参考訳(メタデータ) (2026-01-24T06:10:02Z) - SemGes: Semantics-aware Co-Speech Gesture Generation using Semantic Coherence and Relevance Learning [0.6249768559720122]
共同音声ジェスチャ生成における意味的接地のための新しい手法を提案する。
我々のアプローチは、ベクトル量子化された変分オートエンコーダによって、前もって動きを学習することから始まる。
提案手法は,2つのベンチマークにおいて,音声合成における最先端手法よりも優れる。
論文 参考訳(メタデータ) (2025-07-25T15:10:15Z) - Grounded Gesture Generation: Language, Motion, and Space [3.4973270688542626]
グラウンドドジェスチャ生成のためのマルチモーダルデータセットとフレームワークを提案する。
我々はHumanML3Dフォーマットで標準化された7.7時間以上の同期動作、音声、および3Dシーン情報を提供する。
我々の貢献は、位置決めジェスチャ生成と接地されたマルチモーダル相互作用の研究を促進する基盤を確立する。
論文 参考訳(メタデータ) (2025-07-06T20:19:34Z) - HumanGPS: Geodesic PreServing Feature for Dense Human Correspondences [60.89437526374286]
先行芸術はフレーム間の小さな動きを仮定するか、または大きな動きや視覚的に曖昧な身体部分を扱うことができないローカル記述子に依存します。
本稿では,各画素を特徴空間にマッピングし,特徴距離が画素間の測地距離を反映する深層学習フレームワークを提案する。
セマンティックアノテーションがなければ、提案する埋め込みは自動的に学習し、視覚的に類似した部分を区別し、異なる主題を統一された機能空間にまとめる。
論文 参考訳(メタデータ) (2021-03-29T12:43:44Z) - SIRI: Spatial Relation Induced Network For Spatial Description
Resolution [64.38872296406211]
言語誘導型ローカライゼーションのための新しい関係誘導型ネットワーク(SIRI)を提案する。
提案手法は,80ピクセルの半径で測定した精度で,最先端手法よりも約24%優れていた。
提案手法は,Touchdownと同じ設定で収集した拡張データセットをうまく一般化する。
論文 参考訳(メタデータ) (2020-10-27T14:04:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。