論文の概要: From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation
- arxiv url: http://arxiv.org/abs/2607.17769v1
- Date: Mon, 20 Jul 2026 10:02:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.583412
- Title: From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation
- Title(参考訳): 手話生成からヒューマノイド実行へ:衝突緩和による視覚言語指導
- Authors: Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai,
- Abstract要約: 本稿では,SLG出力を2つのコンポーネントを介してヒューマノイド共同実行にブリッジするシステムを提案する。
まず, SMPL-X衝突軽減モジュールについて述べる。
第2に、IKバックボーン上に構築された視覚誘導アルゴリズム、VLMは、レンダリングされたヒューマノイド運動に対する視覚的批判として機能する。
- 参考スコア(独自算出の注目度): 7.380614531414397
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent sign language generation (SLG) systems increasingly output dense 3D body representations, which better preserve full-body kinematics and geometry for downstream embodiment on humanoid robots. However, these generated motions frequently exhibit self-intersections such as hand-hand and hand-torso penetration. While such artifacts may be tolerated in offline rendering, they become critical in humanoid execution as they lead to infeasible inverse-kinematics (IK) solutions, collisions, and unstable retargeted trajectories. We present a system-level framework that bridges SLG outputs to humanoid joint-space execution via two components. First, we introduce a volumetric SMPL-X collision-mitigation module that projects generated signing motions toward physically plausible configurations while minimally deviating from the original trajectory. Second, we propose a vision-language-guided retargeting algorithm built on an IK backbone: a VLM serves as a visual critic over rendered humanoid motion, identifies embodiment-specific failure modes, and triggers targeted task-space corrections. Our results highlight collision handling and perception-guided refinement as key missing components for reliable humanoid signing.
- Abstract(参考訳): 近年の手話生成 (SLG) システムでは, 人型ロボットの下流環境において, 全身運動学や形状をよりよく保存する高密度な3次元体表現を出力するようになっている。
しかし、これら生成された動きは、手指や手指の貫入などの自己断面積を頻繁に示している。
このようなアーティファクトはオフラインレンダリングでは許容されるかもしれないが、不実現不可能な逆キネマティクス(IK)ソリューション、衝突、不安定な再ターゲット軌道へと導くため、ヒューマノイドの実行において重要なものとなる。
本稿では,SLG出力を2つのコンポーネントを介してヒューマノイド共同実行にブリッジするシステムレベルフレームワークを提案する。
まず,元の軌道から最小に逸脱しながら,物理的に可算な構成に対して署名動作を発生させるSMPL-X衝突軽減モジュールを提案する。
第2に、IKバックボーン上に構築された視覚言語誘導型リターゲティングアルゴリズムを提案する。VLMは、レンダリングされたヒューマノイド運動に対する視覚的批判として機能し、実施形態固有の障害モードを特定し、目標のタスク空間修正をトリガーする。
以上の結果から, 衝突処理と認識誘導による改善が, 信頼性の高いヒューマノイド署名の鍵を欠く要素として注目された。
関連論文リスト
- DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction [50.06148080975928]
本稿では,意味的意図を幾何学的制約から明確に分離する階層型フレームワークであるDeSeGを提案する。
DeSeGは最先端のパフォーマンスを実現し、平均シーン浸透率を47%削減し、SOTAベースラインに対するセマンティックアライメントを29%改善した。
論文 参考訳(メタデータ) (2026-07-07T03:21:08Z) - Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors [51.096845970243855]
高忠実度3Dデータの不足により,全体Humanoid-Object Interaction (HOI) がボトルネックとなる。
本研究では,ゼロショットHOIフレームワークであるImagine2Realを提案する。
論文 参考訳(メタデータ) (2026-05-21T10:15:39Z) - LACE: Latent Visual Representation for Cross-Embodiment Learning [36.1587655731958]
人間の実演から学ぶことは、人間とロボットの体格の視覚的ギャップによって妨げられる。
自己教師型学習バックボーンの潜在空間における人間とロボットの視覚表現を協調するフレームワークであるLACEを提案する。
論文 参考訳(メタデータ) (2026-05-16T01:50:18Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation [23.19464039872024]
FlowHOIは、時間的にコヒーレントなHOIシーケンスを生成するフローマッチングフレームワークである。
本研究では,FlowHOIが最も高い動作認識精度と1.7$times$高い物理シミュレーション成功率を達成することを示す。
論文 参考訳(メタデータ) (2026-02-13T20:46:08Z) - IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes [25.939318593012484]
動的駆動シーンの再構築は、センサ・リアリスティック・シミュレーションによる自律システム開発に不可欠である。
我々は,動的シーンを明示的なインスタンス分解と学習可能なモーショントラジェクトリで再構成する,自己教師型3次元ガウススティングフレームワークIDSplatを提案する。
本手法は, インスタンスレベルの分解を維持しつつ, 競合する再構成品質を実現し, 再トレーニングを伴わずに, 多様なシーケンスやビュー密度を一般化する。
論文 参考訳(メタデータ) (2025-11-24T15:48:08Z) - COPILOT: Human-Environment Collision Prediction and Localization from
Egocentric Videos [62.34712951567793]
エゴセントリックな観測から人間と環境の衝突を予測する能力は、VR、AR、ウェアラブルアシストロボットなどのアプリケーションにおける衝突回避を可能にするために不可欠である。
本稿では、ボディマウントカメラから撮影した多視点エゴセントリックビデオから、多様な環境における衝突を予測するという課題を紹介する。
衝突予測と局所化を同時に行うために,COPILOTと呼ばれるトランスフォーマーモデルを提案する。
論文 参考訳(メタデータ) (2022-10-04T17:49:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。