論文の概要: Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training
- arxiv url: http://arxiv.org/abs/2609.26420v1
- Date: Tue, 22 Sep 2026 13:49:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.671496
- Title: Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training
- Title(参考訳): ヒューマノイドのための物理---------物理--------
- Abstract要約: テキスト・トゥ・モーション・モデルは可塑性な人間の動きを生成するが、ロボットのダイナミクスをモデル化しない。
最近の言語とヒューマノイドのシステムは、このギャップを訓練によって埋める。
デプロイメントコントローラ自体をループに配置することで、トレーニングをまったく行わずに、ギャップのどれだけが閉じているかを測定します。
- 参考スコア(独自算出の注目度): 18.50911782933871
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-motion models generate plausible human motion but do not model a robot's dynamics; whole-body tracking controllers execute robot references reliably but cannot replan an infeasible one. Recent language-to-humanoid systems bridge this gap by training. We measure how much of the gap closes with no training at all, by putting the deployment controller itself in the loop. Sample-simulate-select (S$^3$) draws $N$ motions per prompt from a frozen text-to-motion model, retargets each to a Unitree G1 by direction-matching inverse kinematics, rolls all of them out under full rigid-body dynamics with the pretrained SONIC tracking policy, and keeps the candidate the policy executed best. Because the verifier is the deterministic simulator itself, S$^3$ attains the any-of-$N$ ceiling by construction; what we measure is where that ceiling lies and what falls short of it. On 200 stratified HumanML3D test prompts with $N=8$, upright execution rises from 83.5% to 89.5% and hardware-gate passes from 33 to 85; on the complete test split (4,184 prompts) it rises from 80.5% to 89.5%. A kinematic verifier that predicts falls well (AUROC 0.90) recovers only a quarter of this gain: ranking a prompt's own candidates is harder than classifying the population. What selection cannot fix is one class, prompts that lower the pelvis, which a generator trained on retargeted robot data does execute. We further score the semantic fidelity of the executed motion with the standard text-motion evaluator, with a real-mocap control that attributes the loss to the robot projection, ablate the retargeter against GMR (complementary failures: the any-of-8 ceiling rises to 95.0% over both), and execute all 177 gate-selected clips on the real G1: every one completes standing, with hardware tracking error matching simulation ($r=0.94$).
- Abstract(参考訳): テキスト・トゥ・モーション・モデルは、可塑性な人間の動作を生成するが、ロボットのダイナミクスをモデル化しない。
最近の言語とヒューマノイドのシステムは、このギャップを訓練によって埋める。
デプロイメントコントローラ自体をループに配置することで、トレーニングをまったく行わずに、ギャップのどれだけが閉じているかを測定します。
Sample-simulate-select (S$^3$) はフリーズされたテキスト・ツー・モーションモデルから1プロンプト当たり$N$のモーションを引き出し、それぞれを方向マッチングの逆運動学によってUnitree G1に再ターゲティングし、事前訓練されたSONIC追跡ポリシーでこれら全てを完全な剛体力学の下でロールアウトし、候補が実行したポリシーを最善に維持する。
検証器は決定論的シミュレータ自身であるため、S$^3$は建設によって任意の$N$天井を得る。
200の階層化されたHumanML3Dテストプロンプトは、N=8$で、アップライト実行は83.5%から89.5%に上昇し、ハードウェアゲートは33から85に通過し、完全なテストスプリット(4,184プロンプト)では80.5%から89.5%に上昇する。
AUROC 0.90) を予測するキネマティック検証器は、この利得の4分の1しか回復しない:プロンプトの候補者のランク付けは、人口を分類するよりも難しい。
選択できないものは1つのクラスであり、再ターゲティングされたロボットデータに基づいて訓練されたジェネレータが実行する骨盤を低くする。
さらに、標準的なテキストモーション評価器で実行された動作のセマンティックフィリティを、ロボットプロジェクションの損失に起因する実モード制御でスコア付けし、GMRに対する再ターゲッター(補足的障害:任意の8つの天井が95.0%まで上昇する)をアブレーションし、実際のG1上で177個のゲート選択されたクリップを全て実行し、ハードウェアトラッキングエラーマッチングシミュレーション(r=0.94$)で待機する。
関連論文リスト
- GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction [68.67772166423812]
ヒューマノイド全身制御のための行動世界モデル(BWM)であるGigaBrain-WBC-0.5を提案する。
純粋にリアクティブなトラッカーではなく、因果トランスフォーマーをトレーニングして、次のアクション、次の状態、次の潜伏動作コマンドに対する分布を共同で予測します。
自動地形アノテーションパイプラインは、再ターゲティングされた動きから完全な3D接触形状を復元し、既存の動きデータセットのスケールでの地形アノテートを可能にする。
論文 参考訳(メタデータ) (2026-08-18T18:21:36Z) - DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting [49.70827726228219]
このツールキットは、人間の手による実演のシングルビューRGBステレオ記録を、物理で検証可能なロボットアーム軌道に変換する。
DemoBridgeの中核は、衝突を意識した単一のプランナーである。
物理シミュレーターはループ内で動作し、生成した各フェーズを検証し、障害時にバックトラックするので、与えられたように再生できないデモは破棄されるのではなく、再計画される。
論文 参考訳(メタデータ) (2026-07-10T15:31:04Z) - DataLadder: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid [63.45560198934907]
ジェネラリストロボットポリシーは、信頼できる評価とロボット使用可能なトレーニングデータを必要とする。
本稿では,人間ロボットによるモデル評価とデータ生成のためのシミュレーション可能な変換ツールチェーンであるDataLadderを提案する。
JD Cloud上のクラウドサービスとして、コア再構築、シミュレーション、レンダリング、リアリズム拡張モジュールをパッケージ化します。
論文 参考訳(メタデータ) (2026-06-15T14:21:35Z) - MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation [56.976138997544005]
実世界へのゼロショット転送は可能であるが,静的操作と移動操作の両方に有効であることを示す。
MolmoBot-Dataは180万のエキスパートトラジェクトリのデータセットで、オブジェクトの操作やピック・アンド・プレイスタスクのためのものです。
本研究は,手続き型環境生成と多種多様な調音資産が組み合わさって,ロバストな操作ポリシーを創出できることを実証する。
論文 参考訳(メタデータ) (2026-03-17T17:59:03Z) - ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control [8.983091538704645]
本稿では,ヒューマノイドロボットの言語駆動型全身制御のためのエッジホスト型フレームワークECHOを提案する。
クラウドネイティブ拡散に基づくテキスト・トゥ・モーション・ジェネレータは、自然言語命令から動作参照を合成する。
エッジ展開された強化学習トラッカーは、ロボットのクローズドループでそれらを実行する。
論文 参考訳(メタデータ) (2026-03-17T07:16:18Z) - Data-Driven Autoregressive Power Prediction for GTernal Robots in the Robotarium [0.0]
マルチロボットシステムのためのエネルギー認識アルゴリズムは、正確な消費電力モデルを必要とする。
ジョージア工科大学ロボット館に配備されたGTernalモバイルロボットプラットフォームに対して,軽量な自己回帰予測器を提案する。
論文 参考訳(メタデータ) (2026-03-14T11:43:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。