論文の概要: Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control
- arxiv url: http://arxiv.org/abs/2607.04837v1
- Date: Mon, 06 Jul 2026 09:10:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.100039
- Title: Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control
- Title(参考訳): Athena-WBC:長軸ヒューマノイド全体制御のための機能アライメントポリシーエキスパート
- Authors: Yuan Jiang, Ningyuan Zhang, Xicun Yang, Shidi Li, Yuzhi Jiang, Zhiyi Rong, Shuaikang Ma, Chuanzheng Li, Jie Chen,
- Abstract要約: 本研究は, 目標訓練下においても, 既存の訓練クリップは未解決のままであることを示す。
Athena-WBCは,長身ヒューマノイド全体制御のための機能整合型政策エキスパートを備えた,コンパクトな教師学生パイプラインである。
- 参考スコア(独自算出の注目度): 9.295580187093092
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-scale humanoid motion-tracking controllers are commonly improved by reallocating training effort: difficult motions are sampled more often, isolated into smaller subsets, or assigned to specialized experts. We show that this view is incomplete. In strong whole-body-control baselines, a residual set of feasible training clips remains unsolved even under targeted training, especially for high-dynamic transitions and balance-critical motions. These failures arise not only from insufficient exposure, but from a mismatch between the motion demands and the effective capability induced by the default training recipe. We propose Athena-WBC, a compact teacher-student pipeline with capability-aligned policy experts for long-tail humanoid whole-body control. Dynamic experts use a tracking-focused, constraint-aware objective that removes conservative effort and temporal-control penalties while preserving physical feasibility constraints; balance experts use a gravity curriculum to improve early-training survivability. The resulting privileged teachers are motion-routed for DAgger distillation and then compressed into a single controller with deployable observations followed by RL fine-tuning. Experiments on a full-size humanoid show improved recovery of training-set long-tail motions and better held-out tracking than a strong SONIC-recipe baseline, using only a small number of experts.
- Abstract(参考訳): 大規模なヒューマノイドモーショントラッキングコントローラはトレーニングの実施によって一般的に改善され、難しい動きはより頻繁にサンプリングされ、より小さなサブセットに分離されるか、専門の専門家に割り当てられる。
私たちはこの見解が不完全であることを示す。
強い全身制御ベースラインでは、特にハイダイナミック・トランジションやバランスクリティカル・モーションにおいて、標的トレーニングの下でも、持続可能なトレーニングクリップは未解決のままである。
これらの障害は、被曝が不十分であるだけでなく、運動要求とデフォルトのトレーニングレシピによって引き起こされる効果的な能力とのミスマッチから生じる。
Athena-WBCは,長身ヒューマノイド全体制御のための機能整合型政策エキスパートを備えた,コンパクトな教師学生パイプラインである。
動的専門家は、身体的可能性の制約を保ちながら、保守的な努力と時間的制御のペナルティを排除し、追跡に重点を置き、バランス専門家は、早期訓練の生存性を改善するために重力学カリキュラムを使用する。
得られた特権教師はDAgger蒸留のために動作禁止され、単一のコントローラに圧縮され、デプロイ可能な観察とRL微調整が行われる。
フルサイズのヒューマノイドの実験では、少数の専門家しか使用せず、トレーニングセットの長い尾の動きの回復を改善し、強力なSONICレシピベースラインよりもホールドアウトトラッキングが改善された。
関連論文リスト
- PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents [57.69188221227875]
マルチターンツール利用エージェントのためのPrivileged trAce Co-Trainingフレームワークを提案する。
キーとなる考え方は、専門家のトレースをロールアウト時間ヒントではなく、トレーニング時の最適化信号としてのみ使用することだ。
PACT は強い SFT および RL ベースのベースラインよりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-15T04:46:23Z) - Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning [22.981851203999614]
LoRA-MoEはパラメータ効率の良い微調整のための効果的なパラダイムとして登場した。
既存のLoRA-MoEフレームワークは通常、下流モジュールにまたがる固定かつ均一なトランスフォーマーを採用する。
本稿では,動的モジュールワイド・エキスパート・プルーニングに基づくLoRA-MoEファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T06:45:44Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Force-Aware Residual DAgger via Trajectory Editing for Precision Insertion with Impedance Control [7.670131142516991]
TER-DAggerは、コンタクトリッチな操作のための力覚的模倣学習フレームワークである。
実験により、TER-DAggerは行動クローニング、ヒト誘導補正、リトレーニング、微調整ベースラインと比較して平均成功率を37%以上改善することが示された。
論文 参考訳(メタデータ) (2026-03-04T13:18:05Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - General Humanoid Whole-Body Control via Pretraining and Fast Adaptation [36.02965821695238]
本稿では,FAST(Fast Adaptation and Staable Motion Tracking)とFAST(Fast Adaptation and Staable Motion Tracking)を併用した汎用ヒューマノイド全身制御フレームワーク)を提案する。
FASTはParseval-Guided Residual Policy AdaptationとCenter-of-Mass-Aware Controlを導入した。
シミュレーションと実世界の展開の実験では、FASTはロバスト性、適応効率、一般化において、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-12T13:26:22Z) - Walk the PLANC: Physics-Guided RL for Agile Humanoid Locomotion on Constrained Footholds [20.44610499489492]
二足歩行ロボットは、制約された足場に移動する際にバランス、タイミング、接触決定を調整する必要がある。
本稿では,低次ステッピングプランナが動的に一貫した運動目標を供給できるロコモーションフレームワークを提案する。
この構造化されたステップ計画とデータ駆動型適応の組み合わせは、ヒューマノイドロボット上で正確で、アジャイルで、ハードウェアで検証されたステップストーンの移動を生み出す。
論文 参考訳(メタデータ) (2026-01-09T19:56:42Z) - Co-Supervised Learning: Improving Weak-to-Strong Generalization with
Hierarchical Mixture of Experts [81.37287967870589]
我々は,一貫した生徒を統括する,一貫した一貫した教師ではなく,多様な専門教師の集合を活用することを提案する。
我々のアプローチは、古典的な階層的な専門家の混合に似ている。
提案手法は,OpenAIの弱強ベンチマークと追加のマルチドメインデータセットを用いて,視覚認識タスクにより検証する。
論文 参考訳(メタデータ) (2024-02-23T18:56:11Z) - Sparse MoE as the New Dropout: Scaling Dense and Self-Slimmable
Transformers [107.3726071306935]
そこで我々は,SMoE-Dropoutというプラグイン・アンド・プレイ・トレーニング・フレームワークを提案する。
SMoE-Dropoutはランダムで固定されたルータネットワークで構成され、エキスパートを活性化し、トレーニングが進むにつれて、アクティベートされたエキスパート数を徐々に増加させる。
本実験では,SMoE-Dropout の高密度トレーニングベースラインと等価パラメータ数との比較により,SMoE-Dropout の優れた性能と計算精度を実証した。
論文 参考訳(メタデータ) (2023-03-02T22:12:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。