論文の概要: Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion
- arxiv url: http://arxiv.org/abs/2606.00637v1
- Date: Sat, 30 May 2026 09:23:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 15:10:24.322481
- Title: Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion
- Title(参考訳): ヒューマノイド知覚ロコモーションにおけるテランの符号化のためのグローバルローカルアテンション分解
- Abstract要約: 人型移動における地形符号化のためのグローバルローカルアテンション分解(GLAD)を提案する。
実験により、GLADは難解な隙間、石段、階段上での信頼性の高い移動を可能にすることが示された。
実世界におけるLiDARを用いたUnitree G1ヒューマノイドロボットの展開において,提案手法はロバストなゼロショット・シム・トゥ・リアルトランスファーを実現する。
- 参考スコア(独自算出の注目度): 7.888727249239356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although reinforcement learning has significantly advanced humanoid locomotion, perceptive policies still struggle on sparse-foothold terrain and constrained environments. Success in these scenarios requires both broad terrain awareness and precise foothold selection, two perceptual roles that conventional encoders often entangle. To address this challenge, we propose Global-Local Attention Decomposition (GLAD) for terrain encoding in humanoid locomotion. Realized by a coarse-to-fine encoder over a robot-centric elevation map, GLAD explicitly separates these objectives: a global attention branch utilizes attention pooling to summarize the surrounding terrain context, while a state-conditioned local attention branch sparsifies and encodes precise foothold-relevant geometry. This explicit attention decomposition prevents the dilution of fine-grained spatial cues while reducing training overhead. Experiments demonstrate that GLAD enables reliable locomotion over challenging gaps, stepping stones, and stairs. Furthermore, the learned policy exhibits emergent terrain-responsive behaviors, autonomously following narrow paths and avoiding obstacles under simple velocity commands without explicit navigation planners. In real-world deployment on a Unitree G1 humanoid robot using onboard LiDAR, the proposed method achieves robust zero-shot sim-to-real transfer across diverse sparse-foothold and obstacle-rich domains.
- Abstract(参考訳): 強化学習はヒューマノイドの移動を著しく進歩させたが、それでも足場や制約のある環境では知覚的な政策が苦戦している。
これらのシナリオの成功には、広い地形認識と、従来のエンコーダがしばしば絡む2つの知覚的役割である、正確な足場選択の両方が必要である。
この課題に対処するため,ヒューマノイド移動における地形符号化のためのGLAD(Global-Local Attention Decomposition)を提案する。
グローバルアテンションブランチは、周囲の地形コンテキストを要約するためにアテンションプールを使用し、ステートコンディショニングされたローカルアテンションブランチは、正確なフットホールド関連幾何を分散してエンコードする。
この明示的な注意分解は、訓練オーバーヘッドを低減しつつ、きめ細かい空間的手がかりの希釈を防止する。
実験により、GLADは難解な隙間、石段、階段上での信頼性の高い移動を可能にすることが示された。
さらに、学習されたポリシーは、地形に敏感な行動を示し、狭い経路を自律的に追従し、明確なナビゲーションプランナーなしで単純な速度コマンドで障害物を避ける。
実世界におけるLiDARを用いたUnitree G1ヒューマノイドロボットの展開において,提案手法は多種多様な足場と障害物に富む領域にまたがるロバストなゼロショット・シミュレートを実現する。
関連論文リスト
- TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model [49.03909082056646]
人型ロボットを用いて, 乱雑な室内環境をナビゲートする問題について検討した。
本稿では,最初の全身視覚言語ナビゲーションフレームワークであるTANGOを紹介する。
シミュレーション実験では、タンゴは視覚言語ナビゲーションにおける最先端の性能を実証した。
論文 参考訳(メタデータ) (2026-09-08T17:59:55Z) - Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking [78.30338456206984]
本稿では,汎用3D足場追跡ポリシーをトレーニングするための新しいフレームワークを提案する。
本手法は, 目標検層による足場支援を動的に行うことにより, 学習方針を特定の地形に依存しないものにする。
我々の新しいターゲット表現は、雑音や不正確なポーズ推定や足の接触推定といった現実の課題を効果的に緩和する。
論文 参考訳(メタデータ) (2026-06-06T16:44:56Z) - Meridian: Metric-Semantic Primitive Matching for Cross-View Geo-Localization Beyond Urban Environments [47.53030013880309]
ロボット自動化の成功には、リピータビリティ、タスク計画、目標仕様、安全な操作をサポートするために、正確なグローバルローカライゼーションが必要である。
本稿では,空中画像と地上ロボットRGB-Dカメラデータにまたがって,ハイレベルなメトリック・セマンティックプリミティブをマッチングする方法であるメリディアンを提案する。
我々のアルゴリズムは、自律運転データセット、公園とキャンパスのエリア、荒野キャンプなど、幅広い環境にまたがる地上ロボットをローカライズできることを実証する。
論文 参考訳(メタデータ) (2026-06-04T15:52:40Z) - TAGA: Terrain-aware Active Gaze Learning for Generalizable Agile Humanoid Locomotion [13.927597120628064]
本研究では,意識に基づくヒューマノイド制御のためのTerrin-aware Active Gaze学習フレームワークTAGAを紹介する。
本フレームワークは,予測的手がかりを学習し,ハイトスキャンの特定の領域に積極的に参画するためのモデルである。
このような視線行動は、追加の監督や明示的な指導を必要とせず、強化学習だけで自然に現れることが判明した。
論文 参考訳(メタデータ) (2026-06-04T08:52:56Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - Pro-HOI: Perceptive Root-guided Humanoid-Object Interaction [57.252599851031505]
本稿では,知覚根誘導型ヒューマノイドオブジェクトインタラクション,Pro-HOIを紹介する。
Pro-HOIは、堅牢なヒューマノイドロコ操作のための一般化可能なフレームワークである。
ユニツリーG1ロボットの実証検証は、Pro-HOIが一般化と堅牢性においてベースラインを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2026-03-01T14:19:59Z) - AME-2: Agile and Generalized Legged Locomotion via Attention-Based Neural Map Encoding [13.367858405827926]
AME-2はアジャイルと一般化された移動のための統合強化学習フレームワークである。
コントロールポリシーには、新しいアテンションベースのマップエンコーダが組み込まれている。
パイプラインは並列シミュレーションとも統合されており、オンラインマッピングでコントローラをトレーニングすることが可能です。
論文 参考訳(メタデータ) (2026-01-13T12:18:50Z) - START: Traversing Sparse Footholds with Terrain Reconstruction [11.632418196552324]
我々は,高度にスパースな足場でアジャイルで安定した移動を可能にする,単段階学習フレームワークSTARTを提案する。
STARTは、ローコストのオンボードビジョンとプロプレセプションのみを活用して、局所的な地形の高度マップを正確に再構築する。
実験結果から,STARTは実世界の様々なシナリオにまたがるゼロショット転送を実現することが示された。
論文 参考訳(メタデータ) (2025-12-15T10:02:41Z) - Mastering Diverse, Unknown, and Cluttered Tracks for Robust Vision-Based Drone Racing [22.63301233637327]
ドローンレースの目標を固定した障害物のないトラックの強化学習手法のほとんどは、未知の乱雑な環境に一般化を残したままであった。
この課題は、レース速度と衝突回避のバランスをとる必要があること、限られた実現可能な空間が、訓練中に地元のオプティマに閉じ込められた政策探索を引き起こすことに起因している。
高速飛行のための政策探索を継続する初期ソフトコリデーショントレーニングフェーズと、堅牢な障害物回避を強制するハードコリデーション改善フェーズの2段階学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-10T12:02:48Z) - Gait-Adaptive Perceptive Humanoid Locomotion with Real-Time Under-Base Terrain Reconstruction [86.53248703859718]
本研究では,地形認識,歩行制御,全身制御を一つの強化学習ポリシーにマージする知覚的移動フレームワークを提案する。
31-DoF、1.65mのヒューマノイドロボットによる実験は、シミュレーションと実世界の両方で堅牢な移動を実証している。
論文 参考訳(メタデータ) (2025-12-08T11:42:41Z) - NoTVLA: Narrowing of Dense Action Trajectories for Generalizable Robot Manipulation [54.87964060934928]
VLA(Vision-Language-Action)モデルは、現実の展開において重要な障壁に直面している。
本稿では,軌道の狭小化に焦点を絞った新しい手法として,軌道の狭小化(Narrowing of Trajectory)VLAフレームワークを提案する。
NoTVLAは2つのクリティカルな制約の下で動作しながら、pi0よりも優れたパフォーマンスと一般化を実現している。
論文 参考訳(メタデータ) (2025-10-04T18:26:55Z) - Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration [58.4036440289082]
ハンドオブジェクトモーションキャプチャ(MoCap)は、大規模でコンタクトに富んだデモと、器用なロボットスコープの約束を提供する。
Dexploreは、リポジトリとトラッキングを実行し、MoCapから直接ロボット制御ポリシーを学習する、統一された単一ループ最適化である。
論文 参考訳(メタデータ) (2025-09-11T17:59:07Z) - Cascaded Diffusion Models for Neural Motion Planning [36.53334347874921]
本研究では,拡散政策を用いたグローバルな動き計画学習手法を提案する。
我々のアプローチは、グローバルな予測と局所的な洗練を統一するカスケード階層モデルを用いる。
ナビゲーションや操作を含む複数の領域における課題タスクにおいて,本手法は(5%)優れていた。
論文 参考訳(メタデータ) (2025-05-21T06:21:50Z) - Think Global, Act Local: Dual-scale Graph Transformer for
Vision-and-Language Navigation [87.03299519917019]
本稿では,2次元グラフ変換器 (DUET) を提案する。
我々は,グローバルな行動空間における効率的な探索を可能にするために,トポロジカルマップをオンザフライで構築する。
提案手法であるDUETは、目標指向の視覚・言語ナビゲーションベンチマークにおいて最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2022-02-23T19:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。