論文の概要: SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion
- arxiv url: http://arxiv.org/abs/2608.26583v2
- Date: Mon, 31 Aug 2026 05:04:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.247626
- Title: SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion
- Title(参考訳): SOLO:安定なOmni-terrain長軸知覚型ヒューマノイドロコモーション
- Abstract要約: 地表面の高密度化は行動クリティカルな詳細を円滑にし,時間的信用割当を欠く点の模倣という,2つの複合的な長軸不安定性の原因に対処する統合フレームワークSOLOを提案する。
そのクエリリコンストラクタ(QR)は、フーリエエンコードされたセルクエリを使用して、深さプロプリセプショントークンから空間的に特異的なエビデンスを検索し、鋭い地形境界を保存する。
Trajectory-Aware MSE (TA-MSE) 蒸留は、PPO報酬に対する次世代の教師と学生の意見の不一致を追加し、一般化アドバンテージ推定により、過去の行動に対する将来の不一致を伝播させる。
- 参考スコア(独自算出の注目度): 41.64988244398264
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans traverse complex terrain over long distances without losing balance, whereas perceptive humanoid policies become fragile as perception and control errors accumulate. We present SOLO, a unified framework addressing two compounding causes of this long-horizon fragility: dense terrain reconstruction smooths action-critical details, and pointwise imitation lacks temporal credit assignment. Its Query Reconstructor (QR) uses Fourier-encoded cell queries to retrieve spatially specific evidence from depth-proprioception tokens, preserving sharp terrain boundaries. Trajectory-Aware MSE (TA-MSE) Distillation adds next-state teacher-student disagreement to the PPO reward, enabling Generalized Advantage Estimation to propagate future disagreement penalties to preceding actions. In simulation, QR reduces height-map L1 error by factors of 3.3-4.0, while TA-MSE surpasses PPO and MSE+PPO in curriculum progression. On stress-test terrains, SOLO achieves 97.5% mean traversal success and 96% stepping-stone success, versus 75.0-75.6% and 0-3% for dense-reconstructor variants. Deployed zero-shot with only a chest-mounted depth camera and proprioception, SOLO completes a continuous 1.5-km outdoor route and an indoor mixed-terrain course. Project page: https://sunpihai-up.github.io/solo/
- Abstract(参考訳): 人間はバランスを失うことなく遠くに複雑な地形を横切るが、知覚的なヒューマノイド政策は知覚と制御の誤りが蓄積するにつれて脆弱になる。
我々は,この長期的不安定性の2つの複合原因に対処する統合的枠組みであるSOLOについて述べる。
そのクエリリコンストラクタ(QR)は、フーリエ符号化されたセルクエリを使用して、深度保護トークンから空間的に特異的なエビデンスを検索し、鋭い地形境界を保存する。
Trajectory-Aware MSE (TA-MSE) Distillation (TA-MSE) Distillation(英語版)は、PPO報酬に対する次世代の教師と学生の意見の不一致を追加し、一般化アドバンテージ推定(英語版)により、過去の行動に対する将来の不一致を伝播させる。
シミュレーションでは、QRは高さマップL1エラーを3.3-4.0の係数で削減し、TA-MSEはカリキュラムの進行でPPOとMSE+PPOを上回っている。
応力試験において、SOLOは97.5%の平均的横断的な成功と96%のステッピングストーンの成功を達成し、75.0-75.6%と0-3%の高密度リコンストラクタ変種を達成している。
胸部に搭載された深度カメラとプロプレセプションのみを搭載したゼロショットが配備され、SOLOは1.5kmの屋外ルートと屋内混合路を完備する。
プロジェクトページ:https://sunpihai-up.github.io/solo/
関連論文リスト
- World-Model-Augmented Visual Locomotion for Humanoids on Foothold-Constrained Terrain [29.978527754674044]
我々は、近未来観測と報奨に関する学習された予測的要約が、そのような設定に必要な予測情報を提供することができるかどうかを問う。
本稿では, WM-LOCO(World-Model-Augmented Visual Locomotion)について述べる。
シミュレーションでは、WM-LOCOは、マッチしたベースラインが完全に失敗するギャップやステッピングストーンで成功し、階段上でのベースラインの成功率と一致する。
論文 参考訳(メタデータ) (2026-09-02T12:57:01Z) - Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents [50.85250898062218]
大規模言語モデル(LLM)エージェントは、通常、ReActスタイルのプロトコルに従う。
自然な方法は、エージェントが可変長のアクションチャンクを出力することです。
しかし、こうした政策を標準的な強化学習で素直に訓練することは失敗する。
論文 参考訳(メタデータ) (2026-09-02T03:17:11Z) - Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation [52.90741218586653]
長距離物理世界のエージェントは、信頼できるクローズドループ動作の決定を根拠にしながら、遠くの目標を推論しなければならない。
本稿では, 長期探査用NFMエグゼキュータとVLM推論エージェントを結合したエージェントスキャフォールディングフレームワークであるNavMCPを紹介する。
NavMCPは、Embodied Question AnsweringとUnitree Go2の最先端の結果を達成する。
論文 参考訳(メタデータ) (2026-08-31T07:50:16Z) - SSTG-Nav: Metric-Grounded Spatial-Semantic Topological Graphs for Reusable Object Navigation [2.272547247667044]
SSTG-Navは再利用可能なメートル法セマンティックメモリで、1回のサーベイを実行可能なオブジェクトゴールに変換する。
36シーンにわたる1000のHM3D-v2エピソードにおいて、私たちのゴールに依存しないトポロジーは99.4%の幾何学的成功天井を達成した。
論文 参考訳(メタデータ) (2026-08-01T08:40:04Z) - CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking [6.465600276213322]
VLA(Vision-Language-Action)ポリシーは、視覚的標的を効果的に追跡することができるが、建物、植生、道路沿いの物体が視線を塞ぐと、その性能は劣化することが多い。
本稿では,空間認識型VLAモデルCosFly-VLAについて述べる。
OpenVLAとは対照的に、CosFly-VLA-0.8Bはオープンループ平均変位誤差(ADE)を外見テストで34.1%、目に見えないテストで35.3%削減する。
論文 参考訳(メタデータ) (2026-07-16T13:52:08Z) - The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents [0.0]
インターベンションタイミングは信頼性の低い構造であり、シングルアノテータF1を不適切な最適化ターゲットとする。
我々の貢献は、人間のレータ間の信頼性、4つの検出器アーキテクチャ、モデルのLEM-judgeスイープ、再現された飽和効果にまたがるこの問題を、共同でマッピングすることである。
論文 参考訳(メタデータ) (2026-06-02T23:54:27Z) - Milestone-Guided Policy Learning for Long-Horizon Language Agents [67.87164829944238]
我々は,長軸言語エージェントを訓練するためのマイルストーン誘導型政策学習フレームワークBEACONを紹介する。
ALFWorld、WebShop、ScienceWorldでは、BEACONはGRPOとGiGPOを一貫して上回っている。
これらの結果から,長期言語エージェントの訓練に有効なパラダイムとして,マイルストーン・アチョンド・クレジット・アサインが確立された。
論文 参考訳(メタデータ) (2026-05-07T12:00:40Z) - Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols [6.357772907811544]
SSRP(Self- Synthesizing Reasoning Protocols)は、アーキテクチャ計画と手続き実行の分離を実装するメタ認知フレームワークである。
提案する実験層は,浅電流に基づく検索パイロット,高エントロピーSOP,セマンティックハイジャック3ホップ多要素合成タスクの3種類である。
以上の結果から,GPT 5.4の非定常バニラ基準線が0.1%に崩壊し,SSRPは715X耐力限界を達成した。
論文 参考訳(メタデータ) (2026-04-27T14:13:30Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs [85.37131922131657]
我々はLVLM(Large Vision-Language Models)の重大な欠陥を明らかにした。
これらのモデルが正しい答えを知っていても、誤った推論経路を通じて頻繁にそこに到達します。
PSO(Path-Select Optimization)は,既存のLVLMの推論性能と安定性を両立させる2段階のポストトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-06T03:02:55Z) - On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral [59.14787085809595]
この障害を引き起こす中核的なメカニズムとしてLazy Likelihood Displacement(LLD)を同定する。
LDDは早期に出現し、自己強化性LDDデススパイラル(LDD Death Spiral)を引き起こす。
本稿では,GRPO のための軽量な確率保存正則化 LLDS を提案する。
論文 参考訳(メタデータ) (2025-12-03T19:41:15Z) - Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail [85.47497935739936]
Alpamayo-R1 (AR1) は、因果推論の連鎖と軌道計画を統合する視覚言語モデルである。
また,AR1は,軌道のみのベースラインに比べて,難問の計画精度が12%向上することを示した。
今後のアップデートで、AR1モデルとCoCのサブセットをリリースする予定です。
論文 参考訳(メタデータ) (2025-10-30T01:25:34Z) - Adversarial Loss for Semantic Segmentation of Aerial Imagery [12.241693880896348]
本稿では,意味的セグメンテーションにおける局所的・グローバル的文脈の理解を学習する新たな損失関数を提案する。
DeepLab v3+ネットワークに新たに提案された損失関数は、マサチューセッツの建物データセットの最先端結果を取得する。
論文 参考訳(メタデータ) (2020-01-13T14:22:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。