論文の概要: InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
- arxiv url: http://arxiv.org/abs/2610.02196v2
- Date: Sun, 04 Oct 2026 03:52:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.529833
- Title: InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
- Title(参考訳): InterEvolve:Humanoid Loco-Manipulationのためのリワードプログラムのテスト時間進化
- Abstract要約: ヒューマノイド・ロコ・マニピュレーションの試験時間進化について検討した。
私たちの重要な洞察は、ワイドコントローラが、新しいタスクに必要な能力の多くをすでに持っていることです。
InterEvolveはこのインターフェースを2つのコンポーネントで実現している。
- 参考スコア(独自算出の注目度): 54.00038257772902
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study test-time evolution for humanoid loco-manipulation: solving tasks that a controller was never trained for by repurposing its existing skills, improving from its own attempts, and retaining what it learns, without retraining. Our key insight is that a broad controller already holds much of the competence a new task needs, and that this competence becomes accessible through an interface between planning and control that is expressive enough to specify contact-rich, multi-stage interactions, yet executable and measurable enough that execution feedback can guide planning from experience. InterEvolve realizes this interface with two components. First, we develop an object-aware forward-backward (FB) behavioral foundation model, whose object residuals on a frozen body prior turn a new reward about the body or objects into loco-manipulation behavior at test time. Second, we specify tasks as reward programs: staged rewards with completion conditions and tunable constants. A large language model (LLM) agent revises the program structure in context, drawing on execution feedback and a skill library of verified programs, while a numerical optimizer tunes its constants. With every candidate verified across parallel simulation scenarios, the program explores new ways to induce, repurpose, and compose the controller's existing motor competence for the task at hand, and thus improves over iterations. Experiments show that human-designed rewards leave much of the FB model's loco-manipulation competence untapped, whereas the programs InterEvolve evolves release it, sometimes through novel strategies. It further produces behaviors for diverse tasks, complex scenes, and long-horizon compositions in simulation, and evolved skills run autonomously on a physical Unitree G1 from egocentric onboard perception.
- Abstract(参考訳): 我々は,ヒューマノイド・ロコ・マニピュレーションのためのテスト・タイムの進化について検討した。既存のスキルを再調達し,自己の試行から改善し,学習したことを再訓練することなく維持することで,コントローラがトレーニングを受けなかったタスクを解決する。
我々の重要な洞察は、広義のコントローラが、新しいタスクに必要な能力の多くをすでに保持しており、この能力は、コンタクトリッチで多段階のインタラクションを指定できるが、実行フィードバックが経験からプランを導くのに十分な、十分に実行可能な、計画と制御のインターフェースを通じてアクセス可能であることです。
InterEvolveはこのインターフェースを2つのコンポーネントで実現している。
まず, 物体が凍結した物体に残留する物体を, 物体や物体に対する新たな報酬を, 試験時間にロコ操作行動へと変換する挙動基礎モデルを構築した。
次に、タスクを報酬プログラムとして指定する。
大規模言語モデル(LLM)エージェントは、プログラム構造をコンテキストで修正し、実行フィードバックと検証済みプログラムのスキルライブラリを描画し、数値オプティマイザはその定数をチューニングする。
並列シミュレーションのシナリオで検証された全ての候補を用いて、プログラムは、手前のタスクに対するコントローラの既存のモーター能力を誘導し、再利用し、構成する新しい方法を探求し、イテレーションよりも改善する。
実験では、人間によって設計された報酬がFBモデルのロコ操作能力の多くを無力化する一方、InterEvolveは新たな戦略によってそれを解放する。
さらに、多様なタスク、複雑なシーン、ロングホライゾン構成のシミュレーションのための振る舞いを生成し、進化したスキルは、自我中心のオンボード知覚から物理的なUnitree G1上で自律的に実行される。
関連論文リスト
- Learning Reliable GUI Agents under Imperfect Priors [38.09245403941059]
GUIエージェントは完璧な知識を追求するのではなく、不完全な事前の下で正しく行動することを学ぶべきだと我々は主張する。
構造化された探索戦略は、対話的な要素をトラバースし、UIの状態遷移グラフを構築し、人間のアノテーションなしでVLMを介して(タスク、軌道)ペアを合成する。
ノイズアウェアトレーニング戦略は、5種類の現実的誤りを自己探索軌道に注入し、エージェントに行動前に事前の信頼性を評価するように教える。
論文 参考訳(メタデータ) (2026-09-30T11:45:51Z) - V-Gym: Enhancing Agentic Visual Reasoning via Skill-Data Co-Evolution [68.43599428916389]
V-Gymは、手続き的なスキルと実行軌跡からのマルチモーダルな実践データを反復的に進化させる、自律的なフレームワークである。
スキル進化の過程で、V-Gymは軌道を分析して階層的なスキルを蒸留し、洗練し、手続き的なガイダンスと適用性条件を更新する。
結果として得られた実践結果は、その後のスキル更新にフィードバックされ、継続的なスキル改善のループを閉じます。
論文 参考訳(メタデータ) (2026-09-28T09:09:24Z) - Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills [31.23929961213889]
大規模言語モデル(LLM)エージェントは、現実世界のタスクを解きながら豊富なエピソード軌道を蓄積する。
SkillEvolBenchは、経験の再利用からスキル形成まで、このステップを評価するための診断ベンチマークである。
現在のエージェントは、しばしばローカルに適応するが、堅牢な再利用可能なスキルを形成することは滅多にない。
論文 参考訳(メタデータ) (2026-05-22T18:23:31Z) - Your Code Agent Can Grow Alongside You with Structured Memory [6.836735626065529]
我々は,人間とAIの継続的な共進化を可能にするフレームワークであるMemCoderを提案する。
MemCoderはまず、過去のコミットから潜伏した意図-コードマッピングを蒸留するために、過去の人間の経験を構造化する。
次に、検証フィードバックによって駆動される自己リファインメントメカニズムを使用して、エージェントの動作をリアルタイムで修正する。
論文 参考訳(メタデータ) (2026-02-25T06:39:29Z) - HumanoidVerse: A Versatile Humanoid for Vision-Language Guided Multi-Object Rearrangement [51.16740261131198]
視覚言語誘導型ヒューマノイド制御のための新しいフレームワークであるHumanoidVerseを紹介する。
HumanoidVerseは、自然言語命令と自我中心のカメラRGB観測のみでガイドされる複数のオブジェクトの連続的な操作をサポートする。
我々の研究は、現実の知覚的制約の下で複雑なシーケンシャルなタスクを実行できる、堅牢で汎用的なヒューマノイドエージェントに向けた重要なステップである。
論文 参考訳(メタデータ) (2025-08-23T08:23:14Z) - SkillBlender: Towards Versatile Humanoid Whole-Body Loco-Manipulation via Skill Blending [79.83865372778273]
SkillBlenderは、多目的なヒューマノイドロコ操作のための新しい階層的強化学習フレームワークである。
SkillBlenderは、まずゴール条件付きタスク非依存のプリミティブスキルを事前訓練し、その後、これらのスキルを動的にブレンドして複雑なロコ操作タスクを達成する。
また,3つのエボディメント,4つのプリミティブスキル,8つの難解なロコ操作タスクを含む並列的,クロスエボディメント,多種多様なシミュレーションベンチマークであるSkillBenchを紹介した。
論文 参考訳(メタデータ) (2025-06-11T03:24:26Z) - Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution [34.66260172204154]
人間の学習過程を反映したボトムアップエージェントパラダイムを導入する。
エージェントは、試行錯誤メカニズムを探索し、成果を反映し、時間とともにスキルを抽象化することで能力を獲得する。
Slay the Spire and Civilization Vでは、エージェントが生の視覚的入力を通じて知覚し、マウスのアウトプットを介して行動する。
論文 参考訳(メタデータ) (2025-05-23T09:38:55Z) - Octopus: Embodied Vision-Language Programmer from Environmental Feedback [58.04529328728999]
身体視覚言語モデル(VLM)は多モード認識と推論において大きな進歩を遂げた。
このギャップを埋めるために、我々は、計画と操作を接続する媒体として実行可能なコード生成を使用する、具体化された視覚言語プログラマであるOctopusを紹介した。
Octopusは、1)エージェントの視覚的およびテキスト的タスクの目的を正確に理解し、2)複雑なアクションシーケンスを定式化し、3)実行可能なコードを生成するように設計されている。
論文 参考訳(メタデータ) (2023-10-12T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。