論文の概要: Self-Evolving Embodied Agents via Skill-Harness Evolution
- arxiv url: http://arxiv.org/abs/2608.11350v1
- Date: Tue, 11 Aug 2026 18:55:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.355724
- Title: Self-Evolving Embodied Agents via Skill-Harness Evolution
- Title(参考訳): スキル・ハーネス進化を介する自己進化型炭水化物
- Authors: Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li,
- Abstract要約: 身体的エージェントは、ファンデーションモデルを中心としたシステムとして、ますます構築されている。
教師付き微調整と強化学習はエージェントを新しい環境に適応させることができるが、追加のデータ、報酬、トレーニングの実行が必要である。
SHAPERは,モデルパラメータの凍結を保ちつつ,列車不要な態様適応のための自己進化型フレームワークである。
- 参考スコア(独自算出の注目度): 53.307052568223945
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied agents are increasingly built as systems around foundation models, where performance depends not only on model weights but also on the skills, context, action interfaces, and execution harness surrounding the model. While supervised fine-tuning and reinforcement learning can adapt agents to new environments, they require additional data, rewards, and training runs; meanwhile, many train-free code-centric approaches rely on programmable robot APIs that may be unavailable in fixed-interface settings. We propose SHAPER, a self-evolving framework for train-free embodied adaptation that keeps model parameters frozen and improves the non-parametric agent system by evolving reusable skills and a context-code harness through target-environment rollouts. In SHAPER, the same frozen model can serve as both planner and optimizer, refining its external skills and context-code harness without parameter updates. We evaluate SHAPER on VLABench and ESI-Bench, covering embodied agents with different low-level action interfaces, and compare against pure execution, supervised fine-tuning, and test-time-scaling baselines such as verifier-free selection and voting. Our results suggest that skill-and-harness optimization is a practical route to self-evolving embodied agents when model training is expensive, unavailable, or undesirable.
- Abstract(参考訳): エージェントは、モデルウェイトだけでなく、スキル、コンテキスト、アクションインターフェース、モデルを取り巻く実行ハーネスにも依存する。
教師付き微調整と強化学習はエージェントを新しい環境に適応させることができるが、追加のデータ、報酬、トレーニングの実行が必要になる。
モデルパラメータの凍結を保ち、再利用可能なスキルを進化させることにより非パラメトリックエージェントシステムを改善し、ターゲット環境のロールアウトを通じてコンテキストコードハーネスを実現する。
SHAPERでは、同じ凍結モデルがプランナーとオプティマイザの両方として機能し、パラメータ更新なしで外部スキルとコンテキストコードハーネスを改善できる。
我々は,VLABench と ESI-Bench 上で SHAPER を評価し,異なる低レベルアクションインタフェースを持つエンボディエージェントをカバーし,純粋な実行,教師付き微調整,検証自由選択や投票などのテスト時間スケーリングベースラインと比較した。
この結果から,モデルトレーニングが高価で,利用できない,あるいは望ましくない場合には,スキル・アンド・ハーネスの最適化が,自己進化型エンボディエージェントへの実践的経路であることが示唆された。
関連論文リスト
- Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents [37.91666123749406]
Co-Harnessは、ポストトレーニング中にエージェントハーネスとモデルパラメータを共同で最適化するフレームワークである。
自律的なケーススタディによると、Co-Harnessはシステムのクラッシュから回復し、推論効率を改善し、人間の介入なしにアンサンブル戦略を発見することができる。
論文 参考訳(メタデータ) (2026-07-17T02:39:57Z) - Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents [4.765206163164323]
モデル重みや評価環境を変化させることなく冷凍LDMエージェントを改善するライフサイクル対応ランタイムハーネスであるLife-Harnessを提案する。
ライフ・ハーネスは、繰り返し発生する相互作用の失敗を、環境契約、手続きスキル、行動実現、軌道規制にまたがる再利用可能な介入に変換することによって、訓練軌道から進化する。
ライフハーネスはモデル116のうち116で改善され、環境設定は18モデルバックボーンで改善され、平均的な相対的改善は88.5%である。
論文 参考訳(メタデータ) (2026-05-21T08:36:49Z) - ASACK : Adaptive Safe Active Continual Koopman Learning for Uncertain Systems with Contractive Guarantees [0.38887448816036313]
クープマン作用素論 (Koopman operator theory) は、持ち上げ可観測物に作用する線型作用素を通して非線形力学を表現するための枠組みを提供する。
本稿では,学習モデルの安全かつ効率的なオンライン改善を可能にする,継続的適応型クープマン学習のための統合フレームワークを提案する。
提案したアプローチは、リアルタイム効率を犠牲にすることなく、コントロールフレームワーク内の学習、デプロイメント、安全性を統一する。
論文 参考訳(メタデータ) (2026-05-10T17:11:51Z) - Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments [70.42705564227548]
大規模言語モデル(LLM)のための環境自動構築パイプラインを提案する。
これにより、外部ツールに頼ることなく、詳細な測定可能なフィードバックを提供する高品質なトレーニング環境の作成が可能になる。
また、ツール使用の精度とタスク実行の完全性の両方を評価する検証可能な報酬機構も導入する。
論文 参考訳(メタデータ) (2025-08-12T09:45:19Z) - A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models [4.417707977122247]
本稿では,学習目標をリアルタイムで適応的に調整できるオンライン強化学習フレームワークであるAdaPOを提案する。
その結果,本手法は直接推論と自己評価能力の両方を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-05T07:54:01Z) - Action Flow Matching for Continual Robot Learning [54.10050120844738]
ロボット工学における継続的な学習は、変化する環境やタスクに常に適応できるシステムを求める。
本稿では,オンラインロボット力学モデルアライメントのためのフローマッチングを利用した生成フレームワークを提案する。
ロボットは,不整合モデルで探索するのではなく,行動自体を変換することで,より効率的に情報収集を行う。
論文 参考訳(メタデータ) (2025-04-25T16:26:15Z) - ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning [84.69651852838794]
ツール学習により、LLM(Large Language Models)は複雑なユーザタスクを解決するための外部ツールを活用することができる。
本稿では,ツール学習のための反復学習と適応的洗練の両方を含む新しいフレームワークであるToolACE-Rを提案する。
我々は、いくつかのベンチマークデータセットにわたる広範な実験を行い、ToolACE-Rが高度なAPIベースのモデルと比較して、競争力のあるパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2025-04-02T06:38:56Z) - Self-Progressing Robust Training [146.8337017922058]
敵対的なトレーニングのような現在の堅牢なトレーニング方法は、敵対的な例を生成するために「攻撃」を明示的に使用します。
我々はSPROUTと呼ばれる自己プログレッシブ・ロバスト・トレーニングのための新しいフレームワークを提案する。
その結果,スケーラブルで効果的で攻撃に依存しないロバストなトレーニング手法に新たな光を当てた。
論文 参考訳(メタデータ) (2020-12-22T00:45:24Z) - Once-for-All Adversarial Training: In-Situ Tradeoff between Robustness
and Accuracy for Free [115.81899803240758]
敵の訓練とその多くの変種は、ネットワークの堅牢性を大幅に改善するが、標準精度を妥協するコストがかかる。
本稿では,訓練されたモデルをその場で迅速に校正する方法を問うとともに,その標準と堅牢な精度のトレードオフについて検討する。
提案するフレームワークであるOne-for-all Adversarial Training (OAT)は,革新的なモデル条件トレーニングフレームワーク上に構築されている。
論文 参考訳(メタデータ) (2020-10-22T16:06:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。