論文の概要: ROOT: Discovering Rewards for User-Specified Embodied Behaviors
- arxiv url: http://arxiv.org/abs/2610.04250v1
- Date: Sat, 03 Oct 2026 03:19:52 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:46:13.119674
- Title: ROOT: Discovering Rewards for User-Specified Embodied Behaviors
- Title(参考訳): ROOT: ユーザが指定した身体的行動に対するリワードを発見する
- Abstract要約: Reward Optimization via Observable Trees (ROOT) は、学習したポリシーとユーザ指定の具体的行動とを一致させる報酬関数を発見するためのフレームワークである。
ROOTは、既存の大規模言語モデル(LLM)ベースの報酬生成手法で生成されたものよりも、ユーザの意図に合わせた行動を生成する。
- 参考スコア(独自算出の注目度): 7.397911227097208
- License:
- Abstract: Reinforcement learning for embodied control remains constrained by the difficulty of reward specification. Although recent large language model (LLM)-based methods can synthesize reward functions from natural-language descriptions, they often fail to capture subtle behavioral properties that humans care about, such as natural gait, posture, and movement style. This limitation arises because many desired behaviors are easier to recognize visually than to encode in a reward function. We introduce Reward Optimization via Observable Trees (ROOT), a framework for discovering reward functions that align learned policies with user-specified embodied behaviors. Rather than relying solely on scalar training statistics, ROOT casts reward design as an observation-guided search over a persistent experiment tree that stores reward programs, trained policies, and rollout observations, together with behavioral insights distilled by a video-language model, to diagnose behavioral failures and guide subsequent reward refinements. We evaluate ROOT on seven tasks across four embodiments: simulated Hopper, HalfCheetah, Ant, Unitree Go2, and as well as the real-world Unitree Go2. ROOT produces behaviors that better align with user intent than those generated by existing LLM-based reward-generation methods, achieving up to 86.8% locomotion-completeness accuracy and improving Vid-LLM behavioral alignment from 3.56/5 to 4.14/5, a 16.5% improvement over baselines. Human evaluations further support these results, with ROOT preferred in 51-63% of pairwise comparisons.
- Abstract(参考訳): 具体化制御のための強化学習は、報酬仕様の難しさに制約されているままである。
近年の大規模言語モデル(LLM)に基づく手法は、自然言語記述から報酬関数を合成できるが、自然歩行、姿勢、運動スタイルなど、人間が関心を持つ微妙な行動特性を捉えることができないことが多い。
この制限は、多くの望ましい振る舞いが報酬関数を符号化するよりも視覚的に認識しやすいために生じる。
本稿では,学習したポリシーとユーザの具体的行動とを一致させる報酬関数を発見するためのフレームワークであるROOT(Reward Optimization via Observable Trees)を紹介する。
ROOTは、スカラートレーニングの統計にのみ依存するのではなく、報酬プログラム、トレーニングされたポリシー、ロールアウト観察を格納する永続的な実験ツリーに対する報酬設計を、ビデオ言語モデルによって抽出された行動洞察とともに、行動障害の診断とその後の報酬改善の導出に利用している。
シミュレーションしたHopper, HalfCheetah, Ant, Unitree Go2, および実世界のUnitree Go2の7つの実施形態でROOTを評価した。
ROOTは、既存のLCMベースの報酬生成法で生成されたものよりもユーザ意図に整合し、86.8%の運動完全性を達成し、Vid-LLMの行動アライメントを3.56/5から4.14/5に改善し、ベースラインよりも16.5%改善した。
人間による評価はこれらの結果をさらに支持し、ROOTは対比較の51-63%で好まれる。
関連論文リスト
- Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models [15.173629384871013]
VLA(Vision-Language-Action)モデルは、マルチモーダルコンテキストをロボットアクションに変換することができるが、そのアクションデコーダは行動クローニングによって主に訓練されている。
Intention Distillation (INDI) を提案する。
論文 参考訳(メタデータ) (2026-08-24T16:42:49Z) - OdysSim: Building Foundation Models for Human Behavior Simulation [70.35265860287608]
大規模言語モデルは、対話的評価と社会シミュレーションのための人間のシミュレータとして、ますます多くデプロイされている。
しかし、有益性駆動のポストトレーニングは、それらを同質で過度に同意できるアシスタントレジスタへと引き寄せる。
OdysSimは行動基礎モデルに関する最大のオープン・システマティック・リサーチである。
論文 参考訳(メタデータ) (2026-06-12T07:31:55Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning [27.226155951073064]
Shop-R1は大規模言語モデル(LLM)の推論能力向上を目的とした新しい強化学習フレームワークである
合理的な生成には、内部モデル信号(例えば、ロジット分布)を活用して、推論プロセスを自己管理的に導く。
行動予測のために,報酬ハッキングを防止するため,スケーリングの難しさを考慮した階層型報酬構造を提案する。
論文 参考訳(メタデータ) (2025-07-23T18:10:43Z) - VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences [13.337649128532307]
嗜好に基づくRLは、比較フィードバックから報酬を学ぶことによって、これらの落とし穴のいくつかを緩和する。
単一の最終状態の画像は、一般的にエージェントの完全な動きを捉えるのに失敗する。
本稿では,フィードバックの精度を向上し,報酬学習とエージェントのポリシーの整合性を向上する2部構成のソリューションを提案する。
論文 参考訳(メタデータ) (2025-03-18T01:51:27Z) - RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution [50.171320156632866]
人間のフィードバックからの強化学習は、大きな言語モデルを人間の好みに合わせるための有望なアプローチを提供する。
現在の報酬モデルはシークエンス・ツー・ワンモデルとして動作し、単一、スパース、遅延報酬を全出力シーケンスに割り当てる。
よりきめ細かなトークンレベルの指導手法をRLトレーニングに提案する。
論文 参考訳(メタデータ) (2024-11-13T02:45:21Z) - Sample-Efficient Preference-based Reinforcement Learning with Dynamics
Aware Rewards [2.5101508961934837]
優先度に基づく強化学習(PbRL)は、エージェントの行動に対する二項フィードバックから学習した報酬関数を介して、ロボットの行動と人間の嗜好を一致させる。
本研究では,PbRLの試料効率を桁違いに向上することを示す。
論文 参考訳(メタデータ) (2024-02-28T01:41:34Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Basis for Intentions: Efficient Inverse Reinforcement Learning using
Past Experience [89.30876995059168]
逆強化学習(IRL) - エージェントの報酬関数をその振る舞いを観察することから推測する。
本稿では、エージェントの報酬関数を観察することのできないIRLの問題に対処する。
論文 参考訳(メタデータ) (2022-08-09T17:29:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。