論文の概要: CriticHack: Evaluating Visual Rewards Under Robot Policy Optimization
- arxiv url: http://arxiv.org/abs/2610.02527v1
- Date: Thu, 01 Oct 2026 21:57:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.097147
- Title: CriticHack: Evaluating Visual Rewards Under Robot Policy Optimization
- Title(参考訳): CriticHack:ロボットポリシー最適化による視覚的報酬の評価
- Abstract要約: 報酬モデルは、タスクを完了させるのと同じくらい、間違ったオブジェクトに作用する実行をスコアすることができる。
このような報酬を最適化することは、これらの間違った目的の失敗を増幅し、報酬とタスクの成功は共に上昇することを示す。
- 参考スコア(独自算出の注目度): 7.391591776073451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learned visual reward models are increasingly used to optimize robot policies, yet a reward model can score an execution that acts on the wrong object as highly as one that completes the task. We show that optimizing such a reward can amplify these wrong-object failures while reward and task success both rise, so the signals a practitioner would normally monitor look healthy. We fine-tune every denoiser parameter of a diffusion policy against Robometer on a drawer task. Starting from a supervised policy with no prior reward exposure, five training runs raise task success by 10.2 percentage points and wrong-object failures by 10.9 points on 512 evaluation seeds, whereas five runs trained on the simulator's task-completion signal raise success without amplifying wrong-object failures (difference 9.2 points, 95% CI 5.6 to 13.0). The amplification recurs from a policy previously optimized against learned rewards, under the policy's native diffusion sampler, at matched distance from the initial policy, and across constrained-policy experiments with two critics and two optimizers. A tilt model explains when it occurs: under KL-regularized optimization, an outcome becomes more frequent whenever its expected reward under the initial policy exceeds the population average. Robometer separates successes from failures well overall (AUROC .81) but scores wrong-object failures slightly above successes (AUROC .37), so optimization raises both. The same model predicts the outcome shifts across 26 constrained settings (Spearman .89), including those in which task success falls, and Robometer's own published success-termination recipe inherits the error. A frozen outcome verifier redirects the same optimization toward the requested task.
- Abstract(参考訳): 学習された視覚報酬モデルは、ロボットポリシーの最適化にますます使われていますが、報酬モデルは、タスクを完了したのと同じくらい、間違ったオブジェクトに作用する実行をスコア付けすることができます。
このような報酬を最適化することは、これらの間違った目的の失敗を増幅し、報酬とタスクの成功は共に上昇し、実践者が監視する信号は正常に見えます。
ドローカタスクにおけるロビオメーターに対する拡散ポリシの全てのデノイザパラメータを微調整する。
5回のトレーニングでは10.2ポイントのタスク成功と10.9ポイントの間違った目標失敗を512評価シードで達成し、5回のトレーニングでは間違った目標失敗を増幅することなく、シミュレータのタスク補完信号でトレーニングされた5回のトレーニングは成功を高める(ただし、9.2ポイント、95% CI 5.6から13.0)。
この増幅は、それまで学習した報酬に対して最適化されていた政策から再帰し、政策のネイティブ拡散サンプリング(英語版)の下で、最初の政策から一致した距離で、そして2人の評論家と2人の最適化者による制約付き政治実験を通して行われる。
KL規則化された最適化の下では、初期政策の下で期待される報酬が人口平均を超えると、結果がより頻繁になる。
ロビオメーターは成功を全体(AUROC .81)から分離するが、失敗点が成功点よりわずかに多い(AUROC .37)ため、最適化はどちらも上昇する。
同じモデルは26の制約された設定(Spearman .89)で結果のシフトを予測する。
凍結結果検証器は、要求されたタスクに対して同じ最適化をリダイレクトする。
関連論文リスト
- DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation [59.77542456468077]
器用な操作のための強化学習(RL)は、指と物体の接触を発見し、その物体を正確に制御する必要がある。
我々のベースラインPPOは、5Mステップ後に最初の動作ノイズの近くで終了し、探索スケールの明示的な制御を動機付けます。
PPO, 批判のないGRPO継続, フローフリーなPPOの3つのポリシー最適化設定について検討した。
論文 参考訳(メタデータ) (2026-09-30T04:19:47Z) - Stable and Efficient Real-World Online VLA Post-Training via Asynchronous Replay-Anchored Policy Improvement [60.83624556700821]
本稿では,リプレイ動作における批評家とアクターの更新の両方を基盤として,ロールアウトと学習を同時に行うフレームワークを提案する。
RAPolicyを4つのシングルタスク設定と1つのジョイント5タスク設定で実世界で評価し,オンライントレーニングの予算は1~2時間に過ぎなかった。
論文 参考訳(メタデータ) (2026-09-19T08:45:18Z) - Learning and Transferring Closed-Loop Robot Software [11.7547120211534]
クローズドループロボットポリシーは、観察処理、状態管理、状況に依存した分岐を必要とする。
我々は、ソースタスクにおける実装の改善が、新しいタスクのポリシー獲得にも役立つかどうかを考察する。
各ソースタスクに対して、コーディングエージェントは、いくつかの成功したデモからポリシーコードを生成し、シミュレーションフィードバックを使用して反復的に改善する。
新しいタスクのために、エージェントは、アーカイブされた実装、ターゲットのデモ、実行フィードバックを使用してポリシーを生成し、改善する。
論文 参考訳(メタデータ) (2026-09-17T08:51:12Z) - Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition [16.480150894507908]
集中型トレーニングと分散実行(CTDE)とハイブリッドリワードアーキテクチャ(HRA)を組み合わせた統合フレームワークを導入する。
実験の結果,提案フレームワークはサンプル効率と政策性能の両方を大幅に改善することがわかった。
本手法は,最先端のベースラインと比較して,テニスボールのピック・アンド・プレイスにおける成功率を60%から80%に向上させる。
論文 参考訳(メタデータ) (2026-08-10T15:54:25Z) - MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing [0.0]
共有実行モデルの下でメタ決定ポリシーを比較するためのオープンで検査可能なフレームワークであるMetaRoute-Benchを提案する。
タスク対応のコンポジションポリシは79.4%が成功し、強いワークロード固有の静的ポリシでは76.7%が成功している。
静的ポリシーとは対照的に、これは2.7パーセントの改善であり、ペアの95%CIプラスまたはマイナス2.0ポイント、平均コストが4.7%、レイテンシが6.4%向上している。
論文 参考訳(メタデータ) (2026-07-31T07:01:21Z) - Robot Critics that Sweat the Small Stuff [44.13358184052461]
本稿では、政策から得られた成功と失敗のロールアウトを用いて、相互進行監視を構築することによって、批評家を微調整する手法を提案する。
我々の批評家は、精密な進行推論と微妙な故障検出に優れており、先行進行推論基準よりも優れています。
論文 参考訳(メタデータ) (2026-06-19T16:14:12Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success [3.362633173562401]
軌道を収集する成功条件付けは,望ましい結果を得たものを識別し,軌道に沿う動作を模倣するためにポリシーを更新する。
我々はこの理論をリターンしきい値付け(return thresholding)の一般的な実践に適用し、これは改善を増幅するが、真の目的との潜在的なミスアライメントのコストがかかることを示す。
論文 参考訳(メタデータ) (2026-01-26T05:54:39Z) - REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective [57.57786477441956]
応答の個体群に対する適応的・意味的最適化問題を提案する。
我々の目標は、Llama3の攻撃成功率(ASR)を2倍にし、サーキットブレーカー防御でASRを2%から50%に向上させることである。
論文 参考訳(メタデータ) (2025-02-24T15:34:48Z) - Policy Gradient Bayesian Robust Optimization for Imitation Learning [49.881386773269746]
我々は、期待される性能とリスクのバランスをとるために、新しいポリシー勾配スタイルのロバスト最適化手法PG-BROILを導出する。
その結果,PG-BROILはリスクニュートラルからリスク・アバースまでの行動のファミリを創出できる可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-11T16:49:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。