論文の概要: Dynamics-Induced Commitment in Learning-Based Robotic Penalty Kicks
- arxiv url: http://arxiv.org/abs/2609.21100v1
- Date: Thu, 17 Sep 2026 21:21:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.783376
- Title: Dynamics-Induced Commitment in Learning-Based Robotic Penalty Kicks
- Title(参考訳): 学習型ロボットペナルティキックにおけるダイナミクスによるコミット
- Abstract要約: ロボットゲームでの学習は、身体がまだ実行可能であることによって制限される。
我々はこれを,ゲームレベルの自己プレーポリシーがサッカー全体のコントローラを固定する階層型ヒューマノイド四段式ペナルティシステムで研究する。
- 参考スコア(独自算出の注目度): 31.095840839156065
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning in robotic games is constrained not only by strategic information but also by what the body can still execute. We study this coupling in a hierarchical humanoid-quadruped penalty system in which game-level self-play policies command fixed soccer whole-body controllers (S-WBCs). The humanoid shooting skill is initialized from self-collected motion-capture data, whereas the quadruped saving skill is learned by reinforcement learning. We introduce dynamics-induced commitment mapping (DIC-Map), a body-grounded analysis that estimates continuation capability, identifies the first persistent loss of a terminal alternative, and tests whether the remaining interaction admits a reduced zero-sum game. For symmetric terminal alternatives, the reduced game yields a closed-form bound on optimal strategy concentration determined by the responder's value of deferring. We further show that, when the responder acts through an estimator, equal response values eliminate the direct terminal-allocation gradient and leave an estimator-mediated first-order learning channel. Experiments locate commitment about 0.29 s before contact, and changing only ball speed shifts deferral coverage. Across four responder policies, replacing the estimator raises save rate from 0.240 to 0.472, whereas a comparable gain in read accuracy obtained by waiting raises it only to 0.246. Posterior analysis is used for the equilibrium comparison because the available coverage terms are observational proxies. Project website: https://chris-ruizegeng.github.io/penaltykick/
- Abstract(参考訳): ロボットゲームでの学習は、戦略的情報だけでなく、身体がまだ実行できるものによっても制約される。
ゲームレベルの自己プレーポリシーが固定サッカー全身制御装置(S-WBC)を指令する階層型ヒューマノイド四角形ペナルティシステムにおいて,この結合について検討する。
自己収集型モーションキャプチャーデータからヒューマノイドシューティングスキルを初期化し、強化学習により4倍の貯蓄スキルを学習する。
本稿では,継続能力を推定するボディグラウンド解析であるダイナミックス誘導コミットメントマッピング(DIC-Map)を導入し,端末の代替品の最初の永続的損失を特定し,残りのインタラクションがゼロサムゲームに還元されているかどうかを検証した。
対称端末の代替品の場合、縮小されたゲームは、応答子の遅延値によって決定される最適な戦略集中に基づいて閉形式となる。
さらに, 応答器が推定器を介して振る舞うと, 等価応答値が直接終端位置勾配を排除し, 推定器を介する1次学習チャネルを残すことを示す。
実験では接触前に約0.29秒のコミットメントを定め、ボール速度だけを変えると遅延範囲が変化する。
推定器を置き換えた4つの応答器ポリシー全体では、節約率は0.240から0.472に上昇するが、待機によって得られる読み出し精度は0.246にしか上昇しない。
平衡比較に後解析を用いるのは、利用可能なカバレッジ項が観測プロキシであるからである。
プロジェクトウェブサイト:https://chris-ruizegeng.github.io/penaltykick/
関連論文リスト
- Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning [1.96243636752331]
実際のロボットのためのHIL(Human-in-the-loop)オンライン強化学習は、人間の介入を素早く吸収し、人間の先行性を超えて改善し続けなければならない。
本稿では,この2つのコンポーネントをベースとしたトレーニング手法を提案する。
emphMC Q-chunk 批判者は、モンテカルロへのチャンクレベルのアクション値をリプレイバッファから返します。
emphmax-Qの選択的な模倣は、各状態において、現在のポリシーアクションとバッファサンプルの間の高額なQ$アクションを模倣することでアクターを更新する。
論文 参考訳(メタデータ) (2026-08-15T07:13:59Z) - RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance [84.26294415726723]
汎用報酬モデルが、ロボット学習のスケーリングのボトルネックになりつつある。
ロボット操作のためのオープンソースのバリューファンデーションモデルであるRynnValueを紹介した。
RynnValueは7000時間以上、好みやプログレッシブアノテーションなしで約3Mの命令条件付きクリップにスケールする。
論文 参考訳(メタデータ) (2026-08-10T17:09:37Z) - Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition [16.480150894507908]
集中型トレーニングと分散実行(CTDE)とハイブリッドリワードアーキテクチャ(HRA)を組み合わせた統合フレームワークを導入する。
実験の結果,提案フレームワークはサンプル効率と政策性能の両方を大幅に改善することがわかった。
本手法は,最先端のベースラインと比較して,テニスボールのピック・アンド・プレイスにおける成功率を60%から80%に向上させる。
論文 参考訳(メタデータ) (2026-08-10T15:54:25Z) - Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment [53.913175773174636]
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
論文 参考訳(メタデータ) (2026-07-15T17:16:24Z) - Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory [1.2127875744950842]
LLMエージェントは、どのコンテキストウィンドウよりもはるかに大きなインタラクション履歴を蓄積する。
生産システムは意味的類似性や傾向に答える。
本研究では、7つの解釈可能な因子に対する多要素記憶関数 V(m)=sum_i w_i f_i(m) を提案する。
論文 参考訳(メタデータ) (2026-06-11T06:17:31Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Reproducing AlphaZero on Tablut: Self-Play RL for an Asymmetric Board Game [0.6574517227976925]
非対称な歴史的ボードゲームであるTablutへのAlphaZero強化学習アルゴリズムの適用について検討する。
100回以上のセルフプレイが実施され、改良されたモデルは着実に改善され、ベイズエロの格付けは1235となった。
実験の結果、AlphaZeroのセルフプレイフレームワークが高度に非対称なゲームに移行できることが確認された。
論文 参考訳(メタデータ) (2026-04-07T06:16:19Z) - HSVI-based Online Minimax Strategies for Partially Observable Stochastic Games with Neural Perception Mechanisms [31.51588071503617]
ニューラル認知機構と非対称情報構造を持つ連続状態の部分観測可能なゲームの変種を考察する。
1つのエージェントは部分的な情報を持ち、もう1つのエージェントは状態に関する完全な知識を持っていると仮定される。
本稿では,各エージェントに対して$varepsilon$-minimax戦略プロファイルを計算するための効率的なオンライン手法を提案する。
論文 参考訳(メタデータ) (2024-04-16T15:58:20Z) - Improve Agents without Retraining: Parallel Tree Search with Off-Policy
Correction [63.595545216327245]
木探索(TS)における2つの大きな課題に取り組む。
我々はまず、TSと事前学習された値関数による行動選択が、元の事前学習されたエージェントと比較して性能を低下させるという、反直感的な現象を発見し、分析する。
Batch-BFS(Batch-BFS)は,木の各深さのすべてのノードを同時に前進させるGPUワイドファースト検索である。
論文 参考訳(メタデータ) (2021-07-04T19:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。