論文の概要: Anticipatory Robot Goalkeeping via Monotone Optimal Stopping
- arxiv url: http://arxiv.org/abs/2609.23976v1
- Date: Mon, 21 Sep 2026 01:17:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:12:47.048987
- Title: Anticipatory Robot Goalkeeping via Monotone Optimal Stopping
- Title(参考訳): モノトン最適停止による予測ロボットゴールキーピング
- Abstract要約: 待ちはターゲットに関する情報をより信頼できるものにしますが、インターセプションの物理的な機会を減らします。
動的ロボットインターセプションのための構造的リリース最適化法であるモノトーン最適停止法を提案する。
MOSは,パラメータマッチング学習ゲートよりも平均保存率を67.7%から74.4%に向上することを示した。
- 参考スコア(独自算出の注目度): 27.7968930025327
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robots engaged in fast physical interactions often need to act before the intent of another agent is fully known. Anticipatory goalkeeping illustrates this challenge. Waiting provides more reliable information about the target but reduces the physical opportunity for interception, whereas acting early preserves reachability but requires initiating motion under uncertainty. Given a fixed closed-loop save controller, we formulate the decision of when to initiate motion as a policy-conditional finite-horizon optimal stopping problem. Building on this formulation, we propose monotone optimal stopping (MOS), a structured release-timing method for dynamic robotic interception. The quadruped save policy is trained with reinforcement learning, while MOS determines when the policy should be activated from the evolving robot state and target belief. Rather than predicting a release time or relying on confidence alone, MOS learns the return advantage of acting now over waiting for one more observation. We derive a direct Bellman recursion for this act-versus-wait margin and impose monotonicity only with respect to physical urgency, reflecting the irreversible loss of interception opportunity as time elapses. This structure enables early activation for dynamically demanding saves while preserving closed-loop adaptation when later observations change the predicted target. Under a single-crossing condition, MOS admits a threshold release boundary with a bounded approximation error. Extensive simulation studies show that MOS improves the mean save rate from 67.7% to 74.4% over a parameter-matched learned gate and increases reversal saves from 52.1% to 66.5%. Real-robot experiments further demonstrate rapid interception and post-release direction correction under human shot-direction feints.
- Abstract(参考訳): 高速な物理的相互作用に従事するロボットは、しばしば他のエージェントの意図が完全に知られる前に行動する必要がある。
予想的なゴールキーピングは、この課題を示しています。
待ちは、ターゲットに関する情報をより信頼できるものにするが、インターセプションの物理的機会を減少させる一方、早期に行動することは到達可能性を維持するが、不確実性の下で動きを開始する必要がある。
固定閉ループ保存制御器が与えられた場合、ポリシー条件付き有限ホライゾン最適停止問題として運動を開始するタイミングを定式化する。
この定式化に基づいて,動的ロボットインターセプションのための構造的解法であるモノトン最適停止法(MOS)を提案する。
四つ組の貯蓄政策は強化学習で訓練され、MOSは進化するロボットの状態と目標信念からその政策がいつ活性化されるべきかを決定する。
リリース時間を予測したり、信頼のみに頼るのではなく、MOSは、もう1つの観察を待つよりも、今行動しているというリターンのアドバンテージを学びます。
我々は、この行為と待ち時間のマージンに対する直接のベルマン再帰を導き、物理的緊急性に関してのみ単調性を課し、時間の経過とともにインターセプション機会が不可逆的に失われることを反映している。
この構造は、後続の観測で予測された目標が変化した場合に、クローズドループ適応を保ちながら、動的に貯蓄を要求する早期の活性化を可能にする。
単交差条件下では、MOSは有界近似誤差を持つしきい値解放境界を持つ。
大規模なシミュレーション研究により、MOSはパラメータ整合学習ゲートで平均貯蓄率を67.7%から74.4%に改善し、逆貯蓄率を52.1%から66.5%に向上させた。
リアルロボット実験は、人間のショット・ディレクション・フィーント下での迅速なインターセプションとリリース後の方向補正をさらに実証する。
関連論文リスト
- PredActor: Predictive Action Diffusion for Steerable Onboard Humanoid Control [49.348182500314614]
アクションのみの拡散は直接アクションを生成するが、テスト時間運動の目的に対する明示的な将来の軌道は欠如している。
連立状態-作用拡散はこの表現を提供するが、代表コントローラはしばしば特権付きフルボディ状態に依存する。
提案するPredActorは,これらのステアリング機能を,直接実行されるポリシに組み込む,予測的行動拡散ポリシである。
論文 参考訳(メタデータ) (2026-09-21T16:20:25Z) - Dynamics-Induced Commitment in Learning-Based Robotic Penalty Kicks [31.095840839156065]
ロボットゲームでの学習は、身体がまだ実行可能であることによって制限される。
我々はこれを,ゲームレベルの自己プレーポリシーがサッカー全体のコントローラを固定する階層型ヒューマノイド四段式ペナルティシステムで研究する。
論文 参考訳(メタデータ) (2026-09-17T21:21:35Z) - SPARROW: Survival-POMCP for Adaptive Robot Routing, Observation, and Waiting [17.46665446011569]
ロボットの計画されたルートをブロックする一時的な障害は、シーケンシャルなナビゲーション問題を引き起こす。
部分観測可能な半マルコフ決定過程として,一時的障害物間のグラフナビゲーションを定式化する。
本稿では,部分観測可能なモンテカルロ計画に基づく信念空間プランナであるSPARROWを紹介する。
論文 参考訳(メタデータ) (2026-09-17T19:01:44Z) - Learning Foresight without Explicit Trajectories for 3D Diffusion Policies [54.692734738738885]
3次元拡散ポリシは、現在の観測から幾何学的に基底化されたアクションを生成するのに強い。
我々は,この予測を明示的な計画を導入することなく,シンプルかつ効果的な手段である運動傾向ガイダンスを導入する。
正確にどこに移動すべきかを告げることなく、相互作用がどこに向かっているかを知ることで、大きなメリットを享受できることを、私たちは示しています。
論文 参考訳(メタデータ) (2026-09-17T16:44:13Z) - When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems [57.450132281381066]
ピアエビデンスが単一のメッセージによって決定されるのではなく、隠れたしきい値に達すると、バックドアの動作が起動される。
我々は,MASとBundary-Conditioned Backdoor Injection(BCBI)のための集合的エビデンス-ホールドバックドアパラダイムを導入する。
クリーンな通信力学を学習し,異常なエージェント更新を隔離する,クリーンな唯一の潜時防御であるLATTEを提案する。
論文 参考訳(メタデータ) (2026-08-02T08:38:44Z) - ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control [54.267632784131415]
ReactiveBFMは、ヒューマノイドのためのリアルタイムループ計画制御フレームワークである。
定期的なプレフィックスサンプリングカリキュラムを通じて、致命的な累積露光バイアスを軽減する。
これは、テキスト条件付きクローズドループ運動の膨大なレパートリーにおいて、前例のない物理的機敏さを示す。
論文 参考訳(メタデータ) (2026-06-29T14:27:27Z) - Predictive Style Matching: Natural and Robust Humanoid Locomotion [0.2348805691644085]
予測スタイルマッチング(Predictive Style Matching)は、ロボットの低体状態履歴と速度コマンドを、上体関節と歩行目標の解釈にマッピングする。
ユニツリーG1では、シミュレーションとハードウェアの両方において、PSMはタスクのみのRLよりも、およそ1桁の精度で上半身スタイルの誤差を低減する。
論文 参考訳(メタデータ) (2026-06-05T09:21:20Z) - Perception-to-Pursuit: Track-Centric Temporal Reasoning for Open-World Drone Detection and Autonomous Chasing [0.0]
本稿では,検出と実行可能な追従計画を橋渡しするトラック中心の時間的推論フレームワークを提案する。
我々の研究は、動きパターンに対する時間的推論が正確な予測と行動可能な追跡計画の両方を可能にすることを示した。
論文 参考訳(メタデータ) (2026-01-27T07:57:29Z) - Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent [9.370683025542686]
本稿では,サブタスク境界における障害の検出と修正を行う,アクティブなリプランニングフレームワークを提案する。
AI2-THORシミュレータの実験では,実行障害発生前の意味的および空間的ミスマッチを検出する。
論文 参考訳(メタデータ) (2025-08-15T07:48:51Z) - Learning Vision-based Pursuit-Evasion Robot Policies [54.52536214251999]
我々は、部分的に観察可能なロボットの監督を生成する完全観測可能なロボットポリシーを開発する。
我々は、RGB-Dカメラを搭載した4足歩行ロボットに、野生での追従回避のインタラクションにポリシーを展開させる。
論文 参考訳(メタデータ) (2023-08-30T17:59:05Z) - A Neural Active Inference Model of Perceptual-Motor Learning [62.39667564455059]
アクティブ推論フレームワーク(英: active inference framework、AIF)は、現代の神経科学を基盤とした、有望な新しい計算フレームワークである。
本研究では,ヒトの視覚行動指導において,AIFが期待する役割を捉える能力をテストする。
本稿では,多次元世界状態から自由エネルギーの一次元分布にマッピングする先行関数の新たな定式化について述べる。
論文 参考訳(メタデータ) (2022-11-16T20:00:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。