論文の概要: Self-Adaptive Learning and Model Predictive Control for Tracking Unknown Dynamics with No Regret
- arxiv url: http://arxiv.org/abs/2607.26370v1
- Date: Wed, 29 Jul 2026 01:07:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.505937
- Title: Self-Adaptive Learning and Model Predictive Control for Tracking Unknown Dynamics with No Regret
- Title(参考訳): 回帰のない未知のダイナミクス追跡のための自己適応学習とモデル予測制御
- Abstract要約: 本研究では,未知のターゲットダイナミクスを追跡するための制御手法として,自己適応型オンライン学習を提案する。
ターゲットダイナミクスは、特に、構造化された、ランダムな、または/または対向運動の混合物のスイッチング挙動を示すことができる。
提案手法は,スクラッチから,自己教師付き,ワンショット,計算効率のよい学習を通じて,複数の予測器を同時に学習する。
- 参考スコア(独自算出の注目度): 21.1874838887222
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose a self-adaptive online learning for control method for tracking unknown target dynamics. The target dynamics can exhibit switching behavior, particularly, a mixture of structured, random, and/or adversarial motion. Such challenging target tracking scenarios arise in applications of dynamic mapping, traffic control, and pursuit evasion, where robots need to track, pursue, or avoid collision with moving landmarks, objects, humans, etc., whose dynamics are unknown. Our method simultaneously learns multiple predictors from scratch, via self-supervised, one-shot, and computationally efficient learning, and adaptively selects the best one to match the observed target behavior. The method enjoys finite-time near-optimality guarantees in expectation, characterized as a function of the learning error of the target dynamics and the frequency that the target dynamics switch. In the absence of both error and switching, the method asymptotically matches the optimal non-causal control policy that knows a priori the target dynamics, i.e., the method enjoys no regret in expectation. In the presence of learning errors and switching, the method degrades gracefully, \eg when there are errors and no switching, the average regret is proportional to the average learning error and switching times. To prove these guarantees, a novel technical approach is required compared to the existing works that employ RFF-based online learning. We validate our method in Crazyflie simulations and hardware experiments, across target trajectories that vary from structured to random to adversarial, in comparison to non-stochastic, kernel-based, and neural-network-based methods for online learning.
- Abstract(参考訳): 本研究では,未知のターゲットダイナミクスを追跡するための制御手法として,自己適応型オンライン学習を提案する。
ターゲットダイナミクスは、特に、構造化された、ランダムな、または/または対向運動の混合物のスイッチング挙動を示すことができる。
このような挑戦的な目標追跡シナリオは、動的マッピング、交通制御、追跡回避の応用に現れ、ロボットは動いたランドマークや物体、人間などとの衝突を追跡、追跡、回避する必要がある。
提案手法は,複数の予測器をスクラッチから,自己教師付き,ワンショット,計算効率の学習を通じて同時に学習し,観測対象行動に適合する最適な予測器を適応的に選択する。
目標動力学の学習誤差と目標動力学が切り替える頻度の関数として特徴付けられる予測における有限時間近最適保証を享受する。
エラーとスイッチングの両方がない場合、この方法は目標ダイナミクスの優先順位を知っている最適な非因果制御ポリシーと漸近的に一致します。
学習誤差や切替の有無で、誤りや切替がない場合、平均的後悔は平均的な学習誤差や切替時間に比例する。
これらの保証を証明するためには、RFFベースのオンライン学習を採用する既存の研究と比較して、新しい技術的アプローチが必要である。
オンライン学習における非確率的,カーネルベース,ニューラルネットワークベースの手法と比較して,構造化からランダム,逆方向まで様々な対象軌跡を網羅したクレイジーリーシミュレーションおよびハードウェア実験において,本手法の有効性を検証した。
関連論文リスト
- Action Flow Matching for Continual Robot Learning [54.10050120844738]
ロボット工学における継続的な学習は、変化する環境やタスクに常に適応できるシステムを求める。
本稿では,オンラインロボット力学モデルアライメントのためのフローマッチングを利用した生成フレームワークを提案する。
ロボットは,不整合モデルで探索するのではなく,行動自体を変換することで,より効率的に情報収集を行う。
論文 参考訳(メタデータ) (2025-04-25T16:26:15Z) - An Adaptive Fuzzy Reinforcement Learning Cooperative Approach for the
Autonomous Control of Flock Systems [4.961066282705832]
この研究は、群集システムの自律制御に適応的な分散ロバスト性技術を導入している。
比較的柔軟な構造は、様々な目的を同時に狙うオンラインファジィ強化学習スキームに基づいている。
動的障害に直面した場合のレジリエンスに加えて、アルゴリズムはフィードバック信号としてエージェントの位置以上のものを必要としない。
論文 参考訳(メタデータ) (2023-03-17T13:07:35Z) - Safe Multi-agent Learning via Trapping Regions [89.24858306636816]
我々は、動的システムの定性理論から知られているトラップ領域の概念を適用し、分散学習のための共同戦略空間に安全セットを作成する。
本稿では,既知の学習力学を持つシステムにおいて,候補がトラップ領域を形成することを検証するための二分分割アルゴリズムと,学習力学が未知のシナリオに対するサンプリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-02-27T14:47:52Z) - Active Learning of Discrete-Time Dynamics for Uncertainty-Aware Model Predictive Control [46.81433026280051]
本稿では,非線形ロボットシステムの力学を積極的にモデル化する自己教師型学習手法を提案する。
我々のアプローチは、目に見えない飛行条件に一貫して適応することで、高いレジリエンスと一般化能力を示す。
論文 参考訳(メタデータ) (2022-10-23T00:45:05Z) - Nonlinear Model Based Guidance with Deep Learning Based Target
Trajectory Prediction Against Aerial Agile Attack Patterns [0.0]
深層学習に基づく軌道予測と非線形モデル予測制御を組み合わせた新しいミサイル誘導アルゴリズムを提案する。
目標加速度予測を用いた非線形モデルに基づく予測制御(NMPC-TAP)は,誤差距離の観点から比較すると有意に優れていた。
論文 参考訳(メタデータ) (2021-04-06T13:20:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。