論文の概要: Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance
- arxiv url: http://arxiv.org/abs/2608.09628v1
- Date: Mon, 10 Aug 2026 14:09:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.298471
- Title: Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance
- Title(参考訳): 宇宙デブリ回避のための近似政策最適化による衛星軌道最適化
- Authors: Logan Luna, Juan Ortiz Couder, Raul Alejandro Vargas-Acosta,
- Abstract要約: 決定論的GEOの1000エピソードにおいて、エージェントは97.5%の衝突回避成功率を達成する。
我々は,サン/ムーンの3体摂動,燃料依存推力,破片場を用いてニュートンの2体力学をシミュレートした。
私たちの仕事はhttps://purl.org/sat-trajectory-avoidance.orgで公開されているフレームワークです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Collision avoidance systems are commonly used to avoid fragmentation events occurring in Low-Earth Orbit (LEO) and Geosynchronous Equatorial Orbit (GEO). However, these events have been growing in frequency as orbital congestion worsens with the launch of megaconstellations. Consequently, conjunction alerts and collision risks are becoming increasingly common. Current practices, which are commonly manual or rule-based, have difficulty scaling to these worsening dynamic environments. To address this intensifying situation, we propose a reinforcement-learning policy for autonomous collision avoidance, trained via Proximal Policy Optimization (PPO) along with an open-source, high-fidelity astrodynamics simulator for training and evaluation. In 1,000 deterministic GEO episodes, our agent achieves a 97.5% collision avoidance success rate, outperforming traditional controllers such as a rule-based baseline (20.7% success) and an impulsive delta-v planner baseline (27.5% success). To achieve these results, we designed a simulator to train and evaluate our agent, using real-world and simulated debris. We simulate Newtonian two-body dynamics using Sun/Moon third-body perturbations, fuel-dependent thrust, and configurable debris fields. The agent is trained with curriculum learning and shaped rewards oriented toward encouraging survival, adequate projected miss distance, and delta-v conservation. Finally, our evaluation consisted of a fully deterministic pipeline, including shared seeds, per-episode logs, and telemetry exports. Our work is a publicly available framework at https://purl.org/sat-trajectory-avoidance
- Abstract(参考訳): 衝突回避システムは、低地球軌道(LEO)とGeosynchronous Equatorial Orbit(GEO)で発生する断片化イベントを避けるために一般的に用いられる。
しかし、これらの事象は、巨星の打ち上げによって軌道の混雑が悪化するにつれて、頻度が増している。
その結果、共同警報や衝突の危険性はますます一般的になりつつある。
一般的に手動あるいはルールベースの現在のプラクティスは、これらの悪化する動的環境へのスケーリングが困難である。
そこで本研究では,PPO(Proximal Policy Optimization)とオープンソースの高忠実度天体力学シミュレータを用いて,自律衝突回避のための強化学習政策を提案する。
1000の決定論的GEOエピソードにおいて、我々のエージェントは97.5%の衝突回避成功率を達成し、ルールベースベースライン(20.7%の成功)やインパルスデルタ-vプランナーベースライン(27.5%の成功)といった従来のコントローラよりも優れていた。
これらの結果を得るために,実世界とシミュレーションされた破片を用いてエージェントの訓練と評価を行うシミュレータを設計した。
我々は,サン/ムーンの3体摂動,燃料依存推力,および構成可能な破片場を用いてニュートンの2体力学をシミュレートする。
このエージェントはカリキュラムの学習と、生き残り、適切に投影されたミス距離、デルタ-V保存を奨励するために形づくられた報酬で訓練されている。
最後に, 種子の共有, エピソード単位のログ, テレメトリエクスポートなど, 完全な決定論的パイプラインから評価した。
私たちの仕事はhttps://purl.org/sat-trajectory-avoidanceで公開されているフレームワークです。
関連論文リスト
- Neural operator learning for collision-aware trajectory planning of spacecraft swarms [6.404845149899844]
我々は、宇宙船、ターゲット、デブリを1回の前方通過で群全体の衝突認識軌道にマッピングする置換同変ニューラル演算子を導入する。
オペレーターは最適な軌道ラベルなしで訓練され、自己監督された物理目標と自身のロールアウトに対して発生する敵の脅威を組み合わせる。
11,000以上のカタログ化されたオブジェクトの中で、ゼロショットを1000個の群れに一般化し、エージェントごとの最適制御ソルバの精度と一致し、破片のブラインドベースラインが不可能な最悪の脅威を回避し、群れ内の近さを数倍に減らした。
論文 参考訳(メタデータ) (2026-07-31T22:10:47Z) - World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning [60.88859946006306]
Adversa World Modeling(英語版)は理論上基礎を成すマルチエージェント・セルフプレイ・ファインチューニングフレームワークである。
内的最小化においては、プランナーの予測世界モデルは、スパースでシーン適応的なアタック・アタック・アライアンスを学ぶロール条件の敵に変換される。
nuPlan と InterPlan のベンチマーク実験により,本手法が伝達可能な対角相互作用を生成することを示す。
論文 参考訳(メタデータ) (2026-07-12T07:44:16Z) - ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control [54.267632784131415]
ReactiveBFMは、ヒューマノイドのためのリアルタイムループ計画制御フレームワークである。
定期的なプレフィックスサンプリングカリキュラムを通じて、致命的な累積露光バイアスを軽減する。
これは、テキスト条件付きクローズドループ運動の膨大なレパートリーにおいて、前例のない物理的機敏さを示す。
論文 参考訳(メタデータ) (2026-06-29T14:27:27Z) - RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework [49.531001563853984]
RAD-2はクローズドループ計画のための統一されたジェネレータ・ディスクリミネーターフレームワークである。
様々な軌道候補を生成する一方、RL最適化判別器は、これらの候補を長期的な運転品質に応じて再現する。
強い拡散ベースのプランナーに比べて衝突速度を56%削減する。
論文 参考訳(メタデータ) (2026-04-16T17:59:44Z) - ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving [63.980630608984605]
本稿では、ゼロサムマルコフゲームとして、駆動ポリシー(ディフェンダー)と敵エージェント(アタックラー)の相互作用を扱うクローズドループのmin-max最適化フレームワークであるADV-0を提案する。
これを実現するため,我々は動的敵の進化を反復的な選好学習とし,この最適性を効率的に近似し,アルゴリズムに依存しない解をゲームに提供する。
実験により、多様な安全クリティカルな障害を効果的に露呈し、学習方針と運動プランナーの両方の一般化可能性を大幅に向上させることが示されている。
論文 参考訳(メタデータ) (2026-03-16T12:58:31Z) - Optimal Multi-Debris Mission Planning in LEO: A Deep Reinforcement Learning Approach with Co-Elliptic Transfers and Refueling [22.261628532402067]
本稿では, ホフマン転移, 安全近接操作, 明示的再給油論理を組み合わせた統合型楕円型操舵フレームワークを提案する。
我々は、Greedy、Monte Carlo Tree Search(MCTS)、Deep reinforcement Learning(RL)の3つの異なる計画アルゴリズムをベンチマークする。
100以上のテストシナリオの実験結果から,Masked PPOはミッション効率と計算性能に優れることが示された。
論文 参考訳(メタデータ) (2026-02-04T22:15:14Z) - Optimizing Mission Planning for Multi-Debris Rendezvous Using Reinforcement Learning with Refueling and Adaptive Collision Avoidance [22.261628532402067]
本研究では, アクティブデブリ除去ミッションにおける適応衝突回避のための強化学習に基づく枠組みを提案する。
小型衛星は、柔軟性、コスト効率、操縦性から採用され、ADRのようなダイナミックなミッションに適している。
このフレームワークは、補給戦略、効率的なミッション計画、適応衝突回避を統合し、宇宙船のランデブー操作を最適化する。
論文 参考訳(メタデータ) (2026-02-04T21:49:20Z) - TLE-Based A2C Agent for Terrestrial Coverage Orbital Path Planning [0.0]
低地球軌道(LEO)の混雑は、地球観測衛星の効率的な展開と安全な運用に永続的な課題をもたらす。
本研究では,Advantage Actor-Critic (A2C) アルゴリズムを用いて衛星軌道パラメータを精密な地上被覆のために最適化する強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-14T17:44:51Z) - On-orbit Servicing for Spacecraft Collision Avoidance With Autonomous Decision Making [0.0]
本研究は、宇宙船衝突回避演習(CAM)を支援するために、AIによるOOSミッションの実装を開発する。
本稿では、RL(Reinforcement Learning)を用いて訓練された自律型サーベイラを提案し、ターゲット衛星と宇宙デブリの衝突を自律的に検出し、絶滅危惧衛星とのランデブーとドッキングを行い、最適なCAMを実行する。
論文 参考訳(メタデータ) (2024-09-25T17:40:37Z) - ReGentS: Real-World Safety-Critical Driving Scenario Generation Made Stable [88.08120417169971]
機械学習に基づく自律運転システムは、現実世界のデータでは稀な安全クリティカルなシナリオで課題に直面していることが多い。
この研究は、軌道最適化によって複雑な現実世界の通常のシナリオを変更することによって、安全クリティカルな運転シナリオを生成することを検討する。
提案手法は、頑健なプランナーの訓練には役に立たない非現実的な発散軌道と避けられない衝突シナリオに対処する。
論文 参考訳(メタデータ) (2024-09-12T08:26:33Z) - Reinforcement Learning for Low-Thrust Trajectory Design of
Interplanetary Missions [77.34726150561087]
本稿では, 惑星間軌道のロバスト設計における強化学習の適用について検討する。
最先端アルゴリズムのオープンソース実装が採用されている。
その結果得られた誘導制御ネットワークは、堅牢な名目的軌道と関連する閉ループ誘導法の両方を提供する。
論文 参考訳(メタデータ) (2020-08-19T15:22:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。