論文の概要: Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield
- arxiv url: http://arxiv.org/abs/2606.25366v1
- Date: Wed, 24 Jun 2026 03:55:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.212507
- Title: Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield
- Title(参考訳): 信頼性非対称宇宙機オートノミー: 検証された適応型ランタイムシールドで学習可能なGNCスタックを設計する
- Abstract要約: ルールベースの自律性は認証可能であるが不安定であり、学習された自律性は能力があるが検証するのは難しい。
AMPLE-GNCは3層誘導、ナビゲーション、制御スタックである。
文法制約付き復号化による事前訓練された360Mモデルの微調整は、ハードな出力値保証を与える。
我々は,有能な制御器であっても,ラッチングセーフホールドシールドが抑制可能であることを示す。
- 参考スコア(独自算出の注目度): 2.28438857884398
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deep-space missions need onboard autonomy that is both capable and certifiable. Rule-based autonomy is certifiable but brittle, while learned autonomy is capable but hard to verify. We present AMPLE-GNC, a three-tier guidance, navigation, and control stack. Its capability path combines a small foundation-model commander that maps natural language to PDDL+, a constraint-screening verifier, and a fault-adaptive controller. All three are bounded by a runtime shield with nine linear-temporal-logic invariants whose predictor soundness is machine-checked by the Kind 2 model checker. On a 6-DOF Basilisk testbed, we make three contributions. First, we deploy an edge commander. Fine-tuning a pretrained 360M model with grammar-constrained decoding gives a hard output-validity guarantee and 84% planner-executable actions. On a de-leaked test, novel-phrasing generalization is 38% exact and 51% action, rising to 48% exact after phrasing-diversity re-finetuning; we separate syntactic validity from semantic accuracy. Second, we introduce a fault-adaptive controller. Rapid Motor Adaptation infers latent actuator faults online and recovers 97.8% of actuator-sign faults and 94.4% of continuous-gain faults within the training randomization envelope. Fault-unaware PD and from-scratch end-to-end RL both score 0%, while the strongest classical-adaptive baseline reaches 55% on continuous gain. Beyond the envelope, a split-conformant retrain scores 57-67%, and adding 4x more in-regime data worsens performance, showing that randomization breadth, not data volume, drives generalization. Robustness is flat under star-tracker noise to 0.005. Third, we show that a latching safe-hold shield can suppress even a capable controller. A split-conformal recovery-deadline certificate with adaptation-aware engagement reconciles safety and recovery, keeping the controller 94.5% autonomous while still catching non-recovery.
- Abstract(参考訳): 深宇宙ミッションには、有能かつ認証可能な自律性が必要です。
ルールベースの自律性は認証可能であるが不安定であり、学習された自律性は能力があるが検証するのは難しい。
AMPLE-GNCは3層誘導、ナビゲーション、制御スタックである。
その能力パスは、自然言語をPDDL+にマッピングする小さな基礎モデルコマンド、制約スクリーニング検証器、フォールト・アダプティブ・コントローラを組み合わせたものである。
これら3つはすべて、Kind 2モデルチェッカーによって予測音が機械チェックされる9つの線形時間論理不変量を持つランタイムシールドによって境界付けられている。
6-DOFのBasiliskテストベッドでは、3つのコントリビューションを行います。
まず、エッジコマンドをデプロイします。
文法制約付き復号法で事前訓練された360Mモデルを微調整すると、ハードな出力値保証と84%のプランナー実行可能な動作が得られる。
脱リード試験では, 新規表現の一般化は38%, 51%であり, 48%まで上昇し, 相乗的妥当性を意味的精度から分離した。
次に,障害適応型コントローラを提案する。
ラピッドモーター適応(Rapid Motor Adaptation)は、潜在アクチュエータ障害をオンラインで推測し、97.8%のアクチュエータサイン障害と94.4%の連続ゲイン障害をトレーニングランダム化エンベロープ内で回復させる。
フォールト・アウェアPDとオフ・スクラッチ・エンド・ツー・エンドRLはいずれも0%、最強の古典適応ベースラインは連続利得で55%に達する。
エンベロープの向こうでは、スプリット・コンフォーマント・リトレインが57-67%のスコアを獲得し、さらに4倍のイン・レジームデータを追加することで、データボリュームではなくランダム化幅が一般化を促進することを示す。
ロバスト性は0.005の星追跡音の下で平坦である。
第3に,有能な制御器であっても,ラッチングセーフホールドシールドが抑制可能であることを示す。
アダプティブ・アウェア・エンゲージメントを備えたスプリット・コンフォーマル・リカバリ・デッドライン証明書は、安全とリカバリを調整し、制御器は94.5%の自律性を維持しながら、非回復性を維持している。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World [0.0]
LLMルータは、各要求を最も安価な適切なモデルに合わせることで効率を約束し、マルチステップエージェント内のステップごとに適用されるようになっている。
しかし、エージェントルータはシングルターンルータのように評価され、ログ付きトラジェクトリを再生し、他のモデルの出力を置換することで評価される。
我々は,SWE-benchエージェントを制御点にフォークし,環境を再構築し,各フォークを異なるモデルで継続し,サンプリングと再生を分離する同モデル制御フォークと比較する。
論文 参考訳(メタデータ) (2026-08-08T17:07:11Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction [17.527470001317685]
本研究では,コンパクトな小言語モデル (SLM) を制御推論のために再訓練し,検証器誘導補正ループに組み込むことができるかを検討する。
ランダム化熱制御シミュレーション(それぞれ500段の30の実験)では、平均的なアクションアライメント精度が91.5%に達する。
シンボリック・リマッピングの下では95%のインレンジレートを維持しており、トークンレベルの合意が減ったにもかかわらず、堅牢な物理的規制を示している。
論文 参考訳(メタデータ) (2026-06-24T13:49:01Z) - What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods [2.28438857884398]
近年のFTCの研究は、宇宙船のアクチュエーターの故障で高い成功を収めたことを報告している。
我々は、成功がトレーニングで見たことのない欠陥にそれを保持することを意味しているとき、宇宙船が何を指しているのかを尋ねる。
私たちは、落ち着いたゲートの周りに構築されたベンチマークで回答します。
論文 参考訳(メタデータ) (2026-06-24T04:08:39Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models [9.281774217584289]
CyberCorrectは、大規模言語モデルの自己訂正を形式化するフレームワークである。
タイプ指向補正制御器は、診断されたエラーカテゴリに基づいて修理指示を生成する。
収束判定器は、制御理論から適応された安定性基準を用いて繰り返し終了を決定する。
論文 参考訳(メタデータ) (2026-05-17T07:47:34Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute [10.548368675645403]
CoRefineは、トークンのごく一部を使って競争精度を達成する自信誘導型自己精製法である。
コントローラはフルトレースの信頼性を消費し、停止するか、再検査するか、あるいは別のアプローチを試すかを決定する。
これをCoRefine-Treeに拡張します。これは、探索とエクスプロイトを適応的にバランスさせる、ハイブリッドなシーケンシャル並列型です。
論文 参考訳(メタデータ) (2026-02-09T17:44:41Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Valid Stopping for LLM Generation via Empirical Dynamic Formal Lift [6.908972852063454]
シーケンシャルEDFLは、シーケンシャルベースラインに対して22~28%生成を減少させる。
EDFLは第1段階のフィルタとして機能し、検証負荷を83%削減する。
論文 参考訳(メタデータ) (2025-10-07T21:28:53Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。