論文の概要: Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection
- arxiv url: http://arxiv.org/abs/2606.15427v1
- Date: Sat, 13 Jun 2026 18:29:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.568792
- Title: Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection
- Title(参考訳): 軌道上宇宙機検査のためのプロンプティングによる視線モデルの拡張
- Authors: Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs, Seemanthini K. Putane, Van Minh Nguyen, Ryan T. White,
- Abstract要約: 宇宙飛行の検査システムは、しばしば打ち上げ前に知覚モデルを展開し、その後モデル重みを更新したり、固定されたラベルセットを拡張することは実用的ではない。
本研究は,プロンプト駆動型視覚言語モデルが,打ち上げ後のセマンティック展開を可能にし,搭載重量を変更することなく,自然言語プロンプトを介して新しい宇宙船コンポーネントを特定できるかどうかを考察する。
- 参考スコア(独自算出の注目度): 1.6804523947717527
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spaceborne inspection systems often deploy perception models prior to launch, after which updating model weights or expanding fixed label sets becomes operationally impractical. While supervised models can be integrated pre-flight, adding new semantic capabilities in orbit requires retraining and re-uploading parameters. We investigate whether prompt-driven vision--language models can enable post-launch semantic expansion, allowing new spacecraft components to be specified via natural-language prompts without modifying onboard weights. We evaluate zero-shot instance segmentation of spacecraft components under a strictly frozen, single-pass inference protocol on a test set of $129$ images of previously unseen satellites. Under fixed global thresholds and no post-processing, SAM3 achieves $0.385$ mAP@$0.5$ and $0.267$ mAP@$0.5{:}0.95$. Performance is strongly scale-dependent: large structural elements like spacecraft bodies ($0.639$ AP@$0.50$) and solar arrays ($0.598$ AP@$0.5$) localize reliably, while relatively small appendages like antennas ($0.221$ AP@$0.5$) and thrusters ($0.081$ AP@$0.5$) remain difficult. Prompt formulation influences performance, with structured prompts incorporating spatial and geometric descriptors yielding up to $82%$ improvement over short category-name prompts. The model operates within the memory and compute envelope of contemporary embedded GPUs, suggesting prompt-driven grounding can provide a practical mechanism for post-launch semantic extension of dominant spacecraft structures while highlighting limitations of zero-shot localization for fine-scale components under orbital domain shift.
- Abstract(参考訳): 宇宙飛行の検査システムは、しばしば打ち上げ前に知覚モデルを展開し、その後モデル重みを更新したり、固定されたラベルセットを拡張することは実用的ではない。
教師付きモデルは事前飛行に統合できるが、軌道に新しいセマンティック機能を追加するには、パラメータの再トレーニングと再アップロードが必要である。
本研究は,プロンプト駆動型視覚言語モデルが,打ち上げ後のセマンティック展開を可能にし,搭載重量を変更することなく,自然言語プロンプトを介して新しい宇宙船コンポーネントを特定できるかどうかを考察する。
衛星部品のゼロショット・インスタンス・セグメンテーションを、129ドル(約1万2000円)の衛星画像を用いて厳密に凍結したシングルパス推論プロトコルで評価した。
固定されたグローバルしきい値と後処理なしで、SAM3は0.385$ mAP@$0.5$と0.267$ mAP@$0.5{:}0.95$を達成する。
宇宙船本体 (0.639$ AP@$0.50$) や太陽電池アレイ (0.598$ AP@$0.5$) のような大きな構造要素は確実にローカライズされるが、アンテナ (0.221$ AP@$0.5$) やスラスタ (0.081$ AP@$0.5$) のような比較的小さな付加物は依然として難しい。
プロンプトの定式化は性能に影響を与え、空間的および幾何学的記述子を組み込んだ構造化プロンプトは、短いカテゴリ名プロンプトよりも最大82%$の改善をもたらす。
このモデルは、現在の組み込みGPUのメモリと計算エンベロープ内で動作し、プロンプト駆動の接地により、オービタルドメインシフトの下での微小なコンポーネントのゼロショットローカライゼーションの制限を強調しながら、支配的な宇宙船構造のセマンティック拡張を後から開始する実用的なメカニズムを提供することができる。
関連論文リスト
- SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation [1.0262304700896199]
宇宙船認識のための大規模マルチモーダルベンチマークである textbfSpaceSense-Bench を提案する。
各フレームは、タイム同期1024$times$1024 RGBイメージ、ミリ精度深度マップ、256ビームのLiDAR点雲を提供する。
対象検出,2Dセマンティックセマンティックセグメンテーション,RGB-LiDAR融合による3Dポイントクラウドセグメンテーション,単眼深度推定,方向推定の5つのタスクをベンチマークし,2つの重要な発見点を同定した。
論文 参考訳(メタデータ) (2026-03-10T07:52:28Z) - Learning Accurate Segmentation Purely from Self-Supervision [87.78965637247107]
Selfmentは完全に自己管理型のフレームワークで、人間のラベルなしでオブジェクトを生画像から直接分割する。
Selfmentは、複数のベンチマークで新しい最先端(SoTA)結果を設定する。
論文 参考訳(メタデータ) (2026-02-27T07:36:32Z) - THOR: A Versatile Foundation Model for Earth Observation Climate and Society Applications [9.852915112122567]
THOR は入力の不均一性とデプロイメントの剛性の両方を解決する "Computeadaptive" 基盤モデルである。
我々は、新しいランダム化パッチと入力画像サイズ戦略を用いて、THORを事前訓練する。
これにより、どんなパッチサイズでも推論してトレーニング済みの重みのセットをデプロイすることが可能になり、再トレーニングせずに計算コストと特徴解決の間の動的なトレードオフが可能になる。
論文 参考訳(メタデータ) (2026-01-22T14:38:00Z) - Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space [56.37266873329401]
大規模言語モデル (LLM) は、高度に一様でない情報密度を示す言語にもかかわらず、全てのトークンに一様計算を適用する。
我々は,潜在表現から意味境界を学習し,トークンから推論がより効率的である圧縮概念空間へ移行する階層型言語モデリングフレームワークである$textbfDynamic Large Concept Models (DLCM)$を提案する。
論文 参考訳(メタデータ) (2025-12-31T04:19:33Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - Scaling Embedding Layers in Language Models [61.939921364422936]
$SCONE$は入力埋め込み層を拡張して言語モデルのパフォーマンスを向上させる新しいメソッドである。
SCONE$は、n-gramの頻繁なセットに埋め込みを導入しながら、元の語彙を保持します。
これらの埋め込みは、各入力トークンに対してコンテキスト化された表現を提供し、トレーニング中に別のモデルで学習する。
$SCONE$は、n-gram埋め込みの数を増やし、それらを学ぶために使用するモデルをスケーリングする、という2つの新しいスケーリング戦略を可能にします。
論文 参考訳(メタデータ) (2025-02-03T18:59:32Z) - E-LANG: Energy-Based Joint Inferencing of Super and Swift Language
Models [9.36591003178585]
本稿では,大規模高精度スーパーモデルと軽量スウィフトモデルの間での推論を分散するE-Langと呼ばれる効果的な動的推論手法を提案する。
E-Langは簡単に採用でき、アーキテクチャに依存しない。
エンコーダのみのバックボーンや分類タスクにのみ適用可能な既存の手法とは異なり,本手法はエンコーダ・デコーダ構造や,翻訳などのシーケンス・ツー・シーケンスタスクにも有効である。
論文 参考訳(メタデータ) (2022-03-01T21:21:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。