論文の概要: TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation
- arxiv url: http://arxiv.org/abs/2605.31217v1
- Date: Fri, 29 May 2026 12:21:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.595318
- Title: TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation
- Title(参考訳): Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation
- Authors: Abid Ali, Arunkumar Rathinam, Djamila Aouada,
- Abstract要約: モノアテンション6-F宇宙船は、個々のフレームを処理し、操作中に取得した画像シーケンスに存在する時間情報を破棄する。
本稿では,凍結したViTビジョントランスの自己調整層に3Dアダプタを注入する TALON (Token-conditioned Adapter) を提案する。
Pre-Alignedは、凍結された注意を時間的に濃縮されたトークンの推論を可能にし、ポストアテンションの代替よりもブロック毎に1つのアダプタでパフォーマンスを向上する。
SPADESデータセットでは、TAは前回の最先端よりもポーズエラーを50%削減し、スイスのデータセットではADD-0.1dで21.8%上回る。
- 参考スコア(独自算出の注目度): 14.854437007037683
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Monocular 6-DoF spacecraft pose estimation methods predominantly process individual frames, discarding the temporal information present in an image sequence acquired during spacecraft manoeuvres. Few temporal approaches require full backbone fine-tuning or auxiliary optical flow networks, risking catastrophic forgetting or increasing computational cost, respectively. We propose TALON (Token-Aligned Lightweight adapters for Orbital Navigation): spatiotemporal 3D adapters injected before the self-attention layers of a frozen ViT vision transformer, combined with a patch-token alignment loss that geometrically grounds the adapted features to keypoint structure through a prototype-conditioned KL-divergence objective. Pre-attention placement allows the frozen attention to reason over temporally enriched tokens, achieving stronger performance with a single adapter per block than post-attention alternatives. The alignment loss shapes the intermediate representations so that each keypoint induces a spatially precise activation in the token field, while the framework adds less than 5% parameters to the frozen backbone. On SPADES dataset, TALON reduces the pose error by 50% over the prior state-of-the-art, and on SwissCube dataset it surpasses the prior best by 21.8% in ADD-0.1d accuracy. Zero-shot cross-domain evaluation from sim-to-real on SPARK real data reduces pose error by 4.7x, and ablations characterise the role of adapter depth across in-domain and cross-domain settings.
- Abstract(参考訳): 単眼の6-DoF宇宙船は、主に個々のフレームを処理し、宇宙船の操作中に取得した画像シーケンスに存在する時間情報を破棄する。
時間的アプローチはほとんどなく、完全なバックボーンの微調整や補助的な光学フローネットワークが必要であり、それぞれ壊滅的な忘れ込みや計算コストの増大を危険にさらしている。
テラオン (Token-Aligned Lightweight Adapter for Orbital Navigation): 凍結したViTビジョントランスの自己アテンション層の前に注入された時空間3Dアダプタと, 試作したKL分割目標を用いて, 適応した特徴をキーポイント構造に幾何学的に基礎付けるパッチ・トケンアライメント・アライメント・ロスを併用する。
事前アテンション配置により、凍結した注意が時間的に豊かになったトークンを推論し、アテンション後の代替手段よりも1ブロックあたりのアダプタでより強力なパフォーマンスを達成することができる。
アライメント損失は中間表現を形作るので、各キーポイントはトークンフィールドで空間的に正確なアクティベーションを誘導し、一方フレームワークは凍結したバックボーンに5%未満のパラメータを追加する。
SPADESデータセットでは、TALONは前回の最先端よりも50%のポーズエラーを減らし、SwissCubeデータセットではADD-0.1d精度で21.8%の精度で前回の最高値を上回っている。
SPARK実データにおけるsim-to-realによるゼロショットのクロスドメイン評価は、ポーズエラーを4.7倍に減らし、ドメイン内およびクロスドメイン設定におけるアダプタ深さの役割を特徴付ける。
関連論文リスト
- Point-MF: One-step Point Cloud Generation from a Single Image via Mean Flows [4.719615308536812]
単一画像の点雲再構成は、単一のRGB画像から隠蔽された部分を含む完全な3D形状を推測しなければならない。
低NFE単一像点雲再構成のための平均フローベースのフレームワークであるPoint-MFを提案する。
論文 参考訳(メタデータ) (2026-04-27T15:10:47Z) - FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation [43.11840324722107]
単一の画像から宇宙船の6自由度ポーズを推定することは、軌道内サービシングや宇宙ゴミの除去といった自律的な操作には不可欠である。
視覚変換器(ViT)をベースとしたアーキテクチャであるFastPose-ViTを提案する。
提案手法は,対象境界ボックスから抽出した画像を処理し,これらの局所化予測をフルイメージスケールにマッピングする,新しい数学的フォーマリズムを導入する。
論文 参考訳(メタデータ) (2025-12-10T16:11:00Z) - IPA: An Information-Preserving Input Projection Framework for Efficient Foundation Model Adaptation [56.72132739364876]
隠れた空間の情報を明示的に保存する特徴認識型プロジェクションフレームワークであるIPAを提案する。
IPAはLoRAとDoRAを一貫して改善し、平均1.5ポイントの精度でコモンセンス推論を行う。
論文 参考訳(メタデータ) (2025-09-04T17:10:01Z) - Adaptive Point-Prompt Tuning: Fine-Tuning Heterogeneous Foundation Models for 3D Point Cloud Analysis [51.37795317716487]
本稿では,パラメータの少ない事前学習モデルを微調整するAdaptive Point-Prompt Tuning (APPT)法を提案する。
局所幾何学を集約することで原点雲を点埋め込みに変換し、空間的特徴を捉える。
任意のモダリティのソース領域から3Dへの自己アテンションを校正するために,重みを点埋め込みモジュールと共有するプロンプトジェネレータを導入する。
論文 参考訳(メタデータ) (2025-08-30T06:02:21Z) - High-Frequency Semantics and Geometric Priors for End-to-End Detection Transformers in Challenging UAV Imagery [6.902247657565531]
本稿では,空中シーンに適したリアルタイム検出変換器であるHEDS-DETRを紹介する。
まず,高周波数拡張セマンティックスネットワーク(HFESNet)のバックボーンを提案する。
第2に、高分解能特徴を効率的に融合させることにより、情報損失に対処する。
第三に、2つの相乗的成分を用いてデコーダの安定性と位置決め精度を向上させる。
論文 参考訳(メタデータ) (2025-07-01T14:56:56Z) - Parameter-Efficient Fine-Tuning in Spectral Domain for Point Cloud Learning [49.91297276176978]
我々は,ポイントクラウドのための新しい固有textbfPointGST (textbfGraph textbfSpectral textbfTuning) 法を提案する。
ポイントGSTは事前訓練されたモデルを凍結し、スペクトル領域の微調整パラメータのための軽量で訓練可能なポイントクラウドスペクトルアダプタ(PCSA)を導入する。
さまざまなタスクにわたる挑戦的なポイントクラウドデータセットの実験では、ポイントGSTが完全に微調整されたデータセットを上回るだけでなく、トレーニング可能なパラメータも大幅に削減されていることが示されている。
論文 参考訳(メタデータ) (2024-10-10T17:00:04Z) - CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse Inputs [65.80187860906115]
スパース入力によるNeRFの性能向上のための新しい手法を提案する。
まず, サンプル線が, 3次元空間内の特定のボクセルと交差することを保証するために, ボクセルを用いた放射線サンプリング戦略を採用する。
次に、ボクセル内の追加点をランダムにサンプリングし、トランスフォーマーを適用して各線上の他の点の特性を推測し、ボリュームレンダリングに組み込む。
論文 参考訳(メタデータ) (2024-03-25T15:56:17Z) - Coordinate Transformer: Achieving Single-stage Multi-person Mesh
Recovery from Videos [91.44553585470688]
ビデオから複数人の3Dメッシュを回収することは、バーチャルリアリティーや理学療法などにおけるグループ行動の自動認識に向けた重要な第一歩である。
本稿では,複数人物の時空間関係を直接モデル化し,同時にエンドツーエンドでマルチ・メッシュ・リカバリを行うコーディネート・トランスフォーマーを提案する。
3DPWデータセットの実験では、CoordFormerが最先端の精度を大幅に向上し、MPJPE、PAMPJPE、PVEの計測値でそれぞれ4.2%、8.8%、そして4.7%を上回った。
論文 参考訳(メタデータ) (2023-08-20T18:23:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。