論文の概要: Communication-Efficient Relative Pose Estimation with Vision Foundation Models for Ephemeral Collaborative Perception
- arxiv url: http://arxiv.org/abs/2607.14539v1
- Date: Thu, 16 Jul 2026 03:46:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.977816
- Title: Communication-Efficient Relative Pose Estimation with Vision Foundation Models for Ephemeral Collaborative Perception
- Title(参考訳): 瞬時協調知覚のための視覚基礎モデルを用いたコミュニケーション効率の良い相対的ポース推定
- Abstract要約: CERPEは、視覚基盤モデルを調整するシステムレベルのフレームワークで、エゴモーションとロボット間の相対的なポーズを共同で推定する。
重なり合わない出会いは、計量スケールされたエゴモーションを通じてロボット間の相対的なポーズを伝播することによって処理される。
CERPEは、短命協調知覚における選択されたベースラインに対する6-DoF相対的なポーズ推定を改善する。
- 参考スコア(独自算出の注目度): 8.399354317934963
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Relative pose estimation is a fundamental capability for collaborative perception and coordination in multi-robot systems. However, robots encountering each other in real-world environments often operate in short interaction windows and must operate under limited communication bandwidth with intermittent or missing visual overlap caused by occlusions or limited fields of view. Existing approaches typically rely on global reference frames, assume sustained view overlap, or incur prohibitive communication costs, thereby limiting their applicability to ephemeral collaborative perception. To address these challenges, we introduce communication-efficient relative pose estimation (CERPE), a system-level framework that coordinates vision foundation models to jointly estimate ego-motion and inter-robot relative pose. CERPE reduces unnecessary raw-observation exchange by using continuously shared fixed-size descriptors to gate event-triggered raw-image requests independently of pose estimation. Non-overlapping encounters are handled by propagating inter-robot relative poses through metrically scaled ego-motion, thus maintaining relative pose estimates even in the absence of visual overlap. Experiments in simulation and real-world robots show that CERPE improves 6-DoF relative pose estimation over selected baselines in ephemeral collaborative perception.
- Abstract(参考訳): 相対的ポーズ推定は,複数ロボットシステムにおける協調認識と協調の基本的な機能である。
しかし、現実の環境で遭遇するロボットは、短時間のインタラクションウィンドウで動作し、排他的あるいは視野の制限による視覚的重なりが欠如しているため、限られた通信帯域で動作しなければならない。
既存のアプローチは通常、グローバルな参照フレーム、持続的なビューオーバーラップ、あるいは禁止的な通信コストを前提とすることで、短命な協調認識の適用性を制限している。
これらの課題に対処するため,コミュニケーション効率の高い相対ポーズ推定(CERPE)を導入し,視覚基盤モデルとロボット間相対ポーズを協調的に推定するシステムレベルのフレームワークを提案する。
CERPEは、ポーズ推定とは無関係にイベントトリガーされた生画像要求をゲートするために、継続的に共有された固定サイズのディスクリプタを使用することで、不要な生画像交換を減らす。
非重なりの出会いは、計量的スケールのエゴモーションを通じてロボット間の相対的なポーズを伝播することにより処理され、視覚的重なりがなくても相対的なポーズ推定が維持される。
シミュレーションと実世界のロボット実験により、CERPEは短命の協調知覚において、選択されたベースラインよりも6-DoFの相対的なポーズ推定を改善することが示された。
関連論文リスト
- IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training [18.292611164084537]
IMPACTは,事前誘導と目標設定を併用したスケーラブルなインタラクション対応フレームワークである。
IMPACTは、対応するMSE訓練ベースラインを一貫して上回り、相互作用の忠実度、物理的妥当性、視覚的品質を改善している。
論文 参考訳(メタデータ) (2026-08-31T18:00:36Z) - Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation [6.979012378888037]
本稿では,定数アーム長に基づく幾何制約を強制することにより,深度推定を改善するArm Kinematic Correction (AKC)法を提案する。
Vicon参照システムに対する実験的検証は、静的および動的関節運動の信頼性を示す。
その結果, AKCは信頼性の低い時間フィルタと組み合わせても, 長期的, 厳密な自己閉塞下では頑健性を高め, 解剖学的整合性を維持することが示唆された。
論文 参考訳(メタデータ) (2026-06-17T16:20:10Z) - SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance [49.69016078147708]
密接な相互作用シナリオにおける人間の行動の正確な再構築は、拡張現実における現実的な仮想インタラクションの実現に不可欠である。
本稿では,これらの問題に効果的に対処するための意味的および幾何学的手がかりを統合する拡散ベースのフレームワークであるSocialMirrorを提案する。
SocialMirrorはインタラクティブなヒューマンメッシュを再構築する上で,最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-15T07:41:52Z) - From Perception to Action: An Interactive Benchmark for Vision Reasoning [51.11355591375073]
Causal Hierarchy of Actions and Interactions (CHAIN)ベンチマークは、モデルが物理的制約に基づいて構造化されたアクションシーケンスを理解し、計画し、実行できるかを評価するために設計された。
CHAINは、受動的知覚からアクティブな問題解決、機械パズルのインターロックや3D積み重ね、パッキングといったタスクへと評価をシフトする。
以上の結果から,トップパフォーマンスモデルでは,物理構造や因果制約の内在化に苦慮し,信頼性の高い長期計画の作成に失敗することが多く,認識された構造を効果的に翻訳することができないことが示唆された。
論文 参考訳(メタデータ) (2026-02-24T15:33:02Z) - Distributed and Consistent Multi-Robot Visual-Inertial-Ranging Odometry on Lie Groups [1.2247984232203188]
本稿では、複数のロボット間でVIOとUWBの測定を密に融合させる分散視覚慣性測度(DC-VIRO)フレームワークを提案する。
リー群上の右不変誤差定式化を利用して、提案手法は標準VIOの可観測性を保存する。
論文 参考訳(メタデータ) (2026-02-22T13:07:50Z) - Beyond Proximity: A Keypoint-Trajectory Framework for Classifying Affiliative and Agonistic Social Networks in Dairy Cattle [0.764671395172401]
市販の乳製品納屋におけるインタラクションの分類のためのポーズベースの計算フレームワークを提案する。
画素レベルの外観や単純な距離測定に頼るのではなく、キーポイント軌道からの相互作用運動シグネチャを符号化する。
その結果,対話を意識したソーシャルネットワーク構築に適した,視覚に基づくソーシャルインタラクションの自動推論のための概念実証が確立された。
論文 参考訳(メタデータ) (2025-12-17T01:01:51Z) - What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction [5.958765450103163]
QEVDベンチマークとデータセットは、フィットネスコーチングの挑戦的かつ制御されながら現実的な領域における人間とAIの相互作用を探索するものだ。
このベンチマークでは、複雑な人間の行動を認識し、起こりうる誤りを特定し、リアルタイムで適切なフィードバックを提供するために、視覚言語モデルが必要である。
そこで本研究では,適切なタイミングで適切なフィードバックで人間の行動に非同期に応答できる,シンプルなエンドツーエンドストリーミングベースラインを提案する。
論文 参考訳(メタデータ) (2024-07-11T00:10:45Z) - TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the Wild [77.59069361196404]
TRiPODは、グラフの注目ネットワークに基づいて身体のダイナミクスを予測する新しい方法です。
実世界の課題を取り入れるために,各フレームで推定された身体関節が可視・視認可能かどうかを示す指標を学習する。
評価の結果,TRiPODは,各軌道に特化して設計され,予測タスクに特化している。
論文 参考訳(メタデータ) (2021-04-08T20:01:00Z) - Kinematic-Structure-Preserved Representation for Unsupervised 3D Human
Pose Estimation [58.72192168935338]
大規模インスタディオデータセットの監視を用いて開発された人間のポーズ推定モデルの一般化可能性については疑問が残る。
本稿では,2対あるいは2対の弱い監督者によって抑制されない,新しいキネマティック構造保存型非教師付き3次元ポーズ推定フレームワークを提案する。
提案モデルでは,前方運動学,カメラ投影,空間マップ変換という3つの連続的な微分可能変換を用いる。
論文 参考訳(メタデータ) (2020-06-24T23:56:33Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。