論文の概要: EAGOR: Embodied Reasoning in Omni-direction
- arxiv url: http://arxiv.org/abs/2607.06165v1
- Date: Tue, 07 Jul 2026 11:39:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.504634
- Title: EAGOR: Embodied Reasoning in Omni-direction
- Title(参考訳): EAGOR:Omni-directionにおけるEmbodied Reasoning
- Abstract要約: EAGORは、360方向推論を具体化するためのトレーニング不要な幾何認識フレームワークである。
EAGORは既存の手法を一貫して上回り、ベンチマークデータセットの平均相対利得は+34.4%、+45.6%に達した。
- 参考スコア(独自算出の注目度): 3.042262674701172
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Omni-directional (360°) cameras provide embodied agents with a holistic view of their surroundings, making them suited for directional reasoning in tasks such as navigation and object search. Existing Vision Language Models (VLMs) project 360° observations to 2D equirectangular projection (ERP) images and process them using architectures designed for perspective images. However, they ignore the spherical nature of 360° observations, where each pixel represents a viewing direction relative to the agent. Consequently, their direction estimates often become inconsistent under camera view transformations caused by agent motion. This limitation is particularly critical for map-free navigation, where the agent must continuously estimate the target direction in its egocentric frame. We propose EAGOR, a training-free, geometry-aware framework for embodied 360° directional reasoning. Instead of predicting target directions as ERP image coordinates, EAGOR formulates directional reasoning as recursive Bayesian estimation directly on the sphere. It maintains a continuous belief over target directions and propagates it equivariantly under agent motion without training the backbone VLMs. To achieve this, we introduce the Spherical Harmonic Belief Field (SH-BF), whose spherical harmonic representation provides a globally defined, rotation-aware basis for directional estimation on the spherical manifold. This formulation eliminates ERP seam discontinuities, latitude distortions, and interpolation errors. We evaluate EAGOR on two benchmark datasets and real-world experiments with a legged robot across directional reasoning tasks. EAGOR consistently outperforms existing methods, achieving average relative gains of +34.4% and +45.6% on HOS and OSR-Bench, respectively, while improving navigation success by +14.6%, reducing step count by 17.7%, and lowering mean angular error by 24.5%.
- Abstract(参考訳): Omni-directional (360°) カメラは、周囲の全体像を具現化されたエージェントに提供し、ナビゲーションや物体探索などのタスクの方向推論に適している。
既存の視覚言語モデル(VLM)は2次元等角射影(ERP)画像に360度観測を計画し、視点像用に設計されたアーキテクチャを用いて処理する。
しかし、彼らは360度観測の球面の性質を無視し、各ピクセルはエージェントに対して観察方向を表す。
その結果、エージェントの動きによるカメラビュー変換では、その方向推定が矛盾することが多い。
この制限は地図のないナビゲーションにおいて特に重要であり、エージェントはエゴセントリックフレームの目標方向を継続的に推定しなければならない。
EAGORは360°方向推論を具体化するためのトレーニング不要な幾何認識フレームワークである。
EAGORは、ERP画像座標として目標方向を予測する代わりに、方向推論を球面上で直接帰納的ベイズ推定として定式化する。
目標方向に対する継続的な信念を維持し、背骨のVLMを訓練することなく、エージェント運動下で均等に伝播する。
これを実現するために、球面高調波場(SH-BF)を導入する。球面高調波表現は、球面多様体上の方向推定に対して、グローバルに定義された回転対応の基底を与える。
この定式化により、ERPシームの不連続性、緯度歪み、補間誤差が排除される。
EAGORを2つのベンチマークデータセット上で評価し、方向推論タスクにまたがる脚付きロボットを用いた実世界実験を行った。
EAGORは既存の手法を一貫して上回り、HOSとOSR-Benchの平均相対的な利得は+34.4%、OSR-Benchは+45.6%、ナビゲーションの成功は+14.6%、歩数17.7%、平均角誤差24.5%となっている。
関連論文リスト
- PATH: Continuous Target Sensing among Autonomous Cooperative Drones [2.225982890331028]
本稿では,2つの移動型UAV間の目標ハンドオフのためのプラットフォームに依存しない,幾何学的支援型センシングおよび検証フレームワークを提案する。
PATHは96.0%のフレームレベル受信側ターゲット取得精度を実現し、2.0%は偽陽性、2.0%は偽陰性である。
論文 参考訳(メタデータ) (2026-09-11T05:24:08Z) - TriDE: Triangle-Consistent Translation Directions for Global Camera Pose Estimation [6.2145524307257665]
本稿では,高精度な高次検証信号として,カメラ三角形の整合性を利用するTriDEを提案する。
実画像グラフの実験により、TriDEは方向精度を大きなマージンで向上し、下流カメラの位置がより良くなることが示された。
論文 参考訳(メタデータ) (2026-05-07T19:43:15Z) - MoCapAnything V2: End-to-End Motion Capture for Arbitrary Skeletons [56.68975315643491]
本稿では,ビデオ・ツー・ローテーションとビデオ・ツー・ローテーションを共同で学習し,最適化する,最初のエンドツーエンドフレームワークを提案する。
本手法は, メッシュベースパイプラインの20倍の速度で, 回転誤差を17度から10度, 見えない骨格では6.54度に低減する。
論文 参考訳(メタデータ) (2026-04-30T17:16:38Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - Object Pose Transformer: Unifying Unseen Object Pose Estimation [54.20344997573707]
モデルなしのオブジェクトポーズ推定を未知のインスタンスで学習することは、3Dビジョンにおける根本的な課題である。
我々のチームは、RGB入力から深度、ポイントマップ、カメラパラメータ、正規化されたオブジェクト座標を共同で予測します。
当社はカメラ非依存で、カメラ固有の知識をオンザフライで学習し、メトリックスケールリカバリのためのオプションの深度入力をサポートします。
論文 参考訳(メタデータ) (2026-03-24T16:04:16Z) - CREG: Compass Relational Evidence for Interpreting Spatial Reasoning in Vision-Language Models [0.0]
視覚言語モデル(VLM)は空間推論ベンチマークで強く機能するが、方向関係のエンコード方法はまだよく分かっていない。
我々は,マルチレイヤのコントラスト空間属性を基準中心の極性系に投影するフレームワークCREG(Grad-Act Graph)を紹介する。
以上の結果から, 対照的な多層アトリビューションは, 標準的なサリエンシに基づく説明よりも, より忠実に指向性のある証拠を提示できることが示唆された。
論文 参考訳(メタデータ) (2026-03-20T20:09:19Z) - Orient Anything V2: Unifying Orientation and Rotation Understanding [106.90704703054115]
Orient Anything V2は、オブジェクト3Dの向きと回転を一対または一対の画像から統一的に理解するための拡張モデルである。
V2はこの能力を拡張し、様々な回転対称性を持つ物体を扱い、相対回転を直接推定する。
オブジェクト指向推定,6DoFポーズ推定,および11の広く使用されているベンチマークにおけるオブジェクト対称性認識における最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2026-01-09T06:43:59Z) - PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control [67.17998939712326]
本稿では,ロボットの状態推定と制御を単一のフレームワーク内で統一する条件拡散モデルPoseDiffを提案する。
中心となるPoseDiffは、生の視覚を3Dキーポイントや関節角などの構造化されたロボットの状態にマッピングする。
この基盤の上に構築されたPoseDiffは、ビデオからアクションへの逆ダイナミクスに自然に拡張する。
論文 参考訳(メタデータ) (2025-09-29T10:55:48Z) - Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks [17.357441373079382]
本稿では,オブジェクト指向認識を主評価対象とするベンチマークであるDORI(Discriminative Orientation Reasoning Intelligence)を紹介する。
DORIは、正面アライメント、回転変換、相対方向関係、標準方向理解の4つの次元を評価する。
最先端の視覚言語モデル15について評価した結果,限界が明らかとなった。
DORIは、ロボット制御の改善、3Dシーン再構築、物理的環境における人間とAIの相互作用に影響を及ぼす。
論文 参考訳(メタデータ) (2025-05-27T18:22:44Z) - Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models [79.96917782423219]
オリエント・アプライシング(Orient Anything)は、1つの画像でオブジェクトの向きを推定するために設計された最初のエキスパートで基礎的なモデルである。
3Dオブジェクトの前面にアノテートするパイプラインを開発することで、正確な向きのアノテーションで2Mイメージを収集する。
本モデルでは,レンダリング画像と実画像の両方において,最先端の向き推定精度を実現する。
論文 参考訳(メタデータ) (2024-12-24T18:58:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。