論文の概要: OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment
- arxiv url: http://arxiv.org/abs/2607.17657v1
- Date: Mon, 20 Jul 2026 08:07:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.545298
- Title: OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment
- Title(参考訳): OrientSAM: 指向性を考慮した空間アライメントによるマルチモーダル空間推論におけるカメラ中心ショートカットの緩和
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、視点変換を必要とする空間的推論に苦慮している。
本稿では,このようなカメラ中心のショートカット動作の根底にある要因として,オブジェクト指向が重要であることを示す。
マルチモーダルモデルのための指向性を考慮した空間アライメントフレームワークOrientSAMを提案する。
- 参考スコア(独自算出の注目度): 9.267125647845143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) still struggle with spatial reasoning that requires perspective transformation. In particular, they often rely on camera-centric cues rather than reasoning from the reference object's viewpoint, leading to systematic errors in non-camera reference settings. In this paper, we first analyze this failure mode and show that object orientation is a key factor underlying such camera-centric shortcut behavior. To address this issue, we propose OrientSAM, an orientation-aware spatial alignment framework for multimodal models. OrientSAM injects explicit orientation information into multimodal representations through orientation-aware tokens and Fourier-based angle encoding, and further adopts a curriculum learning strategy to progressively improve perspective-aware reasoning. In addition, we build a spatial data construction pipeline to generate orientation-aware spatial supervision from large-scale images. Experiments on Spatial-MM, ViewSpatial, and 3DSRBench show that OrientSAM consistently outperforms strong baselines, especially on non-camera-view, person-centric, and orientation-sensitive tasks. The results further demonstrate that explicit orientation modeling is important for mitigating camera-centric shortcut behavior and enabling more robust allocentric spatial reasoning in multimodal models.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)は、視点変換を必要とする空間的推論に苦慮している。
特に、参照オブジェクトの視点から考えるよりも、カメラ中心のキューに頼っていることが多いため、非カメラ参照設定における体系的なエラーにつながる。
本稿では、まず、この障害モードを分析し、このようなカメラ中心のショートカット動作の根底にある重要な要因がオブジェクト指向であることを示す。
この問題に対処するため,マルチモーダルモデルのための指向性を考慮した空間アライメントフレームワークOrientSAMを提案する。
OrientSAMは、方向対応トークンとフーリエに基づく角度符号化を通じて、多モーダル表現に明示的な向き情報を注入し、さらに、視点対応推論を段階的に改善するカリキュラム学習戦略を採用する。
さらに,大規模画像から方向対応空間監視を生成するための空間データ構築パイプラインを構築した。
Space-MM, ViewSpatial, 3DSRBenchの実験では、OrientSAMは、特に非カメラビュー、人中心、指向性タスクにおいて、強いベースラインを一貫して上回っている。
さらに、カメラ中心のショートカット動作を緩和し、マルチモーダルモデルにおいてよりロバストな同心空間推論を可能にするために、明示的な配向モデリングが重要であることを示した。
関連論文リスト
- OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping [69.48762031013514]
OmniView-Spaceはマルチモーダルなエゴセントリックなエビデンスを通じて空間の一貫性を維持するために設計されたフレームワークである。
提案手法は, マルチパースペクティブ空間マッピング (MPSM) の3つのコアコンポーネントから構成される。(1) 幾何をクエリ整列型視覚認知マップとテキスト空間グラフに再構成する手法,(2) クエリによって要求されるエゴアンカーを積極的に選択し,対応するMPSM証拠を要求するためのインターリーブドポリシー,(3) MPSM生成トラジェクトリとエゴフレーム報酬を用いてモデルを自己生成認知マップで推論する認知マップ蒸留である。
論文 参考訳(メタデータ) (2026-07-01T12:45:12Z) - VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection [19.163908796279802]
自然画像における難解なジェスチャーの接地は、ARと人間とロボットのコラボレーションに不可欠である。
VistaRefは空間的指向の意識を高めるために設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-06-23T12:30:04Z) - Why Far Looks Up: Probing Spatial Representation in Vision-Language Models [44.01280555484389]
視覚言語モデル(VLM)は空間推論ベンチマークにおいて高い性能を達成する。
しかし、これが構造化された3D理解の反映なのか、あるいは自然画像の統計的ショートカットに依存しているのかは不明だ。
空間軸がどのように構成されているかを測定するために,最小のコントラスト対を構成する表現レベル分析フレームワークを導入する。
論文 参考訳(メタデータ) (2026-05-28T16:18:01Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - On the Generalization Capacities of MLLMs for Spatial Intelligence [72.21075026598761]
我々は、RGBのみのアプローチは、カメラをまたいで一般化する能力に根本的な欠陥があると主張している。
これによりMLLMは、真の3次元幾何学的原理を学習するのではなく、トレーニングカメラの分布に過度に適合することを示す。
空間MLLMのためのカメラ対応MLLMフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-05T14:46:11Z) - Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective [17.592210658831902]
空間推論は、人間の知性の中核的な側面であり、3D環境における知覚、推論、計画を可能にする。
現在の視覚言語モデル(VLM)は、多視点設定における空間的推論のための幾何学的コヒーレンスとクロスビュー整合性を維持するのに苦労している。
本稿では,VLMが相補的な視点で空間的メンタルモデルを構築し,調整し,維持する方法を評価するための,認知的基盤を持つベンチマークであるReMindView-Benchを紹介する。
論文 参考訳(メタデータ) (2025-12-02T02:21:29Z) - FaceSleuth-R: Adaptive Orientation-Aware Attention for Robust Micro-Expression Recognition [25.77351512351652]
textbfFaceSleuth-Rは、新しい textbfSingle-Orientation Attention (SOA) モジュールを中心にしたフレームワークです。
SOAは軽量で差別化可能な演算子で、ネットワークが層固有の最適方向を学習できるようにする。
私たちは、SOAが様々なデータセットにまたがる、普遍的なニアバーティカルな動きを常に発見していることを示します。
論文 参考訳(メタデータ) (2025-06-03T09:44:18Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models [79.96917782423219]
オリエント・アプライシング(Orient Anything)は、1つの画像でオブジェクトの向きを推定するために設計された最初のエキスパートで基礎的なモデルである。
3Dオブジェクトの前面にアノテートするパイプラインを開発することで、正確な向きのアノテーションで2Mイメージを収集する。
本モデルでは,レンダリング画像と実画像の両方において,最先端の向き推定精度を実現する。
論文 参考訳(メタデータ) (2024-12-24T18:58:43Z) - ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives [109.11714588441511]
Ego-Exoオブジェクト対応タスクは,セグメンテーションを通じて,ego-Exoパースペクティブ間のオブジェクト関係を理解することを目的としている。
最近提案されたセグメンテーション手法であるPSALMは、このタスクでデモされたゼロショット能力を例外として挙げている。
我々は、マルチモーダルコンディションフュージョンとSSLベースのクロスビューオブジェクトアライメントという、2つの重要なモジュールを特徴とする新しいアプローチであるObjectRelatorを提案する。
論文 参考訳(メタデータ) (2024-11-28T12:01:03Z) - Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning [7.911608620021529]
マルチモーダル・大規模言語モデル(MLLM)は、人間とAI技術をマルチモーダル・アプリケーションで結びつける重要なインターフェースとして機能する。
現在のMLLMは、トレーニングデータにおける矛盾した向きアノテーションにより、画像内のオブジェクトの向きを正確に解釈する上で、課題に直面している。
本稿では,MLLMの向き理解とユーザの視点を一致させる,エゴセントリックな命令チューニングを提案する。
論文 参考訳(メタデータ) (2024-11-24T15:07:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。