論文の概要: ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
- arxiv url: http://arxiv.org/abs/2607.17599v1
- Date: Mon, 20 Jul 2026 06:40:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.51351
- Title: ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
- Title(参考訳): ConsiSpace:ビデオ空間推論のための幾何学的一貫性の学習
- Abstract要約: ConsiSpaceは、幾何感応性ビデオ空間推論のための幾何整合性対応フレームワークである。
暗黙的なエビデンストークンと明示的な幾何学的手がかりを含む幾何一貫性メモリ(GCM)を構築する。
統合自己教師付き強化学習(UCSSRL)を用いて、クロスビュー安定性を向上する。
- 参考スコア(独自算出の注目度): 22.393717134409012
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video spatial reasoning is essential for navigation-oriented perception and long-video question answering, where models must infer spatial relations across long horizons under changing viewpoints. However, existing multimodal large language models (MLLMs) remain largely semantic-centric, and often fail to reliably aggregate consistent spatial evidence from redundant video observations, leading to inefficient or unstable reasoning. To address these issues, we propose ConsiSpace, a geometry-consistency-aware framework for geometry-sensitive video spatial reasoning that turns spatial consistency into both an evidence organization principle and an explicit post-SFT learning signal. We build a geometry-consistent memory (GCM) including implicit evidence tokens and explicit geometric cues, and leverage efficient organization strategies to compactly preserve task-related spatial evidence. Furthermore, we utilize unified consistency self-supervised reinforcement learning (UC-SSRL) after supervised fine-tuning to improve cross-view stability, with answer-, metric-, and topology-consistency rewards. Extensive experiments on three spatial-reasoning benchmarks, VSI-Bench, OSI-Bench, and MMSI-Video-Bench, show consistent gains, improving the average score by 12.6 points over the strongest baselines.
- Abstract(参考訳): 映像空間推論はナビゲーション指向の認識と長ビデオ質問応答において不可欠であり、モデルが視点の変化の下で長い地平線をまたいで空間関係を推測しなければならない。
しかし、既存のマルチモーダル大言語モデル(MLLM)は、主に意味中心であり、しばしば冗長なビデオ観察から一貫した空間的証拠を確実に集約することができず、非効率または不安定な推論をもたらす。
これらの問題に対処するために,空間的一貫性をエビデンス組織原理とSFT後学習信号の両方に変換する幾何感性ビデオ空間推論のための幾何整合性対応フレームワークであるConsiSpaceを提案する。
我々は,暗黙のエビデンストークンと明示的な幾何学的手がかりを含む幾何一貫性メモリ(GCM)を構築し,効率的な組織戦略を活用し,タスク関連空間的エビデンスをコンパクトに保存する。
さらに、教師付き微調整後の統合整合性自己教師強化学習(UC-SSRL)を活用し、回答、計量、トポロジ整合性報酬を用いて、クロスビュー安定性を向上させる。
VSI-Bench(英語版)、OSI-Bench(英語版)、MMSI-Video-Bench(英語版)の3つの空間推論ベンチマークに対する大規模な実験は、最強の基準線に対して平均スコアを12.6ポイント改善した。
関連論文リスト
- G$^2$TAM: Geometry Grounded Track Anything Model [49.05553245076823]
本稿では,RGB画像やビデオのみを用いて,3次元のインスタンス追跡を高速化するための統一的なフレームワークを提案する。
G$2$TAMは空間的に整列した幾何学的表現を暗黙記憶として使用し、安定したインスタンス識別とフレームとビュー間のローカライゼーションを保証する。
中心となるのは、視覚的およびテキスト的プロンプトを共有幾何学空間に統合し、エンドツーエンドの空間再構成とインスタンス一貫性マスク予測を可能にするクロスモーダル空間エンコーダである。
論文 参考訳(メタデータ) (2026-07-04T09:32:13Z) - SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping [69.48762031013514]
OmniView-Spaceはマルチモーダルなエゴセントリックなエビデンスを通じて空間の一貫性を維持するために設計されたフレームワークである。
提案手法は, マルチパースペクティブ空間マッピング (MPSM) の3つのコアコンポーネントから構成される。(1) 幾何をクエリ整列型視覚認知マップとテキスト空間グラフに再構成する手法,(2) クエリによって要求されるエゴアンカーを積極的に選択し,対応するMPSM証拠を要求するためのインターリーブドポリシー,(3) MPSM生成トラジェクトリとエゴフレーム報酬を用いてモデルを自己生成認知マップで推論する認知マップ蒸留である。
論文 参考訳(メタデータ) (2026-07-01T12:45:12Z) - S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence [77.5121349100339]
textscS-Agentは空間的知覚をフレーム中心の認識を超えたシーン中心の理解に再認識する。
textscS-Agentは、VLMをセマンティックプランナーとしてキャストし、必要な証拠を決定する。
textscS-Agentは、トレーニングのない方法で、オープンソースとクローズドソース両方のVLMを一貫して改善する。
論文 参考訳(メタデータ) (2026-06-18T17:34:55Z) - SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning [18.3204772691015]
空間的推論には、入力に応じて異なる戦略を柔軟に調整する必要がある。
既存のアプローチのほとんどは、固定空間を暗黙的に学習する単一の推論パイプラインに依存している。
空間推論のための異種多エージェントフレームワークであるSpatiOを導入し、複数の視覚言語の専門家と相補的帰納バイアスを協調する。
論文 参考訳(メタデータ) (2026-04-23T01:19:37Z) - SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning [67.67774742200626]
空間知能は、視覚的な観察から幾何学的および物理的構造を推論する能力を指すもので、大きな言語モデルにとって重要な課題である。
テキスト推論と視覚的想像力を組み合わせた統合型マルチモーダル生成フレームワークを提案する。
本フレームワークでは,高レベルなセマンティックプランニングのためのテキストチェーンと,幾何感応的な状態変換と整合性保存のための視覚的想像力を用いて,分割・対数戦略を採用している。
論文 参考訳(メタデータ) (2026-04-19T11:21:59Z) - Thinking with Geometry: Active Geometry Integration for Spatial Reasoning [68.59084007360615]
我々は,能動的知覚にパラダイム・パッシブ・フュージョンをシフトさせるフレームワークであるGeoThinkerを提案する。
特徴混合の代わりに、GeoThinkerはモデルが内部の推論要求に応じて条件付けられた幾何学的証拠を選択的に検索することを可能にする。
その結果,次世代の空間知能には,空間構造を積極的に統合する能力が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-02-05T18:59:32Z) - EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence [10.889641815961133]
空間知能アプローチは通常、2D推論パイプラインやブラックボックス再構成モジュールを備えたMLLMに3Dキューを付加する。
本稿では,マクロ認識とマイクロ検証による進行的空間認知のためのフレームワークであるEagleVisionを提案する。
論文 参考訳(メタデータ) (2025-12-17T07:51:36Z) - Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective [17.592210658831902]
空間推論は、人間の知性の中核的な側面であり、3D環境における知覚、推論、計画を可能にする。
現在の視覚言語モデル(VLM)は、多視点設定における空間的推論のための幾何学的コヒーレンスとクロスビュー整合性を維持するのに苦労している。
本稿では,VLMが相補的な視点で空間的メンタルモデルを構築し,調整し,維持する方法を評価するための,認知的基盤を持つベンチマークであるReMindView-Benchを紹介する。
論文 参考訳(メタデータ) (2025-12-02T02:21:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。