論文の概要: OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning
- arxiv url: http://arxiv.org/abs/2606.30378v1
- Date: Mon, 29 Jun 2026 14:38:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.283638
- Title: OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning
- Title(参考訳): OmniCoT: グローバルおよびマルチステップパノラマ推論のためのベンチマーク
- Abstract要約: OmniCoTは,MLLMがグローバルなエビデンスを利用し,視点を越えて多段階の推論を行うことを可能にするパノラマ空間推論スイートである。
トレーニングのためにOmniCoT-Tは、パノラマ的な証拠に中間推論ステップを明示的にリンクする、構造化された段階的なChain-of-Thoughtアノテーションで構築されている。
- 参考スコア(独自算出の注目度): 94.47284498900895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have demonstrated promising spatial reasoning capabilities, while these abilities remain underexplored in the emerging visual modality of panoramic imagery. The full 360°$\times$180° field of view of panoramas essentially supports complex global multi-step reasoning, which is also the fundamental advantage of panoramas in applications such as embodied intelligence. However, existing panoramic benchmarks largely focus on simplistic queries that rely on local cues or single-/few-step reasoning, thereby ignoring the fundamental advantage of panoramas and failing to fully exploit their potential. To address this gap, we introduce OmniCoT, a panoramic spatial reasoning suite designed to enable MLLMs to use global evidence and perform multi-step inference across viewpoints. It includes OmniCoT-B (6.7K data) for evaluation, which measures both answer accuracy and reasoning quality, OmniCoT-Real (1K data) as a manually annotated real-world subset to quantify the Sim-to-Real gap. For training, OmniCoT-T (14.3K data) is purpose-built with structured stepwise Chain-of-Thought annotations that explicitly link intermediate reasoning steps to panoramic evidence. Based on OmniCoT-T, we introduce OmniCoT-R1 and adopt a two-stage training strategy tailored to the geometrically complex panoramic space, where Supervised Fine-tuning (SFT) anchors reasoning to panoramic evidence (e.g., bearings, proximity) and GRPO penalizes geometrically incoherent paths to consolidate global 360° spatial consistency. Through OmniCoT, we aim to recalibrate the difficulty of panoramic spatial reasoning to better align with the intrinsic capabilities of panoramic imagery, thereby fostering meaningful progress in this research area.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は,パノラマ画像の新たな視覚的モダリティにおいて,これらの能力が過小評価されている一方で,有望な空間推論能力を示している。
360°$\times$180°のパノラマの視野は、本質的には複雑な多段階推論をサポートしており、これはエンボディインテリジェンスのような応用におけるパノラマの基本的な利点でもある。
しかし、既存のパノラマベンチマークは、ローカルなキューやシングルステップの推論に依存する単純なクエリに重点を置いているため、パノラマの基本的な利点を無視し、その可能性を完全に活用できない。
このギャップに対処するために,MLLMのグローバルエビデンス利用と視点多段階推論を実現するために設計されたパノラマ空間推論スイートであるOmniCoTを紹介する。
評価用のOmniCoT-B (6.7Kデータ)、回答精度と推論品質の両方を測定するOmniCoT-Real (1Kデータ)、手動で注釈付けされた現実世界のサブセットとしてSim-to-Realギャップを定量化するOmniCoT-Real (1Kデータ)が含まれる。
トレーニングのために、OmniCoT-T (14.3K データ) は、パノラマ証拠に中間推論ステップを明示的に関連付ける、構造化された段階的チェイン・オブ・ソートアノテーションで構築されている。
OmniCoT-Tに基づき、オムニCoT-R1を導入し、幾何学的に複雑なパノラマ空間に適した2段階のトレーニング戦略を採用する。
我々は,OmniCoTを通じてパノラマ画像の本質的な能力と整合性を高めるために,パノラマ空間推論の難しさを再検討し,本研究領域における有意義な進歩を育むことを目的とする。
関連論文リスト
- OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping [69.48762031013514]
OmniView-Spaceはマルチモーダルなエゴセントリックなエビデンスを通じて空間の一貫性を維持するために設計されたフレームワークである。
提案手法は, マルチパースペクティブ空間マッピング (MPSM) の3つのコアコンポーネントから構成される。(1) 幾何をクエリ整列型視覚認知マップとテキスト空間グラフに再構成する手法,(2) クエリによって要求されるエゴアンカーを積極的に選択し,対応するMPSM証拠を要求するためのインターリーブドポリシー,(3) MPSM生成トラジェクトリとエゴフレーム報酬を用いてモデルを自己生成認知マップで推論する認知マップ蒸留である。
論文 参考訳(メタデータ) (2026-07-01T12:45:12Z) - PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World [20.19893789145407]
本研究では, MLLMが連続的, 観測中心空間としての正方形射影パノラマを推論するために必要となるパノネイティブ理解について検討する。
球面形状を視覚ストリームに注入する球面空間交叉型パノワールドについて紹介する。
実験によると、PanoWorldはPanoSpace-Bench、H* Bench、R2R-CE Val-Unseenベンチマークにおいて、プロプライエタリベースラインとオープンソースベースラインの両方を大幅に上回っている。
論文 参考訳(メタデータ) (2026-05-13T08:31:22Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - More than the Sum: Panorama-Language Models for Adverse Omni-Scenes [63.9800546079941]
既存の視覚言語モデル(VLM)はピンホール画像用に調整され、複数の視野の狭い入力を縫い合わせ、完全な全シーン理解を組み立てる。
本稿では,Panorama-Language Modeling (PLM) パラダイムについて紹介する。
論文 参考訳(メタデータ) (2026-03-10T12:19:50Z) - Universal Pansharpening Foundation Model [67.10467574892282]
高分解能マルチスペクトル(MS)画像は、テクスチャリッチパンクロマティック(PAN)画像と低分解能MS画像からのスペクトル特性から空間的詳細を統合することで生成する。
本稿では,衛星非依存およびシーンロバスト融合のための普遍的パンシャーピング基盤モデルFoundPSを提案する。
論文 参考訳(メタデータ) (2026-03-04T08:30:15Z) - PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion [87.13016347332943]
PanoWorld-Xは、多彩なカメラ軌道を持つ高忠実で制御可能なパノラマビデオ生成のための新しいフレームワークである。
動作範囲,制御精度,視覚的品質など,様々な面で優れた性能を示す実験を行った。
論文 参考訳(メタデータ) (2025-09-29T16:22:00Z) - Omnidirectional Spatial Modeling from Correlated Panoramas [4.75637997496421]
既存の全方位法は、フレーム間の相関したパノラマを無視しながら、単一のフレーム内でシーン理解を実現する。
textbfCFpanoは、フレーム間の相関したパノラマの視覚的質問応答に特化した、textbf Firstベンチマークデータセットである。
本稿では,マルチモーダル大言語モデル (MLLM) とグループ相対政策最適化 (GRPO) を微調整したメソッド名と,クロスフレーム相関パノラマを用いた頑健で一貫した推論のための一組の報酬関数を提案する。
論文 参考訳(メタデータ) (2025-09-02T10:14:55Z) - Dense360: Dense Understanding from Omnidirectional Panoramas [24.862817640267572]
信頼性に配慮したアノテーションを網羅した全方位パノラマデータセットを提案する。
具体的には,160Kパノラマと5Mのエンティティレベルキャプション,1Mのユニークな参照表現,100Kのエンティティグラウンドのパノラマシーン記述を含む。
論文 参考訳(メタデータ) (2025-06-17T12:35:23Z) - Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method [8.039453341761538]
我々は,最初のデータセットであるOmniVQAを導入し,全方向視覚質問応答のための最初のベンチマークを行う。
最先端MLLMの評価結果から,全方向視覚質問応答の処理における限界が明らかとなった。
本研究ではQwen2.5-VL-Instructに基づく規則に基づく強化学習手法である360-R1を提案する。
論文 参考訳(メタデータ) (2025-05-20T10:55:26Z) - Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning? [66.88619941063048]
MLLM(Multimodal large language model)は全方向空間推論に対応しているのか?
OSR-Benchはこの設定のために特別に設計された最初のベンチマークである。
高忠実度パノラマ屋内シーンマップには、153,000以上の多様な質問応答ペアが含まれている。
GPT-4o, Gemini 1.5 Proを含む8つの最先端MLLMを評価し, ゼロショット設定で主要なオープンソースモデルを評価した。
論文 参考訳(メタデータ) (2025-05-17T08:48:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。