論文の概要: Agentic AI with Structured CoT for Enhancing AI's Spatial Intelligence: Visualization and Reasoning of Rotation
- arxiv url: http://arxiv.org/abs/2610.04188v2
- Date: Tue, 06 Oct 2026 03:11:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.301186
- Title: Agentic AI with Structured CoT for Enhancing AI's Spatial Intelligence: Visualization and Reasoning of Rotation
- Title(参考訳): 構造化CoTによるエージェントAIによるAIの空間的知性向上:回転の可視化と推論
- Abstract要約: 我々は,3次元空間における物体の回転を理解するために,高度な生成AIの空間的能力について検討した。
生成エージェントAIモデル(GPT-5.6)の空間的インテリジェンスを訓練し,その空間的回転過程について検討した。
- 参考スコア(独自算出の注目度): 6.787283726925412
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent studies show that artificial intelligence (AI) with language and vision capabilities still experiences limitations in spatial reasoning. In this paper, we have studied the spatial capabilities of advanced generative AI to understand the rotations of objects in 3D space, utilizing AI's image processing and language processing features. We trained and examined the spatial intelligence of a generative Agentic AI model (GPT-5.6) to understand the spatial rotation process with rotation diagrams based on the revised Purdue Spatial Visualization Test: Visualization of Rotations (Revised PSVT:R). We improvised the Revised PSVT:R by superimposing additional graphical and contextual features to evaluate how different Chain-of-Thought (CoT) reasoning strategies influence model performance. The results indicate that structured CoT reasoning improves the spatial reasoning performance of the base GPT-5.6 model in both datasets (PSVT:R and PSVT:R with coordinate system). We used three CoT approaches - (1) Structured CoT, (2) few-shot Structured CoT, and Structured CoT with Self-optimized Prompt. The three CoT approaches evaluated in this study showed no significant performance difference. Results showed that combining structured CoT reasoning with relevant contextual information leads to considerable improvements in VLM performance on 3D rotation tasks, demonstrating the potential of agentic AI for more effective spatial reasoning. However, when contextual information is removed, structured CoT reasoning alone provides limited improvement, and the models continue to exhibit notable difficulties in understanding spatial transformations. These findings suggest that effective spatial reasoning in VLMs relies on the integration of visual, textual, and reasoning-based information in future agentic AI systems for spatial intelligence.
- Abstract(参考訳): 近年の研究では、言語と視覚能力を備えた人工知能(AI)が空間推論の限界をまだ経験していることが示されている。
本稿では,AIの画像処理と言語処理機能を活用し,3次元空間における物体の回転を理解するための高度な生成AIの空間的能力について検討した。
生成エージェントAIモデル(GPT-5.6)の空間知能をトレーニングし,更新されたPurdue Space Visualization Test: Visualization of Rotations(PSVT:R)に基づいて回転図を用いた空間回転過程の理解を行った。
改良されたPSVT:Rは、追加のグラフィカルな特徴と文脈的特徴を重畳して、異なるChain-of-Thought(CoT)推論戦略がモデル性能にどのように影響するかを評価することで、改良されたPSVT:Rを開発した。
その結果、構造化CoT推論により、両方のデータセット(PSVT:RとPSVT:Rと座標系)におけるベースGPT-5.6モデルの空間的推論性能が向上することが示された。
我々は,(1)構造化CoT,(2)少数ショット構造化CoT,および自己最適化Promptを用いた構造化CoTという3つのCoTアプローチを用いた。
本研究で評価した3つのCoTアプローチは,有意な性能差は認められなかった。
その結果、構造化CoT推論と関連する文脈情報を組み合わせることで、3次元回転タスクにおけるVLM性能が大幅に向上し、より効果的な空間推論のためのエージェントAIの可能性が示された。
しかし、文脈情報を取り除いた場合、構造化されたCoT推論だけでは改善が限定され、空間変換を理解する上で顕著な困難を呈し続けている。
これらの結果は、VLMにおける効果的な空間推論は、将来の空間知能のためのエージェントAIシステムにおける視覚的、テキスト的、推論に基づく情報の統合に依存していることを示唆している。
関連論文リスト
- Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models [16.417990770250146]
本研究では,空間表現を明示した視覚言語モデルを備えた軽量でアーキテクチャに依存しないフレームワークであるSpace Tokensを紹介する。
シーンレベルの3次元形状とオブジェクト中心の空間特性を連続的な潜在トークンに蒸留することにより、これらのモダリティをチェーンオブ思考の推論プロセスに直接組み込むことができる。
その結果、連続的な空間トークンは、幾何学的推論を大きな視覚言語モデルに統合する効果的な、解釈可能な、計算的に効率的なメカニズムを提供することが示された。
論文 参考訳(メタデータ) (2026-08-10T22:20:07Z) - SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning [65.67266333751569]
現在のLRM(Large Reasoning Models)は、空間推論タスクにおいて顕著な汎用性を示すが、性能は著しく劣る。
本研究では,内的推論プロセスを対象とした自己指導型強化学習フレームワークを提案する。
このラベルのない整合性トレーニングは,地道的な監督によって訓練されたモデルの精度にアプローチし,多様なタスクやデータ領域にまたがる同様の一般化を実現することを示す。
論文 参考訳(メタデータ) (2026-06-10T10:50:06Z) - How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective [103.44502230776352]
視覚言語モデル(VLM)における視覚空間推論(VSR)の系統的研究について述べる。
空間インテリジェンスを3つのレベル,すなわち基本的な知覚,空間理解,空間計画,および空間インテリジェンスベンチマークSIBenchに分類した。
論文 参考訳(メタデータ) (2025-09-23T12:00:14Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - AI's Spatial Intelligence: Evaluating AI's Understanding of Spatial Transformations in PSVT:R and Augmented Reality [6.531561475204309]
3次元空間の回転を理解するには、言葉による記述や視覚的、インタラクティブな例が伴う。
近年の研究では、言語と視覚能力を備えた人工知能は、空間推論の限界に直面している。
我々は,その画像と言語処理機能を利用してオブジェクトの回転を理解する,生成AIの空間的能力について検討した。
論文 参考訳(メタデータ) (2024-11-09T19:53:15Z) - REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models [67.55362046790512]
視覚言語モデルには、空間的関係を正しく推論する能力がない。
視覚言語モデルにおける空間忠実度を改善するREVISIONフレームワークを開発した。
本研究の結果から,レンダリングベースのフレームワークは空間認識モデルの開発に有効な手法であることが示唆された。
論文 参考訳(メタデータ) (2024-08-05T04:51:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。