論文の概要: SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
- arxiv url: http://arxiv.org/abs/2607.27703v2
- Date: Tue, 04 Aug 2026 12:14:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.401845
- Title: SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
- Title(参考訳): SpaceCLI: 空間的ツールで推論を学ぶ
- Authors: Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai,
- Abstract要約: 視覚言語モデル(VLM)は、視覚入力を解釈し、空間を推論し、タスクレベルの決定を行うための具体的エージェントとしてますます使われている。
一般的なVLMは全体のタスクを推論できるが、成功を決定する視覚的詳細を見逃してしまうことが多い。
本研究では,空間的ツールによる推論をVLMに教えるフレームワークであるSpatialCLIを提案する。
- 参考スコア(独自算出の注目度): 22.97678203095492
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) are increasingly used in embodied agents to interpret visual inputs, reason about spatial relationships, and make task-level decisions based on that reasoning. However, a fundamental capability mismatch remains: general VLMs can reason about the overall task but often miss the visual details that determine success, while specialist vision models can capture those details but cannot translate them into task-level decisions. In this work, we propose SpatialCLI, a framework that teaches VLMs to reason with spatial tools and progressively internalize the specialist perceptual capabilities they provide. SpatialCLI proceeds in three stages: (1) Call exposes specialist vision models as spatial tools to augment the VLM's perception; (2) Learn uses Cold-Start SFT and agentic RL to improve tool use; and (3) Internalize verbalizes successful tool-use trajectories to internalize specialist perceptual capabilities. We further introduce SpatialCLI-Bench, a 516-example benchmark for compositional perception across localization, segmentation, depth, and pose. On MindCube, SpatialCLI raises Qwen3-VL-8B-Instruct from 29.3% to 84.6% with tools, surpassing GPT-5.6 Sol with tools (72.1%), while retaining 73.8% without tools after internalization.
- Abstract(参考訳): 視覚言語モデル(VLM)は、視覚的な入力を解釈し、空間的関係を推論し、その推論に基づいてタスクレベルの決定を行うための具体的エージェントとして、ますます使われている。
一般的なVLMは全体のタスクを推論できるが、成功を決定する視覚的詳細を見逃すことが多い。
本研究では,空間的ツールによる推論をVLMに教えるフレームワークであるSpatialCLIを提案する。
空間CLIは,(1) VLMの知覚を高めるための空間的ツールとして専門的視覚モデルを公開する,(2) コールドスタート SFT とエージェントRL を用いてツール使用を改善する,(3) 言語化により,専門的知覚能力の内在化を図る,3つの段階で進行する。
さらに、局所化、セグメンテーション、深さ、ポーズにまたがる構成知覚のための516サンプルベンチマークであるSpatialCLI-Benchを紹介する。
MindCubeでは、SpatialCLIはQwen3-VL-8Bインストラクションを29.3%から84.6%に引き上げ、GPT-5.6ソル(72.1%)を上回り、内部化後にツールなしで73.8%を維持している。
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains [28.974013317548664]
VLM(Vision-Language Models)を付加したVRAG
既存のVRAGフレームワークは通常、VLMの知覚能力を拡張するために、厳格で事前定義された外部ツールに依存している。
本稿では,自己創発型言語ツールチェーンによる視覚の微粒化と推論を可能にするLang2Actを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:44:54Z) - SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL [33.692408134748696]
視覚言語モデル(VLM)は、質的な視覚的理解が強いが、計量的に正確な空間的推論に苦慮している。
本稿では,VLMが複数のツールを協調する2段階の学習フレームワークであるDouble Interactive Reinforcement Learning(DIRL)を紹介する。
我々のモデルであるSpaceToolsは、ツール強化された空間推論能力を持ち、空間理解ベンチマーク上で最先端の性能を達成する。
論文 参考訳(メタデータ) (2025-12-03T18:50:04Z) - PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs [46.62285836344724]
MLLMによる物理ツールの理解度を評価するための最初のベンチマークであるPhysToolBenchを紹介する。
我々のベンチマークは、1000以上の画像テキストペアからなるVisual Question Answering (VQA)データセットとして構成されている。
1)ツール認識:ツールの一次機能を認識する必要がある。
(2) ツール理解: ツール操作の根底にある原則を理解する能力をテストする。
論文 参考訳(メタデータ) (2025-10-10T16:10:45Z) - Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models [63.69856480318313]
AGILEは、対話的なプロセスとしてジグソー解決を定式化し、モデルが環境に徐々に関与できるようにする。
我々は AGILE がジグソータスクの性能を大幅に向上させることを示す。
また、9つの一般的な視覚タスクに対して強力な一般化を示し、平均3.1%の改善を実現した。
論文 参考訳(メタデータ) (2025-10-01T17:58:05Z) - Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger [49.81945268343162]
我々は,外部ツール利用のための適応型意思決定戦略であるMeCoを提案する。
MeCoは、表現空間内の高レベル認知信号をキャプチャすることで、メタ認知スコアを定量化する。
MeCoは微調整不要で、最小限のコストがかかる。
論文 参考訳(メタデータ) (2025-02-18T15:45:01Z) - LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error [54.954211216847135]
既存の大規模言語モデル(LLM)は30%から60%の範囲でしか正当性に至らない。
試行錯誤(STE)を模擬したツール拡張LDMの生物学的なインスピレーション法を提案する。
STEは、試行錯誤、想像力、記憶という、生物学的システムにおけるツール使用行動の成功のための3つの重要なメカニズムを編成する。
論文 参考訳(メタデータ) (2024-03-07T18:50:51Z) - CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update [69.59482029810198]
CLOVAは、推論、リフレクション、学習フェーズを含むフレームワーク内で動作するクローズドループビジュアルアシスタントである。
その結果,CLOVAは既存のツール利用手法を5%,知識タグ付けでは10%,画像編集では20%,視覚的質問応答や複数画像推論では5%に上回っていることがわかった。
論文 参考訳(メタデータ) (2023-12-18T03:34:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。