論文の概要: Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- arxiv url: http://arxiv.org/abs/2606.31645v1
- Date: Tue, 30 Jun 2026 13:25:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.235864
- Title: Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- Title(参考訳): CVPR 2026におけるRoboSpatial Challenge: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Space Reasoning
- Abstract要約: 本稿では,RoboSpatialBrainを紹介する。RoboSpatial Challenge at the Embodied Reasoning in Action Workshop。
RoboSpatialBrainは2つのトレーニング不要な推論時間メカニズムを組み合わせる。
RoboSpatialBrainはRoboSpatial Challengeで1位となり、RoboSpatial-Homeの総合的な成功率は80.9%となった。
- 参考スコア(独自算出の注目度): 55.11480729304395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models achieve strong general perception but often struggle with the spatial reasoning required for embodied tasks. We present RoboSpatialBrain, our submission to the RoboSpatial Challenge at the Embodied Reasoning in Action Workshop, CVPR 2026, built on RoboBrain2.5-8B-NV. RoboSpatialBrain combines two training-free, inference-time mechanisms: a forced <think> prefix activation strategy paired with a task-specific post-prompt that elicits deliberate reasoning on context and compatibility tasks, and an explicit reference-frame redirection pipeline that resolves camera-centric and object-centric ambiguity for context tasks. We additionally explore fine-tuning RoboBrain2.5 on compatibility data and present a detailed analysis of its interaction with prompting. RoboSpatialBrain achieved first place in the RoboSpatial Challenge, with an overall success rate of 80.9\% on RoboSpatial-Home. Code is available at https://github.com/YuxiangXie2003/RoboSpatialBrain.
- Abstract(参考訳): 視覚言語モデルは強い一般認識を達成するが、しばしば具体的タスクに必要な空間的推論に苦しむ。
本稿では,RoboBrain2.5-8B-NV上に構築されたCVPR2026のEmbodied Reasoning in Action WorkshopにおけるRoboSpatial Challengeへの応募であるRoboSpatialBrainを紹介する。
RoboSpatialBrainには,2つのトレーニング不要な推論時間メカニズムが組み合わさっている。 強制的な<think>プレフィックスアクティベーション戦略と,コンテキストや互換性タスクに対する意図的に推論を行うタスク固有のポストプロンプトと,コンテキストタスクのカメラ中心およびオブジェクト中心の曖昧性を解決する明示的な参照フレームリダイレクトパイプラインだ。
さらに、互換性データに関する微調整RoboBrain2.5についても検討し、プロンプトとの相互作用を詳細に分析する。
RoboSpatialBrainはRoboSpatial Challengeで1位となり、RoboSpatial-Homeの総合的な成功率は80.9\%となった。
コードはhttps://github.com/YuxiangXie2003/RoboSpatialBrainで入手できる。
関連論文リスト
- RoboWits: Unexpected Challenges for Robotic Creative Problem Solving [58.58727722988084]
我々は、認知的推論、創造的ツールの使用、予期しない状況に対する堅牢性を評価するために設計された、双方向のロボットベンチマークであるRoboWitsを紹介する。
このパイプラインを用いて,30種類の種タスクと208のタスクを,幾何学的,物質的,集合的推論にまたがる変異と難易度でキュレートした。
プレトレーニングされたVLAは,単一タスクの微調整後にシードタスクに予備的な成功を示すが,変異タスクの実行に苦慮している。
論文 参考訳(メタデータ) (2026-05-28T17:57:15Z) - RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System [11.827126059853342]
ロボコール監視研究の広範な調査は、プライバシー上の懸念から、公開データセットへのアクセスが制限されているために妨げられている。
まず、ロボコール監視研究用に設計された合成ロボコールデータセットRobo-SArをキュレートする。
対向ロボコール戦略を特徴付ける音響と言語間の構造的非線形相互作用をモデル化する多モード融合フレームワークであるRoboKAを提案する。
論文 参考訳(メタデータ) (2026-04-30T19:25:53Z) - Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain [62.01012517796797]
動的で非構造的な環境で知覚、理性、行動できるロボットを構築することは、依然として中核的な課題である。
システム2は高レベルの推論を処理し、システム1は低レベルの制御を実行する。
本稿では,マルチモーダル大言語モデル(MLLM)を具体的脳として体系的に評価するベンチマークであるRoboBenchを紹介する。
論文 参考訳(メタデータ) (2025-10-20T17:59:03Z) - RoboPilot: Generalizable Dynamic Robotic Manipulation with Dual-thinking Modes [5.47460315248808]
ロボット操作のための2つのクローズドループフレームワークであるRoboPilotを紹介する。
RoboPilotは、現実世界の動的環境における複雑なタスクに対する適応推論をサポートする。
我々はRoboPilotがタスク成功率の25.9%で最先端のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-30T18:25:47Z) - Robix: A Unified Model for Robot Interaction, Reasoning and Planning [28.191138548365203]
Robixは、ロボット推論、タスク計画、自然言語の相互作用を単一の視覚言語アーキテクチャに統合する統一モデルである。
Robixは、低レベルコントローラのためのアトミックコマンドを動的に生成し、ヒューマンインタラクションのための言語応答を生成する。
論文 参考訳(メタデータ) (2025-09-01T03:53:47Z) - Benchmarking Generalizable Bimanual Manipulation: RoboTwin Dual-Arm Collaboration Challenge at CVPR 2025 MEIS Workshop [120.2806035123366]
RoboTwin Dual-Arm Collaboration Challengeは、CVPR 2025の第2回MeISワークショップで行われた。
ライバルは、剛性、変形性、触覚ベースのシナリオをカバーする17のデュアルアーム操作タスクに完全に取り組んだ。
コンペティションの設定、タスク設計、評価方法論、重要な発見と今後の方向性について概説する。
論文 参考訳(メタデータ) (2025-06-29T17:56:41Z) - RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics [67.11221574129937]
空間参照は、3D物理世界と相互作用するエンボディロボットの基本的な能力である。
本稿では,まず空間的理解を正確に行うことのできる3次元VLMであるRoboReferを提案する。
RoboReferは、強化微調整による一般化された多段階空間推論を推進している。
論文 参考訳(メタデータ) (2025-06-04T17:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。