論文の概要: IMBench: A Benchmark for Intuitive Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.15641v1
- Date: Fri, 17 Jul 2026 05:34:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.752953
- Title: IMBench: A Benchmark for Intuitive Robotic Manipulation
- Title(参考訳): IMBench: 直感的なロボット操作のベンチマーク
- Abstract要約: 人間は推論と運動制御を組み合わせて、様々な制約の下で複雑な操作タスクを解く。
既存のベンチマークは、この統合を達成できない。
IMBENCHは直感的な操作を知覚、身体的推論、行動生成、反復実行にまたがる統合機能として評価するためのベンチマークである。
- 参考スコア(独自算出の注目度): 11.843368723732679
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans combine reasoning and motor control to solve complex manipulation tasks under diverse constraints. They build an understanding of the physical world that helps them convert reasoning into actions and quickly adapt to new scenes, tasks, and rules. We refer to this capability as intuitive manipulation. Existing benchmarks fail to capture this integration: they evaluate physical reasoning in isolation from execution, or measure policy performance without requiring explicit reasoning. We introduce IMBENCH, a benchmark designed to evaluate intuitive manipulation as an integrated capability spanning perception, physical reasoning, action generation, and iterative execution. Our tasks require models to infer task-relevant physical structure and generate feasible action sequences under explicit constraints, including contact-rich manipulation, tool use, and multi-stage dependencies. We introduce a benchmark of 35 tasks, 14K filtered trajectories, and scalable tools for generating diverse scenarios. Experiments reveal a consistent gap: vision language models show partial physical reasoning ability but fail to produce executable plans, while state-of-the-art vision-language-action models struggle to satisfy task constraints and generalize across scenarios. These results identify intuitive manipulation as a missing axis in current foundation models and generalist robot policies, and position IMBENCH as a step toward evaluating and enabling more integrated, adaptive physical intelligence.
- Abstract(参考訳): 人間は推論と運動制御を組み合わせて、様々な制約の下で複雑な操作タスクを解く。
彼らは物理的な世界を理解し、推論をアクションに変換し、新しいシーン、タスク、ルールに迅速に適応するのに役立つ。
この機能を直感的な操作と呼んでいる。
既存のベンチマークはこの統合を捉えることができず、実行から分離した物理的推論を評価したり、明示的な推論を必要とせずにポリシーのパフォーマンスを測定したりする。
IMBENCHは直感的な操作を知覚、身体的推論、行動生成、反復実行にまたがる統合機能として評価するためのベンチマークである。
我々のタスクは、タスク関連物理構造を推論し、接触豊富な操作、ツールの使用、多段階依存を含む明示的な制約の下で実行可能なアクションシーケンスを生成するモデルを必要とする。
多様なシナリオを生成するための,35のタスク,14Kのフィルタトラジェクトリ,スケーラブルなツールのベンチマークを導入する。
視覚言語モデルは部分的な物理的推論能力を示すが、実行可能な計画の生成に失敗し、最先端のビジョン言語アクションモデルはタスク制約を満たすのに苦労し、シナリオをまたいで一般化する。
これらの結果は、直感的な操作を現在の基礎モデルと汎用ロボットポリシーの欠落軸として認識し、IMBENCHをより統合的で適応的な物理的知性を評価するためのステップとして位置づける。
関連論文リスト
- Towards Generalizable Visually Grounded Exploration of Household Devices [74.66117923766632]
汎用的な自律的実施エージェントを実現する上でのボトルネックは、Generalizable Visually Grounded Explorationにある。
VGEBenchは、視覚言語モデルの一般化可能な視野探索能力を評価するために設計されたベンチマークである。
静的なデータセットとは異なり、我々はLogic-Driven State Machineフレームワークを構築している。このフレームワークは多ターンインタラクションループをシミュレートし、アクティブな視覚知覚とフィードバック駆動の修正によって目標を達成するエージェントを説得する。
論文 参考訳(メタデータ) (2026-09-01T07:42:45Z) - From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence [54.62791372989525]
アクションモデル、ビジョン言語-アクションポリシー、世界モデルは、この目標を前進させた。
世界行動モデル(WAM)は、候補者の介入と予測された結果とを結びつけるため、特に有望である。
我々は、WAMへの進化をレビューし、これらの制限をモデルの役割と表現、目的と標準化、システム構成という3つの組み合わせのギャップにまとめる。
論文 参考訳(メタデータ) (2026-07-13T15:22:56Z) - RoboWits: Unexpected Challenges for Robotic Creative Problem Solving [58.58727722988084]
我々は、認知的推論、創造的ツールの使用、予期しない状況に対する堅牢性を評価するために設計された、双方向のロボットベンチマークであるRoboWitsを紹介する。
このパイプラインを用いて,30種類の種タスクと208のタスクを,幾何学的,物質的,集合的推論にまたがる変異と難易度でキュレートした。
プレトレーニングされたVLAは,単一タスクの微調整後にシードタスクに予備的な成功を示すが,変異タスクの実行に苦慮している。
論文 参考訳(メタデータ) (2026-05-28T17:57:15Z) - KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning [21.424432912557293]
我々はKinematic and Dynamic Embodied ReasoningのベンチマークであるKinDERを紹介する。
KinDERは25のプロシージャ生成環境と、パラメータ化されたスキルとデモを備えたGymnasium互換のPythonライブラリで構成されている。
また,シミュレーションと実世界の物理的相互作用の対応性を評価するために,移動マニピュレータを用いた実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-
論文 参考訳(メタデータ) (2026-04-28T15:58:09Z) - From Perception to Action: An Interactive Benchmark for Vision Reasoning [51.11355591375073]
Causal Hierarchy of Actions and Interactions (CHAIN)ベンチマークは、モデルが物理的制約に基づいて構造化されたアクションシーケンスを理解し、計画し、実行できるかを評価するために設計された。
CHAINは、受動的知覚からアクティブな問題解決、機械パズルのインターロックや3D積み重ね、パッキングといったタスクへと評価をシフトする。
以上の結果から,トップパフォーマンスモデルでは,物理構造や因果制約の内在化に苦慮し,信頼性の高い長期計画の作成に失敗することが多く,認識された構造を効果的に翻訳することができないことが示唆された。
論文 参考訳(メタデータ) (2026-02-24T15:33:02Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - Do-Undo: Generating and Reversing Physical Actions in Vision-Language Models [57.71440995598757]
我々は,視覚言語モデルにおける重要なギャップに対処するために,Do-Undoタスクとベンチマークを導入する。
Do-Undoは、物理的な行動の結果をシミュレートし、それを正確に反転させるモデルを必要とし、視覚の世界における真の原因と効果を反映している。
論文 参考訳(メタデータ) (2025-12-15T18:03:42Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Closed Loop Interactive Embodied Reasoning for Robot Manipulation [17.732550906162192]
身体的推論システムは、ロボットハードウェアと認知プロセスを統合して複雑なタスクを実行する。
そこで我々は,CLIER(Closed Loop Interactive Embodied Reasoning)アプローチを導入した。
CLIERは、非視覚的物体の特性の測定、外乱によるシーンの変化、そしてロボット行動の不確実な結果を考慮している。
論文 参考訳(メタデータ) (2024-04-23T16:33:28Z) - Learning Extrinsic Dexterity with Parameterized Manipulation Primitives [8.7221770019454]
我々は、オブジェクトのポーズを変えるために環境を利用する一連のアクションを学習する。
我々のアプローチは、オブジェクトとグリップと環境の間の相互作用を利用してオブジェクトの状態を制御することができる。
拘束されたテーブルトップワークスペースから様々な重量,形状,摩擦特性の箱状物体を選別する手法の評価を行った。
論文 参考訳(メタデータ) (2023-10-26T21:28:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。