論文の概要: PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
- arxiv url: http://arxiv.org/abs/2608.17129v1
- Date: Mon, 17 Aug 2026 21:03:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.131518
- Title: PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
- Title(参考訳): PROBE: VLMエージェントを用いたマニピュレーション・グラウンド視覚質問応答
- Abstract要約: 視覚言語モデル(VLM)は静的シーンにおける2次元グラウンド、空間的推論、エージェントツールベースの計画において優れる。
この設定をMG-VQA (Manipulation-Grounded Visual Question Answering) として定式化する。
本稿では,このようなタスク上でのVLMエージェントのベンチマークと微調整を行うフレームワーク PROBE を紹介する。
- 参考スコア(独自算出の注目度): 20.33055673400906
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language Models (VLMs) excel at 2D grounding, spatial reasoning and agentic tool-based planning in static scenes. However, consider asking a home robot "Is my medication still in the cabinet?" The answer may be physically hidden behind a row of containers that must first be moved aside. Answering such questions in real-world cluttered environments requires reasoning in dynamic scenes: distractors must be manipulated to reveal occluded objects, and each action changes the scene the model must reason over. We formalize this setting as Manipulation-Grounded Visual Question Answering (MG-VQA) and introduce PROBE, a framework for benchmarking and finetuning VLM agents on such tasks. We first develop PROBE-Sim, a high-fidelity tabletop simulator with everyday objects and a robot manipulator equipped with grasping and pushing tools. PROBE-Sim is used to create PROBE-Bench: an evaluation suite of 150 tasks across 6 question types on cluttered tabletop scenes, where a VLM perceives, picks up or pushes objects before answering. We observe consistent trend across all frontier VLMs: agentic tool-based methods outperform their perception-only baselines (8.0% on average) across all task types. We further design PROBE-Agent, a finetuning recipe to distill successful trajectories from a powerful teacher foundation model to a smaller open-weight model using a mixed data recipe that encourages manipulation-efficient question answering. PROBE Agent finetuned models outperform their off-the-shelf agent baseline (11.5% on average) and demonstrate positive transfer to unseen objects and a held-out task. We validate sim-to-real transfer by deploying PROBE-Agent finetuned policies in real-world tabletop environments.
- Abstract(参考訳): 視覚言語モデル(VLM)は静的シーンにおける2次元グラウンド、空間的推論、エージェントツールベースの計画において優れる。
しかし、ホームロボットに「私の薬はまだキャビネットにあるのか?」と尋ねてみよう。
答えはコンテナの行の後ろに物理的に隠されているかもしれない。
このような質問を現実世界の散らばった環境で答えるには、ダイナミックなシーンでの推論が必要である。
我々は,この設定をMG-VQA (Manipulation-Grounded Visual Question Answering) として定式化し,このようなタスク上でのVLMエージェントのベンチマークおよび微調整を行うフレームワークである PROBE を導入する。
ProBE-Simは,日常的な物体を持つ高忠実度テーブルトップシミュレータであり,把持・押圧ツールを備えたロボットマニピュレータである。
PROBE-Simは、散らかったテーブルトップのシーンで、6つの質問タイプにまたがる150のタスクからなる評価スイートである。
エージェントツールベースの手法は、すべてのタスクタイプにおいて、知覚のみのベースライン(平均8.0%)よりも優れています。
我々はさらに、強力な教師基盤モデルから、操作効率の高い質問応答を促す混合データレシピを用いて、より小さなオープンウェイトモデルに、成功した軌跡を蒸留する微調整レシピ PROBE-Agent を設計する。
PROBEエージェントは、市販のエージェントのベースライン(11.5%の平均)を上回り、目に見えないオブジェクトへのポジティブな転送とホールドアウトタスクを実証した。
ProBE-Agent微調整されたポリシーを現実世界のテーブルトップ環境に配置することで、sim-to-real転送を検証する。
関連論文リスト
- ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation [14.85015534787527]
インターリーブされたテキスト・画像生成は、複雑な情報を伝えるためのより直感的な方法を提供する。
現在のパラダイムは、イメージ生成または検索拡張のいずれかに依存しており、クリエイティビティと事実を統一することができない。
この分野での次のマイルストーンはエージェントツールプランニングであり、モデルがいつ、どこで、どのツールを起動して、視覚的にクリティカルなクエリに対してインターリーブされた応答を生成するかを自律的に決定する中心的なコントローラとして機能する。
論文 参考訳(メタデータ) (2026-03-31T15:47:59Z) - MALLVI: A Multi-Agent Framework for Integrated Generalized Robotics Manipulation [0.0]
MALLVIはクローズドループフィードバック駆動ロボット操作を可能にするフレームワークを提供する。
単一のモデルを使用するのではなく、MALLVIは特別なエージェントをコーディネートし、知覚、局所化、推論、高レベルの計画を管理する。
論文 参考訳(メタデータ) (2026-02-18T21:28:56Z) - SAGE: Scalable Agentic 3D Scene Generation for Embodied AI [67.43935343696982]
既存のシーン生成システムは、しばしばルールベースまたはタスク固有のパイプラインに依存し、アーティファクトと物理的に無効なシーンを生成する。
本稿では,ユーザが特定した具体的タスクを与えられたエージェントフレームワークであるSAGEについて,その意図を理解し,大規模にシミュレーション可能な環境を自動的に生成する。
得られた環境は現実的で多様性があり、政策訓練のための現代的なシミュレーターに直接デプロイできる。
論文 参考訳(メタデータ) (2026-02-10T18:59:55Z) - AgenticLab: A Real-World Robot Agent Platform that Can See, Think, and Act [27.922630781100864]
本稿では,モデルに依存しないロボットエージェントプラットフォームであるAgenticLabと,オープンワールド操作のためのベンチマークについて紹介する。
我々は、非構造環境における実ロボットタスクに最先端のVLMベースのエージェントをベンチマークする。
私たちのベンチマークでは、オフラインの視覚言語テストがキャプチャーに失敗するいくつかの障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-02-02T05:30:14Z) - HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation [54.03004125910057]
階層型視覚-言語-アクションモデルは、標準的なモノリシックVLAモデルよりも、ドメイン外のデータを利用するのに効果的であることを示す。
階層設計により、高レベルなVLMは、オフドメイン微調整データと実ロボットテストシナリオの間の重要なドメインギャップをまたいで転送可能であることを示す。
論文 参考訳(メタデータ) (2025-02-08T07:50:22Z) - PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs [140.14239499047977]
視覚言語モデル(VLM)は、論理的推論から視覚的理解に至るまで、様々なタスクにわたって印象的な能力を示している。
PIVOT(Prompting with Iterative Visual Optimization)と呼ばれる新しい視覚的プロンプト手法を提案する。
私たちのアプローチは、ロボットのトレーニングデータやさまざまな環境でのナビゲーション、その他の能力なしに、ロボットシステムのゼロショット制御を可能にします。
論文 参考訳(メタデータ) (2024-02-12T18:33:47Z) - DriveLM: Driving with Graph Visual Question Answering [57.51930417790141]
本研究では,Webスケールデータに基づいて学習した視覚言語モデル(VLM)を,エンド・ツー・エンドの運転システムに統合する方法について検討する。
グラフVQAとエンドツーエンド駆動を併用するVLMベースラインアプローチ(DriveLM-Agent)を提案する。
論文 参考訳(メタデータ) (2023-12-21T18:59:12Z) - Interactive Planning Using Large Language Models for Partially
Observable Robotics Tasks [54.60571399091711]
大きな言語モデル(LLM)は、オープン語彙タスクを実行するロボットエージェントを作成することで、驚くべき成果を上げている。
LLMを用いた部分的に観測可能なタスクのための対話型計画手法を提案する。
論文 参考訳(メタデータ) (2023-12-11T22:54:44Z) - Learning Extrinsic Dexterity with Parameterized Manipulation Primitives [8.7221770019454]
我々は、オブジェクトのポーズを変えるために環境を利用する一連のアクションを学習する。
我々のアプローチは、オブジェクトとグリップと環境の間の相互作用を利用してオブジェクトの状態を制御することができる。
拘束されたテーブルトップワークスペースから様々な重量,形状,摩擦特性の箱状物体を選別する手法の評価を行った。
論文 参考訳(メタデータ) (2023-10-26T21:28:23Z) - Learning Models as Functionals of Signed-Distance Fields for
Manipulation Planning [51.74463056899926]
本研究では,シーン内のオブジェクトを表す符号付き距離場の目的を学習する,最適化に基づく操作計画フレームワークを提案する。
オブジェクトを符号付き距離場として表現することは、ポイントクラウドや占有率の表現よりも高い精度で、様々なモデルの学習と表現を可能にする。
論文 参考訳(メタデータ) (2021-10-02T12:36:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。