論文の概要: Towards Generalizable Visually Grounded Exploration of Household Devices
- arxiv url: http://arxiv.org/abs/2609.00845v1
- Date: Tue, 01 Sep 2026 07:42:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.438949
- Title: Towards Generalizable Visually Grounded Exploration of Household Devices
- Title(参考訳): 一般化可能な家庭用機器探索に向けて
- Authors: Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo,
- Abstract要約: 汎用的な自律的実施エージェントを実現する上でのボトルネックは、Generalizable Visually Grounded Explorationにある。
VGEBenchは、視覚言語モデルの一般化可能な視野探索能力を評価するために設計されたベンチマークである。
静的なデータセットとは異なり、我々はLogic-Driven State Machineフレームワークを構築している。このフレームワークは多ターンインタラクションループをシミュレートし、アクティブな視覚知覚とフィードバック駆動の修正によって目標を達成するエージェントを説得する。
- 参考スコア(独自算出の注目度): 74.66117923766632
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advancements in Vision-Language Models (VLMs) have demonstrated impressive capabilities in static visual recognition and high-level semantic reasoning. However, current embodied exploration paradigms still heavily rely on imitation learning from human-annotated trajectories, which severely limits agents' generalization ability. The key bottleneck of realizing general autonomous embodied agents lies in Generalizable Visually Grounded Exploration: the ability to operate novel devices without manuals or specific training by actively grounding abstract world knowledge into fine-grained visual affordances. Yet, existing benchmarks fail to evaluate this capability: they generally rely on explicit documents and annotated trajectories, neglecting the dynamic Hypothesis-Interaction-Refinement process essential for functional device operation. To bridge this gap, we introduce VGEBench, a comprehensive benchmark designed to evaluate the generalizable visually grounded exploration capabilities of VLMs. Unlike static datasets, we construct a Logic-Driven State Machine framework. This framework simulates multi-turn interaction loops, compelling agents to achieve goals by active visual perception and feedback-driven correction. Experimental results demonstrate that existing VLMs face significant challenges in translating semantic knowledge into physical execution and maintaining long-horizon state tracking.
- Abstract(参考訳): VLM(Vision-Language Models)の最近の進歩は、静的な視覚認識と高レベルのセマンティック推論において、印象的な能力を示している。
しかし、現在の具体的探索パラダイムは、エージェントの一般化能力を著しく制限する人間の注釈付き軌道からの模倣学習に大きく依存している。
汎用的な視覚的接地探索(Generalizable Visually Grounded Exploration) — 抽象世界の知識を精細な視覚的余裕に積極的に根ざすことによって、マニュアルや特定のトレーニングなしで新しいデバイスを操作する能力。
それらは一般に明示的な文書や注釈付き軌跡に依存しており、機能デバイス操作に不可欠な動的仮説-相互作用-制限プロセスを無視している。
このギャップを埋めるために、VGEBenchは、VLMの一般化可能な視野探索能力を評価するために設計された包括的なベンチマークである。
静的データセットとは異なり、ロジック駆動のステートマシンフレームワークを構築します。
このフレームワークは多ターン相互作用ループをシミュレートし、アクティブな視覚知覚とフィードバック駆動補正によって目標を達成するエージェントを説得する。
実験の結果,既存のVLMは,意味的知識を物理的実行に翻訳し,長期状態追跡を維持する上で重要な課題に直面していることがわかった。
関連論文リスト
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation [47.58516950734307]
既存のフレームワークは、しばしば特権化されたシミュレータの状態に依存するか、あるいは完全な命令を仮定し、現実的なデプロイメント課題を回避します。
本稿では,オープンワールドモバイル操作のためのエージェントフレームワークREALを提案する。
我々は、データ収集、教師付き微調整、オンライン強化学習を駆動するための多様なタスク構成を設計する。
論文 参考訳(メタデータ) (2026-07-15T09:55:45Z) - Action with Visual Primitives [36.230909065494345]
VLA(Vision-Language-Action)モデルは、汎用的なロボット操作のための有望なパラダイムとして登場した。
AVP(Action with Visual Primitives)は、このビジュアルプリミティブ中心のインターフェースを実装したエンドツーエンドアーキテクチャである。
AVP は pi_0.5 よりも 27.61% 向上し,近年の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-05-21T08:52:47Z) - ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation [66.02142169323521]
Vision-Language-ActionモデルとWorld Modelは最近、汎用ロボットインテリジェンスのための有望なパラダイムとして登場した。
既存のベンチマークは、主にシミュレータ中心であり、制御性を提供するが、知覚ノイズによって引き起こされる現実のギャップを捉えることができない。
シミュレーションと実世界の実行を橋渡しする標準化された評価フレームワークであるManipArenaを紹介する。
論文 参考訳(メタデータ) (2026-03-30T15:06:41Z) - VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation [61.82502719679122]
本稿では,Versatile, Embodied, Realistic Simulation, EvaluationのベンチマークであるVLNVerseを紹介する。
VLNVerseは、スケーラブルでフルスタックのAI問題としてVLNを再定義する。
ベンチマーク内の全てのタスクに対処できる新しいマルチタスクモデルを提案する。
論文 参考訳(メタデータ) (2025-12-22T04:27:26Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z) - LTD-Bench: Evaluating Large Language Models by Letting Them Draw [57.237152905238084]
LTD-Benchは、大規模言語モデル(LLM)のブレークスルーベンチマークである。
LLMの評価を抽象的なスコアから直接観察可能な視覚出力に変換する。
LTD-Benchの視覚出力は強力な診断分析を可能にし、モデル類似性を調べるための潜在的アプローチを提供する。
論文 参考訳(メタデータ) (2025-11-04T08:11:23Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization [3.131272328696594]
VisionLawは、視覚的な観察から固有の力学の解釈可能な表現を推論する二段階最適化フレームワークである。
既存の最先端手法を著しく上回り、新しいシナリオにおける対話型シミュレーションの強力な一般化を示す。
論文 参考訳(メタデータ) (2025-08-19T12:52:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。