論文の概要: Show-Harness: Just a VLM Agent Can Play Robots
- arxiv url: http://arxiv.org/abs/2609.10522v1
- Date: Wed, 09 Sep 2026 17:53:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.129265
- Title: Show-Harness: Just a VLM Agent Can Play Robots
- Title(参考訳): ロボットを遊べるVLMエージェント「Show-Harness」
- Abstract要約: 身体的視覚言語モデル(VLM)は世界に関する幅広い知性を示すが、この知性をロボット制御に翻訳することは依然として困難である。
本稿では,動作意図をリンクするコンパクトなセマンティックインターフェースを通じて,VLMがロボットを「プレイ」することを可能にする,身体的ハーネスであるShow-Harnessを紹介する。
GUMIはGUIベースのデモコレクションに同じセマンティックアクション空間を拡張し、人間やエージェントが特殊な遠隔操作ハードウェアを使わずにエボディメントをまたいでロボットを「プレイ」することができる。
- 参考スコア(独自算出の注目度): 53.80887083886227
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Foundation vision-language models (VLMs) exhibit broad intelligence about the world, yet translating this intelligence into robot control remains challenging. We present Show-Harness, an Embodied Harness that enables VLMs to "play" robots through a compact semantic interface linking intent to action. Show-Harness exposes discrete semantic action units that VLMs can naturally reason over, while embodiment-specific interpreters deterministically ground them into local robot actions, keeping the VLM directly responsible for fine-grained physical decisions. Through the same interface, Show-Harness demonstrates the feasibility of (1) directly unlocking closed-source frontier VLMs for zero-shot robot control, and (2) adapting small-scale open-source VLMs for low-cost deployment with just a few GPU-hours of fine-tuning. We further develop GUMI (GUI Manipulation Interface), which extends the same semantic action space to GUI-based demonstration collection, allowing humans and agents to "play" robots across embodiments without specialized teleoperation hardware. Extensive experiments show that Show-Harness-equipped VLM agents generalize robustly across tasks, embodiments, and environments, outperforming representative agentic and VLA paradigms. These results suggest that the right interface can unlock substantial embodied capability from foundation VLMs, without requiring additional model capacity or costly embodiment-specific pretraining.
- Abstract(参考訳): ファンデーションビジョン言語モデル(VLM)は世界に関する幅広い知性を示すが、この知性をロボット制御に翻訳することは依然として困難である。
動作意図をリンクするコンパクトなセマンティックインターフェースを通じて、VLMがロボットを「プレイ」できる、エンボディード・ハーネスであるShow-Harnessを提案する。
Show-Harnessは、VLMが自然に推論できる個別のセマンティックアクションユニットを公開し、その一方で、具体化固有のインタプリタは、それらを決定論的にローカルなロボットアクションに固定し、VLMが微細な物理的決定に直接責任を負うようにする。
同じインターフェースを通じて、Show-Harness は(1) ゼロショットロボット制御のためのクローズドソースフロンティア VLM を直接アンロックし、(2) 小規模のオープンソース VLM を、わずか数回のGPU時間で低コストなデプロイメントに適応させることの実現可能性を示した。
GUMI (GUI Manipulation Interface) はGUIベースのデモコレクションに同じセマンティックアクション空間を拡張し、人間やエージェントが特殊な遠隔操作ハードウェアを使わずに実施する。
広範囲な実験により、Show-Harnessを搭載したVLMエージェントは、タスク、実施形態、環境にまたがって堅牢に一般化され、代表エージェントやVLAのパラダイムを上回ることが示されている。
これらの結果から, モデルキャパシティの追加や, コストのかかる具体化特化事前訓練を必要とせず, 基礎VLMから相当な具体化能力を解き放つことができることが示唆された。
関連論文リスト
- Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots [54.62646284378409]
我々は、視覚言語モデル(VLM)に関するポリシーを構築し、認識、計画、制御モジュールのキュレートされたセットにカプセル化された特定のロボット機能によって、その汎用能力を増強する。
Maestroでは、VLMコーディングエージェントがこれらのモジュールを現在のタスクとシナリオのためのプログラムポリシーに動的に構成する。
論文 参考訳(メタデータ) (2025-11-02T12:34:37Z) - Bridging Embodiment Gaps: Deploying Vision-Language-Action Models on Soft Robots [5.993870098970107]
VLA(Vision-Language-Action)モデルは、実際のロボットのための言語ガイド付き汎用制御フレームワークとして提案されている。
本稿では,VLAモデルのソフト連続マニピュレータへの展開について述べる。
論文 参考訳(メタデータ) (2025-10-20T10:06:39Z) - LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [56.505551117094534]
我々はLLaRA: Large Language and Robotics Assistantを紹介した。
まず、既存の行動クローニングデータセットからロボットのための会話スタイルの指導データを生成する自動パイプラインを提案する。
このようなデータセットを限定的に微調整したVLMは、ロボット制御において有意義な行動決定を導出できることを示す。
論文 参考訳(メタデータ) (2024-06-28T17:59:12Z) - MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting [97.52388851329667]
我々は,自由形式の言語命令で指定されたロボット操作タスクを解決するために,マーキングオープンワールドキーポイントアフォード(Moka)を導入する。
我々のアプローチの中心は、VLMの観測画像と物理世界におけるロボットの行動に関する予測を橋渡しする、コンパクトな点ベースの可測性表現である。
ツールの使用,変形可能な身体操作,オブジェクト再構成など,さまざまなテーブルトップ操作タスクにおけるMokaの性能評価と解析を行った。
論文 参考訳(メタデータ) (2024-03-05T18:08:45Z) - PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs [140.14239499047977]
視覚言語モデル(VLM)は、論理的推論から視覚的理解に至るまで、様々なタスクにわたって印象的な能力を示している。
PIVOT(Prompting with Iterative Visual Optimization)と呼ばれる新しい視覚的プロンプト手法を提案する。
私たちのアプローチは、ロボットのトレーニングデータやさまざまな環境でのナビゲーション、その他の能力なしに、ロボットシステムのゼロショット制御を可能にします。
論文 参考訳(メタデータ) (2024-02-12T18:33:47Z) - RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language
Models [4.4173427917548524]
MLLM(Multimodal Large Language Models)は、様々な下流タスクのための新しいバックボーンとして登場した。
我々は、ARMBenchチャレンジにおける視覚的認識タスクに対処するため、BEiT-3バックボーンを備えたRoboLLMフレームワークを紹介した。
論文 参考訳(メタデータ) (2023-10-16T09:30:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。