論文の概要: VIA: Visual Interface Agent for Robot Control
- arxiv url: http://arxiv.org/abs/2607.11119v1
- Date: Mon, 13 Jul 2026 05:52:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.342736
- Title: VIA: Visual Interface Agent for Robot Control
- Title(参考訳): VIA:ロボット制御のためのビジュアルインタフェースエージェント
- Authors: Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh,
- Abstract要約: VIA(Visual Interface Agent for Robot Control)は、ロボット制御をエージェントタスクとして再キャストするフレームワークである。
スクリーンショットを撮り、直感的なコマンドを出し、結果を観察し、調整することで、ブラウザベースの3Dインターフェースを介してマニピュレータを駆動する。
3つのLIBEROゴールタスクで96.7%、ロングホライゾン虹組立タスクで100%を達成している。
- 参考スコア(独自算出の注目度): 34.69686658431114
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robot manipulation is a complex task that requires visual understanding, physical reasoning, planning, and closed-loop control. General-purpose foundation models (FMs) have grown remarkably capable of some of these, especially vision and reasoning. To leverage this for generalist robot policies, current methods typically involve converting existing FMs into vision-language-action (VLA) models by fine-tuning on robot data to output low-level actions. However, VLAs are often orders of magnitude smaller than frontier FMs given the limited data and compute available for fine-tuning, which in turn limits their general capability. Inspired by the growing ability of FMs to operate software through visual interfaces, we ask whether that same competence suffices to control a robot. We present VIA (Visual Interface Agent for robot control), a framework that recasts robot control as an agentic task: an off-the-shelf FM-powered agent drives a manipulator through a browser-based 3D interface by taking screenshots, issuing intuitive commands, observing the outcome, and adjusting. The agent receives no robot-specific fine-tuning and no access to privileged state information: it perceives visual input and acts through a small set of general tools. VIA inherits the agent's general reasoning, closed-loop error recovery, and ability to plan and re-plan from what it observes. It solves a diverse suite of tabletop manipulation tasks zero-shot with both Claude Code and Codex. With the strongest model (Fable 5) it achieves 96.7% success on three LIBERO-Goal tasks and 100% on a long-horizon rainbow assembly task. Performance improves with the scale and strength of the underlying model. These results suggest that frontier agents already possess skills that transfer directly to robot control given the right interface: your coding or computer-use agent is, in a sense, secretly a robot-control agent.
- Abstract(参考訳): ロボット操作は、視覚的理解、物理的推論、計画、クローズドループ制御を必要とする複雑なタスクである。
一般目的基礎モデル(FM)は、これらのいくつか、特にビジョンと推論に顕著な能力を持つようになった。
これを一般的なロボットポリシーに活用するために、現在の手法では、ロボットデータを微調整して低レベルのアクションを出力することで、既存のFMを視覚言語アクション(VLA)モデルに変換するのが一般的である。
しかしながら、VLAは制限されたデータと微調整に使える計算量によって、フロンティアFMよりも桁違いに小さくなり、その結果、一般的な能力は制限される。
FMが視覚インタフェースを介してソフトウェアを操作する能力の増大にインスパイアされ、ロボットを制御できる能力があるかどうかを問う。
我々は,ロボット制御をエージェントタスクとしてリキャストするフレームワークであるVIA(Visual Interface Agent for Robot Control)を紹介した。 市販のFMエージェントは,スクリーンショットを撮り,直感的なコマンドを発し,結果を観察し,調整することで,ブラウザベースの3Dインターフェースを介してマニピュレータを駆動する。
エージェントはロボット固有の微調整を受けず、特権状態情報へのアクセスも行わない。
VIAはエージェントの一般的な推論、クローズドループエラーリカバリ、観察対象から計画と再計画を行う能力を継承する。
Claude CodeとCodexを使って、さまざまなテーブルトップ操作タスクをゼロショットで解決する。
最強のモデル(Fable 5)では、LIBERO-Goalの3つのタスクで96.7%、ロングホライゾンのレインボー組立タスクで100%を達成している。
パフォーマンスは、基礎となるモデルのスケールと強度によって向上します。
これらの結果は、フロンティアエージェントが、正しいインターフェースによってロボット制御に直接移行するスキルを持っていることを示唆している。
関連論文リスト
- VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation [32.23131310342716]
オープンボキャブラリのロングホライゾン操作では、ロボットが柔軟な指示や複雑な多目的シーンを推論する必要がある。
本稿では,VLMが異種ロボット機能を中断可能なツールとしてオーケストレーションするクローズドエージェントループを用いて,これらの要求に対処する。
本稿では,VLA/WAMを中間ロールアウト時の中断可能なツールとして扱うことで,VLMの計画,監視,回復を行うVoLoAgentを提案する。
論文 参考訳(メタデータ) (2026-06-05T16:21:27Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models [5.731055678884616]
Eye Eyeは、高速で、非侵襲的で、意図に富んだ入力モダリティを提供する。
我々は,エゴ中心の視線追跡と視覚言語モデルを利用して,ユーザの意図を推測し,ロボット操作タスクを自律的に実行するシステムであるGAMMAを提案する。
結果は、GAMAが堅牢で直感的で汎用的な制御を提供し、基礎モデルを組み合わせる可能性と、自然でスケーラブルなロボット自律性を見つめることを強調している。
論文 参考訳(メタデータ) (2026-01-08T19:33:03Z) - Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills [31.788094786664324]
現実の具体的タスクにおいて人間レベルのパフォーマンスを達成することができる自律ロボットエージェントを構築することは、ヒューマノイドロボット研究の究極の目標である。
近年の進歩は、ファンデーションモデル(FM)によるハイレベル認知と、ヒューマノイドロボットの低レベルスキル開発に大きな進歩をもたらした。
本稿では,FMとモジュール型スキルライブラリを統合する階層型エージェントフレームワークであるBeat-0を紹介する。
being-0は、器用な手とアクティブなビジョンを備えたフルサイズのヒューマノイドロボット上で、効率的でリアルタイムなパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-16T14:53:53Z) - Magma: A Foundation Model for Multimodal AI Agents [85.53847140774839]
Magmaは、デジタルと物理の両方の世界でマルチモーダルAIエージェントタスクを提供する基盤モデルである。
エージェント機能を実現するために、Magmaは画像、ビデオ、ロボットデータなど、多種多様なデータセットを事前訓練している。
論文 参考訳(メタデータ) (2025-02-18T18:55:21Z) - HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation [54.03004125910057]
階層型視覚-言語-アクションモデルは、標準的なモノリシックVLAモデルよりも、ドメイン外のデータを利用するのに効果的であることを示す。
階層設計により、高レベルなVLMは、オフドメイン微調整データと実ロボットテストシナリオの間の重要なドメインギャップをまたいで転送可能であることを示す。
論文 参考訳(メタデータ) (2025-02-08T07:50:22Z) - Robotic Control via Embodied Chain-of-Thought Reasoning [86.6680905262442]
学習したロボット制御ポリシーの鍵となる制限は、トレーニングデータの外部で一般化できないことである。
視覚言語行動モデル(VLA)に関する最近の研究は、大規模なインターネット事前学習型視覚言語モデルを使用することで、その堅牢性と一般化能力を大幅に向上させることができることを示した。
ロボットの動作を予測する前に、VLAに対して、計画、サブタスク、動作、視覚的接地機能について複数の推論を行うために、VLAに対してEmbodied Chain-of-Thought Reasoning (ECoT)を導入する。
論文 参考訳(メタデータ) (2024-07-11T17:31:01Z) - LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [56.505551117094534]
我々はLLaRA: Large Language and Robotics Assistantを紹介した。
まず、既存の行動クローニングデータセットからロボットのための会話スタイルの指導データを生成する自動パイプラインを提案する。
このようなデータセットを限定的に微調整したVLMは、ロボット制御において有意義な行動決定を導出できることを示す。
論文 参考訳(メタデータ) (2024-06-28T17:59:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。