論文の概要: Generalizing Manipulation Skills with a Local Coding Agent
- arxiv url: http://arxiv.org/abs/2609.26499v1
- Date: Tue, 22 Sep 2026 14:32:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.699468
- Title: Generalizing Manipulation Skills with a Local Coding Agent
- Title(参考訳): 局所符号化エージェントによるマニピュレーションスキルの一般化
- Abstract要約: 我々は、ローカルなオープンウェイトVLMであるQwen3.8-27Bを、コーディングエージェントハーネスからUR3eロボットアームを駆動させる。
キネマティクス、安全限度、古典的なコンピュータビジョン技術を実装したサービスの上に独自のコードを書き、実行する。
我々は,タスクの複雑さに応じて,3.4~67.5分間の期間で45回中30回にのぼる一般化を観察した。
- 参考スコア(独自算出の注目度): 0.47598237350828443
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Today, progress in open-weight language models enables systems capable of writing, executing and debugging code while still running on a single workstation. Most language-driven robots give the model a fixed action interface or a trained policy. Generalizing to a new task therefore means more engineering effort or more data collection, both time-consuming. We investigate whether a local open-weight vision-language model can control a robot and one-shot generalize to new variations of a task without new human programming or training. We let a local open-weight VLM, Qwen3.8-27B, drive a UR3e robotic arm from a coding-agent harness. It writes and runs its own code above a service that implements kinematics, safety limits and classic computer vision techniques. We investigate if this system is capable of generalizing to unseen tasks. Specifically, we test it on nine tasks built from children's toys designed to probe generalization capability across various object characteristics: color, size, shape, and task variation of those. With five trials for each task, we observe generalization in 30 out of 45 trials with durations ranging from 3.4 to 67.5 minutes depending on task complexity. We further test if there is a speedup when an agent is asked to redo the task after successful completion. This resulted in a 50% reduction in duration, indicating that there is self-improvement over time. Finally, we expose the limitations of a local coding agent. We believe that solving those limitations combined with further investigation of self-improvement over time points at a direct path toward real-world deployment of a local coding agent.
- Abstract(参考訳): 今日では、オープンウェイト言語モデルの進歩により、単一のワークステーション上で実行しながら、コードを書き、実行し、デバッグすることが可能になる。
ほとんどの言語駆動ロボットは、モデルに固定されたアクションインターフェースまたは訓練されたポリシーを与える。
したがって、新しいタスクに一般化することで、エンジニアリングの労力やデータ収集が増加し、どちらも時間がかかります。
ローカルなオープンウェイトな視覚言語モデルがロボットを制御でき、新しい人間のプログラミングや訓練なしにタスクの新たなバリエーションにワンショットで一般化できるかどうかを検討する。
我々は、ローカルなオープンウェイトVLMであるQwen3.8-27Bを、コーディングエージェントハーネスからUR3eロボットアームを駆動させる。
キネマティクス、安全限度、古典的なコンピュータビジョン技術を実装したサービスの上に独自のコードを書き、実行する。
本研究では,このシステムが未知のタスクに一般化できるかどうかを考察する。
具体的には、色、サイズ、形状、タスクのバリエーションなど、さまざまな対象特性にまたがる一般化能力を探索するために、子どものおもちゃから作られた9つのタスクでテストする。
各タスクの5つの試行で、タスクの複雑さに応じて3.4から67.5分の範囲で45の試行中30の一般化を観察する。
完了後、エージェントにタスクの再実行を依頼した場合、スピードアップがあるかどうかをさらに検証する。
その結果、持続時間が50%減少し、時間とともに自己改善がもたらされた。
最後に、ローカルコーディングエージェントの制限を明らかにする。
これらの制限の解決と、局所的な符号化エージェントの現実的な展開に向けた直接的な経路において、時間点による自己改善のさらなる調査が組み合わさったと信じている。
関連論文リスト
- Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution [51.89342880214462]
Operations Research knowledge-based 3D Grounded Task Scheduling (ORS3D)は、言語理解、3Dグラウンド、効率最適化の相乗効果を必要とする新しいタスクである。
ORS3Dの研究を容易にするために,ORS3D-60Kを構築した。
ORS3D-60Kの実験は、言語理解、3Dグラウンド、スケジューリング効率にまたがるGRANTの有効性を検証する。
論文 参考訳(メタデータ) (2025-11-24T18:59:17Z) - CAAP: Context-Aware Action Planning Prompting to Solve Computer Tasks with Front-End UI Only [21.054681757006385]
本稿では,スクリーンショット画像のみを通して環境を知覚するエージェントを提案する。
大規模言語モデルの推論能力を活用することで,大規模人間の実演データの必要性を解消する。
AgentはMiniWoB++の平均成功率は94.5%、WebShopの平均タスクスコアは62.3である。
論文 参考訳(メタデータ) (2024-06-11T05:21:20Z) - RoboCoder: Robotic Learning from Basic Skills to General Tasks with Large Language Models [49.23588578549434]
大規模言語モデル(LLM)はロボットタスクの見通しを改善した。
既存のベンチマークはまだ、一般化機能に制限のある単一のタスクに限られている。
包括的なベンチマークと自律学習フレームワークであるRoboCoderを紹介します。
論文 参考訳(メタデータ) (2024-06-06T05:41:47Z) - A Zero-Shot Language Agent for Computer Control with Structured
Reflection [19.526676887048662]
大規模言語モデル(LLM)は、ライブコンピュータ環境での高レベルな目標の計画と実行能力の向上を示している。
タスクを実行するために、最近の作業は、しばしば、教師付き学習または少数/多発的なプロンプトを通じてタスクのトレース例から学習するモデルを必要とする。
我々は、与えられた専門家のトレースを必要としないゼロショットエージェントでこの問題にアプローチする。
論文 参考訳(メタデータ) (2023-10-12T21:53:37Z) - RoboAgent: Generalization and Efficiency in Robot Manipulation via
Semantic Augmentations and Action Chunking [54.776890150458385]
マルチタスク操作能力を持つユニバーサルエージェントを訓練するための効率的なシステムを開発した。
私たちは、12のスキルを持つ1つのエージェントを訓練することができ、38のタスクでその一般化を実証することができます。
平均すると、RoboAgentは目に見えない状況において、従来の方法よりも40%以上性能が高い。
論文 参考訳(メタデータ) (2023-09-05T03:14:39Z) - VIMA: General Robot Manipulation with Multimodal Prompts [82.01214865117637]
ロボット操作タスクの幅広い範囲をマルチモーダルプロンプトで表現できることを示す。
我々は,数千の手続き的に生成されたテーブルトップタスクからなる新しいシミュレーションベンチマークを開発した。
我々は、これらのプロンプトを処理し、自動回帰的に運動動作を出力するトランスフォーマーベースのロボットエージェントVIMAを設計する。
論文 参考訳(メタデータ) (2022-10-06T17:50:11Z) - COG: Connecting New Skills to Past Experience with Offline Reinforcement
Learning [78.13740204156858]
我々は、動的プログラミングによって新しいスキルを拡張するために、事前データを再利用できることを示します。
我々は、新しいタスクを解決するために、以前のデータセットに見られるいくつかの動作をチェーンすることで、アプローチの有効性を実証する。
我々は、高次元画像観察を低レベルのロボット制御コマンドにマッピングし、エンドツーエンドでポリシーを訓練する。
論文 参考訳(メタデータ) (2020-10-27T17:57:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。