論文の概要: ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware
- arxiv url: http://arxiv.org/abs/2609.18514v2
- Date: Sat, 19 Sep 2026 21:02:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.005167
- Title: ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware
- Title(参考訳): ActiveScale: モデル、データ、ハードウェアを越えたロボットのアクティブな知覚のスケーリング
- Abstract要約: コーディネートされたモデル、データ、ハードウェア設計を通じてアクティブな知覚を促進するフレームワークであるActiveScaleを紹介します。
我々のモデルは、フレーム単位のポーズトークンと軽量な予測ヘッドを用いて、歴史的ビデオ観察と明示的なカメラ目的の監視によりVLAを増強する。
さらに,アクティブ・パーセプション・モバイル・マニピュレーション・プラットフォーム(AMP)を紹介した。
- 参考スコア(独自算出の注目度): 13.193347219526862
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Active perception is essential for robotic manipulation when fixed viewpoints leave task-relevant information occluded or unobserved. However, enabling vision-language-action (VLA) models to reason across changing viewpoints and actively acquire informative observations remains challenging. We present ActiveScale, a framework that advances active perception through coordinated model, data, and hardware designs. Our model augments a VLA with historical video observations and explicit camera-pose supervision, using per-frame pose tokens and a lightweight prediction head to associate observations across viewpoints and support a coherent understanding of the scene. To learn from the camera motion naturally present in human activity, we introduce a scalable human--robot mid-training recipe using 1000 hours of egocentric and robotic data, adapting the model to temporal inputs and pose supervision. We further introduce Active-perception Mobile-manipulation Platform (AMP), a robotic platform that supports active perception and mobile manipulation through single-operator teleoperation, enabling scalable collection of demonstrations that coordinate viewpoint changes and manipulation. Experiments demonstrate improved success rates on active-perception tasks, while ablation studies validate the contributions of camera-pose-aware modeling and egocentric mid-training. Together, these components provide an integrated foundation for studying and developing active perception in robotic manipulation.
- Abstract(参考訳): アクティブな知覚は、固定的な視点がタスク関連情報を隠蔽または保存しないままにしておくと、ロボット操作に不可欠である。
しかし、視線-言語-アクション(VLA)モデルで視点の変化を推論し、情報的観察を積極的に得ることは、依然として困難である。
協調モデルやデータ,ハードウェア設計を通じて,アクティブな認識を促進するフレームワークであるActiveScaleを紹介します。
我々のモデルは、フレームごとのポーズトークンと軽量な予測ヘッドを用いて、歴史的ビデオ観察と明示的なカメラ目的の監督によりVLAを強化し、視点をまたいだ観察を関連づけ、シーンの一貫性のある理解を支援する。
人間の活動に自然に存在するカメラの動きから学ぶために,1000時間の自我中心的・ロボット的データを用いて,スケーラブルな人間ロボットの中間訓練レシピを導入し,時間的入力にモデルを適応させ,監督を行う。
さらに,シングルオペレータ遠隔操作による能動的知覚と移動操作を支援するロボットプラットフォームである能動的知覚移動操作プラットフォーム(AMP)を導入し,視点の変化や操作を協調するスケーラブルなデモの収集を可能にした。
実験では、アクティブ・パーセプション・タスクの成功率が向上し、アブレーション研究は、カメラ・プレイス・アウェア・モデリングとエゴセントリック・ミッドトレーニングの貢献を検証した。
これらのコンポーネントは、ロボット操作におけるアクティブな知覚の研究と発展のための統合された基盤を提供する。
関連論文リスト
- ActiveGlasses: Learning Manipulation with Active Vision from Ego-centric Human Demonstration [51.69384671495837]
ActiveGlassesは、エゴ中心の人間のデモからロボット操作を学習するシステムである。
スマートグラスに装着されたステレオカメラは、データ収集とポリシー推論の両方のための唯一の認識装置として機能する。
ゼロ・トランスファーを可能にするために,デモからオブジェクト・トラジェクトリを抽出し,オブジェクト中心のポイント・クラウド・ポリシーを用いて操作と頭部運動を協調的に予測する。
論文 参考訳(メタデータ) (2026-04-09T17:59:08Z) - ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations [32.570602111692914]
複雑な双方向操作が可能なロボットに人体でのデモンストレーションを転送する,データ収集システムのためのフレームワークであるActiveUMIを提案する。
ActiveUMIは、ロボットのエンドエフェクターをミラーするセンサー付きコントローラーを備えたポータブルVR遠隔操作キットを結合する。
操作者の意図した頭部の動きをヘッドマウントディスプレイで記録することにより,視覚的注意と操作の関係を学習する。
論文 参考訳(メタデータ) (2025-10-02T02:44:21Z) - A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning [67.72413262980272]
事前訓練された視覚モデル(PVM)は現代のロボティクスの基本であるが、その最適構成は定かではない。
セマンティック・ボトルネックを導入してオブジェクト中心の表現を誘導する手法であるSlotMIMを開発した。
提案手法は,画像認識,シーン理解,ロボット学習評価において,従来の作業よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-03-10T06:18:31Z) - Latent Action Pretraining from Videos [156.88613023078778]
一般行動モデル(LAPA)のための潜在行動事前訓練について紹介する。
LAPA(英: LAPA)は、VLA(Vision-Language-Action)モデルに接地型ロボットアクションラベルを含まない教師なしの訓練方法である。
本稿では,ロボットアクションラベルを持たないインターネット規模のビデオから学習する手法を提案する。
論文 参考訳(メタデータ) (2024-10-15T16:28:09Z) - Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation [19.17977467107072]
本モデルでは,カメラのNext-Best-View(NBV)ポリシーとグリップのNext-Best Pose(NBP)ポリシーを直列接続し,数発の強化学習を用いてセンサ・モーター協調フレームワークでトレーニングする。
このアプローチにより、エージェントは3人称カメラを調整し、タスクゴールに基づいて環境を積極的に観察し、その後に適切な操作行動を推測することができる。
その結果,操作タスクにおける視覚的制約処理の有効性を示すとともに,ベースラインアルゴリズムを一貫して上回る結果が得られた。
論文 参考訳(メタデータ) (2024-09-23T10:38:20Z) - Learning Predictive Models From Observation and Interaction [137.77887825854768]
世界との相互作用から予測モデルを学ぶことで、ロボットのようなエージェントが世界がどのように働くかを学ぶことができる。
しかし、複雑なスキルのダイナミクスを捉えるモデルを学ぶことは大きな課題である。
本研究では,人間などの他のエージェントの観察データを用いて,トレーニングセットを増強する手法を提案する。
論文 参考訳(メタデータ) (2019-12-30T01:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。