論文の概要: From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
- arxiv url: http://arxiv.org/abs/2607.05396v1
- Date: Mon, 06 Jul 2026 17:59:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.277859
- Title: From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
- Title(参考訳): 固定カメラからフリーカメラへ:キャリブレーションフリーのビューローバストビジョン・ランゲージ・アクションモデル
- Abstract要約: カメラ中心型VLA(CamVLA)は、カメラ幾何学から制御を分離する新しいVLAモデルである。
CamVLAは、さまざまな見当たらない視点での成功率を継続的に改善する。
- 参考スコア(独自算出の注目度): 72.8641426724502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world robot deployment rarely maintains the training-stage camera setup, where cameras often experience repositioning or remounting depending on actual scenarios. Existing view-robust Vision-Language-Action (VLA) policies tolerate such camera variations only when the camera extrinsics are explicitly provided, making them fragile and hard to use especially when view robustness is critical. We argue that the policy should not be told where the camera is, but rather figure it out by itself. To this end, we introduce Camera-Centric VLA (CamVLA), a new VLA model that decouples manipulation controls from camera geometry by predicting (i) a camera-centric end-effector action expressed in the local camera frame, and (ii) a 6-DoF hand-eye matrix relating cameras to the robot base. A deterministic geometric transformation composes the two predictions into a robot base-frame action. This disentangles how I should move in pose-independent camera-centric action generation from where I am looking from in camera-perspective geometric grounding. The resulting policy is calibration-free, depth-free, and single-view, requiring only a single monocular RGB image as the visual observation and task instruction at deployment. Evaluations in both simulation and real-world robot data show that CamVLA consistently improves success rates across diverse unseen viewpoints. Project page: https://alibaba-damo-academy.github.io/CamVLA/.
- Abstract(参考訳): 現実のロボットの展開は、実際のシナリオに応じてカメラが配置や再マウントを経験する、トレーニング段階のカメラ設定を維持することは滅多にない。
既存のビューロバストなビジョン・ランゲージ・アクション(VLA)ポリシーは、カメラ外装が明示的に提供される場合にのみ、このようなカメラのバリエーションを許容し、ビューロバスト性が重要であれば特に脆弱で使用が難しい。
われわれは、このポリシーはカメラがどこにあるかではなく、自分で判断するべきだと論じている。
この目的のために,カメラ中心型VLA(CamVLA)を導入し,カメラ幾何学から制御制御を分離する新しいVLAモデルを提案する。
一 ローカルカメラのフレームに表されるカメラ中心のエンドエフェクター動作
(ii)ロボットベースにカメラを関連付けた6-DoFハンドアイマトリクス。
決定論的幾何学変換は、2つの予測をロボットのベースフレームアクションに構成する。
これは、私がカメラの幾何学的グラウンドで見ている場所から、ポーズ非依存のカメラ中心のアクション生成において、どのように動くべきかを歪めます。
その結果得られたポリシはキャリブレーションフリー、深さフリー、単一ビューであり、デプロイ時の視覚的な観察とタスクの指示として、単一の単眼RGBイメージしか必要としない。
シミュレーションと実世界のロボットデータの両方で評価すると、CamVLAはさまざまな見当たらない視点における成功率を一貫して改善している。
プロジェクトページ: https://alibaba-damo-academy.github.io/CamVLA/。
関連論文リスト
- UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation [50.391925716274926]
textbfUniMoCaは、視覚空間におけるモーションとカメラコントロールを統合する表現駆動フレームワークである。
UniMoCaは、人間の動き制御、カメラ制御、時間的一貫性、カメラ認識の堅牢性において、最小限の複雑さで大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-08-03T09:18:13Z) - See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models [51.019904314336124]
視覚言語アクション(VLA)モデルは、視覚的な観察と言語指示からロボットの動きを予測する。
ほとんどのVLAは、カメラフレーム内のシーンを観察し、シーンが観察された場所とアクションが定義された場所との間のフレームミスマッチを生成する。
このミスマッチをロボット中心のポイントマップで処理し、ロボットフレーム内のシーンポイントの3D座標を画素に格納する。
論文 参考訳(メタデータ) (2026-07-13T12:50:32Z) - LIME: Learning Intent-aware Camera Motion from Egocentric Video [56.023644847494836]
自動回帰観測ゲイン出力と連続的なフローマッチングポーズヘッドを組み合わせた視覚言語カメラモーションジェネレータを提案する。
LIMEは、人間の受動的ビデオからカメラのポーズを積極的に選択し、通常の自我中心の録音を意図認識のアクティブな知覚の監督に変えることができる。
論文 参考訳(メタデータ) (2026-07-02T16:48:43Z) - CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback [43.174121093566264]
我々は、Reward Feedback Learningを構築し、カメラの制御性をさらに向上することを目指している。
現在の報酬モデルには、ビデオカメラのアライメントを評価する能力がない。
本稿では,映像遅延を3次元表現にデコードして報酬量子化を行う,効率的なカメラ対応3Dデコーダを提案する。
論文 参考訳(メタデータ) (2026-01-22T18:59:56Z) - Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning [22.045823914539408]
本研究では、カメラ外在物に明示的に条件付けすることで、ビュー不変の模倣学習について検討する。
本研究では,外在的条件付けが標準行動クローニングポリシーの観点における一般化を著しく向上させることを示す。
論文 参考訳(メタデータ) (2025-10-02T17:47:06Z) - CameraCtrl: Enabling Camera Control for Text-to-Video Generation [86.36135895375425]
ユーザーがコンテンツをより正確に作成し、編集できるようにするため、制御性はビデオ生成において重要な役割を果たす。
しかし、既存のモデルは、より深い物語のニュアンスを表現するための映画言語として機能するカメラポーズの制御を欠いている。
我々は、ビデオ拡散モデルの正確なカメラポーズ制御を可能にするCameraCtrlを紹介する。
論文 参考訳(メタデータ) (2024-04-02T16:52:41Z) - SmartMocap: Joint Estimation of Human and Camera Motion using
Uncalibrated RGB Cameras [49.110201064166915]
複数のRGBカメラからのマーカーレス人間のモーションキャプチャ(モキャップ)は、広く研究されている問題である。
既存の方法は、モキャップシステムの基準フレームとして機能するスタティックカメラに対して、キャリブレーションされたカメラを必要とするか、あるいはそれらをキャリブレーションする必要がある。
複数の静止・移動可能なRGBカメラを用いたモキャップ方式を提案する。
論文 参考訳(メタデータ) (2022-09-28T08:21:04Z) - AirPose: Multi-View Fusion Network for Aerial 3D Human Pose and Shape
Estimation [51.17610485589701]
本研究では,非構造屋外環境のための新しいマーカーレス3次元モーションキャプチャ(MoCap)システムを提案する。
AirPoseは複数の無人飛行カメラで撮影された画像を使って人間のポーズと形状を推定する。
AirPose自体は、事前校正に頼らずに、人のカメラを校正する。
論文 参考訳(メタデータ) (2022-01-20T09:46:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。