論文の概要: LIME: Learning Intent-aware Camera Motion from Egocentric Video
- arxiv url: http://arxiv.org/abs/2607.02417v1
- Date: Thu, 02 Jul 2026 16:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.933452
- Title: LIME: Learning Intent-aware Camera Motion from Egocentric Video
- Title(参考訳): LIME:エゴセントリックビデオからカメラの動きを学習する
- Authors: Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum,
- Abstract要約: 自動回帰観測ゲイン出力と連続的なフローマッチングポーズヘッドを組み合わせた視覚言語カメラモーションジェネレータを提案する。
LIMEは、人間の受動的ビデオからカメラのポーズを積極的に選択し、通常の自我中心の録音を意図認識のアクティブな知覚の監督に変えることができる。
- 参考スコア(独自算出の注目度): 56.023644847494836
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous robots often need to move their camera before they can act: to inspect an object, reveal an occluded region, or obtain a view that responds to a user's intent. While vision-language navigation translates instructions to base motion and vision-language-action policies map instructions to manipulation actions, language-conditioned camera motion remains comparatively underexplored as a first-class action. We formulate language-conditioned camera motion generation: given a current RGB observation and a free-form natural-language intent, predict a relative target camera pose for the next observation. This task is inherently non-trivial: viewpoint changes are driven by latent perceptual intentions, and a valid motion may operate at different semantic granularity, from entering a room to looking around a corner, inspecting a visible object, or revealing an occluded detail. To model this structure, we mine multi-intention camera-motion supervision from egocentric video, pairing plausible intents and observation-gain descriptions with relative SE(3) target poses. We propose LIME, a vision-language camera-motion generator that combines an auto-regressive observation-gain output with a continuous flow-matching pose head. This design lets the model jointly predict what the next view should reveal while representing multi-hypothesis target views. Across experiments and downstream robotic tasks, we show that LIME can learn to actively choose camera poses from passive human video, turning ordinary egocentric recordings into supervision for intent-aware active perception.
- Abstract(参考訳): 自律ロボットは、カメラを動作させる前に、オブジェクトを検査したり、隠された領域を明らかにしたり、ユーザーの意図に反応するビューを取得する必要がある。
視覚言語ナビゲーションは命令をベースモーションに翻訳し、視覚言語アクションポリシーは命令を操作アクションにマッピングするが、言語条件のカメラモーションは、第1級アクションとして比較的過小評価されている。
言語条件付きカメラモーション生成を定式化し、現在のRGB観測と自由形式の自然言語意図を考慮し、次の観測に対する相対目標カメラのポーズを予測する。
視点の変化は潜在知覚の意図によって駆動され、有効な動きは、部屋に入ったり、角を見回したり、見える物体を検査したり、隠された詳細を明らかにするなど、異なる意味的な粒度で機能する。
この構造をモデル化するために、エゴセントリックなビデオから多目的カメラモーションの監視、ペア化可能な意図、および相対的なSE(3)ターゲットのポーズによる観察-ゲイン記述を抽出した。
自動回帰観測ゲイン出力と連続的なフローマッチングポーズヘッドを組み合わせた視覚言語カメラモーションジェネレータLIMEを提案する。
この設計により、モデルはマルチハイブリッドターゲットビューを表現しながら、次のビューが何を示すべきかを共同で予測できる。
実験と下流のロボットタスクを通して、LIMEは受動的人間のビデオからカメラのポーズを積極的に選択することを学び、通常の自我中心の録音を意図を認識したアクティブな知覚の監督へと変える。
関連論文リスト
- Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds [22.4160057556312]
Look-Before-Moveは、監視仕様とモーション実行を分離するカメラ計画フレームワークである。
StoryBlenderをベースとしたダイナミックな3Dストーリーワールドベンチマークを構築し,50ストーリー,457シーン,アニメーションによる1585ショットをカバーした。
実験により,本フレームワークは主観的知覚,意図整合性,軌道品質を代表的ベースラインよりも向上することが示された。
論文 参考訳(メタデータ) (2026-06-25T12:38:39Z) - A DVDrive Approach for doScenes Instructed Driving Challenge [42.41052099695495]
本稿では,OmniDrive上に構築されたdoScenes Instructed Driving Challengeについて述べる。
OmniDriveをdoScenes設定に適応させ、命令付のnuScenesシーンでトレーニングします。
マルチビューの視覚的グラウンドを改善するために,DVPE方式の分割ビュー認識モジュールを導入する。
論文 参考訳(メタデータ) (2026-06-19T17:26:58Z) - MoRight: Motion Control Done Right [71.36903230523589]
両制約に対処する統合フレームワークであるMoRightを紹介した。
オブジェクトの動きは標準静的ビューで指定され、任意のターゲットカメラ視点に転送される。
3つのベンチマークの実験では、生成品質、動作制御性、相互作用認識における最先端のパフォーマンスが示されている。
論文 参考訳(メタデータ) (2026-04-08T17:59:22Z) - Towards Understanding Camera Motions in Any Video [89.97247162415158]
我々は、カメラモーション理解の評価と改善を目的とした大規模なデータセットとベンチマークであるCameraBenchを紹介する。
CameraBenchは、厳格な品質管理プロセスを通じて専門家によって注釈付けされた3,000の多様なインターネットビデオで構成されている。
私たちの貢献の1つは、撮影者との共同で設計されたカメラモーションプリミティブの分類である。
論文 参考訳(メタデータ) (2025-04-21T18:34:57Z) - ChatCam: Empowering Camera Control through Conversational AI [67.31920821192323]
ChatCamは、ユーザーとの会話を通じてカメラの動きをナビゲートするシステムである。
そこで本研究では,テキスト条件付きカメラ軌道生成のためのGPTに基づく自己回帰モデルであるCineGPTを提案する。
また、正確なカメラ軌道配置を保証するアンカー決定器も開発した。
論文 参考訳(メタデータ) (2024-09-25T20:13:41Z) - Attentive and Contrastive Learning for Joint Depth and Motion Field
Estimation [76.58256020932312]
単眼視システムからシーンの3次元構造とともにカメラの動きを推定することは複雑な作業である。
モノクロ映像からの3次元物体運動場推定のための自己教師付き学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-10-13T16:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。