論文の概要: Object Concepts Emerge from Motion
- arxiv url: http://arxiv.org/abs/2609.04348v1
- Date: Thu, 03 Sep 2026 18:11:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.779786
- Title: Object Concepts Emerge from Motion
- Title(参考訳): 物体の概念は動きから創出される
- Abstract要約: 生ビデオから単一画像のオブジェクト中心表現を学習する生物学的にインスパイアされたフレームワークを提案する。
まず7,163時間の運転とWebビデオから1億9500万の擬似ラベル付きフレームを取得し、その監視範囲を4億2100万フレームに拡大した。
エンコーダをSwin-Hまで訓練し、学習した表現をSwinのバックボーンのファミリーに蒸留する。
- 参考スコア(独自算出の注目度): 25.362771842390874
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Object-centric visual representations are important for physical-world perception, but existing visual pretraining methods often capture semantic categories without preserving the identity and coherence of individual instances. We present a biologically inspired framework that learns object-centric representations for single images from raw videos. Our approach uses motion boundaries as a source of object-level grouping: off-the-shelf optical flow and clustering produce pseudo-instance masks, which supervise a single-image encoder with pixel-level pairwise metric learning. The framework requires neither human annotations nor camera calibration. We first obtain 195 million pseudo-labeled frames from 7,163 hours of driving and web videos, then expand the supervision to 421 million frames with Motion-Verified Self-Training, which combines model proposals with motion evidence. We train encoders up to Swin-H and distill the learned representations into a family of Swin backbones. Across monocular depth estimation, 3D object detection, 3D occupancy prediction, and end-to-end planning, the resulting models achieve competitive or superior performance relative to supervised and self-supervised pretraining baselines, with particularly strong transfer on geometry- and instance-sensitive tasks. These results show that motion-derived supervision can teach static image encoders to represent visual instances, providing a complementary direction for scalable visual pretraining.
- Abstract(参考訳): オブジェクト中心の視覚表現は、物理世界の知覚にとって重要であるが、既存の視覚前訓練手法は、個々のインスタンスのアイデンティティとコヒーレンスを保存することなく、意味的カテゴリをキャプチャすることが多い。
生ビデオから単一画像のオブジェクト中心表現を学習する,生物学的にインスパイアされたフレームワークを提案する。
我々のアプローチでは,物体レベルのグルーピングの源として移動境界を用いる:オフザシェルフ光フローとクラスタリングにより擬似インピーダンスマスクが生成され,画素レベルの対距離学習による単一画像エンコーダが監督される。
このフレームワークは人間のアノテーションやカメラのキャリブレーションを必要としない。
まず7,163時間の運転とWebビデオから1億9500万の擬似ラベル付きフレームを取得し、その後、モデル提案とモーションエビデンスを組み合わせたMotion-Verified Self-Trainingで4億2100万フレームに監督を拡張する。
エンコーダをSwin-Hまで訓練し、学習した表現をSwinのバックボーンのファミリーに蒸留する。
単眼深度推定,3次元物体検出,3次元占有予測,エンド・ツー・エンド・プランニングの各モデルでは,教師付きおよび自己監督型事前学習ベースラインに対して,特に幾何学的およびインスタンス敏感なタスクに対して,競争力あるいは優れた性能を達成している。
これらの結果から,静的な画像エンコーダに視覚的インスタンスを表現させ,拡張性のある視覚前訓練のための補完的な方向を与えることができることがわかった。
関連論文リスト
- Vision Pretraining for Dense Spatial Perception [69.54043654361772]
我々は境界中心レンズによる視力事前訓練について研究し、境界と形状の不連続性が幾何学的性質の知覚に必須の手がかりとなるという前提によって動機づけられた。
その結果,境界モデリングは単純な線分を超えて,空間的に構造化された視覚表現を学習するためのスケーラブルな事前学習原理として機能することがわかった。
論文 参考訳(メタデータ) (2026-07-06T15:56:14Z) - PAOLI: Pose-free Articulated Object Learning from Sparse-view Images [27.16160315662701]
本稿では,スパースビュー,アンポーズ画像から明瞭なオブジェクト表現を学習するための新しいフレームワークを提案する。
当社のアプローチは1音節あたり4ビューで運用されており、カメラの監視は行いません。
論文 参考訳(メタデータ) (2025-09-04T14:51:03Z) - Object Concepts Emerge from Motion [24.73461163778215]
教師なしの方法でオブジェクト中心の視覚表現を学習するための生物学的にインスパイアされたフレームワークを提案する。
我々の重要な洞察は、運動境界がオブジェクトレベルのグルーピングの強いシグナルとなることである。
我々のフレームワークは完全にラベルフリーで、カメラキャリブレーションに頼らず、大規模な非構造化ビデオデータにスケーラブルである。
論文 参考訳(メタデータ) (2025-05-27T18:09:02Z) - Perception Encoder: The best visual embeddings are not at the output of the network [70.86738083862099]
本稿では、単純な視覚言語学習によって訓練された画像と映像の理解のための視覚エンコーダであるPerception (PE)を紹介する。
対照的な視覚言語学習だけでは、これらの下流タスクに強力な汎用的な埋め込みを実現できることが分かっています。
PEモデル群は,多種多様なタスクにおいて,クラス内で最高の結果が得られる。
論文 参考訳(メタデータ) (2025-04-17T17:59:57Z) - Heuristic Vision Pre-Training with Self-Supervised and Supervised
Multi-Task Learning [0.0]
マルチタスク方式で自己教師型と教師型の両方の視覚的プレテキストタスクを採用することで、新しい事前学習フレームワークを提案する。
その結果、事前学習したモデルでは、複数の視覚的タスクにおいて、最先端(SOTA)結果と同等以上の結果が得られることがわかった。
論文 参考訳(メタデータ) (2023-10-11T14:06:04Z) - AutoDecoding Latent 3D Diffusion Models [95.7279510847827]
本稿では,3次元オートデコーダをコアとした静的・明瞭な3次元アセットの生成に対して,新しいアプローチを提案する。
3D Autodecoderフレームワークは、ターゲットデータセットから学んだプロパティを潜時空間に埋め込む。
次に、適切な中間体積潜在空間を特定し、ロバストな正規化と非正規化演算を導入する。
論文 参考訳(メタデータ) (2023-07-07T17:59:14Z) - Attentive and Contrastive Learning for Joint Depth and Motion Field
Estimation [76.58256020932312]
単眼視システムからシーンの3次元構造とともにカメラの動きを推定することは複雑な作業である。
モノクロ映像からの3次元物体運動場推定のための自己教師付き学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-10-13T16:45:01Z) - Learning Monocular Depth in Dynamic Scenes via Instance-Aware Projection
Consistency [114.02182755620784]
本稿では,複数の動的物体の6-DoF動作,エゴモーション,深度を,監督なしで一眼レフカメラで明示的にモデル化する,エンドツーエンドのジョイントトレーニングフレームワークを提案する。
筆者らのフレームワークは,最先端の深度・動き推定法より優れていた。
論文 参考訳(メタデータ) (2021-02-04T14:26:42Z) - Self-Supervised Representation Learning from Flow Equivariance [97.13056332559526]
本稿では,複雑なシーンの映像ストリームに直接展開可能な,自己教師型学習表現フレームワークを提案する。
高分解能rawビデオから学んだ我々の表現は、静的画像の下流タスクに簡単に使用できます。
論文 参考訳(メタデータ) (2021-01-16T23:44:09Z) - Lift, Splat, Shoot: Encoding Images From Arbitrary Camera Rigs by
Implicitly Unprojecting to 3D [100.93808824091258]
本稿では,任意の数のカメラから映像データを与えられたシーンの鳥眼ビュー表現を直接抽出するエンド・ツー・エンドアーキテクチャを提案する。
我々のアプローチは、それぞれの画像をそれぞれのカメラのフラストラムに個別に“リフト”し、すべてのフラストラムを鳥の目視格子に“プレート”することです。
提案モデルにより推定される表現は,テンプレートトラジェクトリを鳥眼ビューのコストマップに"撮影"することで,終末動作計画の解釈を可能にすることを示す。
論文 参考訳(メタデータ) (2020-08-13T06:29:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。