論文の概要: Unified Video Dense Prediction from Disjoint Data
- arxiv url: http://arxiv.org/abs/2607.21592v1
- Date: Thu, 23 Jul 2026 17:59:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.530353
- Title: Unified Video Dense Prediction from Disjoint Data
- Title(参考訳): 解離データによる一元的映像密度予測
- Authors: Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee,
- Abstract要約: 深度,表面正規度,セマンティックセグメンテーション,境界,人的部分,アルベド,シェーディング,素材の8つの密集したシーン特性を共同で予測する統合ビデオモデルUniDを紹介する。
本稿では,タスクプロジェクタを介し,タスク毎の専門家が統一されたバックボーンを監督する簡易かつ効果的な蒸留手順を提案する。
UniDは、タスクごとのスペシャリストやマルチタスクベースラインと競合するパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 71.9957801898161
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scene understanding requires simultaneous prediction about geometry, appearance, and semantics. However, existing task-specific annotations are fragmented across incompatible, domain-specific datasets. Current unified systems circumvent this by restricting training to fully co-annotated data, or by incurring the large computational cost of pseudo-labeling. To mitigate this, we introduce UniD, a unified video model that jointly predicts eight dense scene properties-depth, surface normals, semantic segmentation, boundaries, human parts, albedo, shading, and materials-all learned from disjoint, domain-specific datasets. We propose a simple yet effective distillation step in which per-task experts supervise a unified backbone through lightweight task projectors, eliminating the need for annotation overlap or pseudo-labeling. Our key insight is that the strong visual priors of a pretrained diffusion model are sufficient to bridge the domain gaps introduced by disjoint training sources, enabling robust generalization to scene-task combinations never seen during training. UniD achieves competitive performance against per-task specialists and multi-task baselines, with strong generalization to out-of-distribution scenarios and enhanced temporal and cross-task consistency. Code and video results are available at https://unid-video.github.io/.
- Abstract(参考訳): シーン理解には、幾何学、外観、意味論に関する同時予測が必要である。
しかし、既存のタスク固有のアノテーションは、互換性のないドメイン固有のデータセットで断片化されている。
現在の統一システムでは、トレーニングを完全なコノテートデータに制限したり、あるいは擬似ラベルの計算コストを増大させることによってこれを回避している。
これを緩和するために、UniDは、密集した8つのシーン特性(深度、表面正規化、セマンティックセグメンテーション、境界、人的部分、アルベド、シェーディング、物質)を非結合なドメイン固有のデータセットから学習する統合ビデオモデルである。
そこで本研究では,タスクプロジェクタによってタスク毎の専門家が統一されたバックボーンを監督し,アノテーションの重複や擬似ラベルを不要とした簡易かつ効果的な蒸留工程を提案する。
我々の重要な洞察は、事前訓練された拡散モデルの強い視覚的先行性は、解離したトレーニングソースによってもたらされる領域ギャップを橋渡しするのに十分であり、トレーニング中に見たことのないシーンとタスクの組み合わせへの堅牢な一般化を可能にすることである。
UniDは、タスクごとのスペシャリストやマルチタスクベースラインに対する競合的なパフォーマンスを実現し、配布外シナリオへの強力な一般化と、時間的およびクロスタスクの一貫性の向上を実現している。
コードとビデオの結果はhttps://unid-video.github.io/.com/で公開されている。
関連論文リスト
- Tracking and Segmenting Anything in Any Modality [75.32774085793498]
そこで我々はSATAという汎用的なトラッキング・セグメンテーション・フレームワークを提案し、このフレームワークは任意のモダリティ入力でトラッキング・セグメンテーション・サブタスクの広帯域を統一する。
SATAは18の挑戦的なトラッキングとセグメンテーションベンチマークで優れたパフォーマンスを示し、より一般化可能なビデオ理解のための新しい視点を提供する。
論文 参考訳(メタデータ) (2025-11-22T09:09:22Z) - SpecDM: Hyperspectral Dataset Synthesis with Pixel-level Semantic Annotations [27.391859339238906]
本稿では,画素レベルのアノテーションを用いたハイパースペクトル画像の合成における生成拡散モデルの可能性について検討する。
私たちの知る限りでは、アノテーションで高次元のHSIを生成するのはこれが初めてです。
我々は、セマンティックセグメンテーションと変化検出の2つの最も広く使われている密集予測タスクを選択し、これらのタスクに適したデータセットを生成する。
論文 参考訳(メタデータ) (2025-02-24T11:13:37Z) - ULTRA-DP: Unifying Graph Pre-training with Multi-task Graph Dual Prompt [67.8934749027315]
本稿では,タスク識別と位置識別をGNNに注入する,グラフハイブリッド事前学習のための統合フレームワークを提案する。
また,約$k$-nearest隣人のグループに基づいた,新しい事前学習パラダイムを提案する。
論文 参考訳(メタデータ) (2023-10-23T12:11:13Z) - Dense Video Object Captioning from Disjoint Supervision [77.47084982558101]
本稿では,高密度ビデオオブジェクトキャプションのための新しいタスクとモデルを提案する。
このタスクは、ビデオにおける空間的および時間的局所化を統一する。
我々は、この新しいタスクの強力なベースラインにおいて、我々のモデルがどのように改善されているかを示す。
論文 参考訳(メタデータ) (2023-06-20T17:57:23Z) - Taskology: Utilizing Task Relations at Scale [28.09712466727001]
共同で訓練することで,タスクの集合間の固有の関係を活用できることが示される。
タスク間の関係を明確に活用することで、パフォーマンスが向上し、ラベル付きデータの必要性が劇的に低減される。
本稿では, 深度と正規予測, セマンティックセグメンテーション, 3次元運動とエゴモーション推定, および点雲における物体追跡と3次元検出という, タスクのサブセットについて示す。
論文 参考訳(メタデータ) (2020-05-14T22:53:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。