論文の概要: SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization
- arxiv url: http://arxiv.org/abs/2606.29004v1
- Date: Sat, 27 Jun 2026 16:37:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.757702
- Title: SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization
- Title(参考訳): SciFlow:Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization
- Authors: Jamie Menjay Lin, Jisoo Jeong, Hong Cai, Kai Wang, Fatih Porikli,
- Abstract要約: SciFlowは、ネットワークに依存しないトレーニングベースのアプローチで、合成およびオープンワールドドメイン間でのモーション推定を一般化する。
実験の結果,SciFlowは領域の変動の中でモデルロバスト性を著しく向上するだけでなく,オープンな世界では根本的真理を必要とせず,合成から現実への領域一般化を可能にすることがわかった。
- 参考スコア(独自算出の注目度): 55.19058866002113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Motions of objects and scenes carry essential intelligence in video understanding, offering rich cues for interpreting dynamic settings and interactions. Due to the cost and scarcity of high-quality annotation or ground truth of pixel-wise optical flow, however, motion estimation models are typically trained in synthetic domains while deployed in real-world domains. Addressing synthetic-to-real domain generalization challenges has been crucial for developing practical solutions in diverse open-world use cases. This paper introduces SciFlow, a simple yet effective, network-agnostic, training-based approach that leverages self-supervised learning to generalize motion estimation across synthetic and open-world domains. Specifically, SciFlow imposes semantic interference from open-world images onto synthetic images during training, blending indomain features with cross-domain interference, which enables the network to adapt to the real-world domains. Additionally, SciFlow utilizes geometric consistency to ensure validity of the self-supervision. Our experiment results show that SciFlow not only significantly enhances model robustness amidst domain variations, but also remarkably enables synthetic-to-real domain generalization without requiring any ground truth in the open world.
- Abstract(参考訳): オブジェクトやシーンの動きはビデオ理解において不可欠な知性を持ち、ダイナミックな設定やインタラクションを解釈するための豊富な手がかりを提供する。
しかし、高画質のアノテーションや画素単位の光学フローの基底真理のコストや不足のため、モーション推定モデルは現実世界の領域に展開しながら合成ドメインで訓練されるのが一般的である。
人工から現実への領域一般化の課題に対処することは、様々なオープンワールドのユースケースで実用的なソリューションを開発する上で不可欠である。
本稿では,SciFlowについて紹介する。SciFlowは,自己教師付き学習を利用して,合成およびオープンワールドドメイン間での動作推定を一般化する,シンプルで効果的でネットワークに依存しない,トレーニングベースのアプローチである。
具体的には、SciFlowはトレーニング中に、オープンワールドイメージからのセマンティックな干渉を合成画像に課し、ドメイン内の特徴とクロスドメインの干渉を混ぜることで、ネットワークが現実世界のドメインに適応できるようにする。
さらに、SciFlowは幾何学的整合性を利用して、自己スーパービジョンの妥当性を保証する。
実験の結果,SciFlowは領域の変動の中でモデルロバスト性を著しく向上するだけでなく,オープンな世界では根本的真理を必要とせず,合成から現実への領域一般化を可能にすることがわかった。
関連論文リスト
- HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models [50.18051979020699]
エンドツーエンドの自動運転は、従来のモジュラーパイプラインに代わる魅力的な代替手段として登場した。
本稿では,計画軌道に関する学習を組織する軌道駆動学習パラダイムを提案する。
一つの統一モデルが、各ドメイン内で強いパフォーマンスを維持しながら、異種データセット上でトレーニング可能であることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:12:01Z) - SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance [49.69016078147708]
密接な相互作用シナリオにおける人間の行動の正確な再構築は、拡張現実における現実的な仮想インタラクションの実現に不可欠である。
本稿では,これらの問題に効果的に対処するための意味的および幾何学的手がかりを統合する拡散ベースのフレームワークであるSocialMirrorを提案する。
SocialMirrorはインタラクティブなヒューマンメッシュを再構築する上で,最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-15T07:41:52Z) - Structured prototype regularization for synthetic-to-real driving scene parsing [7.087302867255982]
運転シーンのパーシングは、自動運転車が現実世界の交通環境で確実に運転することが重要である。
コストのかかるピクセルレベルのアノテーションへの依存を減らすため、自動生成されたラベルを持つ合成データセットが一般的な選択肢となっている。
合成データに基づいて訓練されたモデルは、合成から実際のドメインギャップのために現実世界のシーンに適用すると、しばしば性能が良くない。
論文 参考訳(メタデータ) (2026-03-17T03:05:28Z) - Adversarially Domain-adaptive Latent Diffusion for Unsupervised Semantic Segmentation [7.099012213719071]
本研究では、ICCLD(Inter-Coder Connected Latent Diffusion)と呼ばれる潜在拡散モデルに基づくセマンティックセグメンテーション手法を提案する。
ICCLDは最先端のUDAメソッドより優れており、mIoUスコアは74.4(GTA5$rightarrow$Cityscapes)と67.2(Synthia$rightarrow$Cityscapes)である。
論文 参考訳(メタデータ) (2024-12-22T04:55:41Z) - Generalizing Event-Based Motion Deblurring in Real-World Scenarios [62.995994797897424]
イベントベースの動作遅延は、低レイテンシイベントを活用することで、有望な結果を示している。
本研究では,フレキシブルな入力空間スケールを実現するとともに,時間スケールの異なる動きのぼかしから学習できるスケール対応ネットワークを提案する。
次に,実世界のデータ分布に適合する2段階の自己教師型学習手法を開発した。
論文 参考訳(メタデータ) (2023-08-11T04:27:29Z) - Normalization Perturbation: A Simple Domain Generalization Method for
Real-World Domain Shifts [133.99270341855728]
実世界のドメインスタイルは環境の変化やセンサノイズによって大きく変化する可能性がある。
深層モデルはトレーニングドメインスタイルしか知らない。
このドメインスタイルのオーバーフィット問題を解決するために,正規化摂動を提案する。
論文 参考訳(メタデータ) (2022-11-08T17:36:49Z) - Zero-Shot Reinforcement Learning with Deep Attention Convolutional
Neural Networks [12.282277258055542]
本研究では、特定の視覚センサ構成を持つ深層注意畳み込みニューラルネットワーク(DACNN)が、より低い計算複雑性で高いドメインとパラメータの変動を持つデータセット上でトレーニングを行うことを示す。
我々の新しいアーキテクチャは、制御対象に対する認識に適応し、知覚ネットワークを事前訓練することなくゼロショット学習を実現する。
論文 参考訳(メタデータ) (2020-01-02T19:41:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。