SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization
Abstractの概要
SciFlowは、合成学習データから実世界およびオープンワールドドメインへのオプティカルフローのドメイン汎化を目的とした、自己教師ありでネットワークに依存しない学習アプローチである。その中心となるアイデアは意味論的クロスドメイン干渉であり、自己教師ありのファインチューニング中にオープンワールド画像を合成画像ペアにブレンドすることで、生徒モデルがクロスドメインの摂動から学習する一方、教師モデルが元の合成ペアに対する疑似ターゲットを提供する。また、この枠組みでは、信頼度マスクとEMAによって更新される教師モデルを使用して学習を安定させ、幾何学的整合性を強制する。本論文では、これを実世界のフローラベル、疑似ラベル、または高コストなレンダリングや再構成パイプラインに依存する手法に代わる、よりシンプルな代替手法として位置づけている。
新規性
特筆すべき貢献は、教師・生徒型の自己教師ありオプティカルフロー枠組みの中で意味論的クロスドメイン干渉を使用し、ラベルなしのオープンワールド画像を合成学習ペアに合成する点である。これにより、ターゲットドメインの正解データを必要とせずに、合成データから実データへの適応を学習時に行うシンプルなメカニズムが構築される。
成果
KITTIベンチマークにおいて、SciFlowは教師ありのベースラインや手法の一部を省略した弱い自己教師ありのバリアントに比べて、RAFTとMobileFlowの両方の性能を向上させている。RAFTの場合、全体設定で2.27 Fl-epeおよび8.4 Fl-allに達し、教師ありベースラインの5.04および17.4から改善された。MobileFlowでは教師ありの8.20および22.6に対して、2.78 Fl-epeおよび8.95 Fl-allを達成した。DAVISやSlowFlowでの定性的な例でも、低照度、モーションブラー、高ノイズなどの条件下において未学習のオープンワールドビデオに対するより堅牢な汎化能力が示されている。
論文の注目点
- SciFlowは自己教師ありのファインチューニング中にラベルなしのオープンワールド画像を合成フレームペアにブレンドし、EMAと信頼度マスクを備えた教師・生徒型設計を採用している。
- 本手法はアーキテクチャに依存せず、大規模モデル(RAFT)と軽量モデル(MobileFlow)の両方で有効性が実証されている。
- 実験により、ターゲットドメインのオプティカルフロー正解データを必要とせずに、合成データから実データへ、およびオープンワールド環境への汎化能力が向上することが示された。