論文の概要: Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition
- arxiv url: http://arxiv.org/abs/2606.24404v1
- Date: Tue, 23 Jun 2026 10:39:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.902501
- Title: Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition
- Title(参考訳): マルチモーダル動作認識のためのモダリティを考慮したアウト・オブ・ディストリビューション検出
- Authors: Lars Doorenbos, Duc Manh Vu, Serdar Ozsoy, Juergen Gall,
- Abstract要約: 我々は、行動認識モデルに追加のモダリティを組み込む方法について研究する。
本研究は、マルチモーダル・アウト・オブ・ディストリビューション(OOD)検出の事例に焦点を当てる。
マルチモーダルシナリオ用に明示的に設計されたポストホック検出器を構築した。
- 参考スコア(独自算出の注目度): 23.03076857904803
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The incorporation of additional modalities into action recognition models increases their performance across a wide range of settings. However, how this additional information can contribute to making the models more robust remains underexplored, particularly for the case of multi-modal out-of-distribution (OOD) detection. While methods exist that regularize the multi-modal training process with OOD detection in mind, they still apply off-the-shelf OOD detectors designed for the uni-modal case during inference, discarding important information. Based on an interesting relationship we find between the multi-modal and uni-modal predictions, we propose to use this signal to build a post-hoc detector explicitly designed for the multi-modal scenario. We combine this new source of information with a feature-space score, which detects off-manifold samples in the multi-modal space, and normalize them by the multi-modal logits. In doing so, the proposed hybrid detector is compatible with existing training-time approaches and consistently improves performance. Experiments on a wide range of established datasets from the MultiOOD benchmark show that, on average, our approach outperforms the state of the art. Our results show the importance of explicitly considering the different modalities at inference time for multi-modal OOD detection.
- Abstract(参考訳): アクション認識モデルに追加のモダリティが組み込まれれば、幅広い設定でパフォーマンスが向上する。
しかし、この追加情報がモデルをより堅牢にするためにどのように貢献するかは、特にOOD(multi-modal out-of-distribution)検出の場合、未調査のままである。
OOD検出を念頭に置いてマルチモーダルトレーニングプロセスを標準化する手法は存在するが、単モーダルケース用に設計されたオフ・ザ・シェルフのOOD検出器を推論中に適用し、重要な情報を捨てる。
マルチモーダル予測とユニモーダル予測の興味深い関係に基づいて,この信号を用いて,マルチモーダルシナリオ用に明示的に設計されたポストホック検出器を構築することを提案する。
この新たな情報源と特徴空間スコアを組み合わせることで,マルチモーダル空間のオフマンフォールドサンプルを検出し,マルチモーダルロジットによって正規化する。
提案したハイブリッド検出器は、既存の訓練時間アプローチと互換性があり、一貫して性能を向上する。
MultiOODベンチマークから得られた幅広い確立されたデータセットの実験により、我々のアプローチは平均して最先端の手法よりも優れていることが示された。
以上の結果から,マルチモーダルOOD検出における推定時間における異なるモダリティを明示的に考慮することの重要性が示唆された。
関連論文リスト
- Active Multimodal Distillation for Few-shot Action Recognition [19.872938560809988]
本稿では,タスク固有のコンテキストキューを用いて,各サンプルに対する信頼度を積極的に識別する新しいフレームワークを提案する。
我々のフレームワークはアクティブサンプル推論(ASI)モジュールを統合し、アクティブ推論を利用して信頼性の高いモダリティを予測する。
強化学習とは異なり、アクティブ推論は報酬をエビデンスに基づく選好に置き換え、より安定した予測を行う。
論文 参考訳(メタデータ) (2025-06-16T10:10:56Z) - Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation [7.827311520283545]
アウト・オブ・ディストリビューション(OOD)の検出とセグメンテーションは、自律運転やロボット支援手術のような安全クリティカルなアプリケーションに機械学習モデルをデプロイするために重要である。
本稿では,理論的支援を伴うマルチモーダル・アウトリア合成の極めて単純かつ高速な手法であるFeature Mixingを提案する。
我々は,OODセグメンテーションのための新しいマルチモーダルデータセットであるCARLA-OODを紹介した。
論文 参考訳(メタデータ) (2025-05-22T17:54:30Z) - DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution Detection [10.834698906236405]
機械学習モデルの堅牢性を保証するためには、アウト・オブ・ディストリビューション(OOD)検出が不可欠である。
マルチモーダルモデルの最近の進歩は、検出性能を高めるために複数のモダリティを活用する可能性を示している。
マルチモーダルOOD検出のための新しいプラグイン・アンド・プレイフレームワークであるDynamic Prototype Updating (DPU)を提案する。
論文 参考訳(メタデータ) (2024-11-12T22:43:16Z) - MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities [11.884004583641325]
我々は,多種多様なデータセットサイズと様々なモダリティの組み合わせを特徴とする,第一種ベンチマークであるMultiOODを紹介する。
我々はまず,既存のOOD検出アルゴリズムをMultiOOD上で評価した。
本稿では,近隣クラスからの情報を活用することで,より広い特徴空間を探索する新しいアウトリー合成手法NP-Mixを提案する。
論文 参考訳(メタデータ) (2024-05-27T17:59:02Z) - Exploiting Modality-Specific Features For Multi-Modal Manipulation
Detection And Grounding [54.49214267905562]
マルチモーダルな操作検出とグラウンド処理のためのトランスフォーマーベースのフレームワークを構築する。
本フレームワークは,マルチモーダルアライメントの能力を維持しながら,モダリティ特有の特徴を同時に探求する。
本稿では,グローバルな文脈的キューを各モーダル内に適応的に集約する暗黙的操作クエリ(IMQ)を提案する。
論文 参考訳(メタデータ) (2023-09-22T06:55:41Z) - Quantifying & Modeling Multimodal Interactions: An Information
Decomposition Framework [89.8609061423685]
本稿では,入力モーダル性と出力タスクを関連付けた冗長性,特異性,シナジーの度合いを定量化する情報理論手法を提案する。
PID推定を検証するために、PIDが知られている合成データセットと大規模マルチモーダルベンチマークの両方で広範な実験を行う。
本研究では,(1)マルチモーダルデータセット内の相互作用の定量化,(2)マルチモーダルモデルで捉えた相互作用の定量化,(3)モデル選択の原理的アプローチ,(4)実世界のケーススタディの3つにその有用性を示す。
論文 参考訳(メタデータ) (2023-02-23T18:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。