論文の概要: MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos
- arxiv url: http://arxiv.org/abs/2610.08192v1
- Date: Tue, 06 Oct 2026 11:42:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.966436
- Title: MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos
- Title(参考訳): MacJEPA:未熟なエゴセントリックビデオからの音声-視覚認識
- Abstract要約: textbfMacJEPAは、視覚行動と音響イベントを、音声・視覚的コンテキストを介して供給されたインターバルクエリから認識する、モダリティの欠如したtextbfMasked-textbfcontextクエリ textbfJEPAである。
すべての目的は、単一のステージでの認識と共同で最適化され、テストタイムの適応は不要である。
- 参考スコア(独自算出の注目度): 4.010598744735379
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Audio-visual models improve egocentric action recognition by exploiting complementary cues, yet typically assume that both streams remain available at inference. Existing missing-modality methods operate on trimmed, single-event clips in which a stream is entirely present or absent, whereas real sensors fail and recover within long, untrimmed observations. We redefine egocentric modality missingness as temporally localized sensor outages within untrimmed, multi-event observations, with whole-clip absence as the limiting case. We introduce \textbf{MacJEPA}, a missing-modality-robust \textbf{Ma}sked-\textbf{c}ontext query \textbf{JEPA} that recognizes visual actions and acoustic events from supplied interval queries over audio-visual context. Window-local modality dropout simulates these sensor outages during training. MacJEPA further repurposes masking in JEPA from a self-supervised pretext into a supervised robustness objective, aligning masked and clean latent representations of both multimodal content tokens and the task-conditioned queries. All objectives are optimized jointly with recognition in a single stage, requiring no test-time adaptation. Across Epic-Kitchens-100 and Epic-Sounds, a single checkpoint remains competitive under complete input and consistently surpasses published missing-modality baselines when either the dominant or auxiliary stream is removed. MacJEPA thus unifies strong full-input recognition with temporal missing-modality robustness in a single model operating on untrimmed multi-event videos.
- Abstract(参考訳): オーディオ視覚モデルは、補完的な手がかりを利用することで、エゴセントリックな行動認識を改善するが、典型的には、両方のストリームが推論時に利用可能であると仮定する。
既存の欠落モード方式は、ストリームが完全に存在するか欠落している、トリミングされた単一領域のクリップで作動するが、実際のセンサーは長い、トリミングされていない観察で失敗し、回復する。
我々は、時間的局所化センサ機能障害としてエゴセントリックなモダリティの欠如を再定義する。
本稿では,視覚行動と音響イベントを,音声・視覚的コンテキスト上で供給されたインターバルクエリから認識する,欠落したモダリティのrobust \textbf{Ma}sked-\textbf{c}ontext query \textbf{JEPA}を紹介する。
ウィンドウローカルなモダリティドロップアウトは、トレーニング中にこれらのセンサーの停止をシミュレートする。
MacJEPAはさらに、JEPAにおけるマスキングを、セルフ教師付きプレテキストから教師付きロバストネスの目標に再利用し、マルチモーダルコンテンツトークンとタスク条件付きクエリの両方のマスク付きおよびクリーンな潜伏表現を整列させる。
すべての目的は、単一のステージでの認識と共同で最適化され、テストタイムの適応は不要である。
Epic-Kitchens-100 と Epic-Sounds 全体では、単一のチェックポイントは完全な入力の下で競争力を持ち続け、支配的または補助的ストリームが削除されたとき、発行された欠落したモダリティベースラインを一貫して上回っている。
したがって、MacJEPAは、トリミングされていないマルチイベントビデオで動作する単一のモデルにおいて、時間的欠落モダリティの堅牢性と強力なフルインプット認識を統一する。
関連論文リスト
- PARSEE-VAD: Efficient Training-Free Online Video Anomaly Detection via Proposition-Aware Reasoning and Streaming Evidence Escalation [24.367658227422698]
凍結したマルチモーダル言語モデルによるトレーニング不要なオンラインビデオ異常検出には,2つの課題がある。
本稿では,意味的エビデンス獲得とスコア状態の進化を分離するフレームワークであるPARSEE-VADを紹介する。
実験はトレーニングなしのオンラインパフォーマンスを示し、選択的ルーティングは専門的な計算を減らします。
論文 参考訳(メタデータ) (2026-09-27T05:24:55Z) - VCR: Learning Valid Contextual Representation for Incomplete Wearable Signals [26.890638722471902]
本稿では,モダリティの欠如に頑健な有効な表現を抽出する自己教師型フレームワークであるVCRを提案する。
VCRは、フル、シングルミス、マルチミスモード設定におけるパフォーマンスとロバスト性を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-13T03:11:39Z) - DPM++: Dynamic Masked Metric Learning for Occluded Person Re-identification [32.9985650634494]
DPM++は、排除された人物の再識別のための動的マスクドメトリックラーニングフレームワークである。
入力適応マスク付きメトリックを学習し、隠蔽されたインスタンスごとに信頼性の高いIDサブスペースを動的に選択する。
全体的なシナリオと排他的シナリオの両方において、従来の最先端の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-07T17:47:23Z) - E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching [87.38371267983263]
時間的ビデオグラウンディングは、クエリイベントに対応する時間セグメントを正確にローカライズすることを目的としている。
E.M.GroundはTVGのための新しいVid-LLMで、総合的で一貫性のあるイベント知覚に焦点を当てている。
E.M.Ground は最先端の Vid-LLM を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-05T02:16:00Z) - ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding [32.72568710955575]
本稿では,実時間オムニ・マルチモーダル・アシスタントであるROMAについて述べる。
ROMAは連続的な入力を同期マルチモーダル単位として処理し、密度の高いオーディオを離散ビデオフレームと整列させて粒度のミスマッチを処理する。
オンライン意思決定では、応答開始を生成から切り離して正確なトリガーを確実にする軽量なスポークヘッドを導入する。
論文 参考訳(メタデータ) (2026-01-15T12:09:04Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization [60.73623588349311]
本研究では,時間的フォージェリーローカライゼーションのための共通文脈対応コントラスト学習フレームワーク (UniCaCLF) を提案する。
提案手法は教師付きコントラスト学習を利用して,異常検出による偽造瞬間の検出と同定を行う。
実物と偽物との間における特徴の識別可能性の限界をさらに押し上げるために、効率的な文脈対応コントラスト符号化を導入する。
論文 参考訳(メタデータ) (2025-06-10T06:40:43Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection [67.70328796057466]
Grounding-MDは、オープンワールドのモーメント検出に適した、革新的なビデオ言語事前学習フレームワークである。
我々のフレームワークは、構造化されたプロンプト機構を通じて、任意の数のオープンな自然言語クエリを組み込む。
Grounding-MDは特異なセマンティック表現学習能力を示し、多種多様な複雑なクエリ条件を効果的に処理する。
論文 参考訳(メタデータ) (2025-04-20T09:54:25Z) - A Study of Dropout-Induced Modality Bias on Robustness to Missing Video
Frames for Audio-Visual Speech Recognition [53.800937914403654]
AVSR(Advanced Audio-Visual Speech Recognition)システムは、欠落したビデオフレームに敏感であることが観察されている。
ビデオモダリティにドロップアウト技術を適用することで、フレーム不足に対するロバスト性が向上する一方、完全なデータ入力を扱う場合、同時に性能損失が発生する。
本稿では,MDA-KD(Multimodal Distribution Approximation with Knowledge Distillation)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-07T06:06:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。