論文の概要: Continual Video-MLLM Adaptation over Evolving Domains
- arxiv url: http://arxiv.org/abs/2607.18716v1
- Date: Tue, 21 Jul 2026 05:16:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.315495
- Title: Continual Video-MLLM Adaptation over Evolving Domains
- Title(参考訳): 進化する領域に対する連続的ビデオ-MLLM適応
- Abstract要約: ビデオマルチモーダルな大言語モデルは、ビデオ理解において強力な能力を示してきたが、逐次進化する領域への適応は未定である。
本稿では、進化するドメインに対する連続的ビデオMLLM適応のためのパラメータ効率の高いフレームワークであるDistributed-Aware Expert Routingを提案する。
2つの強力なビデオ-MLLMバックボーンの実験は、DAERが従来手法より一貫して優れていることを示している。
- 参考スコア(独自算出の注目度): 42.6837206153246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video multimodal large language models have shown strong capability in video understanding, yet their adaptation to sequentially evolving domains remains underexplored. In real-world deployments, video data often arrives continuously from heterogeneous domains, requiring the model to acquire new domain-specific knowledge without overwriting previously learned capabilities. Existing continual learning methods typically rely on shared adaptation spaces, which can induce severe cross-domain interference and catastrophic forgetting. We propose Distribution-Aware Expert Routing, a parameter-efficient framework for continual Video-MLLM adaptation over evolving domains. DAER maintains domain-isolated lightweight experts while keeping the pretrained Video-MLLM backbone frozen, thereby decoupling domain-specific adaptation from the general multimodal knowledge of the pretrained model. To enable fine-grained specialization, we introduce an intra-domain distribution-aware routing mechanism that matches each input to expert-level prototype reservoirs using MMD. To address the absence of task identities at inference time, we further propose an inter-domain routing mechanism that performs prototype matching in a discriminative subspace for robust domain identification. In addition, we introduce adaptive domain merging to improve parameter scalability and adopt a two-stage optimization strategy to stabilize expert specialization during continual learning. We evaluate DAER by curating a domain-incremental benchmark built from ten VidQA datasets covering diverse visual environments and reasoning demands. Experiments on two strong Video-MLLM backbones show that DAER consistently outperforms prior methods.
- Abstract(参考訳): ビデオマルチモーダルな大言語モデルは、ビデオ理解において強力な能力を示してきたが、逐次進化する領域への適応は未定である。
実世界のデプロイメントでは、ビデオデータが不均一なドメインから連続的に届き、以前に学習した能力を上書きすることなく、新しいドメイン固有の知識を取得する必要がある。
既存の連続学習法は通常、共有適応空間に頼り、激しいクロスドメイン干渉や破滅的な忘れを誘発することができる。
本稿では、進化するドメインに対する連続的ビデオMLLM適応のためのパラメータ効率の高いフレームワークであるDistributed-Aware Expert Routingを提案する。
DAERは、事前訓練されたビデオ-MLLMバックボーンを凍結させながら、ドメインを分離した軽量な専門家を維持し、これにより、事前訓練されたモデルの一般的なマルチモーダル知識からドメイン固有の適応を分離する。
細粒度の特殊化を実現するため,MDDを用いた各入力と専門家レベルのプロトタイプ貯水池との整合性を考慮したドメイン内分布認識ルーティング機構を導入する。
推論時にタスクの同一性がないことを解決するため,ロバストなドメイン識別のための識別サブ空間において,プロトタイプマッチングを行うドメイン間ルーティング機構を提案する。
さらに、パラメータのスケーラビリティを向上させるために適応的なドメインマージを導入し、連続学習における専門家の専門化を安定化するための2段階最適化戦略を適用した。
多様な視覚環境と推論要求をカバーする10のVidQAデータセットから構築されたドメインインクリメンタルベンチマークを算出し,DAERを評価する。
2つの強力なビデオ-MLLMバックボーンの実験は、DAERが従来手法より一貫して優れていることを示している。
関連論文リスト
- RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification [14.224783616912783]
視覚言語モデル(VLM)はマルチメディア理解にとってますます不可欠なものになりつつある。
彼らはしばしばドメイン固有のビデオ分類タスク、特に限られたデータで苦労する。
新しいアノテーションを使わずにこのギャップを埋める2段階の自己改善パラダイムを提案する。
論文 参考訳(メタデータ) (2025-11-19T23:12:18Z) - Consistent and Invariant Generalization Learning for Short-video Misinformation Detection [20.688230555928104]
ショートビデオ誤報検出はマルチモーダル領域で広く注目を集めている。
現在のモデルは、ドメインギャップのため、目に見えないドメインで不満足なパフォーマンスを示すことが多い。
本稿では,映像誤情報検出のためのコンシステイシーと不変学習を用いた新しいDOmain一般化モデルを提案する。
論文 参考訳(メタデータ) (2025-07-05T14:53:32Z) - Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization [68.41367635546183]
単一ドメインの一般化は、単一のソースからのデータを使用して、さまざまなシナリオで一貫したパフォーマンスでモデルをトレーニングすることを目的としている。
モデル一般化を改善するために合成データを活用した学習フレームワークDRSFを提案する。
論文 参考訳(メタデータ) (2025-03-17T18:08:03Z) - What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization [10.079844840768054]
ドメインの一般化は、新しい、目に見えないデータ分布に一般化できるモデルを開発することを目的としている。
モデルアーキテクチャと事前学習の目的が機能豊かさに与える影響について検討する。
我々のフレームワークは、最大4%以上のテスト精度向上により、未確認領域への一般化を改善する。
論文 参考訳(メタデータ) (2025-03-09T17:29:01Z) - META: Mimicking Embedding via oThers' Aggregation for Generalizable
Person Re-identification [68.39849081353704]
Domain Generalizable (DG) Person Re-identification (ReID)は、トレーニング時に対象のドメインデータにアクセスすることなく、見えないドメインをまたいでテストすることを目的としている。
本稿では,DG ReID のための OThers' Aggregation (META) を用いた Mimicking Embedding という新しい手法を提案する。
論文 参考訳(メタデータ) (2021-12-16T08:06:50Z) - TAL: Two-stream Adaptive Learning for Generalizable Person
Re-identification [115.31432027711202]
我々は、ドメイン固有性とドメイン不変性の両方が、re-idモデルの一般化能力の向上に不可欠であると主張する。
これら2種類の情報を同時にモデル化するために,2ストリーム適応学習 (TAL) を命名した。
我々のフレームワークは、単一ソースとマルチソースの両方のドメイン一般化タスクに適用できる。
論文 参考訳(メタデータ) (2021-11-29T01:27:42Z) - Cluster, Split, Fuse, and Update: Meta-Learning for Open Compound Domain
Adaptive Semantic Segmentation [102.42638795864178]
セマンティックセグメンテーションのための原則的メタラーニングに基づくOCDAアプローチを提案する。
対象ドメインを複数のサブターゲットドメインに,教師なしの方法で抽出した画像スタイルでクラスタリングする。
その後、メタラーニングがデプロイされ、スタイルコードに条件付きでサブターゲットドメイン固有の予測を融合するように学習される。
モデルに依存しないメタラーニング(MAML)アルゴリズムにより,モデルをオンライン更新することを学び,一般化をさらに改善する。
論文 参考訳(メタデータ) (2020-12-15T13:21:54Z) - Domain Conditioned Adaptation Network [90.63261870610211]
本稿では,ドメイン条件付きチャネルアテンション機構を用いて,異なる畳み込みチャネルを励起するドメイン条件適応ネットワーク(DCAN)を提案する。
これは、ディープDAネットワークのドメインワイドな畳み込みチャネルアクティベーションを探求する最初の試みである。
論文 参考訳(メタデータ) (2020-05-14T04:23:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。