論文の概要: ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.28719v1
- Date: Sat, 27 Jun 2026 03:55:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.666324
- Title: ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models
- Title(参考訳): ComMem:視覚言語モデルのテスト時間適応のための補完メモリシステム
- Authors: Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong,
- Abstract要約: ComMemは2つの重要なコンポーネントで構成されている: 速い適応性のある詳細なメモリ、海馬に似た、およびネオコルテックスに似た、ゆっくりと統合された抽象メモリである。
ComMemは、自然な分散シフトとデータセット間の一般化の両方の下で、最先端の手法を著しく上回っている。
- 参考スコア(独自算出の注目度): 48.594327760096974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time adaptation (TTA) of vision-language models (VLMs) is essential for their robust deployment in dynamic, real-world environments. However, existing TTA methods often adapt locally without accumulating knowledge over time, or operating within a single modality without exploiting VLMs' inherently multi-modal nature. Inspired by the \textbf{Com}plementary \textbf{Mem}ory systems of the biological brain, we propose \textbf{ComMem}, an innovative approach that mimics the distinct but cooperative roles of the hippocampus and neocortex to enable effective TTA for VLMs. ComMem consists of two key components: a fast-adapting detailed memory, akin to the hippocampus, that forms a dynamic visual cache from high-confidence test samples; and a slow-integrating abstract memory, akin to the neocortex, that continually refines global textual prototypes. For each test instance, ComMem jointly optimizes both memory systems to ensure cross-modal consistency. Extensive experiments on 15 benchmark datasets show that ComMem significantly outperforms state-of-the-art methods under both natural distribution shifts and cross-dataset generalization, offering a promising direction for enhancing VLMs' practical adaptability.
- Abstract(参考訳): 視覚言語モデル(VLM)のテスト時適応(TTA)は、動的で現実的な環境への堅牢な展開に不可欠である。
しかしながら、既存のTTA手法は、時間とともに知識を蓄積することなく、あるいはVLMの本質的なマルチモーダルな性質を生かさずに、単一のモダリティ内で動作することなく、ローカルに適応することが多い。
生体脳のtextbf{Com}plementary \textbf{Mem}oryシステムに着想を得て, 海馬と新皮質の区別されるが協調的な役割を模倣し, VLMの効果的なTTAを実現する革新的なアプローチである \textbf{ComMem} を提案する。
ComMemは2つの重要なコンポーネントで構成されている。高速適応の詳細なメモリは海馬に似ており、高信頼のテストサンプルから動的ビジュアルキャッシュを形成する。
テストインスタンス毎に、ComMemは両方のメモリシステムを共同で最適化し、クロスモーダルな一貫性を保証する。
15のベンチマークデータセットに対する大規模な実験により、ComMemは自然分布シフトとデータセット間の一般化の両方の下で最先端の手法を大幅に上回っており、VLMの実用的適応性を高めるための有望な方向を提供する。
関連論文リスト
- Toward a Multi-View Brain Network Foundation Model: Cross-View Consistency Learning Across Arbitrary Atlases [62.33465338932216]
MV-BrainFMは任意のアトラスで構築された脳ネットワークから一般化可能でスケーラブルな表現を学ぶために設計された多視点脳ネットワーク基盤モデルである。
17のfMRIデータセットから20万名以上の被験者を対象に行った実験では、MV-BrainFMは既存の14の脳ネットワーク基盤モデルより一貫して優れていた。
論文 参考訳(メタデータ) (2026-03-20T11:55:00Z) - AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba [56.52470564147458]
マルチモーダル融合と感情分析のための効率的かつ効率的なフレームワークである textbfAlignMamba-2 を提案する。
提案手法では, 最適輸送距離と最大平均離散度の両方を用いてモデルを正規化する2つのアライメント戦略を導入する。
さらに重要なことは、モダリティに特有かつモダリティに偏ったエキスパートによるMixture-of-Expertsアーキテクチャを採用したModality-Aware Mamba層を設計することです。
論文 参考訳(メタデータ) (2026-03-19T03:47:21Z) - Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models [21.20658517302458]
MuGCP (Multi-modal Mutual-Guidance Conditional Prompt Learning) は、条件付きプロンプト生成のための新しいパラダイムである。
AMGモジュールはVisual Conditional Prompts (VCP)を生成し、マルチモーダルタスクにおけるモデルの性能を向上させる。
MPFメカニズムは、SCPとVCPを文脈的プロンプトと統合し、シームレスな調整を保証する。
論文 参考訳(メタデータ) (2025-07-11T08:45:27Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - Joint Multimodal Transformer for Emotion Recognition in the Wild [49.735299182004404]
マルチモーダル感情認識(MMER)システムは、通常、単調なシステムよりも優れている。
本稿では,キーベースのクロスアテンションと融合するために,ジョイントマルチモーダルトランス (JMT) を利用するMMER法を提案する。
論文 参考訳(メタデータ) (2024-03-15T17:23:38Z) - Interactive Continual Learning: Fast and Slow Thinking [19.253164551254734]
本稿では,対話型連続学習フレームワークを提案する。
System1におけるメモリ検索を改善するために,von Mises-Fisher(vMF)分布に基づくCL-vMF機構を導入する。
提案したICLの包括的評価は,既存の手法と比較して,忘れられ,優れた性能を示す。
論文 参考訳(メタデータ) (2024-03-05T03:37:28Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z) - Efficient Multimodal Transformer with Dual-Level Feature Restoration for
Robust Multimodal Sentiment Analysis [47.29528724322795]
マルチモーダルセンシング分析(MSA)が近年注目を集めている。
著しい進歩にもかかわらず、堅牢なMSAへの道にはまだ2つの大きな課題がある。
デュアルレベル特徴回復 (EMT-DLFR) を用いた高効率マルチモーダル変圧器 (Efficient Multimodal Transformer) を提案する。
論文 参考訳(メタデータ) (2022-08-16T08:02:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。