論文の概要: AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning
- arxiv url: http://arxiv.org/abs/2607.15094v1
- Date: Thu, 16 Jul 2026 15:07:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.153809
- Title: AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning
- Title(参考訳): AlphaWiSE:連続マルチモーダル表現学習のための適応重み補間
- Authors: Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu,
- Abstract要約: 2つの凍結したソースチェックポイントを構成するポストホックな重み空間法であるAlphaWiSEを提案する。
音声画像テキスト検索実験は、強い連続学習例よりも一貫した改善を示す。
- 参考スコア(独自算出の注目度): 10.564283891708273
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal models such as CLIP learn a shared embedding space for cross-modal retrieval, but continual adaptation to sequentially arriving data can disrupt the cross-modal alignment acquired from earlier phases. Conventional continual-learning methods return a single checkpoint, which commits every retrieval direction to the same stability-plasticity trade-off. We propose AlphaWiSE, a post-hoc weight-space interpolation method that composes two frozen source checkpoints. For each aligned parameter tensor identified by its checkpoint key, AlphaWiSE fits one scalar interpolation coefficient shared by all tensor entries. The coefficients are fitted on a smaller exemplar memory and used to materialize one interpolated checkpoint. The deployed model has the same architecture and parameter count as either source checkpoint, which does not require additional inference time. Extensive experiments on audio-image-text retrieval show consistent improvements over strong continual-learning baselines across multiple retrieval directions and evaluation metrics.
- Abstract(参考訳): CLIPのようなマルチモーダルモデルは、クロスモーダル検索のための共有埋め込み空間を学習するが、逐次到着するデータへの連続的な適応は、初期のフェーズから取得したクロスモーダルアライメントを妨害する可能性がある。
従来の連続学習手法は単一のチェックポイントを返し、全ての検索方向を同じ安定性と塑性のトレードオフにコミットする。
2つの凍結源チェックポイントを構成するポストホック空間補間法であるAlphaWiSEを提案する。
チェックポイントキーで識別される各アライメントパラメータテンソルに対して、AlphaWiSEはすべてのテンソルエントリで共有されるスカラー補間係数に適合する。
係数は、より小さな模範メモリに装着され、1つの補間されたチェックポイントを実現するために使用される。
デプロイされたモデルは、ソースチェックポイントと同じアーキテクチャとパラメータカウントを持ち、追加の推論時間を必要としない。
音声画像テキスト検索における広範囲な実験は、複数の検索方向と評価指標にまたがる強い連続学習ベースラインよりも一貫した改善を示す。
関連論文リスト
- SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry [69.89196162649091]
SCOPE (Scale-Consistent One-Pass Estimation of 3D Geometry) は、拡張された単眼ビデオシーケンスから3次元幾何学を推定するための新しいアプローチである。
提案手法では,アフィン不変な3次元点マップを全列に共通パラメータで生成し,一貫したスケール不変表現を実現する。
論文 参考訳(メタデータ) (2026-06-19T10:23:25Z) - PAID: Pairwise Angular-Invariant Decomposition for Continual Test-Time Adaptation [70.98107766265636]
本稿では,事前学習した重みの幾何学的特性を出発点として,3つの重要な成分(等級,絶対角,対角構造)を体系的に解析する。
両角構造は多種多様なドメインにわたって安定であり, ドメイン不変な意味情報を符号化し, 適応中に保存すべきことを示唆する。
論文 参考訳(メタデータ) (2025-06-03T05:18:15Z) - VCformer: Variable Correlation Transformer with Inherent Lagged Correlation for Multivariate Time Series Forecasting [1.5165632546654102]
本稿では,変数間の相関を抽出する可変相関変換器(VCformer)を提案する。
VCAはクエリとキー間の遅延に応じて、相互相関スコアを計算し、統合する。
クープマンダイナミクス理論にインスパイアされた我々は、時系列の非定常性を改善するために、クープマン時間検出器(KTD)を開発した。
論文 参考訳(メタデータ) (2024-05-19T07:39:22Z) - KP-RED: Exploiting Semantic Keypoints for Joint 3D Shape Retrieval and Deformation [87.23575166061413]
KP-RED は KeyPoint 主導の Retrieval and deformation フレームワークである。
オブジェクトスキャンを入力として、最も幾何学的に類似したCADモデルを共同で検索し、変形させる。
論文 参考訳(メタデータ) (2024-03-15T08:44:56Z) - DPCN++: Differentiable Phase Correlation Network for Versatile Pose
Registration [18.60311260250232]
本稿では,世界規模で収束し,対応のない位相相関解法を提案する。
DCPN++は,2次元鳥眼視画像,3次元物体・シーン計測,医用画像など,入力モードが異なる幅広い登録タスクで評価される。
論文 参考訳(メタデータ) (2022-06-12T10:00:34Z) - DFC: Deep Feature Consistency for Robust Point Cloud Registration [0.4724825031148411]
複雑なアライメントシーンのための学習に基づくアライメントネットワークを提案する。
我々は,3DMatchデータセットとKITTIオドメトリデータセットに対するアプローチを検証する。
論文 参考訳(メタデータ) (2021-11-15T08:27:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。