論文の概要: SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning
- arxiv url: http://arxiv.org/abs/2607.20511v1
- Date: Sun, 05 Jul 2026 08:27:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.925567
- Title: SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning
- Title(参考訳): SiGMA:マルチモーダルインストラクションチューニングのための手書き統合と適応
- Abstract要約: SiGMAは2つのコンポーネントとの負の干渉を緩和するフレームワークである。
その結果,SiGMAは負の干渉を著しく低減し,MCIT法よりも優れていた。
- 参考スコア(独自算出の注目度): 51.48082586664008
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal Continual Instruction Tuning (MCIT) is crucial for adapting Multimodal Large Language Models (MLLMs) to evolving a sequence of downstream tasks. Prior methods mostly utilize Mixture of Experts or expansion merge approach, primarily focusing on catastrophic forgetting, yet they still suffer from negative interference during inference, where newly learned updates overwrite useful prior knowledge and degrade overall performance. To address this, we propose SiGMA (Sign Guided Merging and Adaptation), a simple yet effective framework that mitigates negative interference with two components: sign guided adaptive tuning during training and sign guided merging at inference. Sign guided adaptive tuning reduces collisions with past knowledge and learns the current task with minimal drift, mitigating severe forgetting. Sign guided merging further improves consolidation by selectively scaling salient parameters to preserve and amplify useful task specific knowledge. Experiments on UCIT and DCL benchmarks show that SiGMA significantly reduces negative interference and outperforms state of the art MCIT methods. Our code is available at SiGMA.
- Abstract(参考訳): マルチモーダル・インストラクション・チューニング(MCIT)は,マルチモーダル大規模言語モデル(MLLM)を下流タスクの系列に適応させる上で重要である。
従来の手法では、主にMixture of ExpertsまたはExtension mergeアプローチを使用しており、破滅的な忘れ方に重点を置いているが、推論中にネガティブな干渉を被り、新しく学んだ更新が有用な事前知識を上書きし、全体的なパフォーマンスを低下させている。
これを解決するために,SiGMA (Sign Guided Merging and Adaptation) を提案する。これは2つのコンポーネントとの負の干渉を緩和するシンプルで効果的なフレームワークである。
サインガイド適応チューニングは過去の知識との衝突を減らし、最小限のドリフトで現在のタスクを学習し、深刻な忘れを軽減します。
サインガイドされたマージは、有用なタスク固有の知識を保存および増幅するために、サリエントパラメータを選択的にスケーリングすることで、統合をさらに改善する。
UCITおよびDCLベンチマークの実験により、SiGMAは負の干渉を著しく低減し、最先端のMCIT法より優れていることが示された。
私たちのコードはSiGMAで利用可能です。
関連論文リスト
- Adaptive Augmentation-Aware Latent Learning for Robust LiDAR Semantic Segmentation [40.73286976237313]
逆気象条件は、LiDARポイントクラウドセマンティックセグメンテーションネットワークの性能を著しく低下させる。
既存の拡張ベースの手法は、訓練中に気象干渉をシミュレートすることで堅牢性を高める試みである。
本稿では,多種多様な拡張を効果的に活用する適応型拡張対応潜在学習フレームワークであるA3Pointを提案する。
論文 参考訳(メタデータ) (2026-03-01T12:33:14Z) - C-MOP: Integrating Momentum and Boundary-Aware Clustering for Enhanced Prompt Evolution [37.02233725807037]
境界対応コントラストサンプリング (BACS) と Momentum-Guided Semantic Clustering (MGSC) による最適化を安定化するフレームワーク C-MOP を提案する。
C-MOPは、PromptWizardやProTeGiのようなSOTAベースラインを一貫して上回り、平均利得は1.58%と3.35%である。
論文 参考訳(メタデータ) (2026-02-11T14:04:47Z) - When Domain Pretraining Interferes with Instruction Alignment: An Empirical Study of Adapter Merging in Medical LLMs [0.6345523830122167]
大規模言語モデルは、ドメイン適応と命令アライメントを組み合わせる際に驚くべきアダプタ干渉を示す。
医学LLMのための2段階のLORAパイプラインについて検討し、ドメイン指向事前トレーニング(PT)と教師付き微調整(SFT)を個別に訓練し、後にマージした。
論文 参考訳(メタデータ) (2026-01-26T10:54:06Z) - Unifying Search and Recommendation in LLMs via Gradient Multi-Subspace Tuning [33.69176756907003]
Gradient Multi-Subspace Tuning (GEMS)は、検索とレコメンデーションタスクを統合する新しいフレームワークである。
GEMSは検索タスクとレコメンデーションタスクの両方において、最先端のベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-01-14T14:03:07Z) - CLASS-IT: Conversational and Lecture-Aligned Small-Scale Instruction Tuning for BabyLMs [81.79228604962687]
本研究は,小規模のLMが命令チューニングの恩恵を受けることができるかどうかを考察する。
我々は,統合的・逐次的なカリキュラムに適用された対話型および質問応答型指導調律データセットを比較した。
その結果、命令チューニングは微調整のシナリオでは小さくても一貫した利得をもたらすことが示され、逐次キュリキュラはマージされたデータより優れていた。
しかし、改良はゼロショットタスクに一貫して移行するわけではなく、相互作用中心の適応と広範な言語一般化とのトレードオフを示唆している。
論文 参考訳(メタデータ) (2025-10-29T10:36:39Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Beyond Freezing: Sparse Tuning Enhances Plasticity in Continual Learning with Pre-Trained Models [10.904981532789824]
事前訓練されたモデルによる継続的な学習は、シーケンシャルなタスクにまたがる効率的な適応を大いに約束する。
既存のアプローチはPTMを凍結し、プロンプトやアダプタのような補助モジュールに依存している。
MIST(Mutual Information-Guided Sparse Tuning)は,PTMパラメータのサブセットを選択的に更新するプラグイン・アンド・プレイ方式である。
論文 参考訳(メタデータ) (2025-05-26T13:09:25Z) - Promptable Anomaly Segmentation with SAM Through Self-Perception Tuning [63.55145330447408]
異常セグメンテーションのための textbfSelf-textbfPerceptinon textbfTuning (textbfSPT) 法を提案する。
SPT法は, 自己描画型チューニング戦略を取り入れ, 異常マスクの初期粗いドラフトを生成し, 精製処理を行う。
論文 参考訳(メタデータ) (2024-11-26T08:33:25Z) - LLMEmb: Large Language Model Can Be a Good Embedding Generator for Sequential Recommendation [57.49045064294086]
大きな言語モデル(LLM)は、その人気とは無関係に、アイテム間の意味的関係をキャプチャする能力を持つ。
LLMEmb(LLMEmb)は、LCMを利用してアイテム埋め込みを生成し、逐次レコメンダシステム(SRS)の性能を向上させる手法である。
論文 参考訳(メタデータ) (2024-09-30T03:59:06Z) - Meta-Learning Adversarial Bandit Algorithms [55.72892209124227]
我々は,バンディットフィードバックを用いたオンラインメタラーニングについて研究する。
我々は自己協和障壁正規化器を用いてオンラインミラー降下一般化(OMD)をチューニングすることを学ぶ。
論文 参考訳(メタデータ) (2023-07-05T13:52:10Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。