論文の概要: Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails
- arxiv url: http://arxiv.org/abs/2607.02020v1
- Date: Thu, 02 Jul 2026 10:50:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.796106
- Title: Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails
- Title(参考訳): 連続的マルチモーダル学習における隠れ留置:正確さが生き残った時, 接地障害
- Abstract要約: 我々は,MLLMの継続的な適応が,その答えだけでなく,視覚的,テキスト的,OCR,チャート,文書的エビデンスをいかに活用するかを考察する。
モデルが異なるあるいは根拠のないエビデンスチャネルに静かに移行している間に、解答精度を保ちながら、エンフィデントエビデンス利用の忘れを識別する。
我々は,リプレイ不要な依存制約付き連続学習フレームワークであるtextscRCLを提案する。
- 参考スコア(独自算出の注目度): 6.708653593551749
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models must continually adapt to evolving tasks and domains, yet standard continual learning metrics mainly measure whether old answers remain correct, leaving the stability of multimodal grounding largely unexamined. We study this overlooked failure mode and ask whether a continually adapted MLLM can preserve not only what it answers, but also how it uses visual, textual, OCR, chart, and document evidence. We identify \emph{hidden evidence-use forgetting}, where answer accuracy is retained while the model silently shifts toward different or less grounded evidence channels, and propose \textsc{RCL}, a replay-free reliance-constrained continual learning framework. \textsc{RCL} freezes the previous checkpoint as a behavioral reference, estimates teacher and student evidence-reliance profiles through counterfactual channel interventions, and jointly optimizes task learning, prediction preservation, and reliance preservation without adding inference-time cost. Across CoIN, COAST, MCITlib, and an evidence-sensitive multimodal stream, \textsc{RCL} consistently improves final performance and reduces forgetting over replay-free, PEFT, routing, and memory-assisted baselines, while substantially lowering modality reliance drift, dominant evidence flips, and hidden forgetting rates. These results suggest that robust continual multimodal learning requires preserving the evidence path behind correct answers, not merely the answers themselves.
- Abstract(参考訳): マルチモーダルな大規模言語モデルは、進化するタスクやドメインに継続的に適応しなければならないが、標準的な連続学習指標は主に古い回答が正しいかどうかを測定し、マルチモーダルな基盤の安定性はほとんど検討されていない。
我々は、この見過ごされた失敗モードを調査し、継続的な適応型MLLMが、その答えだけでなく、視覚的、テキスト的、OCR、チャート、文書的エビデンスをどのように利用するのかを問う。
モデルが無作為なエビデンスチャネルに静かに移行している間に解答精度を維持できる「emph{hidden evidence-use forgetting」を同定し、リプレイ不要な信頼性制約付き連続学習フレームワークである「textsc{RCL}」を提案する。
従来のチェックポイントを行動基準として凍結し、反ファクトチャネルの介入を通じて教師と学生のエビデンス・信頼プロファイルを推定し、推論時間コストを加算することなくタスク学習、予測保存、信頼性保存を共同で最適化する。
CoIN, COAST, MCITlib, およびエビデンスに敏感なマルチモーダルストリームにおいて, \textsc{RCL} は最終性能を一貫して改善し,リプレイフリー, PEFT, ルーティング, メモリアシストベースラインの忘れを低減し, モダリティ依存のドリフト, 支配的なエビデンスフリップ, 隠れ忘れ率を大幅に低下させる。
これらの結果は、頑健な連続的マルチモーダル学習は、単に答えそのものではなく、正しい答えの背後にあるエビデンスパスを保存する必要があることを示唆している。
関連論文リスト
- TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs [83.78708832901194]
大規模ビデオ言語モデル(LVLM)は、野生のマルチモーダル感情認識(ER)のようなマルチモーダルタスクにおいて顕著なパフォーマンスを示している。
しかし、現実のデプロイメントは依然として困難であり、テスト時にモダリティが欠落したりうる。
凍結した教師が自己蒸留により適応的な低学級の生徒を指導する手法を提案する。
MELD, DFEW, BAHを0%-50%のモダリティで実験した結果, この統一型適応復元設計はエントロピーベースの適応, RAG, およびパープレキシティベースの生成より一貫して優れていた。
論文 参考訳(メタデータ) (2026-08-18T23:40:28Z) - REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering [25.519927761448603]
REVEALは、長いビデオ質問応答のためのルーリック誘導エージェントフレームワークである。
本稿では,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化する適応型視覚類似性に基づく前処理パイプラインを提案する。
この構造化メモリ上に構築されたREVEALは、自動的に構築されたルーリックライブラリを使用して、検索された証拠が満足度基準を満たすかどうかを明示的に検証する。
論文 参考訳(メタデータ) (2026-08-09T09:55:42Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training [30.22002300048916]
大規模言語モデルテストタイムトレーニング(TTT)は、しばしばローカルプロキシメトリクスによって評価される。
TTTメモリを校正する行動評価フレームワークを導入する。
論文 参考訳(メタデータ) (2026-07-01T03:07:17Z) - Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents [16.193335398478386]
ロングホライゾンの言語エージェントは、観測、トレースの推論、および検索された事実のウィンドウを蓄積する。
既存のシステムは、保持を局所的に扱い、可観測性制約の下での長期的な影響をモデル化しない。
我々は,オンライン・オブザーバブル機能とオフライン・アベイラビリティ・インスペクションの厳格な分離を強制する学習強化フレームワークOSL-MRを提案する。
論文 参考訳(メタデータ) (2026-06-09T09:15:33Z) - AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents [30.801952443449633]
継続的な学習は、エージェントが一連のタスクに再利用可能な経験を蓄積し、時間とともに改善し、無関係な経験からの干渉を避けることを期待する。
ほとんどの取り組みは、長いコンテキストの会話やドキュメントに対する検索と推論に重点を置いているが、最近の長命適応ベンチマークは、しばしば単純なタスクストリームに依存している。
本稿では、制御されたタスクストリームと転送利得のメトリクスに着目した連続学習エージェントのための評価フレームワークAgentCLを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:32:59Z) - MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models [64.2820121997882]
MIITAはメモリ駆動型推論時間適応フレームワークである。
教師付きエクスペリエンスをセマンティックアンカーを備えたコンパクトな修正指向プロトタイプとして格納し、セマンティックおよび不確実性ベースのキューを使用して推論時にそれらを検索する。
実験により、MIITAは最終性能を継続的に改善し、固定メモリの予算下での忘れを軽減している。
論文 参考訳(メタデータ) (2026-05-20T03:03:04Z) - LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations [53.20772659095155]
本稿では、トレーニング時不完全観察において、より困難なIMLの設定に取り組む。
本稿では,この課題を条件付きシーケンス推論タスクとして再構成したLIMSSR(LLM-Driven Incomplete Multimodal Sequence-to-Score Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-05-01T06:11:42Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought? [79.86483056611105]
推論 LLM は、答えを出す前にステップバイステップの思考連鎖を生成する。
これらの推論は、その内部で発生する破壊の痕跡をどれほど堅牢にしていますか?
一定のタイミングでモデル自身のCoTを摂動させる制御された評価フレームワークを導入する。
論文 参考訳(メタデータ) (2026-02-07T10:02:58Z) - Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting [70.83781268763215]
視覚言語モデル(VLM)は、大規模事前学習を活用することで、多様なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
VLMは、クロスモーダル機能ドリフト、共有アーキテクチャによるパラメータ干渉、ゼロショット機能侵食など、ユニークな課題に直面している。
本調査は、生涯の視覚言語システムを開発する研究者にとって、包括的かつ診断的な基準となることを目的としている。
論文 参考訳(メタデータ) (2025-08-06T09:03:10Z) - Mitigating Catastrophic Forgetting in Task-Incremental Continual
Learning with Adaptive Classification Criterion [50.03041373044267]
本稿では,継続的学習のための適応型分類基準を用いた教師付きコントラスト学習フレームワークを提案する。
実験により, CFLは最先端の性能を達成し, 分類基準に比べて克服する能力が強いことが示された。
論文 参考訳(メタデータ) (2023-05-20T19:22:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。