論文の概要: Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs
- arxiv url: http://arxiv.org/abs/2606.20961v1
- Date: Thu, 18 Jun 2026 21:58:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 11:34:55.446964
- Title: Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs
- Title(参考訳): ベンチマークは十分か? : MLLMの継続的学習の分析
- Authors: Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini,
- Abstract要約: 継続的適応は、進化するドメインにまたがってデプロイされるマルチモーダルな大規模言語モデル(MLLM)に不可欠である。
本稿では、MLLM-CLベンチマークでこの主張を再検討し、2つの主張を論じる。
単純なトレーニングフリーでリプレイフリーなPtotypeal routing method (textscRePRo) は、MR-LoRAのMLLMベースのルータと計算コストがはるかに低い。
第2に、共有専門家は理論上の魅力にもかかわらず、MLLMの継続的な学習を改善しない。
- 参考スコア(独自算出の注目度): 4.1765120028423
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Continual adaptation is essential for multimodal large language models (MLLMs) deployed across evolving domains, but the state-of-the-art MR-LoRA method highly relies on the assumption that a MLLM-based router is necessary to process complex multimodal inputs. This paper revisits this claim on the MLLM-CL benchmark and argues for two claims. \textbf{First}, routing does not require an MLLM: a simple training-free, replay-free ptotypical routing method (\textsc{RePRo}), uses frozen pretrained features and task prototypes to match the MLLM-based router of MR-LoRA at far lower computational cost. \textbf{Second}, shared experts do not improve continual learning for MLLMs, despite their theoretical appeal. We show that these findings arise from two structural limitations of MLLM-CL: (1) its tasks are \textbf{highly separable} in representation space, and (2) its fixed task order makes conclusions \textbf{sensitive to a single curriculum} rather than robust across diverse continual-learning trajectories. As a result, the benchmark primarily rewards learning in isolation rather than genuine continual transfer. This motivates a new design for future benchmarks of continual MLLM learning, with overlapping task manifolds, multiple task orders, fine-grained domain shifts, and evaluation protocols that reward forward transfer as well as retention.
- Abstract(参考訳): マルチモーダルな大規模言語モデル(MLLM)には継続的適応が不可欠であるが、最先端のMR-LoRA法は複雑なマルチモーダル入力を処理するためにMLLMベースのルータが必要であるという仮定に強く依存している。
本稿では、MLLM-CLベンチマークでこの主張を再検討し、2つの主張を論じる。
単純なトレーニングフリーで、リプレイフリーなptotypeal routing method (\textsc{RePRo}) は、MR-LoRAのMLLMベースのルータをはるかに低い計算コストでマッチングするために、凍結した事前訓練された特徴とタスクプロトタイプを使用する。
共有専門家は、理論上の魅力にもかかわらず、MLLMの継続的な学習を改善しない。
MLLM-CL の構造的制約は,(1) タスクは表現空間において \textbf{highly separable} であり,(2) タスクの順序は,多種多様な連続学習軌跡にまたがって頑健ではなく,一つのカリキュラムに対して \textbf{sensitive to a single curriculum} の結論を与える。
その結果、ベンチマークは主に真の連続的な転送ではなく、独立した学習に報いる。
これは、タスク多様体の重複、複数のタスク順序、きめ細かいドメインシフト、前方転送と保持に報いる評価プロトコルなど、将来のMLLM学習のベンチマークのための新しい設計を動機付けている。
関連論文リスト
- Harmonizing Semantic and Collaborative in LLMs: Reasoning-based Embedding Generator for Sequential Recommendation [6.3053631723979455]
大規模言語モデルは、アイテムセマンティクスを豊かにする有望な方法を提供する。
現在の埋め込み方式では、モデルの内部推論能力を利用することができない。
本稿では,ReaEmbを紹介した。ReaEmbは遅延推論強化コントラスト学習段階と協調回帰学習段階を通じて,両方の問題を解決する新しいフレームワークである。
論文 参考訳(メタデータ) (2026-06-15T13:37:52Z) - LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations [53.20772659095155]
本稿では、トレーニング時不完全観察において、より困難なIMLの設定に取り組む。
本稿では,この課題を条件付きシーケンス推論タスクとして再構成したLIMSSR(LLM-Driven Incomplete Multimodal Sequence-to-Score Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-05-01T06:11:42Z) - RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval [2.2125276321198677]
マルチモーダル情報検索(MMIR)は、テキストや画像、あるいは混合クエリや候補を扱う際の柔軟性に注目されている。
近年のマルチモーダル大言語モデル(MLLM)のブレークスルーにより,MLLMの知識を対照的な微調整フレームワークに組み込むことで,MMIR性能が向上している。
本稿では,MMIRのためのMLLMをトレーニングおよびデータフリーでクエリする新しいフレームワークであるRetLLMを紹介する。
論文 参考訳(メタデータ) (2026-02-25T10:31:32Z) - Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning [18.215893951726166]
スパースや遅延した報酬のある環境では、強化学習は高いサンプル複雑さを引き起こす。
この制限は、大規模言語モデル(LLM)をサブゴール発見や軌道誘導に使う動機となった。
LLMガイダンスとエージェント自身のロールアウトの成功の両方から,サブゴールとトラジェクトリを符号化したメモリグラフを構築することで,これらの課題に対処する。
論文 参考訳(メタデータ) (2026-02-20T01:44:35Z) - NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints [100.02131897927484]
本稿では,Multimodal Large Language Models(MLLM)のエンドツーエンドなネイティブトレーニングに焦点を当てる。
そこで我々は,NaViLと呼ばれるネイティブMLLMと,シンプルで費用対効果の高いレシピを組み合わせて提案する。
14のマルチモーダルベンチマークによる実験結果から,既存のMLLMに対するNaViLの競合性能が確認された。
論文 参考訳(メタデータ) (2025-10-09T17:59:37Z) - Sparse Training Scheme for Multimodal LLM [26.81140959413325]
MLLM(Multimodal Large Language Models)は、様々な領域において優れた性能を示す。
スパース・トレーニング・スキーム(STS)と呼ばれるスパース表現に基づく新しい学習効率向上フレームワークを提案する。
このスキームは、ビジュアルトークンを圧縮することで情報負荷を削減するVisual Tokenと、前方および後方の両方で言語モデルの不要なレイヤをスキップすることで計算オーバーヘッドを軽減するLayer Dynamic Skipperの2つの重要なコンポーネントで構成されている。
論文 参考訳(メタデータ) (2025-09-16T11:33:20Z) - Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning [95.44766931218896]
MLLM(Multi-modal large language model)は、テキストベースの推論に遅れを取っている。
本稿では,MLLMの推論コンポーネントをモジュール化し,容易に置き換え可能なパーセプション推論デカップリングを提案する。
本稿では,視覚知覚最適化(VPO)と呼ばれる新しい強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-05T02:28:07Z) - Distilling Transitional Pattern to Large Language Models for Multimodal Session-based Recommendation [67.84581846180458]
セッションベースのレコメンデーション(SBR)は、匿名セッションに基づいて次の項目を予測する。
近年のMultimodal SBR法は、モダリティ学習に単純化された事前学習モデルを用いるが、セマンティック・リッチネスに制限がある。
蒸留パラダイムを拡張し,MSBRの促進のための遷移パターンを分離・整合させる多モードLCM拡張フレームワークTPADを提案する。
論文 参考訳(メタデータ) (2025-04-13T07:49:08Z) - mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA [78.45521005703958]
マルチモーダル検索拡張生成(mRAG)はMLLMに包括的で最新の知識を提供するために自然に導入されている。
我々は、適応的検索と有用な情報ローカライゼーションを実現する textbfRetrieval-textbfReftextbfAugmented textbfGeneration (mR$2$AG) という新しいフレームワークを提案する。
mR$2$AG は INFOSEEK と Encyclopedic-VQA の最先端MLLM を著しく上回る
論文 参考訳(メタデータ) (2024-11-22T16:15:50Z) - TRACE: A Comprehensive Benchmark for Continual Learning in Large
Language Models [52.734140807634624]
調整された大規模言語モデル(LLM)は、タスク解決、指示に従うこと、安全性を確保することにおいて、例外的な能力を示す。
既存の連続学習ベンチマークでは、LLMをリードする上で十分な課題が欠如している。
LLMにおける継続学習を評価するための新しいベンチマークであるTRACEを紹介する。
論文 参考訳(メタデータ) (2023-10-10T16:38:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。