論文の概要: Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach
- arxiv url: http://arxiv.org/abs/2607.26608v1
- Date: Wed, 29 Jul 2026 08:31:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.583054
- Title: Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach
- Title(参考訳): 不均一MLLM核融合における知識伝達機構の理解:単純線形アプローチ
- Abstract要約: クロススケールな知識伝達は、共有注入方向に対する能力依存応答により一順に決定される。
高いレベルの推論の利得は、主に言語モデルから生じます。
これらの知見は,狭義の低干渉条件下での言語側推論伝達として,多種多種MLLM融合を再検討した。
- 参考スコア(独自算出の注目度): 5.040180067606661
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training-free fusion of heterogeneous multimodal large language models (MLLMs) provides a direct route for cross-scale capability transfer, yet improvements in aggregate performance do not reveal what a smaller model actually inherits. Existing studies are largely designed and evaluated on limited task sets or aggregate metrics; as evaluation expands to broader task collections, whether different capabilities can transfer across scales remains poorly understood. To investigate this question, we introduce Cross-Scale Directional Parameter Injection (CDPI), a simple linear probe to analyze cross-scale knowledge transfer during heterogeneous fusion. A local theoretical analysis indicates that knowledge transfer selectivity is determined at first order by capability-dependent responses to a shared injection direction, while second-order curvature effects constrain the effective transfer regime. Across four Qwen3-VL model pairs and twelve multimodal benchmarks, our experiments reveal a consistent pattern of selectivity: gains concentrate on reasoning, particularly high-level reasoning, whereas perception performance remains close to that of the original target model. Component-wise ablations further show that high-level reasoning gains arise primarily from the language model, while ratio analysis finds that positive selective transfer occurs mainly in the small-ratio regime. These findings recast cross-scale heterogeneous MLLM fusion as selective language-side reasoning transfer within a narrow, low-interference regime, rather than broad capability inheritance.
- Abstract(参考訳): ヘテロジニアス・マルチモーダル・大規模言語モデル(MLLM)のトレーニング不要な融合は、クロススケールな機能伝達の直接的な経路を提供するが、集約性能の改善は、より小さなモデルが実際に何を引き継ぐのかを明らかにしない。
既存の研究の大部分は、限られたタスクセットや集約されたメトリクスに基づいて設計され、評価されている。
そこで本研究では,異種核融合時のクロススケールな知識伝達を解析するための簡単な線形プローブであるクロススケール指向パラメーター注入(CDPI)を提案する。
局所的理論解析により,知識伝達選択性は共有射出方向に対する能力依存応答によって一階に決定され,二階曲率効果は効果的な伝達機構を制約することが示された。
4つのQwen3-VLモデルペアと12のマルチモーダルベンチマークで、我々の実験は、一貫した選択性のパターンを明らかにした。
さらに,高次推論の利得は言語モデルによってもたらされるが,比例分析の結果,正の選択的移動は小比のレギュレーションが主であることがわかった。
これらの結果から,広汎な機能継承ではなく,狭義の低干渉状態下での言語側推論として,多種多種性MLLM融合が再検討された。
関連論文リスト
- AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution [61.593935260052795]
Supervised Fine-Tuning (SFT) とReinforcement Learning (RL) による後学習は多モーダル大規模言語モデル(MLLM)における推論の強化に不可欠である
既存のパラダイムは、静的データの制限により、しばしばパフォーマンスのボトルネックに達する。
我々は,真理に順応したデータキュレーションとモデル進化を統合する新しいパラダイムであるアンカー進化(AnE)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:26:34Z) - ES-Merging: Biological MLLM Merging via Embedding Space Signals [52.84455878597969]
埋め込み空間信号からマージ係数を推定する表現対応マージフレームワークを提案する。
提案手法は既存のマージ手法よりも優れており,タスク固有の微調整モデルを超えている。
論文 参考訳(メタデータ) (2026-03-15T14:38:32Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units [34.05875226612676]
本稿では,MDA(Mechanistic Data Attribution)について紹介する。これは,インフルエンス関数を用いて,解釈可能なユニットを特定のトレーニングサンプルにトレースする,スケーラブルなフレームワークである。
本研究は,少数の高影響サンプルを除去または増強する目的の介入が,解釈可能な頭部の出現を顕著に調節することを検証する。
論文 参考訳(メタデータ) (2026-01-29T17:06:54Z) - FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models [20.47311573790516]
FRISM(Fine-fine Reasoning Injection via Subspace-level Model Merging)を提案する。
実験により、FRISMはモデルの本来の視覚能力を損なうことなく推論能力を効果的に改善することが示された。
論文 参考訳(メタデータ) (2026-01-29T02:36:19Z) - Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective [60.45433515408158]
長いチェーン・オブ・ソート(CoT)がトップオプションの決定的決定要因となるが、あいまいなタスクの粒度分布キャリブレータとして機能しないことを示す。
CoTは分布アライメントを改善するが、CoTの内容によって最終的な精度が決定される。
論文 参考訳(メタデータ) (2026-01-06T16:26:40Z) - R^2-HGP: A Double-Regularized Gaussian Process for Heterogeneous Transfer Learning [15.278249213859844]
多出力ガウス過程(MGP)モデルは、その柔軟性と不確実性量子化能力に大きな注目を集めている。
マルチソース・トランスファー・ラーニングのシナリオでは、タスク間の相関を捉える能力から広く採用されている。
本稿では、転送学習におけるいくつかの課題を克服するために、二重規則化ヘテロジニアスガウスプロセスフレームワーク(R2-HGP)を提案する。
論文 参考訳(メタデータ) (2025-12-11T03:38:20Z) - Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling [82.52485740425321]
アドリアックは、ディープニューラルネットワークの堅牢性にとって重要な課題である。
敵攻撃の伝達性は、爆発(最大攻撃能力)と探索(クロスモデル一般化の促進)のジレンマに直面している
論文 参考訳(メタデータ) (2025-11-01T05:43:47Z) - Transfer Learning for Benign Overfitting in High-Dimensional Linear Regression [7.414126402359073]
高次元線形回帰における移動学習と最小$$-norm補間器(MNI)の交叉について検討する。
我々の研究は、新しい2段階のトランスファーMNIアプローチを提案し、そのトレードオフを分析することでギャップを埋める。
論文 参考訳(メタデータ) (2025-10-17T05:58:16Z) - Directional Reasoning Injection for Fine-Tuning MLLMs [51.53222423215055]
マルチモーダルな大言語モデル(MLLM)は急速に進歩しているが、その推論能力は強いテキストのみのモデルよりも遅れていることが多い。
このギャップを埋める既存の方法は、大規模マルチモーダル推論データや強化学習の監督された微調整に依存している。
この問題を解決するために,DRIFT(Directional Reasoning Injection for Fine-Tuning)を提案する。
論文 参考訳(メタデータ) (2025-10-16T18:06:46Z) - CTRLS: Chain-of-Thought Reasoning via Latent State-Transition [57.51370433303236]
チェーン・オブ・シント(CoT)推論は、大規模な言語モデルで複雑な問題を解釈可能な中間ステップに分解することを可能にする。
我々は,遅延状態遷移を伴うマルコフ決定プロセス(MDP)としてCoT推論を定式化するフレームワークであるgroundingSを紹介する。
我々は、ベンチマーク推論タスクにおける推論精度、多様性、探索効率の改善を示す。
論文 参考訳(メタデータ) (2025-07-10T21:32:18Z) - Why Does Little Robustness Help? A Further Step Towards Understanding Adversarial Transferability [23.369773251447636]
DNNの逆例(AE)は転送可能であることが示されている。
本稿では,敵対的伝達可能性の理解に向けてさらなる一歩を踏み出す。
論文 参考訳(メタデータ) (2023-07-15T19:20:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。