論文の概要: MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.09029v1
- Date: Fri, 10 Jul 2026 01:31:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.763621
- Title: MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models
- Title(参考訳): MOSAIC:高能率不均一ビジョンランゲージモデルのための適応層間合成
- Abstract要約: VLM(Vision-Language Models)は、マルチメディアデータを処理する均質トランスフォーマーを用いて成功している。
近年の研究では、線形注意のような効率的なメカニズムを介する異種構造が、均一な設計よりも性能と推論の遅延を改善することが示されている。
適応層間合成のための多目的探索法 (MOSAIC) を提案する。
- 参考スコア(独自算出の注目度): 14.859177902733437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) have achieved success using homogeneous Transformers to process multimedia data. Recent studies show that heterogeneous structures interleaving efficient mechanisms, like linear attention, improve both performance and inference latency over homogeneous designs. However, these efforts rely on handcrafted static mixing patterns, which are sub-optimal and difficult to adapt to specific hardware. To bridge this gap, we propose Multi-Objective Search for Adaptive Inter-layer Composition (MOSAIC), a hardware-aware search method that automatically transforms homogeneous models into optimized heterogeneous architectures. MOSAIC integrates diverse efficiency mechanisms--including linear, sparse, and low-rank operators--into a unified search space. By formulating the selection as a multi-objective Mixed Integer Programming (MIP) problem, our method identifies optimal configurations that maximize downstream performance under strict hardware latency constraints. To mitigate performance degradation from structural transitions, we introduce a two-stage parameter recovery process: global off-policy distillation to stabilize internal representations, followed by a dual-teacher on-policy distillation leveraging a 235B oracle for knowledge expansion and the original 4B teacher for distributional stability. We validate MOSAIC through MOSAIC-4B, derived from Qwen3-VL-4B-Instruct. Results demonstrate that MOSAIC-4B matches the baseline's performance across multiple benchmarks while requiring less than 2% of the original training cost. Furthermore, it substantially improves inference efficiency, achieving 1.76x prefilling and 2.54x decoding speedups.
- Abstract(参考訳): VLM(Vision-Language Models)は、マルチメディアデータを処理する均質トランスフォーマーを用いて成功している。
近年の研究では、線形注意のような効率的なメカニズムを介する異種構造が、均一な設計よりも性能と推論の遅延を改善することが示されている。
しかし、これらの取り組みは手作りの静的な混合パターンに依存しており、それは準最適であり、特定のハードウェアに適応することが困難である。
このギャップを埋めるために、同種モデルを最適化した異種アーキテクチャに自動変換するハードウェア対応検索手法であるMOSAIC(Multi-Objective Search for Adaptive Inter-layer Composing)を提案する。
MOSAICは、線形、スパース、低ランク演算子を含む様々な効率メカニズムを統合検索空間に統合する。
MIP(Mixed Integer Programming)問題として選択を定式化することにより,厳密なハードウェア遅延制約の下で下流性能を最大化する最適構成を同定する。
構造遷移による性能劣化を軽減するため, 内部表現を安定させるグローバルオフポリケート蒸留法と, 知識拡張のための235Bオラクルと, 分散安定のためのオリジナル4B教師を用いた2段階オンポリケート蒸留法を導入する。
我々は,Qwen3-VL-4B-インストラクトから得られたMOSAIC-4Bを用いてMOSAICを検証する。
その結果,MOSAIC-4Bはトレーニングコストの2%未満を必要としながら,複数のベンチマークでベースラインのパフォーマンスと一致していることがわかった。
さらに、推論効率を大幅に改善し、1.76xプリフィルと2.54xデコードスピードアップを達成した。
関連論文リスト
- AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba [56.52470564147458]
マルチモーダル融合と感情分析のための効率的かつ効率的なフレームワークである textbfAlignMamba-2 を提案する。
提案手法では, 最適輸送距離と最大平均離散度の両方を用いてモデルを正規化する2つのアライメント戦略を導入する。
さらに重要なことは、モダリティに特有かつモダリティに偏ったエキスパートによるMixture-of-Expertsアーキテクチャを採用したModality-Aware Mamba層を設計することです。
論文 参考訳(メタデータ) (2026-03-19T03:47:21Z) - DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection [52.32976488996896]
我々はDualGazeNetを紹介した。DualGazeNetは、純粋なトランスフォーマーフレームワークで、有能なオブジェクト検出を行う。
5つのRGBベンチマークの実験によると、DualGazeNetは25の最先端CNNとTransformerベースのメソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-24T08:08:22Z) - MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder Pruning [91.90342432541138]
モデルサイズとトレーニングデータのスケールアップには、インスタンスレベルの知覚のための高度な基盤モデルがある。
資源制約されたプラットフォームにおける高い計算コスト制限。
我々は,高性能コンピューティングプラットフォームとモバイルデバイスの両方において,効率的なセグメンテーションのための新しいベンチマークを導入する。
論文 参考訳(メタデータ) (2025-10-16T18:00:00Z) - OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation [91.45421429922506]
OneCATは、理解、生成、編集をシームレスに統合する統合マルチモーダルモデルである。
我々のフレームワークは、推論中に視覚変換器(ViT)や視覚トークン化器などの外部コンポーネントを不要にする。
論文 参考訳(メタデータ) (2025-09-03T17:29:50Z) - LLM4CMO: Large Language Model-aided Algorithm Design for Constrained Multiobjective Optimization [54.35609820607923]
大規模言語モデル(LLM)は、アルゴリズム設計を支援する新しい機会を提供する。
LLM4CMOは,2つの人口構成をもつ2段階のフレームワークをベースとした新しいCMOEAである。
LLMは複雑な進化最適化アルゴリズムの開発において効率的な共同設計者として機能する。
論文 参考訳(メタデータ) (2025-08-16T02:00:57Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - HiLAB: A Hybrid Inverse-Design Framework [0.0]
HiLABはナノフォトニック構造の逆設計のための新しいパラダイムである。
シミュレーションコストを削減した多様なフリーフォーム構成を生成することで、多機能デバイス設計に対処する。
論文 参考訳(メタデータ) (2025-05-23T05:34:56Z) - HeteroTune: Efficient Federated Learning for Large Heterogeneous Models [35.53420882449293]
HeteroTuneは,限られた通信と予算の下で動作する大規模異種モデルのための,新しいファインチューニングパラダイムである。
我々の手法のコアは、異種モデルの柔軟かつ効率的な集約を可能にする新しいアーキテクチャであるDeMAにある。
We provide the theory analysis and empirical evidence shows that HeteroTune achieves state-of-the-art performance and efficiency across various task and model architectures。
論文 参考訳(メタデータ) (2024-11-25T09:58:51Z) - BiT-MamSleep: Bidirectional Temporal Mamba for EEG Sleep Staging [9.917709200378217]
BiT-MamSleepは,Triple-Resolution CNN(TRCNN)を統合し,効率的なマルチスケール特徴抽出を行う新しいアーキテクチャである。
BiT-MamSleepにはAdaptive Feature Recalibration (AFR)モジュールと時間拡張ブロックが組み込まれている。
4つの公開データセットの実験は、BiT-MamSleepが最先端の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2024-11-03T14:49:11Z) - Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation [15.35494431928751]
トランスフォーマーベースの大規模言語モデル(LLM)は、生成タスクにおいて顕著なパフォーマンスを示すと同時に、現実のサービスにおいて大きな課題をもたらす。
LLMデコーディングの効率を高めるために,モデルアテンションデアグリゲーションを導入する。
分散ヘテロジニアスクラスタにモデルアテンションデアグリゲーションを組み込んだLLM推論システムであるLaminaを開発し,展開する。
論文 参考訳(メタデータ) (2024-05-03T02:15:15Z) - Pruning Self-attentions into Convolutional Layers in Single Path [89.55361659622305]
ビジョントランスフォーマー(ViT)は、様々なコンピュータビジョンタスクに対して印象的なパフォーマンスを実現している。
トレーニング済みのViTを効率よく自動圧縮するSPViT(Single-Path Vision Transformer pruning)を提案する。
われわれのSPViTはDeiT-Bで52.0%のFLOPをトリミングできる。
論文 参考訳(メタデータ) (2021-11-23T11:35:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。