論文の概要: Contribution-Aware Bandwidth Allocation for Multimodal Split Learning
- arxiv url: http://arxiv.org/abs/2609.01406v1
- Date: Tue, 01 Sep 2026 15:28:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.799637
- Title: Contribution-Aware Bandwidth Allocation for Multimodal Split Learning
- Title(参考訳): マルチモーダルスプリット学習のためのコントリビューション対応帯域幅割当
- Authors: Iason Ofeidis, Leandros Tassiulas,
- Abstract要約: Split Learningは、デバイス上の最初のレイヤのみを保持することで、マルチモーダルトレーニングを実現する。
ModalShareは、サーバがすでに受け取ったアクティベーションの連立を計算しているShapleyコントリビューションスコアから、各モダリティの維持比率を設定する。
このスコアを測定することで、アップリンクトラフィックやクライアント側の計算が不要になり、どのストリームがどのストリームであるかを事前に知る必要がなくなる。
- 参考スコア(独自算出の注目度): 7.440677492469226
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal models are increasingly the default option for perception at the network edge, yet they are trained almost entirely in the datacenter, because a client holding several sensor streams cannot host an encoder per modality. Split Learning makes such training feasible by keeping only the first layers on the device, at the cost of an uplink that must carry smashed activations for every modality at every step. Existing compression schemes give each modality the same keep-ratio, so the shared budget is divided in proportion to smashed-activation dimension, a quantity unrelated to how much each modality contributes to the fused prediction. We make that division an explicit decision and call it inter-modality allocation: under a fixed uplink budget, every policy transmits the same expected payload and differs only in how that payload is split across modalities. Our allocator, ModalShare, sets each modality's keep-ratio from a Shapley contribution score that the server computes over coalitions of activations it has already received. Measuring this score adds no uplink traffic and no client-side computation, and needs no prior knowledge of which stream is which. ModalShare improves accuracy over equal keep-ratios by 15.4 and 12.4 percentage points on CREMA-D and MVSA at matched payload in 5x compression, with strong performance across three compressors, three datasets, and four budgets. We show that existing compressors underperform in multimodal settings, with ModalShare recovering what gains are left behind.
- Abstract(参考訳): マルチモーダルモデルは、ネットワークエッジでの認識において、ますますデフォルトの選択肢となっているが、複数のセンサストリームを保持するクライアントが、モダリティ毎にエンコーダをホストできないため、ほぼ完全にデータセンタ内でトレーニングされている。
分割学習(Split Learning)は、デバイス上の最初のレイヤのみを、すべてのステップにおいて、すべてのモードでスマッシュなアクティベーションを担わなければならないアップリンクのコストで維持することで、そのようなトレーニングを実現する。
既存の圧縮スキームは各モダリティに同じ保留比を与えるため、共有予算は、それぞれのモダリティが融合予測にどの程度寄与するかに関係のない、スマッシュ・アクティベーション次元に比例して分割される。
固定されたアップリンク予算の下で、すべてのポリシーは同じ期待されるペイロードを送信し、そのペイロードをモダリティに分割する方法でのみ異なる。
私たちのアロケータであるModalShareは、サーバがすでに受け取ったアクティベーションの連立を計算しているShapleyのコントリビューションスコアから、各モダリティの維持比率を設定しています。
このスコアを測定することで、アップリンクトラフィックやクライアント側の計算が不要になり、どのストリームがどのストリームであるかを事前に知る必要がなくなる。
ModalShare は5倍圧縮で CREMA-D と MVSA で 15.4 と 12.4 の精度を向上し、3 つの圧縮機、3 つのデータセット、4 つの予算で高い性能を持つ。
既存の圧縮機はマルチモーダル環境では性能が悪く、ModalShareは残されている利得を回復する。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems [0.0]
タスク条件付きネットユーティリティ$U(Cmid x)=V(Cmid x)-sum_iin Cc_i$との協調ゲームとしてエージェントの選択と通信をモデル化する。
本稿では,限界値のアクティベーションルールとgreedyルータを提案し,そのモデルを拡張してエッジ毎のコストで通信エッジを最適化し,推定したShapley値を用いて,実行前後にどのエージェントが接触する価値があるかを推定する。
論文 参考訳(メタデータ) (2026-07-24T19:25:21Z) - TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation [0.0]
TriRouteは3つの軸で共有される単一の軽量コントローラである。
不均一な緩和により終端から終端までを運転する。
フルアテンションと高精度キャッシュを文初期位置、まれなサブワード、名前付きエンティティに割り当てる。
論文 参考訳(メタデータ) (2026-07-07T00:12:46Z) - Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers [2.604903535691346]
視覚変換器は強い画像分類精度を達成するが、ほぼ同じ計算で全ての画像領域を処理する。
近年の適応推論法では、トークンを選択的に圧縮したり、早期に推論を終了することで、このコストを削減している。
トークンマージ、早期終了、トークンプルーニングをコーディネートする統合適応型推論フレームワークであるFusionを導入する。
論文 参考訳(メタデータ) (2026-07-01T15:51:25Z) - Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization [58.14514930760722]
参加者が協力して大規模なニューラルネットワークを訓練し、提供する分散セットアップを検討する。
このセットアップでは、フルウェイトセットがどの参加者にも利用できないような、非機械的なウェイトの可能性を探る。
我々は、シャードモデルセットアップを利用するトレーニングおよび推論フレームワーク、Unextractable Protocol Models (UPMs)を紹介する。
論文 参考訳(メタデータ) (2026-05-22T10:24:57Z) - OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models [49.34557936004057]
本稿では,マルチモーダル入力に対する適切な圧縮戦略を動的に選択する,トレーニングフリーなモダリティ適応型トークンプルーニングフレームワークを提案する。
本手法は, 訓練を必要とせず, 高い性能を維持しつつ, 効率的なマルチモーダルトークン削減を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:33:52Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - JigsawComm: Joint Semantic Feature Encoding and Transmission for Communication-Efficient Cooperative Perception [7.867653563872962]
JigsawCommはエンドツーエンドのトレーニング、セマンティックアウェア、通信効率の良いCPフレームワークである。
正規化エンコーダを使用して、意味的関連性とスパースな特徴を抽出する。
軽量のFeature Utility Estimatorを使用して、各エージェントの機能を最終認識タスクへのコントリビューションを予測する。
論文 参考訳(メタデータ) (2025-11-21T23:36:24Z) - Amplifying Prominent Representations in Multimodal Learning via Variational Dirichlet Process [55.91649771370862]
ディリクレ過程(DP)混合モデルは、最も顕著な特徴を増幅できる強力な非パラメトリック法である。
本稿では,DP駆動型マルチモーダル学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-23T16:53:24Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。