論文の概要: Balancing Multimodal Learning via Functional Progress
- arxiv url: http://arxiv.org/abs/2610.03035v1
- Date: Fri, 02 Oct 2026 09:17:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.297413
- Title: Balancing Multimodal Learning via Functional Progress
- Title(参考訳): 機能的進歩によるマルチモーダル学習のバランシング
- Abstract要約: マルチモーダル学習はしばしばモダリティの不均衡に悩まされ、共同最適化プロセスは単一のモダリティによって支配される。
既存の手法では、予測の不確実性や最適化統計から得られるスコアの不均衡からモダリティの不均衡を推定するのが一般的である。
本稿では,FGMO(Function-Space Guided Multimodal Optimization)を提案する。
- 参考スコア(独自算出の注目度): 9.114916684400425
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal learning often suffers from modality imbalance, where the joint optimization process is dominated by a single modality. Existing methods typically estimate modality imbalance from score disparities derived from prediction uncertainty or optimization statistics. However, due to distinct prediction uncertainty and learning dynamics across modalities, direct comparison of such scores may misinterpret intrinsic modality differences as progress gaps, leading to biased imbalance estimation. In this paper, we propose Function-Space Guided Multimodal Optimization (FGMO), which leverages a function-space progress signal to assess modality-wise optimization progress and coordinate optimization across modalities to alleviate modality imbalance. Specifically, we introduce Functional Progress Estimation (FPE) to measure each modality's update-induced function-space response and calibrate it against a loss-aligned unimodal reference, producing a comparable progress signal. Based on this signal, Functional Response Control (FRC) redistributes modality-level function-space budgets and realizes the target responses through tensor-wise learning-rate adjustment. Theoretical analysis establishes a one-step target-contraction property of FRC under bounded controller-state mismatch, and extensive experiments demonstrate the effectiveness of FGMO across multiple multimodal benchmarks.
- Abstract(参考訳): マルチモーダル学習はしばしばモダリティの不均衡に悩まされ、共同最適化プロセスは単一のモダリティによって支配される。
既存の手法では、予測の不確実性や最適化統計から得られるスコアの不均衡からモダリティの不均衡を推定するのが一般的である。
しかし、異なる予測の不確実性と学習力学により、これらのスコアの直接比較は、内在的モダリティ差を進行ギャップとして誤解し、偏りのない不均衡推定をもたらす可能性がある。
本稿では,FGMO(Function-Space Guided Multimodal Optimization, FGMO)を提案する。
具体的には,FPE(Functional Progress Estimation)を導入し,各モードの更新により引き起こされる関数空間の応答を計測し,損失に整合したユニモーダル参照に対してキャリブレーションし,同等のプログレッシブ信号を生成する。
この信号に基づいて、関数応答制御(FRC)は、モダリティレベルの関数空間予算を再分割し、テンソルワイズ学習率調整によりターゲット応答を実現する。
理論的解析により、有界制御状態のミスマッチ下でのFRCの1ステップ目標抽出特性が確立され、FGMOが複数のマルチモーダルベンチマークで有効であることを示す広範な実験が行われた。
関連論文リスト
- IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning [57.16513298507272]
IADD-TRは、IADD(Intervention-Aware Dynamics Decoupling)とTR(Targeted Regularization)を組み合わせた統合フレームワークである。
IADDは、ゼロアクションアンカーを用いて、アクション干渉段階とアクションフリー自然進化段階への遷移を分解し、堅牢な一般化のためにこの2段階の分解の非特異性を解決する。
政策学習においては,リプレイ状態の政策段階関数の効率的な影響関数からTRを導出する。
論文 参考訳(メタデータ) (2026-08-11T08:20:02Z) - Using Non-Lipschitz Signum-based Functions for Distributed Optimization and Machine Learning: Trade-off Between Con-vergence Rate and Optimality Gap [9.045698110081686]
非Lipschitz連続最適化アルゴリズムは、既存の線形解の緩やかな収束率を改善するために提案されている。
分散回帰問題を解析し、線形および非リプシッツ符号に基づく関数を適用して収束率をチェックする。
以上の結果から,シグナムをベースとした菌根反応はより高速に収束するが,高い最適性ギャップが生じる可能性が示唆された。
論文 参考訳(メタデータ) (2026-08-02T13:06:12Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training [64.0932926819307]
本稿では,学習速度減衰とモデルマージの正式な関係を確立するフレームワークであるWarmup-Stable and Merge(WSM)を紹介する。
WSMは様々な崩壊戦略をエミュレートするための統一された理論基盤を提供する。
私たちのフレームワークは、複数のベンチマークで広く採用されているWarmup-Stable-Decay(WSD)アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-07-23T16:02:06Z) - Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement [13.424541949553964]
そこで本研究では,微調整を適応的に優先順位付けしてバランスを保ち,融合を促進させるシェープリー誘導型交互訓練フレームワークを提案する。
我々は4つのマルチモーダル・ベンチマーク・データセットのバランスと精度の両面での性能評価を行い,その手法がSOTA(State-of-the-art)の結果を達成した。
論文 参考訳(メタデータ) (2025-05-26T02:02:57Z) - Learning Dynamic Representations via An Optimally-Weighted Maximum Mean Discrepancy Optimization Framework for Continual Learning [16.10753846850319]
継続的な学習は、モデルを永続的に取得し、保持することを可能にする。
悲惨な忘れ物は モデルパフォーマンスを著しく損なう
本稿では,表現変更に対する罰則を課す,OPMMD(Optimally-Weighted Mean Discrepancy)と呼ばれる新しいフレームワークを紹介する。
論文 参考訳(メタデータ) (2025-01-21T13:33:45Z) - On-the-fly Modulation for Balanced Multimodal Learning [53.616094855778954]
マルチモーダル学習は、異なるモーダルからの情報を統合することでモデル性能を向上させることが期待されている。
広く使われている共同トレーニング戦略は、不均衡で最適化されていないユニモーダル表現につながる。
そこで本研究では,OGM(On-the-fly Prediction Modulation)とOGM(On-the-fly Gradient Modulation)の戦略を提案する。
論文 参考訳(メタデータ) (2024-10-15T13:15:50Z) - Trustworthy Multimodal Regression with Mixture of Normal-inverse Gamma
Distributions [91.63716984911278]
このアルゴリズムは、異なるモードの適応的統合の原理における不確かさを効率的に推定し、信頼できる回帰結果を生成する。
実世界のデータと実世界のデータの両方に対する実験結果から,多モード回帰タスクにおける本手法の有効性と信頼性が示された。
論文 参考訳(メタデータ) (2021-11-11T14:28:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。