論文の概要: Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution
- arxiv url: http://arxiv.org/abs/2605.10470v1
- Date: Mon, 11 May 2026 12:34:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.809753
- Title: Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution
- Title(参考訳): 適応的文脈問題:超解法のための確率的マルチモーダリティガイダンスを目指して
- Authors: Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu,
- Abstract要約: 超解像は本質的に曖昧な問題である。
近年のセマンティックガイダンスおよびマルチモーダルSR手法は, セマンティックアライメントを強化するために, 大規模モデルや外部プリエントを利用する。
本稿では,マルチモーダルSRの理論的モデリングを行い,従来の手法が準最適モダリティ利用によってボトルネックとなることを示した。
- 参考スコア(独自算出の注目度): 15.44096429823272
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Super-resolution (SR) is a severely ill-posed problem with inherent ambiguity, as widely recognized in both empirical and theoretical studies. Although recent semantic-guided and multi-modal SR methods exploit large models or external priors to enhance semantic alignment, the fusion of heterogeneous modalities remains insufficiently understood in practice and theory. In this work, we provide the first theoretical modeling of multi-modal SR, revealing that prior methods are bottlenecked by sub-optimal modality utilization. Our analysis shows that the generalization risk bound can be improved by strengthening the alignment between modality weights and their effective contributions, while reducing representation complexity. This theoretical insight inspires us to propose the novel Multi-Modal Mixture-of-Experts Super-Resolution framework (M$^3$ESR) that employs generalization-oriented dynamic modality fusion for accurate risk control and modality contribution optimization. In detail, we propose a novel spatially dynamic modality weighting module and a temporally adaptive modality temperature scheduling mechanism, enabling flexible and adaptive spatial-temporal modality weighting for effective risk control. Extensive experiments demonstrate that our M$^3$ESR significantly boosts generalization and semantic consistency performances, which confirms our superiority.
- Abstract(参考訳): 超解像 (SR) は本質的に曖昧な問題であり、経験的および理論的研究の両方で広く認識されている。
近年のセマンティックガイダンスおよびマルチモーダルSR法は、意味的アライメントを高めるために大きなモデルまたは外部の先行モデルを利用するが、不均一なモダリティの融合は、実際と理論において不十分に理解されている。
本研究では,マルチモーダルSRの理論的モデリングを行い,従来の手法が準最適モダリティ利用によってボトルネックとなることを示した。
本分析は,モダリティ重みのアライメントを強化し,表現複雑性を低減し,一般化リスクバウンドを改善することができることを示す。
この理論的な洞察は、リスク管理とモダリティ貢献の正確な最適化のために一般化指向の動的モダリティ融合を利用する新しいマルチモーダル混合型超解法フレームワーク(M$^3$ESR)を提案するきっかけとなった。
本稿では, 空間的動的モータリティ重み付けモジュールと時間的適応型モータリティ温度スケジューリング機構を提案し, 有効リスク制御のためのフレキシブルかつ適応型時空間モータリティ重み付けを実現する。
我々のM$^3$ESRは一般化とセマンティック一貫性を著しく向上させ,その優位性を確認した。
関連論文リスト
- LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models [6.350443894942629]
MWAM(Multimodal Weight Allocation Module)は、トレーニング中の各ブランチのコントリビューションを動的に再バランスするプラグイン・アンド・プレイコンポーネントである。
MWAMは幅広いタスクとモダリティの組み合わせで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-02-26T05:51:41Z) - ReLaX: Reasoning with Latent Exploration for Large Reasoning Models [11.506415241741601]
我々は、トークン生成の根底にある潜在力学が、ステアリングポリシー最適化のためのよりリッチな計算構造を符号化していると論じる。
ReLaX(Reasoning with Latent eXploration)を提案する。
論文 参考訳(メタデータ) (2025-12-08T13:48:33Z) - An Integrated Fusion Framework for Ensemble Learning Leveraging Gradient Boosting and Fuzzy Rule-Based Models [59.13182819190547]
ファジィ規則に基づくモデルは解釈可能性に優れ、様々な分野に広く応用されている。
複雑な設計仕様や大規模データセットのスケーラビリティといった課題に直面している。
本稿では,モデル性能と解釈可能性を高めるために,両パラダイムの強みを融合した統合統合フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-11T10:28:23Z) - Hypercomplex Prompt-aware Multimodal Recommendation [6.862998546677475]
提案するHPMRecは,ハイパーコンプレックスなマルチモーダルレコメンデーションフレームワークである。
我々は,HPMRecが4つの公開データセットの実験において,最先端のレコメンデーション性能を達成することを示す。
論文 参考訳(メタデータ) (2025-08-14T15:36:00Z) - Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models [0.0]
モーダリティ・アウェア・アダプティブ・フュージョン・スケジューリング(MA-AFS)は、各モーダリティの寄与をインスタンス単位で動的に調節することを学ぶ。
本研究は, 適応融合の重要性を強調し, 信頼性と不確実性を考慮したマルチモーダル学習に向けた有望な方向性を開く。
論文 参考訳(メタデータ) (2025-06-15T05:57:45Z) - Latent Diffusion Model Based Denoising Receiver for 6G Semantic Communication: From Stochastic Differential Theory to Application [11.385703484113552]
生成人工知能(GAI)を利用した新しい意味コミュニケーションフレームワークを提案する。
意味的特徴抽出のための変分オートエンコーダを組み合わせた潜在拡散モデル(LDM)に基づくセマンティックコミュニケーションフレームワークを提案する。
提案システムはゼロショットの一般化をサポートし,低SNRおよびアウト・オブ・ディストリビューション条件下での優れた性能を実現する訓練自由フレームワークである。
論文 参考訳(メタデータ) (2025-06-06T03:20:32Z) - Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement [13.424541949553964]
そこで本研究では,微調整を適応的に優先順位付けしてバランスを保ち,融合を促進させるシェープリー誘導型交互訓練フレームワークを提案する。
我々は4つのマルチモーダル・ベンチマーク・データセットのバランスと精度の両面での性能評価を行い,その手法がSOTA(State-of-the-art)の結果を達成した。
論文 参考訳(メタデータ) (2025-05-26T02:02:57Z) - Asymmetric Reinforcing against Multi-modal Representation Bias [59.685072206359855]
マルチモーダル表現バイアス(ARM)に対する非対称強化法を提案する。
我々のARMは、条件付き相互情報を通じて支配的なモダリティを表現する能力を維持しながら、弱いモダリティを動的に強化する。
我々はマルチモーダル学習の性能を著しく改善し、不均衡なマルチモーダル学習の軽減に顕著な進展をもたらした。
論文 参考訳(メタデータ) (2025-01-02T13:00:06Z) - On-the-fly Modulation for Balanced Multimodal Learning [53.616094855778954]
マルチモーダル学習は、異なるモーダルからの情報を統合することでモデル性能を向上させることが期待されている。
広く使われている共同トレーニング戦略は、不均衡で最適化されていないユニモーダル表現につながる。
そこで本研究では,OGM(On-the-fly Prediction Modulation)とOGM(On-the-fly Gradient Modulation)の戦略を提案する。
論文 参考訳(メタデータ) (2024-10-15T13:15:50Z) - Trustworthy Multimodal Regression with Mixture of Normal-inverse Gamma
Distributions [91.63716984911278]
このアルゴリズムは、異なるモードの適応的統合の原理における不確かさを効率的に推定し、信頼できる回帰結果を生成する。
実世界のデータと実世界のデータの両方に対する実験結果から,多モード回帰タスクにおける本手法の有効性と信頼性が示された。
論文 参考訳(メタデータ) (2021-11-11T14:28:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。