論文の概要: Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning
- arxiv url: http://arxiv.org/abs/2604.16657v1
- Date: Fri, 17 Apr 2026 19:23:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.120434
- Title: Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning
- Title(参考訳): 不確実性を考慮したマルチモーダル学習のためのクロスモーダルベイズ低ランク適応
- Authors: Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin,
- Abstract要約: CALIBERは音声テキスト学習のための多モード不確実性対応PEFTフレームワークである。
テキスト由来の低ランク機能は、局所的な音響コンテキストを生成するためにフレームレベルのオーディオ埋め込みに付随する。
その結果、CALIBERはテキストのみのベイズPEFTと従来のマルチモーダル・トランスファー学習ベースラインで一貫して一致または改善することがわかった。
- 参考スコア(独自算出の注目度): 1.1242490155213278
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large pre-trained language models are increasingly adapted to downstream tasks using parameter-efficient fine-tuning (PEFT), but existing PEFT methods are typically deterministic and unimodal, making them poorly suited for low-resource multimodal settings where predictive uncertainty and cross-modal reliability both matter. We introduce CALIBER (Context-Aware Low-rank Inference with Bayesian Embedding Regularization), a multimodal uncertainty-aware PEFT framework for audio-text learning. CALIBER extends Bayesian low-rank adaptation by conditioning the variational posterior in the adapter space on per-layer, token-level text-audio cross-attention. Specifically, text-derived low-rank features attend to frame-level audio embeddings to produce localized acoustic context, which then modulates the mean and variance of a compact stochastic latent matrix within the rank-$r$ adapter space. This design treats audio not only as an additional feature source, but as a contextual reliability signal that shapes both adaptation and confidence. By confining stochasticity to a low-dimensional latent component, CALIBER retains the computational efficiency and scalability of PEFT while enabling heteroscedastic multimodal uncertainty estimation. Experimental results across diverse text and audio backbones show that CALIBER consistently matches or improves upon text-only Bayesian PEFT and conventional multimodal transfer-learning baselines, with token-level cross-attention yielding the most consistent gains. Our findings demonstrate that localized cross-modal conditioning is an effective and lightweight mechanism for uncertainty-aware multimodal adaptation.
- Abstract(参考訳): 大規模な事前学習言語モデルは、パラメータ効率の微調整(PEFT)を用いて下流タスクに適応する傾向にあるが、既存のPEFT手法は決定論的かつ非モーダルであり、予測的不確実性とクロスモーダル信頼性の両方が問題となる低リソースマルチモーダル設定には適さない。
音声テキスト学習のための多モード不確実性を考慮したPEFTフレームワークであるCALIBER(Context-Aware Low-rank Inference with Bayesian Embedding Regularization)を紹介する。
CALIBERは、層ごとのトークンレベルのテキスト・オーディオ・クロスアテンションにアダプタ空間の変分後部を条件にすることで、ベイジアン低ランク適応を拡張している。
具体的には、テキスト由来の低ランク機能は、フレームレベルのオーディオ埋め込みに付随し、局所的な音響コンテキストを生成し、その後、ランク-r$アダプタ空間内のコンパクト確率潜在行列の平均と分散を変調する。
この設計は、音声を付加的な特徴源としてだけでなく、適応性と信頼性の両方を形作る文脈的信頼性信号として扱う。
低次元の潜在成分に確率性を収束させることにより、CALIBERはPEFTの計算効率とスケーラビリティを保ちながら、不均一なマルチモーダル不確実性推定を可能にする。
多様なテキストや音声のバックボーンにまたがる実験結果から、CALIBERはテキストのみのベイジアンPEFTや従来のマルチモーダル・トランスファーラーニングベースラインと一貫して一致または改善し、トークンレベルのクロスアテンションは最も一貫した利得をもたらすことが示された。
本研究は,局所型クロスモーダルコンディショニングが,不確実性を考慮したマルチモーダル適応の有効かつ軽量なメカニズムであることを示す。
関連論文リスト
- Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation [1.1242490155213278]
音声コンテキストを伴うテキスト予測タスクに対して,マルチモーダルかつ不確実性を考慮したパラメータ効率の高い微調整手法であるCoCo-LoRAを導入する。
その結果,音声を融合した特徴ストリームとしてではなく,文脈の不確実性信号として用いることで,低リソース予測のための頑健でパラメータ効率のよい代替手段が提供されることがわかった。
論文 参考訳(メタデータ) (2026-04-17T18:12:33Z) - Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume [45.38219855706969]
マルチモーダル大規模言語モデル(MLLM)のためのトレーニング不要不確実性定量化フレームワークUMPIREを紹介する。
UMPIREは、与えられたタスクインスタンスに対するサンプルMLLM応答の不整合調整セマンティックボリュームを計算する。
UMPIREは、画像、音声、ビデオテキストのベンチマークにおいて、エラー検出と不確実性校正において、基準値よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-02-27T17:18:42Z) - Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification [55.56234913868664]
マルチモーダルデータを用いた信頼性学習のためのTAHCD(Test-time Adaptive Hierarchical Co-enhanced Denoising Network)を提案する。
提案手法は,最先端の信頼性の高いマルチモーダル学習手法と比較して,優れた分類性能,堅牢性,一般化を実現する。
論文 参考訳(メタデータ) (2026-01-12T03:14:12Z) - FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs [20.08099668437471]
マルチモーダル大言語モデル(MLLM)の生成した予測は、選択的な予測を可能にし、ユーザの信頼性を向上させることができる。
MLLMのマルチモーダル入力サンプリング技術であるFESTA(Functional Equivalent Smpling for Trust Assessment)を提案する。
FESTAは等価かつ相補的な入力サンプリングに基づいて不確実性尺度を生成する。
論文 参考訳(メタデータ) (2025-09-20T11:50:22Z) - AVadCLIP: Audio-Visual Collaboration for Robust Video Anomaly Detection [57.649223695021114]
本稿では,ロバストなビデオ異常検出に音声と視覚の協調を利用する,弱教師付きフレームワークを提案する。
本フレームワークは,複数のベンチマークにおいて優れた性能を示し,オーディオ統合により異常検出精度が大幅に向上する。
論文 参考訳(メタデータ) (2025-04-06T13:59:16Z) - Multi-QuAD: Multi-Level Quality-Adaptive Dynamic Network for Reliable Multimodal Classification [57.08108545219043]
既存の信頼性の高いマルチモーダル分類手法では、データ品質のロバストな推定ができない。
textitMulti-level Quality-Adaptive Dynamic multimodal network (Multi-QuAD) と呼ばれる信頼性の高い分類のための新しいフレームワークを提案する。
4つのデータセットで行った実験により、Multi-QuADは分類性能と信頼性において最先端の手法を大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2024-12-19T03:26:51Z) - Bayesian Transformer Language Models for Speech Recognition [59.235405107295655]
トランスフォーマーで表現される最先端のニューラルネットワークモデル(LM)は非常に複雑である。
本稿では,トランスフォーマーLM推定のためのベイズ学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-02-09T10:55:27Z) - Learning to Learn Kernels with Variational Random Features [118.09565227041844]
メタラーニングフレームワークにランダムなフーリエ機能を持つカーネルを導入し、その強力な数ショット学習能力を活用する。
変分推論問題としてメタVRFの最適化を定式化する。
MetaVRFは、既存のメタ学習方法に比べて、はるかに優れた、少なくとも競争力のあるパフォーマンスを提供します。
論文 参考訳(メタデータ) (2020-06-11T18:05:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。