論文の概要: Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction
- arxiv url: http://arxiv.org/abs/2608.19971v1
- Date: Thu, 20 Aug 2026 12:45:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.564307
- Title: Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction
- Title(参考訳): 反復的プロキシ補正によるロバスト不完全マルチモーダル感性解析
- Abstract要約: 実世界のマルチモーダル入力は、しばしば不完全あるいは破損し、クロスモーダルの相補性を弱める。
不完全なMSAのための既存のプロキシベースのメソッドは、劣化した言語情報を補うためにワンショットのプロキシ構造に依存している。
頑健な不完全MSAのための反復的プロキシ補正フレームワークを提案する。
- 参考スコア(独自算出の注目度): 8.747820204756566
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal sentiment analysis aims to infer affective states by integrating language, visual, and acoustic cues. However, real-world multimodal inputs are often incomplete or corrupted, which can weaken cross-modal complementarity and introduce misleading information into downstream fusion. Existing proxy-based methods for incomplete MSA commonly rely on one-shot proxy construction to compensate for degraded language information, but the generated proxy may be coarse or unreliable at initialization. Prematurely injecting such a proxy into multimodal reasoning can propagate initial errors and compromise sentiment prediction. To address this limitation, we propose an iterative proxy correction framework for robust incomplete MSA. Our method constructs a language-oriented proxy from non-language modalities and progressively refines it under multimodal context through gated residual correction. The corrected proxy is then adaptively fused with the observed language representation according to an estimated language reliability score, allowing the model to balance proxy-based compensation and trustworthy linguistic evidence. In addition, we introduce a stage-wise latent correction objective that uses the complete language representation as a training-time semantic anchor to stabilize the proxy refinement trajectory. Extensive experiments on MOSI, MOSEI, and SIMS under diverse missing-modality settings demonstrate that the proposed framework consistently outperforms competitive baselines and achieves robust sentiment prediction under incomplete inputs.
- Abstract(参考訳): マルチモーダル感情分析は, 言語, 視覚, 音響的手がかりを統合し, 感情状態の推測を目的とする。
しかし、実世界のマルチモーダル入力は、しばしば不完全あるいは破損しており、これは、相互モーダルの相補性を弱め、下流の融合に誤った情報をもたらす可能性がある。
不完全なMSAのための既存のプロキシベースのメソッドは、一般的に、劣化した言語情報を補うためにワンショットのプロキシ構造に頼っているが、生成されたプロキシは初期化時に粗いか信頼できない。
早期にそのようなプロキシをマルチモーダル推論に注入することで、初期エラーを伝播させ、感情予測を妥協することができる。
この制限に対処するために、ロバストな不完全MSAのための反復的プロキシ補正フレームワークを提案する。
提案手法は,非言語モーダル性から言語指向のプロキシを構築し,ゲート残差補正により多モーダルコンテキスト下で徐々に洗練する。
修正されたプロキシは、推定された言語信頼性スコアに従って、観察された言語表現と適応的に融合し、プロキシベースの補償と信頼できる言語証拠のバランスをとることができる。
さらに,言語表現全体を訓練時セマンティックアンカーとして利用し,プロキシの修正軌道を安定化させる段階的遅延補正手法を提案する。
MOSI, MOSEI, SIMSの多種多様な欠落条件下での広範囲な実験により, 提案手法は競争ベースラインを一貫して上回り, 不完全入力下での堅牢な感情予測を実現することを示した。
関連論文リスト
- Beyond Solver Verdicts: Generative Reward Models for Autoformalization [6.845799966508813]
我々は、オフラインのZ3等価オラクルを参照不要で連続的な参照等価スコアに蒸留する生成検証(GenV)を導入する。
GenV は 0.961 AUROC を基準等価性検証で達成し、未知のトランスレータと分岐形式にまたがるゼロショットを一般化する。
論文 参考訳(メタデータ) (2026-09-10T04:47:55Z) - Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - A Multimodal Dataset for Visually Grounded Ambiguity in Machine Translation [53.06004926782424]
VIDA(Visually-Dependent Ambiguity)は2500の慎重にキュレートされたインスタンスのデータセットで、注釈付きソーススパンの解決には視覚的証拠が必要である。
また,LLM-as-a-judge分類器を用いて,アノテートされた曖昧な表現がスパンレベルで正しく解決されているかどうかを検証する。
論文 参考訳(メタデータ) (2026-05-03T19:55:06Z) - Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs [47.94507630961399]
トレーニング不要なデコードフレームワークであるVISAGEを導入し、推論時に目的を校正する。
我々は、VISAGEが推定誤差の下で有界目的損失を維持することを保証する解析的安定性を保証する。
幻覚感受性および汎用ベンチマークによる評価は、フレームワークの堅牢性を示している。
論文 参考訳(メタデータ) (2026-03-26T17:53:49Z) - Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck [37.780081880731096]
大規模言語モデル(LLM)は多言語評価の標準となっているが、厳密な体系的翻訳バイアスを示す。
このバイアスは (i) 英語との潜在多様体アライメントと (ii) 言語間予測可能性との急激な相関に起因している。
このバイアスを軽減するために、我々は、最小限に十分な判断クリティカルな表現を学習する堅牢な微調整フレームワークであるDIBJudgeを提案する。
論文 参考訳(メタデータ) (2026-03-11T02:55:29Z) - Unlocking Reasoning Capability on Machine Translation in Large Language Models [57.60641851466707]
推論指向の大規模言語モデル(RLM)は、明示的な中間推論を生成することにより、数学やコーディングといったタスクに強い利益をもたらす。
WMT24++ベンチマークを用いて,オープンおよびクローズドヘビー級のRCMを系統的に評価した。
明示的な推論を可能にすることは、言語やモデル間の翻訳品質を一貫して低下させる。
論文 参考訳(メタデータ) (2026-02-16T14:05:59Z) - Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction [51.50282796099369]
本稿では,多次元命令の不確実性低減フレームワークを開発し,意味論的に制約された逆の例を生成する。
言語誘導サンプリングプロセスの予測により、設計したResAdv-DDIMサンプルにより最適化プロセスが安定化される。
セマンティック制約付き3次元逆数例の参照フリー生成を初めて実現した。
論文 参考訳(メタデータ) (2025-10-27T04:02:52Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z) - Improving Instruction Following in Language Models through Proxy-Based Uncertainty Estimation [12.921225188504643]
本稿では,ペア応答の品質に対するロバストな不確実性推定を導入した不確実性認識リワードモデル(URM)を提案する。
実験結果から,提案したプロキシを言語モデルトレーニングに組み込むことによる大きなメリットが示された。
論文 参考訳(メタデータ) (2024-05-10T12:14:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。