論文の概要: Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
- arxiv url: http://arxiv.org/abs/2607.00461v1
- Date: Wed, 01 Jul 2026 05:29:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.733459
- Title: Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
- Title(参考訳): 非対称相互変分学習によるマルチモーダル連続推論
- Abstract要約: 連続潜時推論は、マルチモーダルクエリと最終回答をブリッジする暗黙の推論経路を発見することを目的としている。
これは、厳格な列車干渉ミスマッチ(英語版)を導入する: 訓練時間後部(英語版)は、接地真実の答えに条件付けられ、答えに依存したショートカットを利用することができる。
標準偏差トレーニングでは、テスト時に入手できない情報にアクセスできない後部を模倣するために、推論時間を前倒しし、パフォーマンスが低下する。
本稿では,このミスマッチを双方向の校正目標を用いて解決するフレームワークである非対称多変量学習(AMVL)を提案する。
- 参考スコア(独自算出の注目度): 31.446829707182445
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) are often constrained by a language-space bottleneck, forcing complex visual reasoning into discrete tokens which can lose perceptual nuance. A promising alternative is continuous latent reasoning, where the goal is to discover implicit reasoning pathways that bridge the multimodal query and the final answer. However, this introduces a severe train-inference mismatch: a training-time posterior, conditioned on the ground-truth answer, can exploit answer-dependent shortcuts. Standard variational training then forces the inference-time prior to mimic a posterior that has access to information unavailable at test time, leading to poor performance. To address this, we propose Asymmetric Mutual Variational Learning (AMVL), a framework that resolves this mismatch via a bidirectional calibration objective. A forward KL divergence trains the target-agnostic prior to match the posterior, while a novel reverse KL divergence simultaneously regularizes the posterior, preventing it from collapsing into inference-incompatible regions and mitigating this ``answer leakage''. We provide theoretical analysis formalizing this leakage as prior contamination and prove that our dual-KL objective reduces it. We instantiate AMVL in a latent-integrated MLLM and show that it consistently outperforms strong discrete and latent-reasoning baselines, improving the average score on the complex BLINK benchmark by +10.83 and achieving gains of up to +32.00 on individual reasoning tasks, with analyses confirming improved latent-space stability.
- Abstract(参考訳): MLLM(Multimodal Large Language Model)はしばしば言語空間のボトルネックによって制約され、複雑な視覚的推論を個々のトークンに強制し、知覚的ニュアンスを失う。
そこでは、マルチモーダルクエリと最終回答をブリッジする暗黙の推論経路を見つけることが目的だ。
しかし、これは厳格な列車干渉ミスマッチを生じさせる: 訓練時間後部は、真真正解に基づいて条件付けられ、解答に依存したショートカットを活用できる。
標準偏差トレーニングでは、テスト時に入手できない情報にアクセスできない後部を模倣するために、推論時間を前倒しし、パフォーマンスが低下する。
そこで本稿では,このミスマッチを双方向のキャリブレーション目的によって解決するフレームワークである非対称多変量学習(AMVL)を提案する。
前部KL分岐は後部と一致する前に目標非依存を訓練する一方、新しい逆KL分岐は後部を同時に正規化し、推論非互換領域に崩壊するのを防止し、この「アンサーリーク」を緩和する。
我々は,この漏れを先行汚染として定式化する理論的解析を行い,我々の二重KL目的がそれを減らすことを証明した。
遅延積分MLLMにおいてAMVLをインスタンス化し、強い離散的および潜時共振ベースラインを一貫して上回り、複雑なBLINKベンチマークの平均スコアを+10.83で改善し、個々の推論タスクにおいて最大+32.00のゲインを達成し、遅延空間安定性の向上を確認できることを示す。
関連論文リスト
- RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - A Mutual Information Lower Bound for Multimodal Regression Active Learning [9.04041860173466]
Mutual Information Lower Bound (MI-LB) は、Mixture Network アンサンブルのクローズドフォーム近似である。
我々は,MI-LBがマルチモーダルシステムを備えたベンチマークで評価されたベースラインのすべてに一致または打ち勝つことを示す。
論文 参考訳(メタデータ) (2026-05-14T14:50:47Z) - ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval [64.14282916266998]
Composed Image Retrievalは、参照画像と修正テキストからなるハイブリッドクエリに基づいてターゲット画像を取得することを目的としている。
本稿では,診断・生成・再定義パイプラインに従うモデルに依存しないフレームワークであるReCALLを提案する。
CIRRとFashionIQの実験では、ReCALLは継続的に劣化した機能を再検討し、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-02T04:52:54Z) - Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization [38.469173375694076]
マルチモーダル大言語モデル(MLLM)における幻覚の根本原因を系統的に解析する。
1)不正確な初期記述が後続の推論を誤った前提に固定する連鎖的視覚推論の過度な信頼、(2)政策最適化中の探索の多様性が不十分で、過度に自信があるが誤ったアウトプットを発生させる要因、(3)トレーニングサンプル間の破壊的な衝突、NTKの類似性が誤関連や不安定なパラメータ更新を引き起こす要因である。
実験の結果,提案手法は幻覚率を著しく低減し,MLLMの推論精度を効果的に向上することが示された。
論文 参考訳(メタデータ) (2026-01-09T07:59:18Z) - Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity [13.211627219720796]
強化学習(Reinforcement Learning, RL)は、推論に関わる課題を解決するためにLLMをチューニングするためのデファクトスタンダードとなっている。
我々は、RLが暗黙的に「モード探索」あるいは「ゼロ強制」逆KLを目標分布に最適化し、モデルがターゲットの特定の高確率領域に質量を集中させることを論じる。
そこで本研究では,まず,正解の相対確率を無視しながら,不正確な解をフィルタリングして得られる明示的対象分布から始める。
論文 参考訳(メタデータ) (2025-12-05T18:56:40Z) - In-Context Learning Is Provably Bayesian Inference: A Generalization Theory for Meta-Learning [51.56484100374058]
本稿では,ICLリスクをベイズギャップとポストリアバリアンスの2つのコンポーネントに分割する基本的リスク分解を導入する。
一様アテンション変換器の場合、このギャップの非漸近上界を導出し、事前学習プロンプトの数への依存を明確にする。
後方変動は本質的なタスクの不確実性を表すモデルに依存しないリスクである。
論文 参考訳(メタデータ) (2025-10-13T03:42:31Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Probabilistic Variational Contrastive Learning [8.23660331371415]
我々は,エビデンスローバウンド(ELBO)を最大化するデコーダフリーフレームワークを提案する。
約$q_theta(z|x)$を投影正規分布としてモデル化し、確率的埋め込みのサンプリングを可能にする。
論文 参考訳(メタデータ) (2025-06-11T20:26:07Z) - Hybrid Latent Reasoning via Reinforcement Learning [50.6763762323985]
大規模言語モデル(LLM)の能力を活用した強化学習(RL)による潜時推論について検討する。
RLをベースとしたハイブリッド潜在推論手法であるハイブリッド推論ポリシー最適化(HRPO)を導入する。
HRPOで訓練されたLLMは解釈可能であり、言語横断パターンや短い完了長といった興味深い挙動を示す。
論文 参考訳(メタデータ) (2025-05-24T01:26:16Z) - Improving Variational Autoencoders with Density Gap-based Regularization [16.770753948524167]
変分オートエンコーダ(VAE)は、潜時表現学習と潜時指向生成のためのNLPにおける強力な非教師なし学習フレームワークの1つである。
実際には、ELBoの最適化は、全ての試料の後方分布を同じ分解された局所最適値、すなわち後崩壊またはKL消滅に収束させる。
本稿では, 階層化後分布と先行分布との確率的密度ギャップに基づく新しい正規化により, 両問題に対処する新たな学習目標を提案する。
論文 参考訳(メタデータ) (2022-11-01T08:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。