論文の概要: MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression
- arxiv url: http://arxiv.org/abs/2609.04947v2
- Date: Tue, 08 Sep 2026 03:11:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.042346
- Title: MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression
- Title(参考訳): MCPO:マルチモーダル・チェーン・オブ・ソート圧縮のためのモダリティ・コントラスト優先最適化
- Abstract要約: そこで本研究では,900点未満のトレーニングサンプルを必要とする2段階長圧縮法を提案する。
圧縮段階では、ステップレベルの正規化相互情報プルーニングアルゴリズムを導入する。
アライメント段階では、非対称なマルチモーダル長制御された選好損失を用いる。
実験の結果,CoT長を最大69.5%削減し,最大3.34倍の高速化を実現できることがわかった。
- 参考スコア(独自算出の注目度): 40.580984703096945
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently, multimodal large-scale reasoning models have demonstrated remarkable capabilities in solving complex tasks through long Chains-of-Thought (M-CoT). However, excessively long reasoning trajectories incur substantial computational costs and significant KV-cache pressure. Existing CoT compression and alignment paradigms mainly rely on static rules or single-dimensional preferences, lacking fine-grained cross-modal constraints; as a result, they are prone to inducing visual laziness and hallucinatory reasoning. To address these issues, we propose Modality-Contrastive Preference Optimization (MCPO), a highly sample-efficient two-stage length-compression method that requires fewer than 900 training samples. In the compression stage, we introduce a step-level Normalized Cross-Modal Mutual Information (NCMI) pruning algorithm, which automatically identifies and removes visual-independent reasoning steps by comparing the reasoning discrepancies between with-image and no-image contexts. This significantly reduces redundancy and hallucinatory content in the reasoning chains. In the alignment stage, the model first undergoes supervised fine-tuning to achieve domain-adaptive initialization, followed by optimization using an asymmetric multimodal length-controlled preference loss. This objective adopts a highly nonlinear odds-ratio formulation that provides steep gradients in the with-image context to reinforce length constraints for preferred trajectories, while applying a scaled, flat-gradient linear difference in the no-image context to maintain modality consistency, thereby achieving stable cross-modal preference alignment. Extensive experiments on mainstream base models such as Qwen3-VL-Thinking show that our method can reduce CoT length by up to 69.5% and achieve up to 3.34x end-to-end inference speedup while preserving original accuracy.
- Abstract(参考訳): 近年、マルチモーダルな大規模推論モデルは、長いチェーン・オブ・ソート(M-CoT)を通して複雑なタスクを解く際、顕著な能力を示した。
しかし、過度に長い推論軌道は、かなりの計算コストとかなりのKV-cache圧力をもたらす。
既存のCoT圧縮とアライメントのパラダイムは、主に静的な規則や一次元の嗜好に依存しており、細粒度のクロスモーダルな制約を欠いている。
これらの問題に対処するために,900以上のトレーニングサンプルを必要とする高効率2段階長圧縮法であるMCPOを提案する。
圧縮段階では、非画像と非画像の相違点を比較することで、視覚非依存の推論ステップを自動的に識別し、除去するステップレベル正規化相互情報(NCMI)プルーニングアルゴリズムを導入する。
これにより、推論鎖の冗長性と幻覚内容が著しく減少する。
アライメント段階において、モデルはドメイン適応的初期化を達成するために教師付き微調整を行い、その後非対称なマルチモーダル長制御された選好損失を用いた最適化を行う。
この目的は、モダリティの整合性を維持するために、非イメージの文脈において、拡大された平坦な線形差を適用しながら、非イメージの文脈において、所望の軌跡に対する長さ制約を強化するために、非イメージの文脈において急勾配を与える非常に非線形奇数比の定式化を採用し、安定なクロスモーダルな選好アライメントを実現する。
Qwen3-VL-Thinkingのような主流ベースモデルに対する大規模な実験により、本手法はCoT長を最大69.5%削減し、元の精度を保ちながら最大3.34倍のエンドツーエンド推論速度を達成できることを示した。
関連論文リスト
- Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization [59.20570719781289]
マルチモーダル大規模推論モデルは推論パラダイムを導入し、複雑な視覚言語タスクに強力な能力を示す。
既存のトレーニングベースの手法では、応答レベルの直接選好最適化(DPO)を通じて幻覚を緩和し、CoT(Chain-of-Thought)と最終回答をモノリシックな出力として扱い、協調的に最適化する。
我々は、応答生成条件としてCoTをモデル化し、異なるCoT条件下で同じ好みの回答を優先し、応答支持型推論連鎖アライメントを促進するReasoning-Conditioned Direct Preference Optimization (RC-DPO) を導出する。
論文 参考訳(メタデータ) (2026-05-27T03:27:23Z) - Deterministic Differentiable Structured Pruning for Large Language Models [37.33389749907146]
構造化プルーニングは、重要度の低いアーキテクチャ部品を取り除き、LLM推論コストを削減する。
マスクのみの最適化手法であるDDP(Deterministic Differentiable Pruning)を提案する。
従来のアプローチと比較して、DDPはより表現力が高く、テストミスマッチが減少し、より早く収束する。
論文 参考訳(メタデータ) (2026-03-09T07:59:17Z) - Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression [55.63153956934198]
Chain-of-Thought (CoT)推論はLarge Language Models (LLMs)の推論能力をうまく向上させる
既存のCoT圧縮法は、しばしば高い圧縮比で論理的忠実度が著しく低下する。
本稿では,Extra-CoTと呼ばれる新しいEXTreme-RAtio Chain-of-Thought Compressionフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-09T06:57:15Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Tuning-Free Structured Sparse Recovery of Multiple Measurement Vectors using Implicit Regularization [13.378211527081582]
複数の測定ベクトルにおけるスパース信号を復元するためのチューニング不要なフレームワークを提案する。
最適化力学は「モメンタムのような」効果を示し、真のサポートにおける行のノルムは他のものよりも著しく速く成長することを示した。
論文 参考訳(メタデータ) (2025-12-03T02:53:11Z) - T3: Test-Time Model Merging in VLMs for Zero-Shot Medical Imaging Analysis [15.624549727053475]
既存のモデルマージ技術は、様々な医学的手段で一貫した利益をもたらすことができません。
サンプル単位の係数を計算するバックプロパゲーションフリーフレームワークであるTest-Time Task Adaptive merging (T3)を導入する。
ドメイン内、ベース・ツー・ノーベル、および4つのモダリティにまたがる汚職にまたがる厳密な相互評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-31T08:05:40Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。