論文の概要: Distilling Visual Reasoning into Text Space
- arxiv url: http://arxiv.org/abs/2609.34408v1
- Date: Mon, 28 Sep 2026 06:20:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 21:02:23.445669
- Title: Distilling Visual Reasoning into Text Space
- Title(参考訳): テキスト空間への視覚的推論の蒸留
- Abstract要約: Visual-to-Text Chain-of-Thought Distillation (V2T)は、LVLMが推論時に中間的な視覚表現を生成することなく、視覚的推論を内部化することを可能にするフレームワークである。
V2Tはまず,教師のLVLMを視覚的およびテキスト的思考の連鎖を用いて訓練し,その後,知識蒸留を用いて教師のロジットを用いて生徒のLVLMを訓練し,地道的テキスト的推論からクロスエントロピーを監督する。
- 参考スコア(独自算出の注目度): 78.35420007882202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) have shown strong promise for multimodal reasoning, yet often struggle with tasks requiring concepts beyond what is directly observable in the input image. Existing methods generate intermediate images or latent visual tokens to guide reasoning, but these representations can introduce errors and increasingly interfere with textual reasoning as reasoning progresses. We propose Visual-to-Text Chain-of-Thought Distillation (V2T), a framework that enables LVLMs to internalize visual reasoning without generating intermediate visual representations at inference time. V2T first trains a teacher LVLM using interleaved visual and textual chains of thought, and then uses knowledge distillation to train a student LVLM using the teacher's logits and cross-entropy supervision from ground-truth textual reasoning. When reasoning images can be mapped to the original image, V2T can additionally distill the teacher's attention to corresponding regions, while ground-truth bounding boxes can further guide a subsequent reinforcement learning stage. Experiments across multiple multimodal reasoning benchmarks show that V2T consistently outperforms the teacher and existing baselines, improving average accuracy by 14.3% on a held-out set and 2.7% on the broader visual evaluation suite. Moreover, lightweight SFT and substantially reduced RL make V2T up to 42x faster to train than state-of-the-art baselines.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、マルチモーダル推論に強く期待されているが、入力画像で直接観測可能なもの以上の概念を必要とするタスクに悩まされることが多い。
既存の方法では中間画像や潜在視覚トークンを生成して推論を導くが、これらの表現は誤りを導入し、推論が進行するにつれてテキスト推論に干渉する。
我々は,LVLMが推論時に中間的な視覚表現を生成することなく,視覚推論を内部化するためのフレームワークであるVisual-to-Text Chain-of-Thought Distillation (V2T)を提案する。
V2Tはまず,教師のLVLMを視覚的およびテキスト的思考の連鎖を用いて訓練し,その後,知識蒸留を用いて教師のロジットを用いて生徒のLVLMを訓練し,地道的テキスト的推論からクロスエントロピーを監督する。
推論画像を元の画像にマッピングできる場合、V2Tは教師の注意を対応する領域に蒸留し、接地路境界ボックスはその後の強化学習ステージをさらに導くことができる。
複数のマルチモーダル推論ベンチマークの実験により、V2Tは教師と既存のベースラインを一貫して上回り、ホールドアウトセットでは平均精度を14.3%改善し、より広い視覚評価スイートでは2.7%向上した。
さらに、軽量のSFTと大幅に削減されたRLにより、V2Tは最先端のベースラインよりも42倍速く訓練できる。
関連論文リスト
- VIVAS: Vitalizing Visual Perception in VLM Pre-training via Vision-language Unified Autoregressive Supervision [69.1715693679928]
VLM(Vision-Language Models)は、細粒度の視覚知覚に乏しく、多モード理解を制限している。
本稿では,高密度な構造・意味的視覚トークン化を実現する,統一トークン空間パラダイムに基づくフレームワークVIVASを提案する。
事前訓練中、VIVASは視覚的詳細と言語的内容の両方について視覚言語で統一された自己回帰監視を行う。
論文 参考訳(メタデータ) (2026-08-25T16:20:11Z) - Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention [41.546578522790114]
検証可能な報奨付き強化学習(RLVR)は,大規模言語モデルにおける複雑な推論を促進するための有望なパラダイムとして登場した。
忠実なマルチモーダル推論の両面に対処するために,視覚的注意を固定し,強化するトレーニングフレームワークであるFithful-MR1を提案する。
論文 参考訳(メタデータ) (2026-05-21T07:10:18Z) - From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models [66.95781712577315]
視覚言語モデル(VLM)における知覚と推論の相互作用について、3つの異なる訓練段階に分解して検討する。
提案手法を用いてトレーニングしたモデルでは,20.8%の精度で推論精度が1.5%向上した。
論文 参考訳(メタデータ) (2026-05-19T17:58:40Z) - LanteRn: Latent Visual Structured Reasoning [7.141402207573525]
本稿では,視覚的推論を潜在空間で直接実行可能にするフレームワークであるLanteRnを紹介する。
LanteRnは、推論中に連続的な視覚的思考の埋め込みを生成し、参加する能力を持つ視覚言語変換器を増強する。
我々はLanteRnを3つの知覚中心ベンチマーク(VisCoT, V*, Blink)で評価する。
論文 参考訳(メタデータ) (2026-03-26T16:41:59Z) - Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens [44.19323180593379]
視覚言語モデル(VLM)は多モーダル理解において優れているが、テキストのみの復号化は視覚的推論の言語化を強いる。
最近の試みでは、VLMに明示的な画像をレンダリングするように訓練されているが、重い画像生成による事前学習は、しばしば推論能力を妨げている。
本稿では,VLMデコーディングを通常のテキストと並行して遅延視覚トークンで拡張する,Mirageと呼ばれるマシンメンタルイメージフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:31Z) - Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios [69.00444996464662]
RIV-CoT(Retrieval-based Interleaved Visual Chain-of-Thought法)を提案する。
実験の結果, RIV-CoTの解答精度は3.1%向上し, バニラCoTの解答精度は4.6%向上した。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z) - Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training [24.989732666940153]
オープンソースのマルチモーダル大言語モデル(MLLM)は、テキスト入力や視覚入力を含む様々なタスクに優れる。
MLLMは複雑なマルチモーダルな数学的推論に苦慮し、GPT-4V(ision)やGemini-Proといった独自のモデルに遅れを取っている。
本稿では,2段階のトレーニングパイプラインVCARを提案する。
論文 参考訳(メタデータ) (2024-04-22T21:59:35Z) - See, Think, Confirm: Interactive Prompting Between Vision and Language
Models for Knowledge-based Visual Reasoning [60.43585179885355]
本稿では,知識に基づく視覚推論のための新しいフレームワークであるInteractive Prompting Visual Reasoner(IPVR)を提案する。
IPVRには3つのステージがある。
我々は,知識に基づく視覚的推論データセットについて実験を行った。
論文 参考訳(メタデータ) (2023-01-12T18:59:50Z) - DiMBERT: Learning Vision-Language Grounded Representations with
Disentangled Multimodal-Attention [101.99313208598569]
視覚と言語(V-L)タスクは、視覚内容と自然言語の両方を理解する必要がある。
視覚と言語に対する注意空間を分離したDiMBERT(Disentangled Multimodal-Attention BERT)を提案する。
DiMBERTは3つのタスクに対して最新のパフォーマンスを新たに設定する。
論文 参考訳(メタデータ) (2022-10-28T23:00:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。