論文の概要: LUT: Latent Utility Training for Visual Reasoning
- arxiv url: http://arxiv.org/abs/2608.00743v1
- Date: Sat, 01 Aug 2026 16:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.88312
- Title: LUT: Latent Utility Training for Visual Reasoning
- Title(参考訳): LUT:ビジュアル推論のための潜在ユーティリティトレーニング
- Authors: Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei,
- Abstract要約: 標準VQAペアのみをトレーニングした潜在的推論フレームワークであるLUTを提案する。
LUTはLatent Utilityのトレーニングを2段階に分けている。
トラジェクトリレベルでは,回答関連潜在トラジェクトリを探索し,情報ゲインによって有資格トラジェクトリを選択し,カリキュラム学習を通じてより信頼性が高く学習可能な監視を行う,ユーティリティ対応潜時蒸留(Utility-Aware Latent Distillation SFT)を提案する。
ステップレベルでは、強化学習中の潜伏ステップを微分的に最適化するために、応答から潜伏への属性を用いた潜伏政策最適化を提案する。
- 参考スコア(独自算出の注目度): 16.483773277750874
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models have advanced visual understanding, yet perception-intensive reasoning remains challenging. Recent latent visual reasoning methods introduce hidden-space computation before answering, but they often rely on costly intermediate supervision, such as bounding boxes, sketches, or interleaved rationales. These strategies focus on how latent states should be shaped, but do not explicitly assess whether the latent is useful for the final answer. We propose LUT, a latent reasoning framework trained with only standard VQA pairs. LUT centers training on Latent Utility at two levels. At the trajectory level, we propose Utility-Aware Latent Distillation SFT, which explores answer-relevant latent trajectories, selects qualified trajectories by their information gain, and distills more reliable and learnable supervision through curriculum learning. At the step level, we propose Latent Attribution Policy Optimization, which uses answer-to-latent attribution to differentially optimize latent steps during reinforcement learning. Experiments on perception-intensive visual reasoning benchmarks show that LUT outperforms previous latent reasoning methods and remains competitive with latent-text interleaved methods with lower annotation cost.
- Abstract(参考訳): マルチモーダルな大言語モデルには高度な視覚的理解があるが、認識集約的な推論は依然として困難である。
最近の視覚的推論手法は、答えの前に隠れ空間の計算を導入するが、それらはしばしば、境界ボックス、スケッチ、あるいはインターリーブされた有理数のような、コストのかかる中間的な監督に依存している。
これらの戦略は、潜伏状態がどのように形成されるべきかに焦点を当てるが、最終回答に潜伏状態が有用かどうかを明確に評価しない。
標準VQAペアのみをトレーニングした潜在的推論フレームワークであるLUTを提案する。
LUTはLatent Utilityのトレーニングを2段階に分けている。
トラジェクトリレベルでは,回答関連潜在トラジェクトリを探索し,情報ゲインによって有資格トラジェクトリを選択し,カリキュラム学習を通じてより信頼性が高く学習可能な指導を蒸留する,ユーティリティ対応潜時蒸留(Utility-Aware Latent Distillation)を提案する。
ステップレベルでは、強化学習中の潜伏ステップを微分的に最適化するために、応答から潜伏への帰属を用いた潜伏帰属ポリシー最適化を提案する。
知覚集約型視覚推論ベンチマークの実験では、LUTは従来の潜時推論法よりも優れており、アノテーションコストの低い潜時テキストインターリーブ方式と競合し続けている。
関連論文リスト
- CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs [50.189987475377656]
マルチモーダル推論における適応推論長最適化のための能力認識型報酬形成フレームワークであるCAREを提案する。
CAREは、パスレートの指数的な移動平均を通したスムーズなコンピテンス推定を維持し、それを訓練を進行段階にルートするために利用する。
複数のビデオ推論と一般的なビデオ理解ベンチマークの実験により、CAREは推論精度を一貫して改善し、強化学習を安定化し、トークン効率を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-06-18T08:28:26Z) - Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs [54.16324124242172]
連続潜在空間推論は、マルチモーダルモデルに対するテキストチェーンのコンパクトな代替を提供する。
既存の視覚的推論手法では,これまで見過ごされてきた最適化病理を同定する。
パラメータ更新を伴わない推論時間潜時最適化は、視覚潜時における抑止的推論能力を効果的に解き放つことを示す。
論文 参考訳(メタデータ) (2026-05-04T15:36:12Z) - Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs [6.111899371682025]
視覚言語モデルは、テキストCoTの視覚的情報損失により、複雑な視覚的推論に苦しむことが多い。
我々は,強化潜在推論フレームワークである"Decompose, Look, and Reason"(DLR)を提案する。
ビジョン中心のベンチマークの実験では、DLRは一貫して強いベースラインを上回っている。
論文 参考訳(メタデータ) (2026-04-08T18:52:27Z) - See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs [24.90876091319589]
視覚的マルチモーダル推論のための反復的,トレーニング不要,プラグアンドプレイフレームワークを提案する。
私たちのキーとなるアイデアは、視覚的なエビデンスでテスト時の各推論ステップを監督することです。
本手法はTreeBenchを16.5%-29.5%改善し,RH-AUCを13.7%向上させる。
論文 参考訳(メタデータ) (2026-02-25T02:13:59Z) - Latent Reasoning in LLMs as a Vocabulary-Space Superposition [80.01651003144282]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット・プロンプトによる強力な推論能力を示すが、明示的な推論は計算上のオーバーヘッドを大幅に引き起こす。
遅延推論に関する最近の研究は、明示的な監督なしに遅延空間を推論することでコストを削減するが、性能は著しく低下する。
この問題に対処するため、LLM語彙の列空間に潜伏空間を制限し、潜伏推論を語彙確率の重ね合わせとして扱う。
後続の推論が終わると、それは最終的な答えを得るために明確な推論の固有状態に崩壊する。
Latent-SFTはGSM8kに新しい状態を設定し、明示的に一致する
論文 参考訳(メタデータ) (2025-10-17T10:51:20Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z) - Hybrid Latent Reasoning via Reinforcement Learning [50.6763762323985]
大規模言語モデル(LLM)の能力を活用した強化学習(RL)による潜時推論について検討する。
RLをベースとしたハイブリッド潜在推論手法であるハイブリッド推論ポリシー最適化(HRPO)を導入する。
HRPOで訓練されたLLMは解釈可能であり、言語横断パターンや短い完了長といった興味深い挙動を示す。
論文 参考訳(メタデータ) (2025-05-24T01:26:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。