論文の概要: Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach
- arxiv url: http://arxiv.org/abs/2608.03204v1
- Date: Tue, 04 Aug 2026 06:47:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.063116
- Title: Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach
- Title(参考訳): テスト時間における大規模視覚言語モデルの調整:軌道誘導型構造化サンプリングアプローチ
- Authors: Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang,
- Abstract要約: 訓練後の強化学習アルゴリズムは、視覚言語モデルと人間の意図を合わせるために一般的に使用される。
既存のRLベースのアライメント手法は、しばしばリソース集約的であり、トレーニング目標と推論時間分布のミスマッチに遭遇する。
動的推論時間改善のための軌道誘導型構造化サンプリングを利用する新しいテスト時間アライメント手法を提案する。
- 参考スコア(独自算出の注目度): 26.437913669133874
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training reinforcement learning (RL) algorithms are commonly used to align large vision-language models (LVLMs) with human intent and the requirements of visual reasoning tasks. However, existing RL-based alignment methods are often resource-intensive and encounter mismatches between training objectives and inference-time distributions. To bridge this gap, we propose a novel test-time alignment approach that leverages trajectory-guided structured sampling for dynamic inference-time refinement, achieving better alignment with visual grounding and ensuring logical consistency. Our approach begins with curating a reasoning memory bank via a trajectory learning algorithm, which decomposes complex question solving into ordered sequences of predefined reasoning patterns. It subsequently accomplishes inference-time alignment by first collecting trajectories from reasoning memory bank to establish a global structural reasoning prior, and then using an iterative Markov Chain Monte Carlo (MCMC) algorithm for localized multi-objective refinement of the reasoning trace. Experiments across multiple multimodal reasoning datasets demonstrate that our approach significantly improves accuracy without incurring prohibitive inference overhead. These results establish trajectory-guided test-time sampling as a scalable and effective alternative to traditional post-training alignment, particularly for complex visual reasoning tasks.
- Abstract(参考訳): 後学習強化学習(RL)アルゴリズムは、大きな視覚言語モデル(LVLM)を人間の意図と視覚的推論タスクの要求に合わせるために一般的に用いられる。
しかし、既存のRLベースのアライメント手法は、しばしばリソース集約的であり、トレーニング目標と推論時間分布のミスマッチに遭遇する。
このギャップを埋めるために、動的推論時間改善のための軌道誘導型構造化サンプリングを活用する新しいテスト時間アライメント手法を提案し、視覚的接地との整合性を向上し、論理的整合性を確保する。
我々のアプローチは、複雑な問題解決を事前定義された推論パターンの順序列に分解する軌道学習アルゴリズムを用いて推論メモリバンクをキュレートすることから始まる。
その後、まず推論メモリバンクから軌道を収集してグローバルな構造的推論を確立し、次に反復的マルコフ・チェイン・モンテカルロ(MCMC)アルゴリズムを用いて推論トレースの局所的多目的改善を行う。
複数のマルチモーダル推論データセットに対する実験により,提案手法は不規則な推論オーバーヘッドを発生させることなく精度を著しく向上することが示された。
これらの結果は、特に複雑な視覚的推論タスクにおいて、従来のトレーニング後のアライメントに代わるスケーラブルで効果的な方法として、軌道誘導型テストタイムサンプリングを確立している。
関連論文リスト
- Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought [73.39221516441624]
マルチモーダル・チェーン・オブ・ソート(CoT)推論は、推論軌道を構築するために大きな視覚言語モデルを必要とする。
既存のReinforcement Learning with Verifiable Rewards (RLVR) 法は、様々な視覚的接地度を区別することなく、CoTを均一に扱う。
本稿では,隠れ状態の類似性に先立って認識を導き,トークンのエントロピーと統合する知覚探索ポリシー最適化(PEPO)を提案する。
論文 参考訳(メタデータ) (2026-03-24T06:38:00Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - StAR: Segment Anything Reasoner [11.958150552719296]
Segment Anything Reasoner (StAR)は、複数の視点からデザイン空間を洗練する包括的なフレームワークである。
StARは、広範囲なベンチマークでベースモデルよりも大幅に向上している。
論文 参考訳(メタデータ) (2026-03-15T13:43:34Z) - Learning Structured Reasoning via Tractable Trajectory Control [99.75278337895024]
Ctrl-Rは、トラクタブルな軌道制御を通じて構造化推論を学ぶためのフレームワークである。
Ctrl-Rは,従来達成できなかった推論パターンを効果的に探索し,内部化することができることを示す。
論文 参考訳(メタデータ) (2026-03-02T09:18:19Z) - Latent Chain-of-Thought for Visual Reasoning [53.541579327424046]
大型視覚言語モデル(LVLM)の解釈可能性および信頼性向上には,チェーン・オブ・シント(CoT)推論が不可欠である
我々は,LVLMにおける推論を後部推論として再構成し,償却変分推論に基づくスケーラブルなトレーニングアルゴリズムを提案する。
提案手法は,7つの推論ベンチマークにおいて,最先端のLVLMを強化することを実証的に実証する。
論文 参考訳(メタデータ) (2025-10-27T23:10:06Z) - Revisiting LLM Reasoning via Information Bottleneck [57.519119962528166]
大規模言語モデル(LLM)は、最近、検証可能な報酬付き強化学習(RLVR)を通じて推論能力の顕著な進歩を示した。
本稿では,情報ボトルネック(IB)の原理に基づくLLM推論の理論的特徴について述べる。
IB対応推論最適化(IBRO)を提案する。
論文 参考訳(メタデータ) (2025-07-24T13:14:25Z) - Latent Guided Sampling for Combinatorial Optimization [3.636090511738153]
最近の組合せ最適化手法は、深層学習を利用して解法戦略を学習し、監視学習または強化学習(RL)を通して訓練されている。
有望ではあるが、これらのアプローチは多くの場合、タスク固有の拡張に依存し、配布外のインスタンスではパフォーマンスが悪く、堅牢な推論機構が欠如している。
本稿では,効率的な問題インスタンスを条件づけた新しい潜在空間モデルLGS-Netを提案するとともに,効率的なニューラル推論手法であるLatent Guided Sampling(LGS)を提案する。
論文 参考訳(メタデータ) (2025-06-04T08:02:59Z) - PRefLexOR: Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning and Agentic Thinking [0.0]
PRefLexORは、好みの最適化と強化学習の概念を組み合わせることで、モデルを自己学習可能にする。
本研究は, 生体材料科学の応用に焦点をあて, 様々なケーススタディでその手法を実証する。
論文 参考訳(メタデータ) (2024-10-16T08:46:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。