論文の概要: StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
- arxiv url: http://arxiv.org/abs/2607.00465v1
- Date: Wed, 01 Jul 2026 05:34:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.737934
- Title: StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
- Title(参考訳): StochasT: 視覚インストラクションチューニングのための確率的ターン深さによる学習
- Authors: Yuan Qing, Chengzhi Mao, Boqing Gong,
- Abstract要約: LVLM(Large Vision-Language Models)は、視覚インストラクション・チューニング(Visual Instruction Tuning, VIT)に大きく依存している。
既存のベンチマークでは、孤立したシングルターンシナリオでLVLMを評価する。
本稿では,LVLMのロバスト性を測定するために,Balanced Latin Squareをベースとした,困難なベンチマークに依存しない評価機構を提案する。
- 参考スコア(独自算出の注目度): 31.347649780181545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) rely extensively on Visual Instruction Tuning (VIT) to elicit their multimodal reasoning capabilities. However, we find a discrepancy: VIT often packs multiple language tasks about the same image for conversational, multi-turn training, whereas existing benchmarks evaluate LVLMs in isolated, single-turn scenarios. The models can suffer from visual attention decay and contextual overfitting during multi-turn training, making it hard for them to realize their full potential in the mismatched test phase. To close the gap, we propose learning with Stochastic Turn Depth (StochasT), which stochastically groups language tasks for the same image into clusters of varying sizes (turn depth) while preserving their organic order. Hence, while StochasT draws on Dropout and stochastic depth for ResNets, it does not actually drop anything to maximize the utility of the training data. Furthermore, we introduce a challenging, benchmark-agnostic evaluation mechanism based on the Balanced Latin Square to measure LVLMs' robustness under varying contextual dependencies. Extensive experiments demonstrate that StochasT effectively grants LVLMs strong, harmonized capabilities for both single-turn and multi-turn use cases.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、視覚インストラクション・チューニング(Visual Instruction Tuning, VIT)に大きく依存している。
既存のベンチマークでは、LVLMを独立したシングルターンシナリオで評価するのに対して、VITは会話型、マルチターントレーニングで同じイメージに関する複数の言語タスクを梱包することが多い。
モデルは、マルチターントレーニング中に視覚的注意の低下とコンテキストオーバーフィッティングに悩まされる可能性があるため、ミスマッチしたテストフェーズにおいて、その潜在能力を実現するのが難しくなる。
このギャップを埋めるために,Stochastic Turn Depth (StochasT) を用いた学習を提案する。
したがって、StochasTはResNetsのDropoutと確率的な深さを描画するが、トレーニングデータの有用性を最大化するために実際には何もドロップしない。
さらに,異なるコンテキスト依存下でのLVLMのロバスト性を測定するために,バランスの取れたラテンスクエアに基づくベンチマーク非依存評価機構を導入する。
広汎な実験により、StochasTはシングルターンとマルチターンの両方のユースケースに対して、LVLMを強力で調和した機能に効果的に付与することを示した。
関連論文リスト
- Self-Prophetic Decoding to Unlock Visual Search in LVLMs [108.77389957341586]
LVLM(Large Vision-Language Models)は、真のマルチモーダル推論に向けて急速に進化している。
LVLMビジュアルサーチは、訓練後の本質的能力の非互換性と、長い多段階推論コンテキストにおける干渉の2つの主要な課題に直面している。
固有単一ステップ機能を活用してコヒーレントな多ステップ推論を可能にする自己プロヒーレントデコーディングフレームワークであるSeProDを紹介する。
論文 参考訳(メタデータ) (2026-05-27T17:01:39Z) - Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training [82.17582358979884]
多モーダル大規模言語モデル(MLLM)の推論能力を改善するために、明示的推論トレースを用いた後学習が一般的である。
MLLMのマルチモーダル推論を強化するための視覚対応型自己改善学習フレームワークであるVISTAを提案する。
論文 参考訳(メタデータ) (2026-05-12T10:44:35Z) - FewMMBench: A Benchmark for Multimodal Few-Shot Learning [17.747746608503114]
FewMMBenchは、MLLM(Multimodal large language model)を評価するために設計された包括的なベンチマークである。
ゼロショット,少数ショット,CoT増設数ショット設定で6種類のモデルファミリーから26個のオープンウェイトMLLMを評価した。
以上の結果から,命令調整モデルではゼロショット性能は高いが,デモやCoT推論を付加することで,最小限あるいは最小限の利益を得ることができた。
論文 参考訳(メタデータ) (2026-02-25T12:30:18Z) - WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens [69.97021957331326]
本稿では,VLMと拡散モデル間の分散表現空間をエンドツーエンドの最適化により学習するノイズクエリトークンを提案する。
また、細粒度画像の詳細を復元する線形投影を用いたVAE分岐も導入する。
論文 参考訳(メタデータ) (2025-12-02T09:02:20Z) - Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding [41.828387997311474]
LVLM(Large Vision-Language Models)は画像キャプションや視覚的質問応答といったマルチモーダルタスクにおいて,近年顕著な成果を上げている。
それらは、まだ存在しない、または誤認されたオブジェクトの記述を生成する、オブジェクト幻覚の傾向にある。
本稿では,複数のLVLMからの予測を集約することで幻覚を緩和する,学習不要でトークンレベルのアンサンブルフレームワークであるAdaptive Token Ensemble Decoding (ated)を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:11:24Z) - Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting [70.83781268763215]
視覚言語モデル(VLM)は、大規模事前学習を活用することで、多様なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
VLMは、クロスモーダル機能ドリフト、共有アーキテクチャによるパラメータ干渉、ゼロショット機能侵食など、ユニークな課題に直面している。
本調査は、生涯の視覚言語システムを開発する研究者にとって、包括的かつ診断的な基準となることを目的としている。
論文 参考訳(メタデータ) (2025-08-06T09:03:10Z) - Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning [40.972648044298374]
MLLM(Multi-Modal Large Language Models)は様々なVQAタスクにおいて顕著な性能を示す。
解釈可能性に欠け、複雑な視覚的な入力に苦しむことが多い。
438k問合せ対からなる大規模Visual CoTデータセットを提案する。
視覚的な入力を動的に重視し,解釈可能な思考を提供するマルチターン処理パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-25T17:59:23Z) - SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models [19.005364038603204]
自己整合性チューニング(SC-Tune)と呼ばれる新しい微調整パラダイムを導入する。
SC-Tuneは循環型記述子-ロケータシステムの相乗学習を特徴としている。
SC-Tuneは、オブジェクトレベルの視覚言語ベンチマークにおいて、性能を著しく向上させることを示した。
論文 参考訳(メタデータ) (2024-03-20T03:00:21Z) - Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in
Vision-Language Models [76.410400238974]
モデル出力を補正し、モデルが盲目的に自信を持たないようにするためのフィードバック付きTTAを提案する。
CLIPモデルは、TTA中に報酬モデルとして採用され、VLMにフィードバックを提供する。
提案したCLIPフィードバック(RLCF)フレームワークによるテキスト強化学習は非常に柔軟で普遍的である。
論文 参考訳(メタデータ) (2023-05-29T11:03:59Z) - Dense Contrastive Visual-Linguistic Pretraining [53.61233531733243]
画像とテキストを共同で表現するマルチモーダル表現学習手法が提案されている。
これらの手法は,大規模マルチモーダル事前学習から高レベルな意味情報を取得することにより,優れた性能を実現する。
そこで本稿では,非バイアスのDense Contrastive Visual-Linguistic Pretrainingを提案する。
論文 参考訳(メタデータ) (2021-09-24T07:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。