論文の概要: TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.33414v1
- Date: Sun, 27 Sep 2026 09:49:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 17:08:05.019987
- Title: TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models
- Title(参考訳): TTRSD:視覚言語モデルのための自己蒸留によるテスト時間強化学習
- Abstract要約: テスト時強化学習により、未ラベル入力を用いて視覚言語モデルに適応することができる。
我々は,多視点応答レベル自己蒸留と視覚的コントラストトークン選択を組み合わせたテスト時強化学習フレームワークTTRSDを提案する。
- 参考スコア(独自算出の注目度): 27.31606612106555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time reinforcement learning enables vision-language models (VLMs) to adapt using unlabeled inputs. However, repeated sampling under fixed visual conditions can reinforce shared perceptual errors, while sequence-level rewards fail to isolate visual perception the foundational bottleneck that anchors multimodal reasoning risking the degradation of pre-trained reasoning capabilities. We propose TTRSD, a test-time reinforcement learning framework combining multi-view answer-level self-distillation with visual contrastive token selection. A shared policy aggregates teacher predictions across original, cropped, and downsampled views into an answer distribution. Student trajectories generated from the original image receive rewards based on the support for their final answers in this distribution. To allocate this feedback precisely toward perceptual bottlenecks, we compare the log-probabilities of the same sampled tokens under original and visually ablated inputs while holding their textual prefixes fixed, selecting visually sensitive positions for policy-gradient updates. TTRSD separates update direction, determined by group-relative advantages, from update position, determined by visual sensitivity, without requiring ground-truth labels, external verifiers, or a separate teacher. With only 20 unlabeled adaptation samples, TTRSD improves performance across seven benchmarks and three VLMs, raising InternVL3-2B's MMMU accuracy from 35.79% to 49.32%(+13.53%), demonstrating cross-dataset generalization while preserving inherent reasoning integrity.
- Abstract(参考訳): テスト時強化学習は、ラベルなし入力を用いて視覚言語モデル(VLM)を適応させる。
しかし、固定された視覚条件下での繰り返しサンプリングは、共有知覚誤差を補強するが、シーケンスレベルの報酬は、事前訓練された推論能力の劣化を危険にさらすような基礎的ボトルネックを視覚的に認識するのに失敗する。
我々は,多視点応答レベル自己蒸留と視覚的コントラストトークン選択を組み合わせたテスト時強化学習フレームワークTTRSDを提案する。
共有ポリシーは、教師の予測を、オリジナル、トリミング、ダウンサンプルビューから回答分布に集約する。
原画像から生成された学生軌跡は、この分布における最終回答の支持に基づいて報酬を受け取る。
このフィードバックを知覚的ボトルネックに対して正確に割り当てるために、原文および視覚的に短縮された入力に基づいて、同一のサンプルトークンの対数確率を比較し、テキストの接頭辞を固定し、ポリシーの段階的な更新のために視覚的に敏感な位置を選択する。
TTRSDは、グループ相対的な利点によって決定される更新方向と、視覚感度によって決定される更新位置を分離する。
TTRSDは7つのベンチマークと3つのVLMのパフォーマンスを改善し、インターンVL3-2BのMMMUの精度を35.79%から49.32%(+13.53%)に引き上げた。
関連論文リスト
- Harnessing Image Question Dependence for Better VLM Test-time Reinforcement Learning [66.13367818892503]
Vlm 適応性を向上させるために画像探索依存を利用したテスト時強化学習フレームワーク TTIQ を提案する。
TTIQの教師は、元の画像検索ペアとその画像と質問対応のバリエーションの下で、各サンプル応答を強制する。
イメージと質問への依存と信頼を組み合わせることで、共同で接地された応答を好む応答レベルの報酬を構築する。
論文 参考訳(メタデータ) (2026-09-09T22:54:15Z) - VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation [46.347555076026964]
マルチモーダル・オン・ポリティクス蒸留は、生徒が生成した軌跡を教師に監督することで、きめ細かい視覚的知識を伝達する。
主な課題は、どの補正が、どのように蒸留するかだけでなく、視覚的証拠によって支えられているかを推定することである。
本稿では,教師の補正の視覚的帰属部分を推定する対物目標再構成アルゴリズムである視覚属性蒸留(VAD)を紹介する。
論文 参考訳(メタデータ) (2026-07-30T17:43:46Z) - Robustifying Vision-Language Models via Test-Time Prompt Adaptation [23.05168102474528]
サンプルレベルの推定から分布レベルのアライメントに移行するテストtImeプロンプト・タダプテーションフレームワークであるRITAを提案する。
特に、RITAは、拡張視覚特徴の分布をテキストプロトタイプと整合させ、敵対的外乱を緩和し、モーダルな意味的不一致を是正するために最適なトランスポートを使用する。
論文 参考訳(メタデータ) (2026-07-10T14:19:42Z) - AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals [65.71225905458182]
自己蒸留は、生徒と教師の両方と同じモデルを用いて、言語モデルが自身の軌道から政治学を学ぶことを可能にする。
このセットアップは、別の外部モデルに頼ることなく、密集したトークンレベルのフィードバックを提供する。
複数の特権情報ビューを持つ自己蒸留法であるAVSDを紹介する。
論文 参考訳(メタデータ) (2026-05-20T03:06:36Z) - ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs [5.192293017737767]
既存の公正を意識した手法は、自己監督対象自体を再設計することでこの問題に対処する。
提案するProtoFairは,既存のSSL目標と協調して動作するように設計された,公正性を意識したコントラスト損失である。
ProtoFairはSimCLRとSupConの両方とシームレスに統合される。
論文 参考訳(メタデータ) (2026-05-03T17:07:54Z) - TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning [54.70019148172847]
テスト時強化学習(Test-Time Reinforcement Learning)のパラダイムをビデオ言語データに活用することにより,事前学習されたモデルを明示的なラベルなしで,テスト時のビデオサンプルに適応させることができる。
ビデオアプローチのためのテスト時間適応(TTA-Vid)は、同時に動作する2つのコンポーネントを組み合わせる。
TTA-Vidは、様々なビデオ推論タスクで一貫した改善をもたらし、大規模データで訓練された最先端の手法より優れている。
論文 参考訳(メタデータ) (2026-04-01T09:52:57Z) - ACTRESS: Active Retraining for Semi-supervised Visual Grounding [52.08834188447851]
前回の研究であるRefTeacherは、疑似自信と注意に基づく監督を提供するために教師学生の枠組みを採用することで、この課題に取り組むための最初の試みである。
このアプローチは、Transformerベースのパイプラインに従う現在の最先端のビジュアルグラウンドモデルと互換性がない。
本稿では, ACTRESS を略したセミスーパービジョン視覚グラウンドのためのアクティブ・リトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-07-03T16:33:31Z) - Dense Contrastive Visual-Linguistic Pretraining [53.61233531733243]
画像とテキストを共同で表現するマルチモーダル表現学習手法が提案されている。
これらの手法は,大規模マルチモーダル事前学習から高レベルな意味情報を取得することにより,優れた性能を実現する。
そこで本稿では,非バイアスのDense Contrastive Visual-Linguistic Pretrainingを提案する。
論文 参考訳(メタデータ) (2021-09-24T07:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。