論文の概要: Test-Time Training for Modality Order Consistency in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.20351v1
- Date: Wed, 22 Jul 2026 16:37:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.157454
- Title: Test-Time Training for Modality Order Consistency in Vision-Language Models
- Title(参考訳): 視覚言語モデルにおけるモーダリティ順序整合性の試験時間トレーニング
- Authors: Aditi Gupta, Yossi Gandelsman,
- Abstract要約: 視覚言語モデルは特定の意味的無関係な変化に敏感であることがわかった。
このギャップを利用して、整合性テストタイムのトレーニング方法を設計する。
- 参考スコア(独自算出の注目度): 18.807457093500997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We find that vision-language models are sensitive to a specific semantically irrelevant change: the order in which the image and question are presented. Across three models and three benchmarks, image first prompting consistently outperforms question-first prompting, revealing a repeatable modality order failure. We use this gap to design an order-consistent test-time training method. Our method substantially closes the modality-order gap across all evaluated settings. Surprisingly, it also yields consistent improvements in the stronger image-first branch over the baseline, hence bootstrapping both orderings toward mutual consistency. Activation patching localizes the ordering failure to a narrow mid-network region where representations diverge sharply between prompt orders. We find that the test-time training method repairs this misalignment across layers. Together, our results identify modality-order sensitivity as a circuit-level failure in VLMs and demonstrate that simple, asymmetric test-time adaptation can effectively mitigate it and even improve performance over the baseline.
- Abstract(参考訳): 視覚言語モデルは特定の意味的無関係な変化に敏感であることがわかった。
3つのモデルと3つのベンチマークで、イメージファーストのプロンプトは質問ファーストのプロンプトよりも一貫して優れており、繰り返し可能なモダリティオーダーの失敗が明らかになっている。
このギャップを利用して、整合性テストタイムのトレーニング方法を設計する。
提案手法は, 評価されたすべての設定において, モーダリティ・オーダーのギャップを大幅に埋める。
驚くべきことに、ベースラインよりも強いイメージファーストブランチが一貫した改善を実現しているため、両方の順序を相互整合性に向けてブートストラップする。
アクティベーションパッチは、注文失敗を狭い中間ネットワーク領域にローカライズする。
テストタイムトレーニング手法は,レイヤ間のミスアライメントを修復する。
この結果から,VLMの回路レベルの障害としてモード順の感度を同定し,単純で非対称なテスト時間適応が有効に軽減し,ベースライン上での性能を向上させることを示した。
関連論文リスト
- Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search [26.52140212357349]
テキストベースの人物検索は、厳格なプライバシー制約と手動アノテーションの高コストによって引き起こされるデータ不足により、固有の制限に直面している。
既存の手法は通常、合成人体カプセルデータに基づいてモデルを事前訓練するPretrain-then-Finetuneパラダイムに依存している。
オフラインテスト時間適応方式により、広範囲なターゲットドメインの監視に依存しない新しいPretrain-then-Adaptパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-07T07:48:15Z) - Spanning Tree Autoregressive Visual Generation [51.7635842702602]
本稿では,Spanning Tree Autoregressive (STAR) モデリングについて述べる。
論文 参考訳(メタデータ) (2025-11-21T09:45:17Z) - Test-Time Degradation Adaptation for Open-Set Image Restoration [35.94643881619977]
オープンセット画像復元のためのテスト時間劣化適応フレームワークを提案する。
本手法はタスク固有の手法よりも性能が優れている。
論文 参考訳(メタデータ) (2023-12-02T13:35:48Z) - Understanding and Constructing Latent Modality Structures in Multi-modal
Representation Learning [53.68371566336254]
優れたパフォーマンスの鍵は、完全なモダリティアライメントではなく、有意義な潜在モダリティ構造にある、と我々は主張する。
具体的には,1)モダリティ内正規化のための深い特徴分離損失,2)モダリティ間正規化のためのブラウン橋損失,3)モダリティ内正規化およびモダリティ間正規化のための幾何学的整合損失を設計する。
論文 参考訳(メタデータ) (2023-03-10T14:38:49Z) - Representation Learning via Global Temporal Alignment and
Cycle-Consistency [20.715813546383178]
時間列の整合に基づく表現学習のための弱教師付き手法を提案する。
従来方式に比べて大幅な性能向上を報告しています。
さらに、時間アライメントフレームワークの2つのアプリケーション、すなわち3Dポーズ再構築ときめ細かいオーディオ/ビジュアル検索を報告します。
論文 参考訳(メタデータ) (2021-05-11T17:34:04Z) - Warp Consistency for Unsupervised Learning of Dense Correspondences [116.56251250853488]
密接な対応を学習する上で重要な課題は、実画像対に対する地道整合の欠如である。
密な対応回帰のための教師なし学習目標であるWarp Consistencyを提案する。
私たちのアプローチは、MegaDepth、RobotCar、TSSなど、いくつかの挑戦的なベンチマークに新しい最先端を設定します。
論文 参考訳(メタデータ) (2021-04-07T17:58:22Z) - Graph Sampling Based Deep Metric Learning for Generalizable Person
Re-Identification [114.56752624945142]
我々は、最も一般的なランダムサンプリング手法である有名なpkサンプリングは、深層メトリック学習にとって有益で効率的ではないと主張する。
大規模計量学習のためのグラフサンプリング(GS)と呼ばれる効率的なミニバッチサンプリング手法を提案する。
論文 参考訳(メタデータ) (2021-04-04T06:44:15Z) - MT3: Meta Test-Time Training for Self-Supervised Test-Time Adaption [69.76837484008033]
ディープラーニングの未解決の問題は、ニューラルネットワークがテスト時間中のドメインシフトに対処する能力である。
メタラーニング、自己監督、テストタイムトレーニングを組み合わせて、目に見えないテスト分布に適応する方法を学びます。
この手法はcifar-10による画像分類ベンチマークの最先端結果を大幅に改善する。
論文 参考訳(メタデータ) (2021-03-30T09:33:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。