論文の概要: In-Context Collapse in Vision-Language Models and How to Mitigate it?
- arxiv url: http://arxiv.org/abs/2608.02830v1
- Date: Mon, 03 Aug 2026 19:44:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.935561
- Title: In-Context Collapse in Vision-Language Models and How to Mitigate it?
- Title(参考訳): 視覚言語モデルにおける文脈内崩壊と緩和法
- Abstract要約: マルチショットのインコンテキスト学習により、ビジョン言語モデルは、重み付けをすることなく、画像ラベルによるデモから適応できる。
デモが蓄積されると、モデルのサブセットがemphin-contextの崩壊を起こします。
- 参考スコア(独自算出の注目度): 16.566047545838938
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many-shot in-context learning (ICL) lets vision-language models (VLMs) adapt from image--label demonstrations without weight updates, and is widely assumed to improve as more demonstrations are supplied. We show the opposite: as demonstrations accumulate, a subset of VLMs undergo an \emph{in-context collapse}, a sharp, sometimes catastrophic accuracy drop spanning synthetic classification, natural-image classification, and VQA benchmarks, in some models falling below chance while outputs remain well-formed. Across an open VLM panel ($0.5$B--$11$B) and a frontier model (Claude Sonnet 4.5), the collapse is graded. Two capabilities turn out to be dissociable: robustness to accumulating demonstrations and the ability to learn a novel rule in context, their combinations yield three reproducible regimes. A parameter-matched lesion-and-rescue causally localizes the collapse to the vision-language integration pathway: an adapter on the connector and early/mid layers restores genuine learning (remap accuracy $0.39!\rightarrow!0.91$ at 16 shots), while an equal-capacity adapter on the late readout does not. We propose \textsc{CircA}, whose core is a one-time integration vaccine: trained once on one synthetic task, it transfers collapse-resistance to unseen task families (chance$\rightarrow$$0.71$/$0.60$ on CIFAR/Fashion). The layers best for in-context integration are not the layers best for weight-based consolidation, the late readout achieves higher accuracy and less forgetting at fewer parameters. The collapse is an integration failure at the vision--language interface, correctable by a lightweight, transferable intervention.
- Abstract(参考訳): many-shot in-context learning (ICL)は、画像ラベルによるデモを重み付けなしで適応させる視覚言語モデル(VLM)を可能にし、より多くのデモが提供されるにつれて改善されると広く考えられている。
デモが蓄積されるにつれて、VLMのサブセットが「emph{in-context collapse}」と呼ばれる急激で時折破滅的な精度低下を生かし、合成分類、自然画像分類、VQAベンチマークにまたがって、出力が良好に整ったまま、確率以下に低下するモデルもある。
オープンなVLMパネル(0.5$B--11$B)とフロンティアモデル(Claude Sonnet 4.5)にまたがって、崩壊はグレードされる。
デモを蓄積する堅牢さと、文脈で新しいルールを学ぶ能力の2つの能力が解離し、それらの組み合わせは再現可能な3つの体制を生み出した。
パラメータマッチングされた病変・救助は、視覚言語統合経路への崩壊を因果的に局所化する:コネクタとアーリー/ミドル層へのアダプタは、真の学習を復元する(リマップ精度0.39!
\rightarrow!
0.91$ at 16 shots) であるのに対して、遅延読み出しにおける等容量アダプタはそうではない。
CIFAR/Fashion上では,1回の合成作業で1回トレーニングされたコアである‘textsc{CircA} は,崩壊耐性を未知のタスクファミリに転送する(chance$\rightarrow$0.71$/$0.60$)。
コンテキスト内統合に最適なレイヤは、重量ベースの統合に最適なレイヤではない。
この崩壊はビジョン言語インターフェースにおける統合の失敗であり、軽量で転送可能な介入によって修正可能である。
関連論文リスト
- When Semantics Saturate or Emerge: Adaptation-Conditional Semantic Utility in Source-Free Cross-Domain Few-Shot Learning [5.804468830369267]
ソースフリーのクロスドメイン・ショット学習における言語記述は、ゼロショット精度に応じて選択されることが多い。
本稿では、対象領域の視覚適応後も、そのランクが有効であるかどうかを問う。
論文 参考訳(メタデータ) (2026-08-07T00:38:55Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - Beyond Plain Demos: A Demo-centric Anchoring Paradigm for In-Context Learning in Alzheimer's Disease Detection [12.125931365583218]
物語写本からのアルツハイマー病(AD)は大きな言語モデル(LLM)に挑戦する
AD検出ヒンジのコンテキスト内学習の改善は、より良いデモ(デモ)セットを通じて知覚を豊かにする。
我々は、EmphtextbfDiverse and Contrastive Retrieval (DCR) を通じてコンテキスト幅を共同で拡張し、EmphtextbfProjected Vector Anchoring (PVA) を介して各デモの信号を深くするデモ中心アンカーフレームワークである textbfDA4ICL を紹介する。
論文 参考訳(メタデータ) (2025-11-10T08:13:42Z) - Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment [1.7188280334580195]
我々は、CLIPスタイルのコントラストトレーニングフレームワークを利用して、超スペクトルシーン理解のための視覚言語モデル(VLM)の最適化を試みる。
我々のフレームワークは、視覚バックボーンから凍結した大きな埋め込みモデルの潜在空間へのボクセルレベルの埋め込みをマッピングする。
提案手法は全パラメータの0.07パーセントしか更新していないが、最先端の性能が得られる。
論文 参考訳(メタデータ) (2025-09-20T23:23:04Z) - OTFusion: Bridging Vision-only and Vision-Language Models via Optimal Transport for Transductive Zero-Shot Learning [5.818420448447699]
OTFusionは、視覚情報と意味情報を整合した共有確率表現を学ぶことを目的としている。
OTFusionはオリジナルのCLIPモデルよりも一貫して優れており、平均精度は10%近く向上している。
論文 参考訳(メタデータ) (2025-06-16T17:27:47Z) - TULIP: Towards Unified Language-Image Pretraining [60.99500935831526]
既存のCLIPライクなモデルの代替として,オープンソースでドロップイン可能なTを導入する。
提案手法は, 生成データの拡張, 画像画像の強化, テキストコントラスト学習, 画像/テキスト再構成正規化を利用して, きめ細かい視覚的特徴を学習する。
当社のアプローチでは、ベンチマーク全体で既存の最先端(SOTA)モデルを上回っています。
論文 参考訳(メタデータ) (2025-03-19T17:58:57Z) - YOLOE: Real-Time Seeing Anything [80.98075581214799]
YOLOEは、様々なオープンプロンプト機構をまたいだ検出とセグメンテーションを、単一の高効率モデルに統合する。
YOLOEの例外的なゼロショット性能と高い推論効率と訓練コストの低い転送性。
論文 参考訳(メタデータ) (2025-03-10T15:42:59Z) - Vita-CLIP: Video and text adaptive CLIP via Multimodal Prompting [111.49781716597984]
本稿では,教師付きおよびゼロショット性能のバランスをとるためのマルチモーダル・プロンプト学習手法を提案する。
Kinetics-600, HMDB51, UCF101では, 教師付き環境での競争力を維持しながら, 最先端のゼロショット性能を実現することができる。
論文 参考訳(メタデータ) (2023-04-06T18:00:04Z) - Black Box Few-Shot Adaptation for Vision-Language models [41.49584259596654]
ヴィジュアル・ランゲージ(V-L)モデルは、視覚的・言語的モダリティを整合させるために、対照的な学習で訓練された。
本稿では,プリコンパイルされた画像とテキストの特徴に基づいて,V-L小ショット適応のためのブラックボックス手法について述べる。
対象領域におけるV-L再アライメントに対する単純な線形アプローチである線形特徴アライメント(LFA)を提案する。
論文 参考訳(メタデータ) (2023-04-04T12:42:29Z) - Multi-Modal Few-Shot Temporal Action Detection [157.96194484236483]
Few-shot (FS) と Zero-shot (ZS) の学習は、時間的行動検出を新しいクラスに拡張するための2つの異なるアプローチである。
我々は、FS-TADとZS-TADの結婚として考えられるMMFS (Multi-modality few-shot) TAD問題を導入する。
論文 参考訳(メタデータ) (2022-11-27T18:13:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。