論文の概要: Domain Generalization via Text-Anchored Information Bottleneck
- arxiv url: http://arxiv.org/abs/2607.01657v1
- Date: Thu, 02 Jul 2026 03:31:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.651973
- Title: Domain Generalization via Text-Anchored Information Bottleneck
- Title(参考訳): テキスト・アンコール情報によるドメインの一般化
- Authors: Eunyi Lyou, Yunjeong Choi, Junho Lee, Joonseok Lee,
- Abstract要約: ドメイン一般化(DG)は、環境固有のバリエーションに不変な表現を学習することでこの問題に対処する。
近年のアプローチでは、表現力のある視覚表現の保存が堅牢性を改善すると仮定して、大きな視覚言語モデルに依存している。
このような視覚的堅牢性は、代わりに、表現とトレーニング環境を結びつける刺激的な手がかりを伝播させ、不変学習を妨げることを示す。
- 参考スコア(独自算出の注目度): 25.417894587788208
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual recognition models often fail when deployed in new environments. Domain Generalization (DG) addresses this by learning representations that remain invariant to environment-specific variations. Recent approaches increasingly rely on large vision-language models, assuming that preserving their expressive visual representations improves robustness. However, we show that such visual expressiveness can instead propagate spurious cues that tie representations to the training environments, hindering invariant learning. We therefore discard visual guidance and instead treat the language embedding space as the primary source of domain invariance, naturally acting as an information bottleneck that preserves core semantics while suppressing domain-specific variations. Extensive experiments across diverse backbones exhibit state-of-the-art performance and further analyze what makes guidance effective for robust generalization. These findings shift the focus of DG from improving representations to designing supervision that enforces invariance.
- Abstract(参考訳): 視覚認識モデルは、しばしば新しい環境にデプロイされると失敗する。
ドメイン一般化(DG)は、環境固有のバリエーションに不変な表現を学習することでこの問題に対処する。
近年のアプローチでは、表現力のある視覚表現の保存が堅牢性を改善すると仮定して、大きな視覚言語モデルにますます依存している。
しかし、このような視覚的表現力は、訓練環境に表現を結び付ける刺激的な手がかりを伝播させ、不変学習を妨げることが示される。
したがって、視覚的誘導を捨て、言語埋め込み空間をドメイン不変性の主源として扱い、ドメイン固有のバリエーションを抑えながらコアセマンティクスを保存する情報ボトルネックとして自然に機能する。
多様なバックボーンにわたる広範囲な実験は、最先端のパフォーマンスを示し、さらに、堅牢な一般化に有効なガイダンスを解析する。
これらの知見は、DGの焦点を、表現の改善から、不変性を強制する監督設計へとシフトさせる。
関連論文リスト
- Open-Vocabulary Domain Generalization in Urban-Scene Segmentation [83.15573353963235]
セマンティックドメインのドメイン一般化(DG-SS)は、セグメント化モデルが目に見えない環境で堅牢に動作できるようにすることを目的としている。
VLM(Vision-Language Models)の最近の進歩は、モデルがより広い範囲の概念を認識できるようにすることにより、OV-SS(Open-Vocabulary Semantic)が進歩している。
しかし、これらのモデルはドメインシフトに敏感であり、目に見えない環境にデプロイされた場合、堅牢性を維持するのに苦労する。
状態空間駆動型テキスト画像相関改善機構であるS2-Corrを提案する。
論文 参考訳(メタデータ) (2026-02-21T14:32:27Z) - Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation [16.081767698947186]
セマンティックセマンティックセグメンテーションのための新しいドメイン一般化フレームワーク、すなわちドメイン対応のPrompt駆動のMasked Transformer(DPMFormer)を提案する。
まず,視覚とテキスト間のセマンティックアライメントを促進するために,ドメイン認識型プロンプト学習を導入する。
そこで本研究では,観測可能な領域を多様化するテクスチャ摂動とともに,ドメインを意識したコントラスト学習を提案する。
論文 参考訳(メタデータ) (2025-12-03T06:58:38Z) - Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization [75.88719716002014]
ドメイン一般化 (Domain Generalization, DG) は、目に見えないターゲットドメインに対して効果的に機能する汎用モデルの開発を目指している。
VFM(Pre-trained Visual Foundation Models)の最近の進歩は、ディープラーニングモデルの一般化能力を向上する大きな可能性を示している。
VFMの制御可能で柔軟な言語プロンプトを活用することで,この問題に対処することを提案する。
論文 参考訳(メタデータ) (2025-07-03T03:52:37Z) - WIDIn: Wording Image for Domain-Invariant Representation in Single-Source Domain Generalization [63.98650220772378]
We present WIDIn, Wording Images for Domain-Invariant representation, to disentangleative discriminative visual representation。
まず、ドメイン固有の言語を適応的に識別し、削除するために使用可能な、きめ細かいアライメントを組み込んだ言語を推定する。
WIDInは、CLIPのような事前訓練された視覚言語モデルと、MoCoやBERTのような個別訓練されたユニモーダルモデルの両方に適用可能であることを示す。
論文 参考訳(メタデータ) (2024-05-28T17:46:27Z) - Transitive Vision-Language Prompt Learning for Domain Generalization [41.484858946789664]
ビジョン言語による事前トレーニングにより、ディープモデルは、目に見えないドメインをまたがる一般化において、大きな一歩を踏み出した。
しかし、ドメインの不変性とクラス分離性の間のトレードオフがまだ進行しているという問題がまだ残っている。
論文 参考訳(メタデータ) (2024-04-29T14:56:11Z) - HCVP: Leveraging Hierarchical Contrastive Visual Prompt for Domain
Generalization [69.33162366130887]
ドメイン一般化(DG)は、不変の機能を学ぶことによって、目に見えないシナリオに優れた機械学習モデルを作成するための取り組みである。
モデルにドメインレベルとタスク固有の特性を補足する新しい手法を提案する。
このアプローチは、特定の特徴から不変な特徴をより効果的に分離し、一般化を促進することを目的としている。
論文 参考訳(メタデータ) (2024-01-18T04:23:21Z) - TeG-DG: Textually Guided Domain Generalization for Face Anti-Spoofing [8.830873674673828]
既存の方法は、様々な訓練領域からドメイン不変の特徴を抽出することを目的としている。
抽出された特徴は、必然的に残差スタイルの特徴バイアスを含んでおり、その結果、一般化性能が劣る。
本稿では,テキスト情報をドメイン間アライメントに有効活用するテキストガイド型ドメイン一般化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-30T10:13:46Z) - Style-Hallucinated Dual Consistency Learning: A Unified Framework for
Visual Domain Generalization [113.03189252044773]
本稿では,様々な視覚的タスクにおけるドメインシフトを処理するための統合フレームワークであるStyle-HAllucinated Dual consistEncy Learning (SHADE)を提案する。
我々の汎用SHADEは、画像分類、セマンティックセグメンテーション、オブジェクト検出など、様々な視覚認識タスクにおける一般化を著しく向上させることができる。
論文 参考訳(メタデータ) (2022-12-18T11:42:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。