論文の概要: Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack
- arxiv url: http://arxiv.org/abs/2610.00973v1
- Date: Thu, 01 Oct 2026 03:03:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.872746
- Title: Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack
- Title(参考訳): 概念駆動型ドメイン適応:Haystackで抽象的な針を見つける
- Abstract要約: 科学教師は、画面に何が見えるかを記述するのではなく、彼らが教えようとする抽象概念を照会することによって、しばしばドキュメンタリーの抜粋を探す。
このユースケースは、通常、クエリが観測可能なイベントを記述すると仮定する、既存の言語ベースのビデオモーメント検索方法の制限を公開する。
本稿では, コンパクトなカリキュラム概念を時間的に疎結合な証拠に根ざさなければならない, 抽象的なビデオ検索のコンセプト・トゥ・イン・ア・ヘイスタック問題として, この設定を考察する。
- 参考スコア(独自算出の注目度): 17.45030875962226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Science teachers frequently search for documentary excerpts not by describing what appears on screen, but by querying the abstract concepts they intend to teach. This use case exposes a limitation of existing language-based video moment retrieval methods, which typically assume that queries describe observable events, whereas instructional search requires retrieving concrete visual phenomena that instantiate an underlying scientific principle. We study this setting as concept-to-example video retrieval, an abstract-needle-in-a-haystack problem where compact curriculum concepts must be grounded in temporally sparse documentary evidence. To bridge this abstraction gap, we propose Concept-Driven Domain Adaptation (CDDA), a three-stage framework for adapting two-tower vision-language models to concept-level retrieval. CDDA treats concepts as intermediate semantic anchors: it first structures the textual embedding space with textbook and teacher-handbook example-concept pairs, then transfers this concept-aware geometry to documentary visuals under a frozen visual encoder, and finally jointly adapts both encoders with sparse visual concept supervision. From a geometric perspective, this staged alignment reduces text-concept and vision-concept angular gaps, thereby encouraging concept-level adaptation while preserving the pretrained model's concrete image description alignment. On a curated middle-school physics retrieval benchmark, CDDA achieves stronger pedagogically oriented concept retrieval than several competitive multimodal baselines, including Qwen3-VL-Embedding-2B, while maintaining concrete image-text matching after adaptation.
- Abstract(参考訳): 科学教師は、画面に何が見えるかを記述するのではなく、彼らが教えようとする抽象概念を照会することによって、しばしばドキュメンタリーの抜粋を探す。
このユースケースは、通常、クエリが観測可能な事象を記述していると仮定する、既存の言語ベースのビデオモーメント検索手法の制限を露呈する。
本研究は,コンパクトなカリキュラム概念を時間的に疎結合な証拠に根ざさなければならない,抽象的なビデオ検索のコンセプト・トゥ・イン・ア・ヘイスタック問題として,この設定を考察する。
この抽象的ギャップを埋めるために,概念駆動型ドメイン適応(CDDA)を提案する。
CDDAは、概念を中間的な意味的アンカーとして扱う: テキスト埋め込み空間を教科書と教師/教科書の例-概念ペアで構築し、次にこの概念認識幾何学を凍結されたビジュアルエンコーダの下でドキュメンタリーヴィジュアルに転送し、最後に両エンコーダを疎視的な概念監督で共同で適応する。
幾何学的観点から、この段階的アライメントは、テキスト概念と視覚概念の角のギャップを減らし、事前訓練されたモデルの具体的な画像記述アライメントを保ちながら概念レベルのアライメントを促進する。
キュレートされた中学の物理計算ベンチマークでは、CDDAは、適応後の具体的な画像テキストマッチングを維持しながら、Qwen3-VL-Embedding-2Bを含むいくつかの競合するマルチモーダルベースラインよりも、教育指向の概念検索を強く達成している。
関連論文リスト
- ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval [62.80735412748694]
ConceptFormerは、ビジュアル文書検索のための潜在概念表現学習フレームワークである。
クエリ関連エビデンスとは、局所化された視覚的エビデンスとセマンティックな関連性を明確に橋渡しする、連続的でクエリ条件付き潜在概念である。
平均的なNDCG@10では、最強のビジュアル検索ベースラインと最強のOCRベースのテキスト検索ベースラインに対して16.7%と22.1%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2026-08-16T12:07:12Z) - Bring Your Dreams to Life: Continual Text-to-Video Customization [76.70414091514704]
我々は,忘れと概念の無視に対処するために,連続的カスタマイズビデオ拡散モデルを開発した。
概念の無視に対処するため,地域特性を高め,映像コンテキストをユーザ条件と整合させる制御可能な条件合成を開発した。
私たちのCCVDは、DreamVideoとWan 2.1のバックボーンで既存のCTVGベースラインを上回っています。
論文 参考訳(メタデータ) (2025-12-05T15:25:56Z) - OmniPrism: Learning Disentangled Visual Concept for Image Generation [57.21097864811521]
創造的な視覚概念の生成は、しばしば関連する結果を生み出すために参照イメージ内の特定の概念からインスピレーションを引き出す。
我々は,創造的画像生成のための視覚的概念分離手法であるOmniPrismを提案する。
提案手法は,自然言語で案内される不整合概念表現を学習し,これらの概念を組み込むために拡散モデルを訓練する。
論文 参考訳(メタデータ) (2024-12-16T18:59:52Z) - Conceptual Codebook Learning for Vision-Language Models [27.68834532978939]
視覚言語モデル(VLM)の一般化能力向上のためのCodebook Learning(CoCoLe)を提案する。
視覚概念をキーとして,概念的プロンプトを値として,概念的コードブックを学習する。
この概念的コードブック学習法は,視覚的・言語的モダリティの高度化を実現することができる。
論文 参考訳(メタデータ) (2024-07-02T15:16:06Z) - Static and Dynamic Concepts for Self-supervised Video Representation
Learning [70.15341866794303]
本稿では,自己教師付きビデオ表現学習のための新しい学習手法を提案する。
人間がビデオを理解する方法に触発され、まず一般的な視覚概念を学習し、ビデオ理解のための識別的地域への参加を提案する。
論文 参考訳(メタデータ) (2022-07-26T10:28:44Z) - Automatic Concept Extraction for Concept Bottleneck-based Video
Classification [58.11884357803544]
本稿では,概念に基づくビデオ分類に必要かつ十分な概念抽象セットを厳格に構成する概念発見抽出モジュールを提案する。
提案手法は,自然言語における概念概念の抽象概念を応用し,複雑なタスクに概念ボトルネック法を一般化する。
論文 参考訳(メタデータ) (2022-06-21T06:22:35Z) - Cross-Modal Graph with Meta Concepts for Video Captioning [101.97397967958722]
ビデオキャプションのためのメタ概念を用いたクロスモーダルグラフ(CMG)を提案する。
ビデオキャプションで有用な意味概念を網羅するために、テキスト記述のための対応する視覚領域を弱く学習する。
我々は、予測された述語を用いて、全体的ビデオレベルおよび局所的フレームレベルのビデオグラフを構築し、ビデオシーケンス構造をモデル化する。
論文 参考訳(メタデータ) (2021-08-14T04:00:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。