論文の概要: Show Me Examples: Inferring Visual Concepts from Image Sets
- arxiv url: http://arxiv.org/abs/2607.02402v2
- Date: Mon, 06 Jul 2026 17:05:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.994906
- Title: Show Me Examples: Inferring Visual Concepts from Image Sets
- Title(参考訳): Show Me Examples: イメージセットから視覚概念を推測する
- Authors: Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer,
- Abstract要約: 本稿では,この機能を評価するタスクであるVisual Concept Inference from Sets (VICIS)を紹介する。
コンセプトとクエリ画像を共有するイメージの小さなコンテキストセットが与えられた場合、モデルはコンテキスト定義の概念を保存する新しいイメージを生成する必要がある。
本稿では,イメージセットから視覚概念を推論し,クエリから概念固有の埋め込みを抽出する学習フレームワークとアーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 22.395558604172127
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) can follow complex textual instructions, yet they struggle to reason from purely visual context. In particular, current models fail to infer shared concepts from sets of example images and apply them to new inputs. We introduce Visual Concept Inference from Sets (VICIS), a task that evaluates this capability. Given a small context set of images sharing a concept and a query image, the model must generate new images that preserve the context-defined concept while remaining consistent with the query. We show that state-of-the-art VLMs perform poorly on this task, often ignoring the visual context or defaulting to biased generations. To address this gap, we propose a training framework and architecture that learn to infer visual concepts from image sets and extract concept-specific embeddings from queries. Experiments on synthetic data and large-scale ImageNet/WordNet data show that our model generates more accurate and diverse outputs and generalizes to unseen concepts and modalities such as sketches.
- Abstract(参考訳): 視覚言語モデル(VLM)は複雑なテキスト命令に従うことができるが、純粋に視覚的な文脈から推論することは困難である。
特に、現在のモデルは、サンプル画像の集合から共有概念を推論し、それらを新しい入力に適用することができない。
本稿では,この機能を評価するタスクであるVisual Concept Inference from Sets (VICIS)を紹介する。
コンセプトとクエリ画像を共有するイメージの小さなコンテキストセットが与えられた場合、モデルは、クエリと整合性を維持しながら、コンテキスト定義の概念を保存する新しいイメージを生成する必要がある。
現状のVLMは、視覚的コンテキストを無視したり、バイアスのある世代をデフォルトにしたりすることが多い。
このギャップに対処するために、画像集合から視覚概念を推論し、クエリから概念固有の埋め込みを抽出する学習フレームワークとアーキテクチャを提案する。
合成データと大規模なImageNet/WordNetデータを用いた実験により,我々のモデルはより正確で多様な出力を生成し,スケッチのような未知の概念やモダリティに一般化することがわかった。
関連論文リスト
- Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders [9.716523835964045]
本稿では,視覚言語モデル(VLM)から視覚,テキスト,マルチモーダルの概念を抽出し,解析する,スパースオートエンコーダ(SAE)に基づくフレームワークを提案する。
我々のフレームワークは、既存のSAEベースの手法と比較して、視覚概念の質を最大45%向上させる。
論文 参考訳(メタデータ) (2026-06-19T08:08:43Z) - MyVLM: Personalizing VLMs for User-Specific Queries [78.33252556805931]
視覚言語モデルのパーソナライズに向けての第一歩を踏み出し,ユーザが提供する概念を学習し,推論することを可能にする。
様々なユーザ固有の概念を効果的に認識するために,モデルのトグルとして機能する外部概念ヘッドを付加する。
この概念を認識して、VLMの中間機能空間に埋め込まれた新しい概念を学習する。
この埋め込みは、言語モデルを誘導し、ターゲットの概念を生成された応答に自然に統合する。
論文 参考訳(メタデータ) (2024-03-21T17:51:01Z) - Visual Concept-driven Image Generation with Text-to-Image Diffusion Model [65.96212844602866]
テキスト・ツー・イメージ(TTI)モデルは複雑なシーンの高解像度画像を生成するという印象的な結果を示した。
近年のアプローチでは、これらの手法をパーソナライズ技術で拡張し、ユーザ認証の概念の統合を可能にしている。
しかし、人間の被写体のような複数の相互作用する概念を持つ画像を生成する能力は、1つにまたがったり、複数にまたがったりする概念は、いまだに説明がつかないままである。
これらの課題に対処する概念駆動型TTIパーソナライズフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-18T07:28:37Z) - Language-Informed Visual Concept Learning [22.911347501969857]
我々は概念エンコーダのセットを訓練し、言語インフォームドの概念軸のセットに関連する情報を符号化する。
次に、トレーニング済みのVisual Question Answering(VQA)モデルから得られたテキスト埋め込みの集合に埋め込みの概念を固定する。
推論時に、新しいテスト画像から様々な軸に沿った概念埋め込みを抽出し、それをリミックスして視覚概念の新規な構成で画像を生成する。
論文 参考訳(メタデータ) (2023-12-06T16:24:47Z) - Unsupervised Compositional Concepts Discovery with Text-to-Image
Generative Models [80.75258849913574]
本稿では、異なる画像の集合を考えると、各画像を表す生成概念を発見できるかという逆問題を考える。
本稿では,画像の集合から生成概念を抽出し,絵画やオブジェクト,キッチンシーンからの照明から異なる美術スタイルを分離し,イメージネット画像から得られる画像クラスを発見するための教師なしアプローチを提案する。
論文 参考訳(メタデータ) (2023-06-08T17:02:15Z) - Concept Generalization in Visual Representation Learning [39.32868843527767]
目に見える概念と目に見えない概念のセマンティックな関係が一般化性能に影響を及ぼすと論じる。
概念一般化を原理的に測定できる,ImageNetデータセットの新たなベンチマークであるImageNet-CoGを提案する。
論文 参考訳(メタデータ) (2020-12-10T13:13:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。