論文の概要: Visual Input and Its Framing Affect Attribute-based Descriptions Produced by Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.18345v1
- Date: Wed, 16 Sep 2026 09:08:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.727104
- Title: Visual Input and Its Framing Affect Attribute-based Descriptions Produced by Large Vision-Language Models
- Title(参考訳): 大規模視覚言語モデルによる視覚入力とそのフラーミング影響属性に基づく記述
- Abstract要約: 大規模な視覚言語モデル(LVLM)は、入力として1つのテキストプロンプト、または画像としてのみ使用される。
この論文は、もしテキストプロンプトがその画像の特定のインスタンス(が属する概念のみ)に関するものであるとしても、その応答は影響を受けます。
- 参考スコア(独自算出の注目度): 6.307108363522051
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models (LVLMs) are commonly used with only a single text prompt as the input, or plus an image. In this paper, we demonstrate that when the image exists, even if the text prompt is not about the specific instance (but only the concept it belongs to) in that image, the response would still be affected. For example, when the text prompt only asks for the attribute descriptions of a dog breed, an image depicting a specific dog from that breed would shift the response. Further, how the specific instance is framed in that image would determine towards which the response shifts. Detailed analyses also reveal that in the response, physical terms increase from 18% for text-only to 45% (40%) for subject-focused (subject-in-situation) framings. Overall, the unexpected effects of visual cues on LVLMs highlight the need to understand the presence of an image and its framing when evaluating the robustness of LVLMs.
- Abstract(参考訳): 大規模な視覚言語モデル(LVLM)は、入力として1つのテキストプロンプト、または画像としてのみ使用される。
本稿では, 画像が存在する場合, テキストプロンプトが, その画像中の特定のインスタンス(属する概念のみ)に関するものであるとしても, 応答が影響されることを実証する。
例えば、テキストプロンプトが犬種の属性記述だけを要求すると、その種から特定の犬を描いた画像が反応をシフトする。
さらに、そのイメージの中でどのように特定のインスタンスがフレーム化されているかによって、どのレスポンスがシフトするかが決定される。
詳細な分析の結果,テキストのみの物理用語は18%から45%(40%)に増加した。
全体として、視覚的手がかりがLVLMに与える影響は、LVLMの堅牢性を評価する際に、画像の存在とそのフレーミングを理解する必要性を浮き彫りにする。
関連論文リスト
- An Integrated Vision-and-Language Pretraining (VLP) and Visual Question Answering (VQA) model to Automate Nondestructive Evaluation Image Analysis [0.0]
ChatNDE Figure to Captionは、ディープラーニングと自然言語処理(NLP)を用いたNDE画像の解釈を自動化することを目的としている。
VisionandLanguage Pretraining戦略は、モデルが視覚的特徴と意味のある言語を接続する方法を学ぶのを助けるために開発された。
このシステムはResNet50モデルを組み合わせて、画像から重要な特徴を抽出し、GPT2言語モデルを使ってこれらの特徴を自然な音声テキストに変換する。
論文 参考訳(メタデータ) (2026-08-29T19:19:45Z) - VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text? [51.02924254085878]
VLM(Vision-Language Models)は、テキスト入力と視覚入力のクロスモーダル理解において、優れたパフォーマンスを実現している。
VISTA-Benchは、マルチモーダル認識、推論、および非モーダル理解領域のベンチマークである。
論文 参考訳(メタデータ) (2026-02-04T17:48:55Z) - MARS: Paying more attention to visual attributes for text-based person search [6.438244172631555]
本稿ではMARS(Mae-Attribute-Relation-Sensitive)という新しいTBPSアーキテクチャを提案する。
ビジュアルレコンストラクションロスと属性ロスという2つの重要なコンポーネントを導入することで、現在の最先端モデルを強化する。
CUHK-PEDES、ICFG-PEDES、RSTPReidの3つの一般的なデータセットの実験では、パフォーマンス改善が報告されている。
論文 参考訳(メタデータ) (2024-07-05T06:44:43Z) - ITI-GEN: Inclusive Text-to-Image Generation [56.72212367905351]
本研究では,人書きプロンプトに基づいて画像を生成する包括的テキスト・画像生成モデルについて検討する。
いくつかの属性に対して、画像はテキストよりも概念を表現的に表現できることを示す。
Inclusive Text-to- Image GENeration に容易に利用可能な参照画像を活用する新しいアプローチ ITI-GEN を提案する。
論文 参考訳(メタデータ) (2023-09-11T15:54:30Z) - Transparent Human Evaluation for Image Captioning [70.03979566548823]
画像キャプションモデルのためのルーリックに基づく人間評価プロトコルを開発した。
人為的キャプションは機械的キャプションよりも著しく高品質であることを示す。
この研究は、画像キャプションのためのより透明な評価プロトコルを促進することを願っている。
論文 参考訳(メタデータ) (2021-11-17T07:09:59Z) - A Picture May Be Worth a Hundred Words for Visual Question Answering [26.83504716672634]
画像理解においては、簡潔だが詳細な画像表現を用いることが不可欠である。
より高速なR-CNNのような視覚モデルによって抽出された深い視覚的特徴は、複数のタスクで広く使われている。
本稿では、深い視覚的特徴の代わりに記述-探索ペアを入力とし、言語のみのトランスフォーマーモデルに入力する。
論文 参考訳(メタデータ) (2021-06-25T06:13:14Z) - Multi-Modal Image Captioning for the Visually Impaired [0.0]
盲目の人が自分の周囲を理解する方法の1つは、画像をクリックして、画像キャプションシステムによって生成された説明に頼ることです。
視覚障害者向けキャプション画像に関する現在の作業では、キャプション生成時に画像に存在するテキストデータを使用しない。
本研究では,最先端画像キャプションモデルであるaoanetを改良し,画像に検出されたテキストを入力特徴として活用することを提案する。
論文 参考訳(メタデータ) (2021-05-17T18:35:24Z) - Describe What to Change: A Text-guided Unsupervised Image-to-Image
Translation Approach [84.22327278486846]
本稿では,画像から画像への変換に基づく新しい教師なしの手法を提案する。
本モデルは視覚的属性から画像内容を切り離し,テキスト記述を用いて後者を変更することを学習する。
実験により,提案モデルが2つの大規模公開データセットに対して有望な性能を達成することを示す。
論文 参考訳(メタデータ) (2020-08-10T15:40:05Z) - Probing Contextual Language Models for Common Ground with Visual
Representations [76.05769268286038]
我々は、マッチングと非マッチングの視覚表現を区別する上で、テキストのみの表現がいかに効果的かを評価するための探索モデルを設計する。
以上の結果から,言語表現だけでは,適切な対象カテゴリから画像パッチを検索する強力な信号が得られることがわかった。
視覚的に接地された言語モデルは、例えば検索においてテキストのみの言語モデルよりわずかに優れているが、人間よりもはるかに低い。
論文 参考訳(メタデータ) (2020-05-01T21:28:28Z) - TextCaps: a Dataset for Image Captioning with Reading Comprehension [56.89608505010651]
テキストは人間環境において一様であり、環境を理解するためにしばしば重要である。
画像のコンテキストにおけるテキストの理解方法を研究するために,新しいデータセットであるTextCapsを,28k画像用の145kキャプションで収集した。
我々のデータセットは、テキストを認識し、それをその視覚的コンテキストに関連付け、テキストのどの部分をコピーするか、言い換えるかを決定するモデルに挑戦する。
論文 参考訳(メタデータ) (2020-03-24T02:38:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。