論文の概要: GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction
- arxiv url: http://arxiv.org/abs/2608.04504v1
- Date: Wed, 05 Aug 2026 06:41:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.759963
- Title: GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction
- Title(参考訳): GeoReward: 市場横断予測のための視覚言語モデルにおける文脈変数過大評価の緩和
- Authors: Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng,
- Abstract要約: 視覚言語モデル(VLM)は、文脈変数を過小評価しながら、支配的な視覚・テクストの手がかりを過大評価する傾向があることを示す。
これは、様々な地域市場における広告画像の嗜好を予測するなど、現実世界のアプリケーションでは特に顕著である。
多様な地域市場における広告画像の嗜好を予測するための報酬モデルであるGeoRewardを紹介する。
- 参考スコア(独自算出の注目度): 6.309399496806564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models excel in many multimodal tasks but remain prone to a subtle yet impactful failure mode: they tend to overestimate dominant visual-textual cues while underestimating sparse but decision-critical contextual variables. This issue, which we term Contextual Variable Overestimation (CVE), becomes particularly evident in real-world applications such as predicting advertisement image preferences across diverse geographic markets. For instance, when a VLM is asked to choose between two product images tailored for different countries, it often defaults to a consistent output, ignoring ground-truth regional variations. This collapse occurs because pervasive high-volume signals, such as product attributes and dense image patches, overwhelm the few but critical tokens that encode market-specific context. To address CVE, we first collect a new multimodal dataset of real advertising creatives and their click-through performance across multiple countries. We then introduce GeoReward, a reward model designed to predict ad image preferences across diverse geographic markets. GeoReward integrates three purpose-built mechanisms: (1) Market-Aware Retrieval Augmentation, (2) Context-Guided Visual Modulation, (3) Selective Sensitivity Loss. Furthermore, we demonstrate how GeoReward can guide the fine-tuning of RL for a VLM to generate background designs for text-to-image models, producing market-aware advertising creatives. Experiments validate that our framework mitigates CVE and outperforms existing baselines. This work not only diagnoses a systematic bias in VLMs toward dominant perceptual features but also delivers a targeted solution for applications where sparse contextual variables govern decision-making.
- Abstract(参考訳): 視覚言語モデルは、多くのマルチモーダルタスクにおいて優れているが、微妙だが影響のある失敗モードを伴いがちである。
この問題は、CVE(Contextual Variable Overestimation)と呼ばれるもので、様々な地域市場における広告画像の嗜好を予測するなど、現実世界のアプリケーションでは特に顕著である。
例えば、VLMが、異なる国向けに調整された2つの製品イメージの選択を依頼された場合、それはしばしば、地道な地域差を無視した一貫した出力にデフォルトとなる。
この崩壊は、製品属性や高密度画像パッチなどの広範に広まる高体積信号が、市場固有のコンテキストを符号化する数少ない重要なトークンを圧倒しているために起こる。
CVEに対処するために、我々はまず、実際の広告クリエイティビティのマルチモーダルデータセットと、そのクリックスルー性能を複数の国で収集する。
次にGeoRewardを紹介します。これは、さまざまな地域市場における広告画像の嗜好を予測するために設計された報酬モデルです。
GeoRewardは,(1)市場対応検索強化,(2)コンテキストガイド型視覚変調,(3)選択感度損失の3つの目的構築メカニズムを統合した。
さらに、GeoRewardは、VLMのためのRLの微調整をガイドして、テキスト・ツー・イメージモデルのための背景デザインを生成し、市場対応の広告クリエイティビティを生み出す方法を示す。
実験により、我々のフレームワークはCVEを軽減し、既存のベースラインを上回ります。
この研究は、VLMの系統的バイアスを主要な知覚的特徴に対して診断するだけでなく、疎コンテキスト変数が意思決定を司るアプリケーションに対して、対象とするソリューションを提供する。
関連論文リスト
- UPRE: Zero-Shot Domain Adaptation for Object Detection via Unified Prompt and Representation Enhancement [25.139037597606233]
ゼロショット領域適応(ZSDA)は、ターゲット領域に画像が欠如しているため、重大な課題を提起する。
従来のアプローチでは、この課題に対処するためにVLM(Vision-Language Models)を使用していた。
本稿では,テキストプロンプトと視覚表現を協調的に最適化するUPREフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-01T13:00:41Z) - Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models [47.98900725310249]
新しいパイプラインは、多様なソーシャルメディアイメージを使用して推論指向のジオローカライゼーションデータセットMP16-Reasonを構築する。
GLOBEには、ローカライズビリティアセスメント、ビジュアルキュー推論、位置情報の精度を共同で向上するタスク固有の報酬が組み込まれている。
その結果,GLOBEはジオローカライゼーションタスクにおいて,最先端のオープンソースLVLMよりも優れていることがわかった。
論文 参考訳(メタデータ) (2025-06-17T16:07:58Z) - Teaching VLMs to Localize Specific Objects from In-context Examples [56.797110842152]
現在、視覚言語モデル(VLM)には、状況を考慮した特定の物体をシーン内でローカライズする学習という、基本的な認知能力がないことが分かっています。
この研究は、VLMのパーソナライズされた数ショットのローカライゼーションを探索し、ベンチマークした初めてのものである。
論文 参考訳(メタデータ) (2024-11-20T13:34:22Z) - SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition [71.90536979421093]
本稿では,視覚言語モデル (VLM) の可能性を増幅するために, Gated Alignments (SSPA) フレームワークを用いた分割合成プロンプトを提案する。
我々は、LLMから固有の知識を関連付けるために、文脈内学習アプローチを開発する。
次に,SSP(Split-and-Synthesize Prompting)戦略を提案する。
論文 参考訳(メタデータ) (2024-07-30T15:58:25Z) - Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance [12.33170407159189]
最先端のテキスト・トゥ・イメージ生成モデルでは、日常の物体を現実世界の真の多様性で描写するのに苦労する。
本稿では, 遅延拡散モデルの後方ステップを導出し, サンプルの多様性を高めるための推論時間介入, 文脈化されたVendi Score Guidance(c-VSG)を導入する。
c-VSGは、画像の品質と一貫性を同時に維持または改善しつつ、最もパフォーマンスの悪い領域と平均の両方において、生成画像の多様性を著しく向上させる。
論文 参考訳(メタデータ) (2024-06-06T23:35:51Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z) - Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception [63.03288425612792]
マルチモーダル参照から画素単位のオブジェクト認識と自然言語記述を生成できる汎用MLLMモデルであるbfAnyRefを提案する。
本モデルでは,領域レベルの参照表現生成とセグメンテーションの多様さを含む,複数のベンチマークにおける最先端結果を実現する。
論文 参考訳(メタデータ) (2024-03-05T13:45:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。