論文の概要: What Matters for Grocery Product Retrieval with Open Source Vision Language Models
- arxiv url: http://arxiv.org/abs/2605.18029v1
- Date: Mon, 18 May 2026 08:20:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:49.118269
- Title: What Matters for Grocery Product Retrieval with Open Source Vision Language Models
- Title(参考訳): オープンソースビジョン言語モデルによるグロサリー製品検索の意義
- Authors: Emmanuel G. Maminta, Rowel O. Atienza,
- Abstract要約: 本稿では,GroceryVision Challenge の MPR タスクにおいて,190個のオープンソース VLM のゼロショット評価を行った。
生のWebスクレイプからフィルタリングデータセットへの切り替えは、最大16.6%の精度向上をもたらす。
最先端モデルは94.5%のRecall@5を達成するが、Recall@1では17.5%の低下を被り、対照的な埋め込みはクラスタカテゴリを効果的に活用するが、視覚的に類似したSKUをランク付けすることができないことが明らかになった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal product retrieval (MPR) underpins checkout-free retail and automated inventory systems, yet it demands fine-grained SKU discrimination that standard vision-language benchmarks fail to capture. We present the first systematic zero-shot evaluation of 190 open-source VLMs on the MPR task of the GroceryVision Challenge, isolating pre-training data, architecture, and input resolution. Our analysis yields three actionable findings. \textbf{(1) Data quality trumps scale.} Switching from raw web-scrapes to filtered datasets delivers up to 16.6\% accuracy gains, exceeding the benefit of doubling model parameters. \textbf{(2) Efficient models can win.} MobileCLIP-B (150M parameters) outperforms 351M counterparts trained on noisy data. We introduce \textit{semantic power density} ($φ$), an efficiency metric that penalizes sub-threshold accuracy. \textbf{(3) A precision gap persists.} State-of-the-art models achieve 94.5\% Recall@5 but suffer a 17.5\% drop at Recall@1, revealing that contrastive embeddings cluster categories effectively but fail to rank visually similar SKUs. Code and evaluation scripts are available at \url{https://github.com/upeee/openmpr}.
- Abstract(参考訳): マルチモーダル製品検索(MPR)は、チェックアウト不要の小売および自動在庫システムを支えるものだが、標準的なビジョン言語ベンチマークがキャプチャーに失敗する、きめ細かいSKU識別を要求する。
本稿では,GroceryVision ChallengeのMPRタスクにおいて,190個のオープンソースVLMに対して,事前学習データ,アーキテクチャ,入力解像度を分離した最初のゼロショット評価を行う。
我々の分析は3つの有効な結果をもたらす。
data quality trumps scale. \textbf{(1) データ品質の切り札。
生のWebスクレイプからフィルタリングデータセットに切り替えると、最大16.6%の精度が得られ、モデルパラメータの倍増のメリットを上回る。
\textbf{(2) 効率的なモデルは勝つことができる。
} MobileCLIP-B(150Mパラメータ)はノイズの多いデータに基づいてトレーニングされた351万パラメータを上回った。
サブスレッショルド精度をペナリゼーションする効率指標である「textit{semantic power density}」(φ$)を導入する。
\textbf{(3) 精度のギャップは持続する。
State-of-the-artモデルは94.5\% Recall@5を達成するが、Recall@1で17.5\%の低下を被り、対照的な埋め込みがクラスタカテゴリを効果的に活用するが、視覚的に類似したSKUをランク付けできないことが明らかになった。
コードと評価スクリプトは \url{https://github.com/upeee/openmpr} で入手できる。
関連論文リスト
- Employing Vision-Language Models for Face Image Quality Assessment [0.023141219541346198]
顔画像品質評価(FIQA)はバイオメトリックパイプラインにおいて重要な制御ステップである。
最先端のFIQA法は高い実用性を達成するが、通常「ブラックボックス」として機能する
ゼロショット環境でFIQAを実行することにより,このギャップを埋めるため,市販のビジョンランゲージモデル(VLM)の可能性を検討する。
論文 参考訳(メタデータ) (2026-05-17T14:57:52Z) - VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents [1.06378109904813]
VAREXは政府形態からの構造化データ抽出を評価するためのベンチマークである。
ベンチマークは、1,777の文書と1,771のユニークな文書から成っており、3相品質保証を通じて真理を検証している。
結果は、4Bパラメータ以下では、コンプライアンス出力 -- 抽出能力ではなく -- が主要なボトルネックであることを示している。
論文 参考訳(メタデータ) (2026-03-16T11:15:56Z) - VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering [53.662676566188175]
重要なボトルネックは、パブリックで大規模で高品質なビジュアル質問回答(SVQA)データセットの欠如にある。
本稿では、まず、図形関連テクストコンテキストとQAペアを生成する検証中心のGenerate-then-Verifyフレームワークを提案する。
このフレームワークをインスタンス化し、20の科学的ドメインと12のフィギュアタイプからなる20,351のQAペアのデータセットであるVeriSciQAをキュレートします。
論文 参考訳(メタデータ) (2025-11-25T04:14:52Z) - RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models [6.977949425464]
我々は、見過ごされた集合的視覚基盤モデルRADIOを活用し、mIoU、レイテンシ、パラメータ効率の3つの主要な軸に沿ったゼロショットOVSSを同時に改善する。
RADSegは,3.95倍高速かつ2.5倍少ないパラメータを用いて,ベースViTクラスの6~30%のmIoU改善を実現した。
論文 参考訳(メタデータ) (2025-11-24T21:15:01Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z) - Improved Out-of-Scope Intent Classification with Dual Encoding and Threshold-based Re-Classification [6.975902383951604]
現在の手法は、予測不可能なアウトリーチ分布で困難に直面している。
本稿では,これらの課題に対処するため,Dual for Threshold-Based Re-Classification (DETER)を提案する。
我々のモデルは以前のベンチマークより優れており、未知のインテントに対するF1スコアの13%と5%に向上しています。
論文 参考訳(メタデータ) (2024-05-30T11:46:42Z) - See, Say, and Segment: Teaching LMMs to Overcome False Premises [67.36381001664635]
この課題を解決するために,LMMのカスケードと共同学習手法を提案する。
得られたモデルでは、画像中に物体が存在するかどうかを検知し、その物体が存在しないかをユーザに「例」し、最終的に、対象物のマスクを出力することで「分類」を行う。
論文 参考訳(メタデータ) (2023-12-13T18:58:04Z) - ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value Extraction [51.87391234815163]
電子商取引プラットフォームは、属性と値のペアという形で構造化された製品データを必要とする。
BERTベースの抽出法では,タスク固有の大量のトレーニングデータを必要とする。
本稿では,大規模言語モデル (LLM) を,より訓練的かつ堅牢な代替手段として活用することを検討する。
論文 参考訳(メタデータ) (2023-10-19T07:39:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。