論文の概要: HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning
- arxiv url: http://arxiv.org/abs/2608.24467v1
- Date: Tue, 25 Aug 2026 12:15:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.963072
- Title: HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning
- Title(参考訳): HMGCLIP:eコマース表現学習のための異種多言語コントラスト学習
- Abstract要約: HMGCLIPは統合マルチモーダル埋め込みフレームワークである。
ハイパーグラフトポロジを利用して構造認識型ハードネガをマイニングし,多粒質セマンティクスを関係レベルとハイパーエッジレベルの両方で整列する。
この設計により、細粒度と粗粒度の両方の下流タスクの属性エビデンスを動的に融合する二重粒度推論機構が実現される。
- 参考スコア(独自算出の注目度): 8.325814892232943
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although recent Multimodal Large Language Models (MLLMs) have advanced general product understanding, they implicitly encode product information into global embeddings, thereby limiting their ability to capture fine-grained attributes. This limitation hinders performance in tasks requiring precise attribute discrimination, such as distinguishing subtle material differences among visually similar products. To address this challenge, we propose HMGCLIP, a unified multimodal embedding framework. By constructing a heterogeneous hypergraph, we leverage hypergraph topology to mine structure-aware hard negatives and align multi-granular semantics at both relation and hyperedge levels. This design enables a dual-granularity inference mechanism that dynamically fuses attribute evidence for both fine-grained and coarse-grained downstream tasks. Furthermore, we release a comprehensive fine-grained e-commerce dataset to facilitate future benchmarking. Extensive experiments on this new dataset and the public MAVE benchmark show that HMGCLIP outperforms strong multimodal encoders, MLLMs, and e-commerce baselines, validating the superiority of HMGCLIP.
- Abstract(参考訳): 近年のMLLM(Multimodal Large Language Models)は製品理解の高度化を図っているが,製品情報をグローバルな埋め込みに暗黙的にエンコードし,粒度の細かい属性を捕捉する能力を制限している。
この制限は、視覚的に類似した製品間で微妙な材料差を区別するなど、正確な属性判別を必要とするタスクのパフォーマンスを妨げる。
この課題に対処するために,統合マルチモーダル埋め込みフレームワークであるHMGCLIPを提案する。
ヘテロジニアスなハイパーグラフを構築することで、ハイパーグラフトポロジを利用して構造を意識したハード・ネガをマイニングし、複数粒状セマンティクスを関係レベルとハイパーエッジレベルの両方で整列させる。
この設計により、細粒度と粗粒度の両方の下流タスクの属性エビデンスを動的に融合する二重粒度推論機構が実現される。
さらに,将来的なベンチマークを容易にするための詳細なeコマースデータセットもリリースしている。
このデータセットとパブリックMAVEベンチマークの大規模な実験により、HMGCLIPは強力なマルチモーダルエンコーダ、MLLM、eコマースベースラインよりも優れており、HMGCLIPの優位性を検証している。
関連論文リスト
- AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerce [16.733243065736023]
属性強化細粒度マルチモーダル表現学習(AFMRL)を提案する。
プロダクトのきめ細かい理解を属性生成タスクとして定義する。
MLLM(Multimodal Large Language Models)の生成力を利用して、製品画像やテキストから重要な属性を抽出する。
論文 参考訳(メタデータ) (2026-04-22T03:02:21Z) - Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games [11.804164932866192]
HyMORでは、MLLMは、オープンエンドおよび粗粒のオブジェクト認識を行い、CLIPモデルは、動物や植物のようなドメイン固有のオブジェクトのきめ細かい識別を専門としている。
このハイブリッドデザインは、複数のセマンティックな粒度の正確なオブジェクト理解を可能にし、下流のマルチモーダルコンテンツ生成とインタラクティブなゲームプレイのための堅牢な知覚基盤として機能する。
論文 参考訳(メタデータ) (2026-04-18T02:16:34Z) - Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models [67.45032003041399]
本稿では,MLLMに対する敵例の転送可能性を高めるために,MPCAttack(Multi-Paradigm Collaborative Attack)フレームワークを提案する。
MPCOは異なるパラダイム表現の重要性を適応的にバランスさせ、グローバルな最適化を導く。
我々のソリューションは、オープンソースおよびクローズドソースMLLMに対する標的および未ターゲットの攻撃において、常に最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2026-03-05T06:01:26Z) - Reconstructing Content via Collaborative Attention to Improve Multimodal Embedding Quality [59.651410243721045]
CoCoAは、マルチモーダル埋め込み最適化のための協調注意に基づくコンテンツ再構成事前学習パラダイムである。
EOSをベースとした再構築タスクを導入し、対応するEOS>埋め込みからの入力を再構成するようモデルに促す。
MMEB-V1の実験では、Qwen2-VLとQwen2.5-VLをベースにしたCoCoAが埋め込み品質を著しく向上することを示した。
論文 参考訳(メタデータ) (2026-03-02T05:34:45Z) - Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification [49.109117617514066]
マルチモーダル埋め込みは、視覚と言語を整合させるブリッジとして機能する。
MLLM埋め込みのための適応的グローバルおよび微粒な知覚融合法を提案する。
AGFF-Embedは、総合的および微粒な理解において、最先端のパフォーマンスを包括的に達成する。
論文 参考訳(メタデータ) (2026-02-05T14:52:35Z) - Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues [19.732113077201326]
製品イメージの欠如やテキスト記述など、eコマースプラットフォーム上のモダリティの欠如は、しばしばアノテーションエラーや不完全なメタデータから生じる。
マルチモーダルな大規模言語モデルは、eコマースのシナリオで製品に欠けているモダリティを生成することができるか?
本稿では,コンテンツ品質コンプリートベンチマークと推奨ベンチマークの2つのサブベンチマークからなるMMPCBenchを提案する。
我々は、Qwen2.5-VLおよびGemma-3モデルファミリーから、9つの実世界のeコマースカテゴリーの6つの最先端MLLMを評価し、焦点を当てた。
論文 参考訳(メタデータ) (2026-01-27T16:13:26Z) - MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction [52.89860691282002]
インプシット属性値抽出(AVE)は、電子商取引における商品の正確な表現に不可欠である。
マルチモーダル大言語モデル(MLLM)の進歩にもかかわらず、多次元データの複雑さのため暗黙のAVEは依然として困難である。
我々は,複数のMLLMエージェントを用いて推論を反復的に洗練するマルチエージェント討論フレームワークであるtextscmodelnameを紹介する。
論文 参考訳(メタデータ) (2025-10-07T06:27:42Z) - MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces [23.447713697204225]
MAGEは、革新的なアライメント機構を通じて視覚とテキストの意味空間をブリッジする新しいフレームワークである。
我々は、クロスエントロピーと平均二乗誤差を組み合わせたトレーニング戦略を採用し、アライメント効果を著しく向上させる。
提案するマルチモーダル大規模モデルアーキテクチャであるMAGEは,様々な評価ベンチマークにおける類似の手法と比較して,性能が大幅に向上した。
論文 参考訳(メタデータ) (2025-07-29T12:17:46Z) - SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding [66.74446220401296]
画像の理解と生成の両方が可能なシンプルだが強力なエンコーダのないMLLMであるSynerGen-VLを提案する。
トークンの折り畳み機構と,高分解能画像理解を効果的に支援するビジョンエキスパートベースのプログレッシブアライメント事前学習戦略を導入する。
コードとモデルはリリースされます。
論文 参考訳(メタデータ) (2024-12-12T18:59:26Z) - Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models [49.439311430360284]
コントラスト学習と画像差分キャプションにインスパイアされた新しいデータ合成手法を提案する。
私たちのキーとなるアイデアは、マッチングと異なる要素の両方を識別するためにモデルに挑戦することです。
我々は、この生成されたデータセットを利用して、最先端(SOTA)MLLMを微調整する。
論文 参考訳(メタデータ) (2024-08-08T17:10:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。