論文の概要: Scaling E-Commerce Attribute Extraction with Parallel Decoding
- arxiv url: http://arxiv.org/abs/2609.09716v2
- Date: Fri, 11 Sep 2026 22:07:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.765048
- Title: Scaling E-Commerce Attribute Extraction with Parallel Decoding
- Title(参考訳): 並列デコードによる電子商取引属性抽出のスケールアップ
- Abstract要約: 電子商取引カタログは乱雑で構造化されていないため、どの属性が最も重要かを特定するのは困難だ。
まず2段階のLCMパイプラインを導入し、各製品カテゴリの購入識別属性のコンパクトでランク付けされたスキーマを最初に発見する。
このパイプラインは85%の抽出精度を達成し、蒸留した基礎LLMと同等にし、推算コストを92%削減した。
- 参考スコア(独自算出の注目度): 25.167068017765768
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Customers rely on specific product attributes to compare products and make purchasing decisions, but e-commerce catalogs are messy and unstructured, making it difficult to identify which attributes matter most and extract them at scale. Standard Attribute Value Extraction (AVE) systems treat all attributes equally, producing large, inconsistent attribute sets that do not reflect the factors consumers use to differentiate products. We introduce a two-stage LLM pipeline that first discovers a compact, ranked schema of purchase-discriminative attributes for each product category, then extracts their values from catalog text using a fine-tuned compact LLM (Qwen3-4B) with Hyper-Parallel Decoding (HPD). This pipeline achieves 85% extraction accuracy, on par with the foundational LLM it was distilled from, while reducing inference costs by 92% over foundational LLMs, enabling production-scale use for product discovery and catalog enrichment. The resulting category-level structured representations effectively constitute automatically constructed product knowledge bases, providing consistent, comparable attributes across varied product categories that can ground downstream knowledge-intensive applications.
- Abstract(参考訳): 顧客は製品の比較や購入決定に特定の製品属性に依存するが、Eコマースカタログは乱雑で構造化されていないため、どの属性が重要かを識別し、大規模に抽出することは困難である。
標準属性値抽出 (Standard Attribute Value extract, AVE) システムはすべての属性を等しく扱い、消費者が製品を区別するために使用する要因を反映しない大きな一貫性のない属性セットを生成する。
本稿では,まず2段階のLLMパイプラインを導入し,各商品カテゴリの購入識別属性のコンパクトでランク付けされたスキーマを発見し,その後,Hyper-Parallel Decoding (HPD) を用いた微調整コンパクト LLM (Qwen3-4B) を用いてカタログテキストからそれらの値を抽出する。
このパイプラインは85%の抽出精度を達成し、蒸留した基礎LLMと同等に、基礎LLMよりも推論コストを92%削減し、製品発見とカタログの充実のために生産規模での使用を可能にした。
結果として得られるカテゴリレベルの構造化された表現は、自動的に構築された製品ナレッジベースを効果的に構成し、下流のナレッジ集約アプリケーションの基礎となる様々な製品カテゴリに一貫性があり、同等の属性を提供する。
関連論文リスト
- BEATS: Bootstrapping E-commerce Attribute Taxonomies for Search through Iterative Human-AI Collaboration [16.653517324875384]
BEATSは、スクラッチから製品属性をブートストラップするための、ヒューマン・イン・ザ・ループ LLM フレームワークである。
本システムは楽天台湾で展開され,2,694のサブカテゴリと67,277の属性からなる9つの主要カテゴリに集約されている。
540万以上の製品が生成した属性でタグ付けされており、製品カタログ全体を充実させる計画だ。
論文 参考訳(メタデータ) (2026-06-03T14:06:27Z) - Self-Refinement Strategies for LLM-based Product Attribute Value Extraction [51.45146101802871]
本稿では,製品属性値抽出タスクに2つの自己補充手法を適用した。
実験の結果, 2つの自己補充技術は, 処理コストを大幅に増大させながら, 抽出性能を著しく向上させることができないことがわかった。
開発データを持つシナリオでは、ファインチューニングが最もパフォーマンスが高いのに対して、ファインチューニングの上昇コストは製品記述の量が増加するにつれてバランスがとれる。
論文 参考訳(メタデータ) (2025-01-02T12:55:27Z) - PAE: LLM-based Product Attribute Extraction for E-Commerce Fashion Trends [0.6445605125467574]
本稿では,PDF形式のテキストと画像からなる今後のトレンドレポートのための製品属性抽出アルゴリズムであるPAEを提案する。
a) 構造化されていないデータ(テキストと画像)から属性を抽出する効率的なフレームワークであるPAEを開発する; (b) 今後の属性値を用いて既存の属性を検出するためのBERT表現に基づくカタログマッチング方法論を提供する; (c) PAEが有効で柔軟性があり、同等以上の(92.5% F1-Score)フレームワークであることを示す。
論文 参考訳(メタデータ) (2024-05-27T17:50:25Z) - EIVEN: Efficient Implicit Attribute Value Extraction using Multimodal LLM [52.016009472409166]
EIVENは暗黙的な属性値抽出のためのデータおよびパラメータ効率の良い生成フレームワークである。
本稿では,モデル混同を減らすための新しい学習・比較手法を提案する。
実験の結果,EIVENは暗黙的属性値の抽出において既存の手法よりも有意に優れていることがわかった。
論文 参考訳(メタデータ) (2024-04-13T03:15:56Z) - Using LLMs for the Extraction and Normalization of Product Attribute Values [47.098255866050835]
本稿では,大規模言語モデル(LLM)を用いて,製品タイトルや記述から属性値の抽出と正規化を行う可能性について検討する。
実験のために、Web Data Commons - Product Attribute Value extract (WDC-PAVE)ベンチマークデータセットを紹介します。
論文 参考訳(メタデータ) (2024-03-04T15:39:59Z) - LLM-Ensemble: Optimal Large Language Model Ensemble Method for E-commerce Product Attribute Value Extraction [12.611106580612033]
大規模言語モデル(LLM)は多くの属性抽出タスクにおいて最先端の性能を示す。
属性値抽出のために異なるLLMの出力をアンサンブルするLLMアンサンブルと呼ばれる新しいアルゴリズムを提案する。
提案手法は理論的に最適であるだけでなく,効率的な計算,高速収束,安全な配置も保証できる。
論文 参考訳(メタデータ) (2024-02-29T23:03:19Z) - Enhanced E-Commerce Attribute Extraction: Innovating with Decorative
Relation Correction and LLAMA 2.0-Based Annotation [4.81846973621209]
本稿では,分類のためのBERT,属性値抽出のための条件付きランダムフィールド(CRF)層,データアノテーションのための大規模言語モデル(LLM)を統合した先駆的フレームワークを提案する。
提案手法は, CRFのシーケンス復号技術と相乗化したBERTの頑健な表現学習を利用して, 属性値の同定と抽出を行う。
私たちの方法論は、Walmart、BestBuyのEコマースNERデータセット、CoNLLデータセットなど、さまざまなデータセットで厳格に検証されています。
論文 参考訳(メタデータ) (2023-12-09T08:26:30Z) - ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value Extraction [51.87391234815163]
電子商取引プラットフォームは、属性と値のペアという形で構造化された製品データを必要とする。
BERTベースの抽出法では,タスク固有の大量のトレーニングデータを必要とする。
本稿では,大規模言語モデル (LLM) を,より訓練的かつ堅牢な代替手段として活用することを検討する。
論文 参考訳(メタデータ) (2023-10-19T07:39:00Z) - Product Information Extraction using ChatGPT [69.12244027050454]
本稿では,製品記述から属性/値対を抽出するChatGPTの可能性について検討する。
以上の結果から,ChatGPTは事前学習した言語モデルに類似した性能を達成できるが,微調整を行うにはトレーニングデータや計算処理がはるかに少ないことが示唆された。
論文 参考訳(メタデータ) (2023-06-23T09:30:01Z) - Automatic Validation of Textual Attribute Values in E-commerce Catalog
by Learning with Limited Labeled Data [61.789797281676606]
そこで我々はMetaBridgeと呼ばれる新しいメタ学習潜伏変数アプローチを提案する。
限られたラベル付きデータを持つカテゴリのサブセットから、転送可能な知識を学ぶことができる。
ラベルのないデータで、目に見えないカテゴリの不確実性を捉えることができる。
論文 参考訳(メタデータ) (2020-06-15T21:31:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。