論文の概要: From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking
- arxiv url: http://arxiv.org/abs/2604.27410v1
- Date: Thu, 30 Apr 2026 04:22:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.923149
- Title: From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking
- Title(参考訳): 非構造化から構造化へ:エンティティ検索とランク付けのためのLCMガイド属性グラフ
- Authors: Yilun Zhu, Nikhita Vedula, Shervin Malmasi,
- Abstract要約: 本稿では,Large Language Model (LLM) による属性グラフ構築とグラフ対応LLMランキングを組み合わせた2段階のアプローチを提案する。
オフラインの段階では、構造化されていないテキストから構造化された製品属性を抽出し、カテゴリ対応スキーマを用いた再利用可能な属性グラフを構築する。
オンラインの段階では、検索した候補を、原文ではなくこの構造化された表現を推論してランク付けし、商品単位のトークン使用量を57%削減し、ランキング精度を向上した。
- 参考スコア(独自算出の注目度): 20.966359103135762
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Entity search, i.e., finding the most similar entities to a query entity, faces unique challenges in e-commerce, where product similarity varies across categories and contexts. Traditional embedding-based approaches often struggle to capture nuanced context-specific attribute relevance. In this paper, we present a two-stage approach combining Large Language Model (LLM)-driven attribute graph construction with graph-aware LLM ranking. In the offline stage, we extract structured product attributes from unstructured text, and construct a reusable attribute graph with category-aware schemas. In the online stage, we rank retrieved candidates by reasoning over this structured representation rather than raw text, reducing per-product token usage by 57% while improving ranking precision. Experiments show that our approach outperforms multiple baselines under zero-shot scenarios, achieving a over 5% improvement in average precision without requiring training data, generalizes robustly across diverse product categories, and shows immense potential for real-world deployment.
- Abstract(参考訳): エンティティ検索(Entity Search)、すなわちクエリエンティティに最も類似したエンティティを見つけることは、カテゴリやコンテキストによって製品類似性が異なるeコマースにおいて、ユニークな課題に直面している。
従来の埋め込みベースのアプローチは、しばしば、微妙なコンテキスト固有の属性の関連性を捉えるのに苦労する。
本稿では,Large Language Model (LLM) による属性グラフ構築とグラフ対応LLMランキングを組み合わせた2段階のアプローチを提案する。
オフラインの段階では、構造化されていないテキストから構造化された製品属性を抽出し、カテゴリ対応スキーマを用いた再利用可能な属性グラフを構築する。
オンラインの段階では、検索した候補を、原文ではなくこの構造化された表現を推論してランク付けし、商品単位のトークン使用量を57%削減し、ランキング精度を向上した。
実験により、ゼロショットシナリオ下では、このアプローチが複数のベースラインを上回り、トレーニングデータを必要とせずに平均精度を5%以上向上し、さまざまな製品カテゴリで堅牢に一般化し、実世界の展開の可能性を示す。
関連論文リスト
- <SOG_k>: One LLM Token for Explicit Graph Structural Understanding [57.017902343605364]
我々は、グラフの構造を統一トークン空間内に完全に表現するために、1つの特別なトークン SOG_k> を組み込むことを提案する。
SOG_k>は、簡潔で正確な方法でLLMに理解、生成、理性を与える。
論文 参考訳(メタデータ) (2026-02-02T07:55:09Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - Hierarchical Multi-field Representations for Two-Stage E-commerce Retrieval [12.02097150826061]
Cascading Hierarchical Attention Retrieval Model (CHARM)は、構造化された製品データを階層的なフィールドレベルの表現にエンコードする。
提案手法は, 与えられた階層内の積場間の相互依存を捕捉し, 高速かつ効率的な検索に適したフィールドレベルの表現と集約ベクトルを得る。
一般公開された大規模なEコマースデータセットの実験では、CHARMが最先端のベースラインにマッチするか、性能を上回っていることが示されている。
論文 参考訳(メタデータ) (2025-01-30T19:07:35Z) - Self-Refinement Strategies for LLM-based Product Attribute Value Extraction [51.45146101802871]
本稿では,製品属性値抽出タスクに2つの自己補充手法を適用した。
実験の結果, 2つの自己補充技術は, 処理コストを大幅に増大させながら, 抽出性能を著しく向上させることができないことがわかった。
開発データを持つシナリオでは、ファインチューニングが最もパフォーマンスが高いのに対して、ファインチューニングの上昇コストは製品記述の量が増加するにつれてバランスがとれる。
論文 参考訳(メタデータ) (2025-01-02T12:55:27Z) - Unleashing the Potential of Text-attributed Graphs: Automatic Relation Decomposition via Large Language Models [31.443478448031886]
RoSE (Relation-oriented Semantic Edge-Decomposition) は、生のテキスト属性を分析してグラフ構造を分解する新しいフレームワークである。
我々のフレームワークは、さまざまなデータセットのノード分類性能を大幅に向上させ、ウィスコンシンデータセットでは最大16%の改善を実現した。
論文 参考訳(メタデータ) (2024-05-28T20:54:47Z) - Text-Based Product Matching -- Semi-Supervised Clustering Approach [9.748519919202986]
本稿では,半教師付きクラスタリング手法を用いた製品マッチングの新しい哲学を提案する。
実世界のデータセット上でIDECアルゴリズムを実験することにより,本手法の特性について検討する。
論文 参考訳(メタデータ) (2024-02-01T18:52:26Z) - Exploiting Contextual Target Attributes for Target Sentiment
Classification [53.30511968323911]
TSCの既存のPTLMベースモデルは、1)PTLMをコンテキストエンコーダとして採用した微調整ベースモデル、2)テキスト/単語生成タスクに分類タスクを転送するプロンプトベースモデル、の2つのグループに分類される。
我々は,PTLM を TSC に活用する新たな視点として,言語モデリングと文脈的ターゲット属性による明示的ターゲットコンテキスト相互作用の利点を同時に活用する。
論文 参考訳(メタデータ) (2023-12-21T11:45:28Z) - ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value Extraction [51.87391234815163]
電子商取引プラットフォームは、属性と値のペアという形で構造化された製品データを必要とする。
BERTベースの抽出法では,タスク固有の大量のトレーニングデータを必要とする。
本稿では,大規模言語モデル (LLM) を,より訓練的かつ堅牢な代替手段として活用することを検討する。
論文 参考訳(メタデータ) (2023-10-19T07:39:00Z) - StrAE: Autoencoding for Pre-Trained Embeddings using Explicit Structure [5.2869308707704255]
StrAEは構造化オートエンコーダフレームワークであり、明示的な構造に厳格に固執することで、マルチレベル表現の効果的な学習を可能にする。
本研究の結果は,入力として提供される構造に直接的な関連性があることを示し,既存のツリーモデルではそうではないことを示す。
次に、StrAEを拡張して、単純なローカライズ・マージアルゴリズムを用いてモデルが独自の構成を定義する。
論文 参考訳(メタデータ) (2023-05-09T16:20:48Z) - Entity-Graph Enhanced Cross-Modal Pretraining for Instance-level Product
Retrieval [152.3504607706575]
本研究の目的は, 細粒度製品カテゴリを対象とした, 弱制御型マルチモーダル・インスタンスレベルの製品検索である。
まず、Product1Mデータセットをコントリビュートし、2つの実際のインスタンスレベルの検索タスクを定義します。
我々は、マルチモーダルデータから重要な概念情報を組み込むことができるより効果的なクロスモーダルモデルを訓練するために活用する。
論文 参考訳(メタデータ) (2022-06-17T15:40:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。