論文の概要: Web Price Extraction: State of the Art and an Adaptive Browserless Implementation
- arxiv url: http://arxiv.org/abs/2609.01030v1
- Date: Tue, 01 Sep 2026 10:28:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.552809
- Title: Web Price Extraction: State of the Art and an Adaptive Browserless Implementation
- Title(参考訳): Webの価格抽出: 最先端技術と適応型ブラウザレス実装
- Authors: Evgeniia Kositsyna, Jorge Lloret-Gazo,
- Abstract要約: ウェブサイトからの価格抽出は、電子商取引における市場モニタリング、価格比較、ビジネス分析の鍵となる課題である。
既存の手法は手書きのラッパーとラベル付きページからのルール誘導に依存しており、精度は高いが構造的な変更には不適応である。
本稿では,Webサイト間の構造的差異に対するロバスト性を向上する適応型ブラウザレス価格抽出システムを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Price extraction from websites is a key task for market monitoring, price comparison, and business analytics in e-commerce. Existing approaches can be broadly divided into four groups, and understanding their trade-offs in accuracy and scalability is essential for selecting suitable extraction strategies. Classical methods rely on manually written wrappers and rule induction from labeled pages, offering high accuracy but adapting poorly to structural changes and requiring considerable maintenance effort. Browser-based methods, using tools such as Selenium and Puppeteer, handle dynamic JavaScript content but consume large computational resources and scale poorly. Browserless approaches retrieve HTML directly via HTTP requests, offering significant gains in speed and cost, but rely on rules calibrated for specific sites. Methods based on machine learning and large language models offer adaptability but require training data and substantial computation. Our main contribution is an adaptive browserless price extraction system that improves robustness to structural differences between websites. We implemented a baseline architecture combining HTML page fragmentation with syntactic, semantic, and frequency rules, and extended it in two ways: a Bayesian approach that dynamically updates rule weights, and a genetic algorithm that optimizes the system's global parameters. This hybrid scheme increased precision from 77.2% to 87.3% and reduced average per-page processing time by approximately 14% relative to the baseline, confirming it as a competitive alternative to manually tuned browserless solutions and to more resource-intensive browser- or LLM-based methods, offering high extraction accuracy at low computational cost.
- Abstract(参考訳): ウェブサイトからの価格抽出は、電子商取引における市場モニタリング、価格比較、ビジネス分析の鍵となる課題である。
既存のアプローチは4つのグループに大別でき、適切な抽出戦略を選択するためには、精度とスケーラビリティのトレードオフを理解することが不可欠である。
古典的な手法は手書きのラッパーとラベル付きページからのルール誘導に依存しており、精度は高いが構造的な変更には不適応であり、保守にかなりの労力を要する。
SeleniumやPuppeteerといったツールを使ったブラウザベースのメソッドは、動的JavaScriptコンテンツを処理しますが、大きな計算リソースを消費し、スケールが悪くなります。
ブラウザレスアプローチは、HTTPリクエストを介してHTMLを直接取得し、スピードとコストを大幅に向上させるが、特定のサイトに対して調整されたルールに依存している。
機械学習と大規模言語モデルに基づく手法は、適応性を提供するが、トレーニングデータと実質的な計算が必要である。
私たちの主な貢献は、Webサイト間の構造的差異に対するロバスト性を改善する、アダプティブなブラウザレス価格抽出システムである。
我々は,HTMLページの断片化と構文,意味,周波数ルールを組み合わせたベースラインアーキテクチャを実装し,ルール重み付けを動的に更新するベイズ的アプローチと,システムのグローバルパラメータを最適化する遺伝的アルゴリズムの2つの方法で拡張した。
このハイブリッド方式は、77.2%から87.3%まで精度を高め、ページ毎の処理時間をベースラインと比較して約14%削減した。
関連論文リスト
- AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent [18.58248061903799]
AgentOptは、クライアントサイドAI最適化のための最初のフレームワークに依存しないPythonパッケージである。
我々はまず,マルチステップエージェントパイプラインにおける高インパクト最適化レバーであるモデル選択について検討する。
指数関数的に増加する組み合わせ空間を効率的に探索するために、AgentOptは10の検索アルゴリズムを実装している。
論文 参考訳(メタデータ) (2026-04-07T17:13:47Z) - An Index-based Approach for Efficient and Effective Web Content Extraction [38.40209116782093]
索引に基づくWebコンテンツ抽出について紹介する。
我々はHTMLを構造対応のアドレス可能なセグメントに分割し、あるクエリに関連するコンテンツの位置インデックスのみを抽出する。
本手法は、コンテンツ長からの抽出遅延を分離し、高速なクエリ関連抽出を可能にする。
論文 参考訳(メタデータ) (2025-12-07T03:18:19Z) - Prune4Web: DOM Tree Pruning Programming for Web Agent [20.59581294172181]
Prune4Webは、DOM処理をリソース集約型LLM読み込みから効率的なプログラムプルーニングに移行する新しいパラダイムである。
そこで我々は,Planner, Programmatic Filter, Grounderを協調的に最適化する,特殊なデータアノテーションパイプラインと2ターン対話訓練戦略を提案する。
論文 参考訳(メタデータ) (2025-11-26T13:49:39Z) - Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation [54.61034867177997]
キャッシング推論応答は、大きな言語モデルに他の前方を通さずに、それらを検索することができる。
従来の正確なキャッシュは、クエリ間のセマンティックな類似性を見落とし、不要な再計算をもたらす。
本稿では,未知のクエリおよびコスト分布下でのセマンティックキャッシュ消去のための,原則的,学習ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-11T06:53:27Z) - DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree Traversal [55.13854171147104]
大規模言語モデル(LLM)は、自然言語処理、データ分析、ソフトウェア開発など、さまざまな領域に革命をもたらした。
符号化エージェントのための新しい推論時間計算スケーリングアプローチである動的アクション再サンプリング(DARS)を提案する。
我々は、SWE-Bench Liteベンチマークに対する我々のアプローチを評価し、このスケーリング戦略がClude 3.5 Sonnet V2で55%のパス@kスコアを達成したことを実証した。
論文 参考訳(メタデータ) (2025-03-18T14:02:59Z) - Re-evaluating Group Robustness via Adaptive Class-Specific Scaling [47.41034887474166]
群分散ロバスト最適化は、スプリアス相関とアドレスデータセットバイアスを軽減するために使われる顕著なアルゴリズムである。
既存のアプローチでは、堅牢なアキュラシーの改善が報告されているが、固有のトレードオフのため、平均的な精度が犠牲になっている。
本稿では,既存のデバイアスアルゴリズムに直接適用可能なクラス固有のスケーリング戦略を提案する。
我々は、このトレードオフを軽減するために、インスタンスワイド適応スケーリング技術を開発し、堅牢性と平均的アキュラシーの両方の改善に繋がる。
論文 参考訳(メタデータ) (2024-12-19T16:01:51Z) - Local Methods with Adaptivity via Scaling [38.99428012275441]
本稿では,局所的な学習手法と適応的アプローチを融合して,効率的な分散学習手法を開発することを目的とする。
従来のローカルSGD法について検討し,スケーリング機能により拡張する。
理論的解析に加えて,ニューラルネットワークのトレーニングにより,本手法の有効性を検証した。
論文 参考訳(メタデータ) (2024-06-02T19:50:05Z) - Learning to Optimize Permutation Flow Shop Scheduling via Graph-based
Imitation Learning [70.65666982566655]
置換フローショップスケジューリング(PFSS)は製造業で広く使われている。
我々は,より安定かつ正確に収束を加速する専門家主導の模倣学習を通じてモデルを訓練することを提案する。
我々のモデルのネットワークパラメータはわずか37%に減少し、エキスパートソリューションに対する我々のモデルの解のギャップは平均6.8%から1.3%に減少する。
論文 参考訳(メタデータ) (2022-10-31T09:46:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。