論文の概要: Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models
- arxiv url: http://arxiv.org/abs/2607.06012v1
- Date: Tue, 07 Jul 2026 08:54:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.460475
- Title: Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models
- Title(参考訳): クラスタリング・分類・大規模言語モデルを用いた不動産文書からの構造化データ抽出
- Abstract要約: 最もリッチな資産レベルの情報は、現在、自動化されたシステムが大規模に処理していないような、添付のアンケート書類に記載されている。
選択可能なテキスト文書から構造化されたデータを取得し,分類し,抽出するためのエンドツーエンドパイプラインを提案する。
- 参考スコア(独自算出の注目度): 0.9740025522928777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real estate property listings expose structured metadata through the API. Still, the richest property-level information (i.e., legal status, structural condition, utility supplies, heating systems) sits in attached questionnaire documents that no automated system currently processes at scale. These documents are heterogeneous. Some are digitally generated with selectable text, others are scanned physical forms. There are even more complex layouts that contain checkbox annotations that defeat conventional text extraction. In this paper, we present an end-to-end pipeline for acquiring, classifying, and extracting structured data from selectable text documents. The pipeline was applied to 3965 questionnaire documents collected from a live property platform via reverse-engineered REST APIs. First, we classified each document into one of three structural categories (text_only, scanned, and special_char), then extracted 35 predefined property attributes from eligible documents using DeepSeek R1 as the Large Language Model, prompted to return a structured JSON object. All 2781 submitted documents were processed successfully, producing a final dataset of 2766 unique property records. Downstream validation confirmed the data quality. Cosine similarity matching achieves a Jaccard consistency score of 0.82, and K-Means clustering produces interpretable market segments with a silhouette score of 0.2088. Results show that the proposed extraction from each property document is both feasible and reliable at this scale.
- Abstract(参考訳): 不動産物件のリストは、APIを通じて構造化されたメタデータを公開する。
しかし、最も豊富な財産レベルの情報(法的地位、構造条件、電力供給、暖房システムなど)は、現在自動化されたシステムが大規模に処理していない質問書に添付されている。
これらの文書は異質である。
いくつかは選択可能なテキストでデジタル生成され、他のものは物理的にスキャンされる。
従来のテキスト抽出を破るチェックボックスアノテーションを含む、さらに複雑なレイアウトがある。
本稿では,選択可能なテキスト文書から構造化されたデータを取得し,分類し,抽出するためのエンドツーエンドパイプラインを提案する。
パイプラインは、リバースエンジニアリングのREST APIを通じて、ライブプロパティプラットフォームから収集された3965のアンケートドキュメントに適用された。
まず、各ドキュメントを3つの構造カテゴリのうちの1つ(text_only, scanned, special_char)に分類し、次に、DeepSeek R1をLarge Language Modelとして使用して、許容可能なドキュメントから35の事前定義されたプロパティ属性を抽出し、構造化JSONオブジェクトを返すように促した。
2781件の提出書類は全て処理に成功し、2766件のユニークな資産記録の最終的なデータセットが作成された。
ダウンストリーム検証は、データ品質を確認した。
コサイン類似性マッチングはJaccard一貫性スコアが0.82、K-Meansクラスタリングはシルエットスコアが0.2088の解釈可能な市場セグメントを生成する。
以上の結果から,各財産文書からの抽出は,この規模で実現可能かつ信頼性が高いことが示唆された。
関連論文リスト
- VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval [65.89247522243959]
VisDocAgentBenchは、静的検索とエージェント検索を比較したクローズドコーパスベンチマークである。
100の文書から2,375ページ、120のユニークなターゲットクエリが直接、一橋、二橋のエビデンス構造でバランスを取っている。
強力な遅延対話型ビジュアルレトリバーは、直接アイテムで97.50%のRecall@1に達するが、2ブリッジアイテムでは2.50%に達し、関連性がコーパスコンテキストに依存する場合のクエリ-ターゲットマッチングの限界を明らかにする。
論文 参考訳(メタデータ) (2026-08-18T15:23:06Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - ExStrucTiny: A Benchmark for Schema-Variable Structured Information Extraction from Document Images [19.490609860018804]
文書画像から構造化情報抽出(IE)のための新しいベンチマークデータセットであるExStrucTinyを紹介する。
ExStrucTinyは、手動と合成された人間のバリデーションサンプルを組み合わせた、新しいパイプラインで構築されている。
このベンチマークでオープンでクローズドなビジョン言語モデルを分析し、適応、クエリアンダーセグメンテーション、スキーマ適応といった課題を強調します。
論文 参考訳(メタデータ) (2026-02-12T17:38:57Z) - UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters [55.34921520578968]
視覚言語モデル(VLM)は、テキストと公式の統一的な認識を実現している。
パラメータが0.1Bしか持たない統一認識モデルUniRec-0.1Bを提案する。
文字、単語、行、段落、文書など、複数のレベルでテキストや公式の認識を行うことができる。
論文 参考訳(メタデータ) (2025-12-24T10:35:21Z) - Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documents [9.173952465423966]
標準化されたドキュメントは、反復的なボイラープレートテキストや同様のテーブル構造など、同様のフォーマットを共有している。
この類似性により、従来のRAGメソッドは、ほぼ重複したテキストを誤識別し、精度と完全性を損なう重複検索につながる。
本稿では,これらの問題に対処するためのEvidence Curationフレームワークを用いた階層検索手法を提案する。
論文 参考訳(メタデータ) (2025-05-26T11:08:23Z) - Multi-Field Adaptive Retrieval [39.38972160512916]
MFAR(Multi-Field Adaptive Retrieval)は、構造化データ上の任意の文書インデックスに対応するフレキシブルなフレームワークである。
本フレームワークは,(1) 既存の文書のフィールドへの分解,(2) 文書クエリの条件付けによるフィールドの重要性を適応的に予測するモデル学習,という2つのステップから構成される。
提案手法により,フィールドタイプ間での濃密表現と語彙表現の最適化が実現され,既存の検索者よりも文書のランク付けが大幅に向上し,マルチフィールド構造における最先端の性能が向上することがわかった。
論文 参考訳(メタデータ) (2024-10-26T03:07:22Z) - Contextual Document Embeddings [77.22328616983417]
本稿では,コンテキスト化された文書埋め込みのための2つの補完手法を提案する。
第一に、文書近傍を明示的にバッチ内コンテキスト損失に組み込む別のコントラスト学習目標である。
第二に、隣接する文書情報をエンコードされた表現に明示的にエンコードする新しいコンテキストアーキテクチャ。
論文 参考訳(メタデータ) (2024-10-03T14:33:34Z) - Lightweight Spatial Modeling for Combinatorial Information Extraction From Documents [31.434507306952458]
文書エンティティのK-nearest-neighbor(KNN)グラフに基づいて,注目度計算の新たなバイアスを取り入れたKNNフォーマを提案する。
また、多くの文書に存在する1対1のマッピング特性に対処するために、マッチング空間を用いる。
本手法はトレーニング可能なパラメータの数の観点から既存の手法と比較して非常に効率的である。
論文 参考訳(メタデータ) (2024-05-08T10:10:38Z) - PDFTriage: Question Answering over Long, Structured Documents [60.96667912964659]
構造化文書をプレーンテキストとして表現することは、これらの文書をリッチな構造でユーザ精神モデルと矛盾する。
本稿では,構造や内容に基づいて,モデルがコンテキストを検索できるPDFTriageを提案する。
ベンチマークデータセットは,80以上の構造化文書に900以上の人間が生成した質問からなる。
論文 参考訳(メタデータ) (2023-09-16T04:29:05Z) - A Neural Model for Joint Document and Snippet Ranking in Question
Answering for Large Document Collections [9.503056487990959]
共同文書とスニペットランキングのためのアーキテクチャを提案する。
アーキテクチャは汎用的であり、ニューラルテキスト関連ローダで使用することができる。
BIOASQのバイオメディカルデータを用いた実験により,我々の関節モデルはスニペット検索においてパイプラインを大幅に上回っていることがわかった。
論文 参考訳(メタデータ) (2021-06-16T16:04:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。