論文の概要: Lot Machine: Multimodal Lot Extraction from Auction Catalogs
- arxiv url: http://arxiv.org/abs/2608.30510v2
- Date: Tue, 01 Sep 2026 20:07:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.745711
- Title: Lot Machine: Multimodal Lot Extraction from Auction Catalogs
- Title(参考訳): ロットマシン:オークションカタログからのマルチモーダルロット抽出
- Authors: Mathias Zinnen, Alisha Mund, Sabine Lang, Lukas Hüttner, Thomas Gorges, Vincent Christlein,
- Abstract要約: 歴史的オークションカタログから構造化されたロットレベルのメタデータを自動的に抽出するパイプラインを提案する。
我々は,視覚言語モデル (VLM) を,様々なプロンプト戦略と制約付き復号化フレームワークの下で評価する。
この研究は、VLMベースのパイプラインが、大規模な自動分析のために歴史的オークションカタログをアンロックできることを実証している。
- 参考スコア(独自算出の注目度): 3.5918066453136697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For provenance research and art market studies, auction catalogs are an essential resource to trace specific objects over time and space. While historical auction catalogs follow established domain conventions, their internal formatting remains highly variable, and their large-scale analysis is currently restricted by the lack of machine-readable representations of the auction lots. We propose a pipeline to automatically extract structured lot-level metadata from German Sales, a large database of historical auction and sales catalogs from the 19th and 20th centuries. Using a manually annotated test set of representative catalog pages, we evaluate Vision-Language Models (VLMs) under varying prompt strategies and constrained decoding frameworks. To reflect the practical constraints faced by cultural heritage institutions, including budget, compute resources, and data privacy requirements, we benchmark the methods across different deployment modes ranging from commercial providers to locally hosted, quantized models. We find that commercial endpoints establish the performance ceiling, while institutional gateways offer a viable, privacy-preserving alternative. Local deployments remain feasible, but strictly require enforcing the output structure during generation to guarantee a valid JSON format. While varying degrees of human-in-the-loop correction are still necessary, this work demonstrates that a VLM-based pipeline can successfully unlock historical auction catalogs for large-scale automated analysis.
- Abstract(参考訳): 先進的な研究や芸術市場の研究では、オークションカタログは時間と空間を通じて特定の物体を追跡するのに欠かせない資源である。
歴史的オークションカタログは確立されたドメインの慣習に従っているが、内部のフォーマットは非常に可変的であり、大規模な分析は、現在、オークションロットの機械可読表現の欠如によって制限されている。
本研究では,19世紀から20世紀にかけての歴史的オークションおよび販売カタログの大規模データベースであるドイツ販売から,構造化されたロットレベルのメタデータを自動的に抽出するパイプラインを提案する。
代表的なカタログページを手動でアノテートしたテストセットを用いて、様々なプロンプト戦略と制約付きデコードフレームワークの下でビジョン・ランゲージ・モデル(VLM)を評価する。
予算や計算資源,データプライバシ要件など,文化遺産機関が直面する現実的な制約を反映するために,我々は,商用提供者からローカルにホストされた量子化モデルに至るまで,さまざまな展開モードの手法をベンチマークする。
商業的なエンドポイントがパフォーマンスの天井を確立するのに対して、機関のゲートウェイは実行可能な、プライバシ保護の代替手段を提供しています。
ローカルデプロイメントは引き続き実現可能だが、有効なJSONフォーマットを保証するためには、生成時に出力構造を強制する必要がある。
この研究は、VLMベースのパイプラインが大規模な自動解析のために歴史的オークションカタログをアンロックできることを証明している。
関連論文リスト
- FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios [58.34124792457706]
製造業セクターは、単純な認識から自律的な実行に移行するために、MLLM(Multimodal Large Language Models)をますます採用している。
進捗は、データの不足と、既存のデータセットにおけるきめ細かいドメインセマンティクスの欠如によって妨げられている。
まず、実世界の2D画像と3Dポイントクラウドを組み合わせて、微粒なドメインセマンティクスを付加した高品質なデータセットを構築します。
次に, 3 つの製造課題,すなわち, 構造面検査, 組立検査, 組立検証の18の最先端MLLMを評価し, 大幅な性能差を明らかにした。
論文 参考訳(メタデータ) (2026-04-08T12:23:27Z) - Large Language Models as Automatic Annotators and Annotation Adjudicators for Fine-Grained Opinion Analysis [3.186130813218338]
この作業では、宣言的なアノテーションパイプラインを使用して、テキスト中の詳細な意見を識別します。
LLM は自動アノテータやアジュディケータとして機能し,個々の LLM ベースのアノテータ間で高いアノテータ間合意を実現する。
これにより、これらの微粒な意見アノテートデータセットを作成するのに必要なコストと人的労力が削減される。
論文 参考訳(メタデータ) (2026-01-23T14:52:56Z) - FEDEXCHANGE: Bridging the Domain Gap in Federated Object Detection for Free [58.34974215853841]
Federated Object Detection (FOD)は、クライアントがさまざまなドメインからローカルデータにアクセスすることなく、グローバルなオブジェクト検出モデルを協調的にトレーニングすることを可能にする。
既存のFOD法はしばしばエッジデバイスのハードウェア制約を見落とし、高い計算コストを発生させる局所的なトレーニング正規化を導入する。
本稿ではFEDEXCHANGEを提案する。FEDEXCHANGEはドメインギャップを埋める新しいFODフレームワークである。
論文 参考訳(メタデータ) (2025-09-01T17:39:25Z) - Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search [54.987957691350665]
クエリ駆動テキスト要約(QDTS)は、与えられたクエリに基づいてテキスト文書から簡潔で情報的な要約を生成することを目的としている。
従来の抽出的要約モデルは、主にランク付け候補の要約セグメントに基づいており、産業応用において支配的なアプローチとなっている。
産業Web検索におけるリアルタイムQDTSに対処するための生成モデルの適用を開拓するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-28T08:51:51Z) - Building a Few-Shot Cross-Domain Multilingual NLU Model for Customer Care [1.0129089187146396]
注釈付きデータに微調整された多言語BERTのようなSOTA事前訓練されたモデルは、顧客ケアに関連する下流タスクにおいて優れたパフォーマンスを示している。
本稿では,いくつかのラベル付きサンプルを用いて,最先端のドメイン固有モデルを他のドメインに拡張する組込みモデルアーキテクチャを提案する。
カナダとメキシコのeコマース Customer Careデータセットを数ショットで検出する実験では、精度が20~23%向上した。
論文 参考訳(メタデータ) (2025-06-04T19:14:48Z) - A New Pipeline For Generating Instruction Dataset via RAG and Self Fine-Tuning [0.0]
本研究では,特定のドメインを微調整するための高品質な命令データセットを構築するパイプラインを提案する。
ドメイン固有の文書を取り込み、パイプラインは関連性のある適切な命令を生成する。
ケーススタディでは、専門知識と患者情報の繊細な取り扱いを必要とする領域である精神医学の領域にこのアプローチを適用した。
論文 参考訳(メタデータ) (2024-08-12T03:52:11Z) - Prompting Encoder Models for Zero-Shot Classification: A Cross-Domain Study in Italian [75.94354349994576]
本稿では,より小型のドメイン固有エンコーダ LM と,特殊なコンテキストにおける性能向上手法の併用の可能性について検討する。
本研究は, イタリアの官僚的・法的言語に焦点をあて, 汎用モデルと事前学習型エンコーダのみのモデルの両方を実験する。
その結果, 事前学習したモデルでは, 一般知識の頑健性が低下する可能性があるが, ドメイン固有のタスクに対して, ゼロショット設定においても, より優れた適応性を示すことがわかった。
論文 参考訳(メタデータ) (2024-07-30T08:50:16Z) - Adapting Large Language Models for Content Moderation: Pitfalls in Data
Engineering and Supervised Fine-tuning [79.53130089003986]
大規模言語モデル(LLM)は、様々なドメインでタスクを処理するための実現可能なソリューションとなっている。
本稿では、コンテンツモデレーションのためにプライベートにデプロイ可能なLLMモデルを微調整する方法を紹介する。
論文 参考訳(メタデータ) (2023-10-05T09:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。