論文の概要: Domain-Specific Text Embedding Models for Entity Resolution
- arxiv url: http://arxiv.org/abs/2608.16161v1
- Date: Mon, 17 Aug 2026 06:26:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.557276
- Title: Domain-Specific Text Embedding Models for Entity Resolution
- Title(参考訳): エンティティ解決のためのドメイン特化テキスト埋め込みモデル
- Abstract要約: 本稿では,ドメイン固有3重項微調整が事前学習した埋め込みモデルに適応できるかどうかを考察する。
その結果, 類似した非マッチから真のマッチを分離する上で, 大幅な改善が見られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: General-purpose text embedding models are designed to capture semantic similarity but are not optimised for distinguishing entity records that represent the same real-world business or person. This limitation affects applications such as entity resolution and duplicate record retrieval, where small textual differences may either preserve or change identity. This paper investigates whether domain-specific triplet fine-tuning can adapt pretrained embedding models for identity-sensitive retrieval. A synthetic dataset of business and person records was created with identity-preserving variations and challenging non-matching examples. Two widely used embedding models were evaluated before and after fine-tuning using a margin-based similarity evaluation. The results show substantial improvements in separating true matches from highly similar non-matches, demonstrating that domain-specific triplet training can effectively reshape general-purpose embedding spaces for entity retrieval. These findings suggest that targeted fine-tuning provides a practical approach for improving embedding models in data quality management and information retrieval applications.
- Abstract(参考訳): 汎用テキスト埋め込みモデルは、セマンティックな類似性を捉えるために設計されているが、同一の現実世界のビジネスまたは人を表すエンティティレコードを区別するために最適化されていない。
この制限は、エンティティの解像度や重複したレコード検索のようなアプリケーションに影響を及ぼし、小さなテキストの違いはアイデンティティを保存または変更する可能性がある。
本稿では,ドメイン固有のトリプルトファインチューニングが,事前学習した埋め込みモデルに適応できるかどうかを考察する。
ビジネスと個人記録の合成データセットが作成され、アイデンティティ保存のバリエーションと非マッチングの事例に挑戦した。
ファインチューニング前後の2種類の埋め込みモデルをマージンベース類似性評価を用いて評価した。
この結果から, ドメイン固有の三重項学習が, エンティティ検索のための汎用埋め込み空間を効果的に形成できることが示唆された。
これらの結果から,データ品質管理や情報検索アプリケーションにおける組込みモデルの改善に,標的となる微調整が有効な方法であることが示唆された。
関連論文リスト
- Adaptive Hopfield Network: Rethinking Similarities in Associative Memory [25.935774032106256]
連想記憶モデル(Associative memory model)は、生物学的インテリジェンスの基本となる、コンテンツ適応可能なメモリシステムである。
我々は、この洞察に富むが未知の確率をサンプルから近似する新しいメカニズムである適応的類似性を開発する。
我々は,この機構を新しい適応ホップフィールドネットワーク(A-Hop)に統合し,様々なタスクにまたがって最先端の性能を実現することを実証した。
論文 参考訳(メタデータ) (2025-11-25T18:36:47Z) - RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization [36.973388673687815]
RanLayNetは、自動的に割り当てられたラベルでリッチ化された合成ドキュメントデータセットである。
本研究では,データセットでトレーニングしたディープレイアウト識別モデルに対して,実際の文書のみをトレーニングしたモデルと比較して,性能が向上したことを示す。
論文 参考訳(メタデータ) (2024-04-15T07:50:15Z) - Order-preserving Consistency Regularization for Domain Adaptation and
Generalization [45.64969000499267]
ディープラーニングモデルは、モデルがドメイン固有の属性に過敏である場合、ドメイン間の課題で失敗する。
クロスドメインタスクのための順序保存一貫性規則化(OCR)を提案する。
論文 参考訳(メタデータ) (2023-09-23T04:45:42Z) - Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction [67.54420015049732]
Aspect Sentiment Triplet extract (ASTE) は感情分析における課題であり、人間の感情に対するきめ細かい洞察を提供することを目的としている。
既存のベンチマークは2つのドメインに限定されており、目に見えないドメイン上でのモデルパフォーマンスを評価しない。
各種ドメインのサンプルに注釈を付けることでドメイン拡張ベンチマークを導入し,ドメイン内設定とドメイン外設定の両方でモデルの評価を可能にする。
論文 参考訳(メタデータ) (2023-05-23T18:01:49Z) - SALUDA: Surface-based Automotive Lidar Unsupervised Domain Adaptation [62.889835139583965]
我々は、ソースデータとターゲットデータに基づいて、暗黙の基盤となる表面表現を同時に学習する教師なし補助タスクを導入する。
両方のドメインが同じ遅延表現を共有しているため、モデルは2つのデータソース間の不一致を許容せざるを得ない。
実験の結果,本手法は実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-
論文 参考訳(メタデータ) (2023-04-06T17:36:23Z) - Modular Domain Adaptation [31.073814047189742]
オフザシェルフモデルは感情などのテキストを測定するために広く使われている。
ソースデータへのアクセスがなければ、妥当性の脅威となるドメインシフトを考慮に入れるのは難しい。
モデル生産者とモデル消費者が協力して、より正確なテキスト測定を容易にする方法を示す。
論文 参考訳(メタデータ) (2022-04-26T22:08:58Z) - On Generalization in Coreference Resolution [66.05112218880907]
モデルの市販性能を評価するため、異なるドメインを対象とした8つのコア参照解決データセットを統合する。
次に、それらのドメイン、アノテーションガイドライン、メタデータが異なるにもかかわらず、トレーニングのために3つのデータセットを混ぜて、単一のモデルを共同でトレーニングする方法を提案する。
ゼロショット環境では、単一のデータセット転送でトレーニングされたモデルが不十分であるのに対して、共同トレーニングの成果によって全体的なパフォーマンスが改善されていることが分かりました。
論文 参考訳(メタデータ) (2021-09-20T16:33:22Z) - Revisiting Mahalanobis Distance for Transformer-Based Out-of-Domain
Detection [60.88952532574564]
本稿では,ドメイン外インテント検出手法を徹底的に比較する。
意図分類のための3つの標準データセット上で,複数のコンテキストエンコーダとメソッドを効率良く評価する。
本研究の主目的は,超微調整トランスフォーマーを用いたドメイン内データエンコーダが優れた結果をもたらすことである。
論文 参考訳(メタデータ) (2021-01-11T09:10:58Z) - Few-Shot Named Entity Recognition: A Comprehensive Study [92.40991050806544]
マルチショット設定のモデル一般化能力を向上させるための3つの手法を検討する。
ラベル付きデータの比率の異なる10の公開nerデータセットについて経験的比較を行う。
マルチショットとトレーニングフリーの両方の設定で最新の結果を作成します。
論文 参考訳(メタデータ) (2020-12-29T23:43:16Z) - Interpretable Entity Representations through Large-Scale Typing [61.4277527871572]
本稿では,人間の読みやすいエンティティ表現を作成し,箱から高パフォーマンスを実現する手法を提案する。
我々の表現は、微粒な実体型に対する後続確率に対応するベクトルである。
特定のドメインに対して,学習に基づく方法で,型セットのサイズを縮小できることを示す。
論文 参考訳(メタデータ) (2020-04-30T23:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。