論文の概要: Two-Step Occupation Coding
- arxiv url: http://arxiv.org/abs/2607.20101v1
- Date: Wed, 22 Jul 2026 12:55:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.078786
- Title: Two-Step Occupation Coding
- Title(参考訳): 2ステップ作業符号化
- Abstract要約: 本稿では,職種と職種を区別する新しい2段階のアプローチを提案する。
最初のステップでは、ドメイン固有の名前付きエンティティ認識(NER)モデルが、連続したテキスト内の職種を識別する。
第2のステップでは、抽出されたジョブのタイトルを分類にマッピングし、分類器がこのマッピングのみに集中できるようにする。
この方法はドイツの文書のために開発されたが、他の言語に転送可能である。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Occupation coding links job titles in free text to occupational taxonomies and is a core task in labor market research. Existing approaches typically address this problem in a single end-to-end step, jointly identifying job titles and assigning occupational codes. This paper presents a novel two-step approach that separates these tasks. In the first step, a domain-specific Named Entity Recognition (NER) model identifies occupational titles in continuous text, even under noise such as OCR errors. In the second step, the extracted job titles are mapped to a taxonomy, enabling the classifier to focus exclusively on this mapping. We demonstrate that this separation improves accuracy, robustness, and interpretability compared to single-step approaches. The method has been developed for German documents but is transferable to other languages. We further introduce a margin-based confidence criterion for occupation coding, replacing common absolute thresholds. To support reproducibility, we publish the source code and evaluation scripts.
- Abstract(参考訳): Occupation codeは、フリーテキストの職名と職業分類学を結びつけ、労働市場研究における中核的な課題である。
既存のアプローチでは、1つのエンドツーエンドのステップでこの問題に対処し、ジョブを共同で識別し、職種コードを割り当てる。
本稿では,これらの課題を分離する新しい2段階のアプローチを提案する。
最初のステップでは、ドメイン固有の名前付きエンティティ認識(NER)モデルが、OCRエラーのようなノイズの下でも、連続したテキスト内の職種を識別する。
第2のステップでは、抽出されたジョブのタイトルを分類にマッピングし、分類器がこのマッピングのみに集中できるようにする。
この分離により, 単一ステップのアプローチに比べて精度, 堅牢性, 解釈性が向上することを示す。
この方法はドイツの文書のために開発されたが、他の言語に転送可能である。
さらに、共通絶対しきい値を置き換える、職業符号化のためのマージンベースの信頼基準を導入する。
再現性を支援するため,ソースコードと評価スクリプトを公開する。
関連論文リスト
- GatedLexiconNet: A Comprehensive End-to-End Handwritten Paragraph Text Recognition System [3.9527064697847005]
内部線分割と畳み込み層に基づくエンコーダを組み込んだエンドツーエンドの段落認識システムを提案する。
本研究は、IAMでは2.27%、RIMESでは0.9%、READ-16では2.13%、READ-2016データセットでは5.73%の文字誤り率を報告した。
論文 参考訳(メタデータ) (2024-04-22T10:19:16Z) - VacancySBERT: the approach for representation of titles and skills for
semantic similarity search in the recruitment domain [0.0]
本稿では、HRドメインに適用されたディープラーニングセマンティックサーチアルゴリズムに焦点を当てた。
この記事の目的は、求人広告で言及されているスキルとタイトルを結びつけるために、シームズネットワークをトレーニングする新しいアプローチを開発することである。
論文 参考訳(メタデータ) (2023-07-31T13:21:15Z) - Description-Enhanced Label Embedding Contrastive Learning for Text
Classification [65.01077813330559]
モデル学習プロセスにおける自己監督型学習(SSL)と新しい自己監督型関係関係(R2)分類タスクの設計
テキスト分類とR2分類を最適化対象として扱うテキスト分類のための関係学習ネットワーク(R2-Net)の関係について検討する。
ラベルセマンティックラーニングのためのマルチアスペクト記述を得るためのWordNetからの外部知識。
論文 参考訳(メタデータ) (2023-06-15T02:19:34Z) - Towards Unsupervised Recognition of Token-level Semantic Differences in
Related Documents [61.63208012250885]
意味的差異をトークンレベルの回帰タスクとして認識する。
マスク付き言語モデルに依存する3つの教師なしアプローチについて検討する。
その結果,単語アライメントと文レベルのコントラスト学習に基づくアプローチは,ゴールドラベルと強い相関関係があることが示唆された。
論文 参考訳(メタデータ) (2023-05-22T17:58:04Z) - Disambiguation of Company names via Deep Recurrent Networks [101.90357454833845]
企業名文字列の埋め込みである教師付き学習を通じて,Siamese LSTM Network を抽出する手法を提案する。
私たちは、ラベル付けされるサンプルを優先するActive Learningアプローチが、より効率的な全体的な学習パイプラインをもたらす方法を分析します。
論文 参考訳(メタデータ) (2023-03-07T15:07:57Z) - Towards End-to-end Handwritten Document Recognition [0.0]
手書き文字認識は、その多くの応用のために過去数十年にわたって広く研究されてきた。
本稿では,文書全体の手書きテキスト認識をエンドツーエンドで行うことで,これらの課題に対処することを提案する。
RIMES 2011, IAM, READ 2016 データセットの段落レベルでの最先端結果に到達し, これらのデータセットのラインレベル状態よりも優れていた。
論文 参考訳(メタデータ) (2022-09-30T10:31:22Z) - Predicting Job Titles from Job Descriptions with Multi-label Text
Classification [0.0]
ジョブ記述テキストから関連職名を予測するための多ラベル分類手法を提案する。
本稿では,Bio-GRU-LSTM-CNNを各種事前学習言語モデルで実装し,職種予測問題に適用する。
論文 参考訳(メタデータ) (2021-12-21T09:31:03Z) - Transformer-Based Approach for Joint Handwriting and Named Entity
Recognition in Historical documents [1.7491858164568674]
本研究は,手書き文書における名前付きエンティティ認識にトランスフォーマネットワークを採用した最初のアプローチを示す。
我々は,Esposalles データベースを用いた ICDAR 2017 Information extract コンペティションにおいて,新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2021-12-08T09:26:21Z) - Cross-domain Speech Recognition with Unsupervised Character-level
Distribution Matching [60.8427677151492]
2つの領域における各文字間の微粒化適応を行うための文字レベルの分布マッチング手法であるCMatchを提案する。
Libri-Adaptデータセットを用いた実験の結果,提案手法はクロスデバイスとクロス環境の両方で14.39%,16.50%の単語誤り率(WER)を低減できることがわかった。
論文 参考訳(メタデータ) (2021-04-15T14:36:54Z) - Pairwise Learning for Name Disambiguation in Large-Scale Heterogeneous
Academic Networks [81.00481125272098]
本稿では,MA-PairRNN(Multi-view Attention-based Pairwise Recurrent Neural Network)を提案する。
MA-PairRNNは、不均一グラフ埋め込み学習とペアワイズ類似学習をフレームワークに統合する。
実世界の2つのデータセットの結果から、我々のフレームワークは名前の曖昧さに対するパフォーマンスを著しく一貫した改善をしていることがわかる。
論文 参考訳(メタデータ) (2020-08-30T06:08:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。