論文の概要: JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
- arxiv url: http://arxiv.org/abs/2607.11715v2
- Date: Wed, 15 Jul 2026 11:13:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.43254
- Title: JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
- Title(参考訳): JobHop v2: 大規模キャリア軌道データセット
- Authors: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie,
- Abstract要約: JobHopv2は、エンドツーエンドの大規模言語モデル(LLM)抽出によって構築された、公開可能なJobHopデータセットの改良版である。
データセットは、355,315ドルのキャリアトラジェクトリからなり、ESCOの職業コード、四半期ごとの時間情報、正規化された5段階の教育の達成が注釈付けされている。
- 参考スコア(独自算出の注目度): 44.09276843323847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale, richly annotated career trajectory data underpins workforce planning, job recommendation, and labour market analysis, yet publicly available datasets are either small, closed to independent use, or built from pre-standardized occupational codes with LLM-synthesized rather than authentic free text. We present JobHop~v2, an improved version of the publicly available JobHop dataset, constructed through end-to-end large language model (LLM) extraction from a corpus of ${\sim}440{,}000$ pseudonymized, multilingual resumes provided by VDAB, the Flemish Public Employment Service. The released dataset comprises $355{,}315$ career trajectories annotated with ESCO occupational codes, quarter-level temporal information, and normalized five-level education attainment, broadening both the coverage and the annotation richness of the original release. Relative to v1, JobHop~v2 introduces a redesigned extraction pipeline based on reasoning-controlled LLM inference with a retry mechanism (achieving a 100% JSON parse rate), a richer extraction schema, and a revised evaluation protocol scored against three complementary annotation baselines. Evaluated against these baselines, our best extractor comes closest to the inter-annotator agreement ceiling among all compared models, trailing it by only 1.1-2.7 percentage points. The dataset and code are publicly released to support reproducible career-trajectory research.
- Abstract(参考訳): 大規模な、豊富な注釈付きキャリアの軌跡は、労働計画、仕事の推薦、労働市場分析の基盤となっているが、公開されているデータセットは、小さく、独立した用途に閉鎖されているか、あるいは、本物の自由テキストではなく、LLMシンセサイザーで事前に標準化された職業コードから構築されている。
本稿では、JobHopデータセットの改良版であるJobHop~v2について、Flemish Public Employment ServiceであるVDABが提供している、${\sim}440{,}000$の偽名付き複数言語履歴書から、エンドツーエンドの大規模言語モデル(LLM)を抽出して構築した。
リリースデータセットは、355{,}315$のキャリアトラジェクトリで構成され、ESCOの職業コード、四半期レベルの時間情報、正規化された5段階の教育達成によって、オリジナルのリリースのカバレッジとアノテーション豊かさの両方を広げる。
v1とは対照的に、JobHop~v2では、推論制御されたLCM推論に基づいて、リトライ機構(100%JSONパースレートを達成する)、よりリッチな抽出スキーマ、そして3つの補完的なアノテーションベースラインに対して評価された修正された評価プロトコルによって、再設計された抽出パイプラインが導入されている。
これらのベースラインに対して評価し、比較したモデルの中で、最も優れた抽出器はアノテーション間の合意天井に最も近づき、わずか1.1-2.7%のポイントで追従する。
データセットとコードは公開され、再現可能なキャリア-軌道研究をサポートする。
関連論文リスト
- Cross-modal Retrieval Models for Stripped Binary Analysis [62.89251403093734]
BinSeekは、取り除かれたバイナリコード分析のための最初の2段階のクロスモーダル検索フレームワークである。
BinSeekEmbeddingは、バイナリコードのセマンティックな関連性を学ぶために、大規模なデータセットでトレーニングされている。
BinSeek-Rerankerは、コンテキスト拡張による記述に対する候補コードの関連性を慎重に判断することを学ぶ。
論文 参考訳(メタデータ) (2025-12-11T07:58:10Z) - AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent [36.65355075707938]
AI研究における重要な応用の1つは、エージェントとベースライン検索による実験設計を自動化することである。
ベースラインおよびデータセットレコメンデーションのための包括的フレームワークを提案する。
我々は、正確な相互作用連鎖を構築して明確な推論連鎖を構築し、解釈可能な正当化を生成するために大きな言語モデルを微調整する推論強化リランカを開発する。
論文 参考訳(メタデータ) (2025-11-07T01:51:56Z) - JobHop: A Large-Scale Dataset of Career Trajectories [43.84577100931558]
ジョブホップ(JobHop)は、ベルギーのフランドルにある公共雇用サービスVDABが提供する匿名の履歴書から派生した大規模なパブリックデータセットである。
構造化されていない履歴データを処理し、構造化された経歴情報を抽出し、標準化された ESCO の職業コードに正規化する。
この結果、361,000人以上の履歴書から抽出され、グループ化された166万以上の作業経験の豊富なデータセットが得られた。
論文 参考訳(メタデータ) (2025-05-12T15:22:29Z) - Enhancing Talent Employment Insights Through Feature Extraction with LLM Finetuning [0.0]
遠隔作業の可利用性、報酬構造、教育要件、作業経験の好みなどの変数を識別する堅牢なパイプラインを開発する。
本手法は,従来の解析ツールの限界を克服するために,意味的チャンキング,検索拡張生成(RAG),微調整DistilBERTモデルを組み合わせる。
細調整されたモデルの包括的評価を行い、その強度、限界、スケーリングの可能性について分析する。
論文 参考訳(メタデータ) (2025-01-13T19:49:49Z) - KARRIEREWEGE: A Large Scale Career Path Prediction Dataset [29.24421465266904]
我々は500万以上のキャリアパスを含む包括的な公開データセットであるKARRIEREWEGEを紹介する。
履歴書に典型的に見られる自由テキスト入力の問題に対処するために,職名や記述を合成することで,それを強化する。
これにより、非構造化データからの正確な予測が可能になり、実際のアプリケーションの課題と密接に一致します。
論文 参考訳(メタデータ) (2024-12-19T08:02:08Z) - Leveraging Foundation Language Models (FLMs) for Automated Cohort Extraction from Large EHR Databases [50.552056536968166]
本稿では,2つの大規模かつ広くアクセス可能なEHRデータベース上で列マッチングを自動化するアルゴリズムを提案し,評価する。
提案手法は,学習済みの小型汎用言語モデルを用いて,13ドル列のうち12ドルを正確にマッチングし,高いトップ3の精度を92%の精度で達成する。
論文 参考訳(メタデータ) (2024-12-16T06:19:35Z) - AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators [98.11286353828525]
GPT-3.5シリーズのモデルは、様々なNLPタスクにまたがる顕著な少数ショットとゼロショットの能力を示している。
本稿では,2段階のアプローチを取り入れたAnnoLLMを提案する。
我々はAnnoLLMを用いた対話型情報検索データセットを構築した。
論文 参考訳(メタデータ) (2023-03-29T17:03:21Z) - Summary-Source Proposition-level Alignment: Task, Datasets and
Supervised Baseline [94.0601799665342]
資料の参照要約における文のアライメントは,補助的な要約作業として有用であった。
本稿では,2つの重要な新機能を導入しながら,要約ソースアライメントを明示的なタスクとして確立することを提案する。
我々は提案レベルのアライメントのための新しいトレーニングデータセットを作成し、利用可能な要約評価データから自動的に抽出する。
教師なしアプローチよりも優れたアライメント品質を示す教師付き命題アライメントベースラインモデルを提案する。
論文 参考訳(メタデータ) (2020-09-01T17:27:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。