論文の概要: Letting the Data Speak: Extracting Keywords from Crowdsourced Collections with AI
- arxiv url: http://arxiv.org/abs/2607.09324v1
- Date: Fri, 10 Jul 2026 12:06:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.433692
- Title: Letting the Data Speak: Extracting Keywords from Crowdsourced Collections with AI
- Title(参考訳): データスポーティング:AIでクラウドソーシングされたコレクションからキーワードを抽出する
- Authors: Miguel Arana-Catania, Catherine Conisbee, Matthew Kidd,
- Abstract要約: 本稿では,クラウドソーシングコレクションからキーワードを抽出するプロジェクトについて報告する。
オックスフォード大学主催の第2次世界大戦のデジタルコレクションである「The Their Finest Hour Online Archive」が使用されている。
このプロジェクトは、キーワード抽出を自動化する3つの自然言語処理手法を評価した。
- 参考スコア(独自算出の注目度): 0.33985395340995606
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Identifying and assigning keywords at scale is a technical, practical, and ethical challenge for crowdsourced collections. This article reports the findings of the "Extracting Keywords from Crowdsourced Collections" project, which used the Their Finest Hour Online Archive, a crowdsourced Second World War digital collection hosted by the University of Oxford, as a case study. The project evaluated three Natural Language Processing approaches to automate keyword extraction: Named Entity Recognition, Keyword Extraction, and Topic Modelling. It tested these approaches across a range of artificial intelligence techniques, from traditional statistical methods to modern GenAI neural networks. Our quantitative and qualitative findings indicate that Natural Language Processing approaches offer real potential for keyword extraction at scale in crowdsourced collections, but that no single method offers a complete solution and that model choice significantly shapes results. We argue that in crowdsourced collections, where metadata is the direct product of engagement with living contributors, automated keyword extraction raises distinct stewardship responsibilities that must be addressed alongside technical performance. Open-weight, extractive models emerge from our evaluation as best placed to support responsible deployment, while generative AI, despite its abstractive potential, introduces accountability risks that anyone managing crowdsourced collections should weigh carefully.
- Abstract(参考訳): 大規模なキーワードの特定と割り当ては,クラウドソーシングによるコレクションの技術的,実践的,倫理的課題である。
本稿では,オックスフォード大学主催のクラウドソーシング第2次世界大戦のデジタルコレクションであるThe Their Finest Hour Online Archiveを用いた「クラウドソーシングコレクションからキーワードを抽出する」プロジェクトの成果を事例として報告する。
このプロジェクトでは、キーワード抽出を自動化する自然言語処理アプローチとして、名前付きエンティティ認識、キーワード抽出、トピックモデリングの3つを評価した。
彼らはこれらのアプローチを、従来の統計手法から現代のGenAIニューラルネットワークまで、さまざまな人工知能技術でテストした。
定量的および定性的な結果から,自然言語処理手法は,クラウドソーシングされたコレクションにおいて,大規模にキーワード抽出を行う可能性を示唆するが,完全な解法を提供する手法は1つもなく,モデル選択が結果を著しく形作ることが示唆された。
メタデータが生のコントリビュータとの関わりの直接的な産物であるクラウドソーシングコレクションでは、自動キーワード抽出によって、技術的パフォーマンスと並行して対処しなければならない管理責任が明確になる、と我々は主張する。
オープンウェイトで抽出可能なモデルは、責任あるデプロイメントをサポートするのに最適なものとして、私たちの評価から現れます。
関連論文リスト
- Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality [74.59049806800176]
このデモペーパーでは、Tevatronツールキットの重要な特徴、学界と産業の橋渡しについて取り上げている。
強い多言語・多モーダルな有効性を実現するための密集型検索器について紹介する。
私たちはOmniEmbedもリリースしています。私たちの知る限り、テキスト、画像ドキュメント、ビデオ、オーディオ検索を統一する最初の埋め込みモデルです。
論文 参考訳(メタデータ) (2025-05-05T08:52:49Z) - Generative Compositor for Few-Shot Visual Information Extraction [60.663887314625164]
生成空間モデルとして生成空間モデル(Generative Generative Spacetor)を提案する。
ジェネレーティブジェネレーター(Generative Generative Spacetor)は、ソーステキストから単語を検索することでコンポジタの操作をエミュレートするハイブリッドポインタージェネレータネットワークである。
提案手法は,1ショット,5ショット,10ショットの設定において,ベースラインを上回りながら,フルサンプルトレーニングにおいて高い競争力を発揮する。
論文 参考訳(メタデータ) (2025-03-21T04:56:24Z) - Unearthing Large Scale Domain-Specific Knowledge from Public Corpora [103.0865116794534]
データ収集パイプラインに大規模なモデルを導入し、ドメイン固有の情報の生成をガイドします。
このアプローチをRetrieve-from-CCと呼ぶ。
ドメイン固有の知識に関するデータを収集するだけでなく、パブリックコーパスから潜在的推論手順を含むデータをマイニングする。
論文 参考訳(メタデータ) (2024-01-26T03:38:23Z) - Informed Named Entity Recognition Decoding for Generative Language
Models [3.5323691899538128]
Informed Named Entity Recognition Decoding (iNERD) を提案する。
8つの名前付きエンティティ認識データセット上で5つの生成言語モデルを評価し、優れた結果を得るため、統合されたエンティティコーパス上でモデルを粗いチューニングを行い、その性能を向上させる。
論文 参考訳(メタデータ) (2023-08-15T14:16:29Z) - Extreme Multi-Label Skill Extraction Training using Large Language
Models [19.095612333241288]
本稿では,スキル抽出のための精度の高い完全合成ラベル付きデータセットを生成するための費用対効果のアプローチについて述べる。
以上の結果より,textitR-Precision@5では15~25ポイントの連続的な増加が見られた。
論文 参考訳(メタデータ) (2023-07-20T11:29:15Z) - A Cloud-based Machine Learning Pipeline for the Efficient Extraction of
Insights from Customer Reviews [0.0]
本稿では,パイプラインに統合された機械学習手法を用いて,顧客レビューから洞察を抽出するクラウドベースのシステムを提案する。
トピックモデリングには、自然言語処理用に設計されたトランスフォーマーベースニューラルネットワークを用いる。
本システムでは,このタスクの既存のトピックモデリングやキーワード抽出ソリューションよりも優れた結果が得られる。
論文 参考訳(メタデータ) (2023-06-13T14:07:52Z) - Modeling Multi-Granularity Hierarchical Features for Relation Extraction [26.852869800344813]
本稿では,原文のみに基づく多粒度特徴抽出手法を提案する。
外部知識を必要とせずに,効果的な構造的特徴が達成可能であることを示す。
論文 参考訳(メタデータ) (2022-04-09T09:44:05Z) - Generating More Pertinent Captions by Leveraging Semantics and Style on
Multi-Source Datasets [56.018551958004814]
本稿では,データソースの非一様結合をトレーニングすることで,流動的な記述を生成するタスクに対処する。
ノイズの多い画像とテキストのペアを持つ大規模データセットは、サブ最適の監視源を提供する。
本稿では,検索コンポーネントから抽出したスタイルトークンとキーワードを組み込むことにより,セマンティクスと記述スタイルを活用・分離することを提案する。
論文 参考訳(メタデータ) (2021-11-24T19:00:05Z) - Unsupervised Paraphrasing with Pretrained Language Models [85.03373221588707]
教師なし環境で,事前学習した言語モデルを用いて高品質なパラフレーズを生成する訓練パイプラインを提案する。
提案手法は,タスク適応,自己スーパービジョン,動的ブロッキング(Dynamic Blocking)という新しい復号アルゴリズムから構成される。
提案手法は,Quora Question PairとParaNMTの両方のデータセット上で,最先端の性能を達成できることを示す。
論文 参考訳(メタデータ) (2020-10-24T11:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。