論文の概要: A Shared IPTC Topic Space for Cross-Source Topic Modelling
- arxiv url: http://arxiv.org/abs/2606.26845v1
- Date: Thu, 25 Jun 2026 10:32:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.235043
- Title: A Shared IPTC Topic Space for Cross-Source Topic Modelling
- Title(参考訳): クロスソーストピックモデリングのための共有IPTCトピックスペース
- Abstract要約: 本稿では,分類学で定義された1つの共有トピック空間にコーパスを配置する再現可能なフレームワークを提案する。
フレームワークはNew York Times 2011コーパスで開発され、選択された。
- 参考スコア(独自算出の注目度): 3.368151533620041
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Comparing topic attention across different media is hindered by a fundamental modelling problem: topic models fitted separately to each corpus produce corpus-specific topic spaces that cannot be aligned directly. This paper presents a reproducible framework that places corpora in a single shared topic space defined by a taxonomy. Discovered topics are obtained with guided BERTopic, scored against the ninety-four IPTC Media Topics' taxonomy topics (level-1) through weighted keyword and target centroids, and then collapsed upward to seventeen IPTC parent topics by a maximum-similarity rule. The framework was developed and selected on a controlled New York Times 2011 corpus through a narrowing sequence: a broad model screen, a focused mapping refinement, a strict finalist comparison, a target-construction ablation, and a threshold calibration. In this corpus, the guided family retained substantially stronger mapped coverage than a zero-shot benchmark under stricter assignment thresholds, a parent-enriched target construction improved both coverage and parent consistency, and coverage declined gradually rather than collapsing as the assignment threshold was tightened. The contribution is an externally anchored method for constructing a shared topic space that enables reproducible cross-source topic comparison.
- Abstract(参考訳): 各コーパスに個別に配置されたトピックモデルは、直接アライメントできないコーパス固有のトピック空間を生成する。
本稿では,分類学で定義された1つの共有トピック空間にコーパスを配置する再現可能なフレームワークを提案する。
発見されたトピックは、90のIPTCメディアトピックス(レベル-1)の分類トピック(重み付きキーワードとターゲットセントロイド)に対して、誘導されたBERTopicで取得され、最大相似ルールにより17のIPTC親トピックに上向きに崩壊する。
このフレームワークは、ワイド・モデル・スクリーン、集中マッピングの改良、厳格なファイナリスト比較、ターゲット・コンストラクション・アブレーション、しきい値のキャリブレーションという、制限されたニューヨーク・タイムズ2011コーパスで開発され、選択された。
このコーパスでは、ガイドされた家族は、厳密な割り当て閾値の下でゼロショットベンチマークよりもかなり強力なマップ付きカバレッジを維持し、親強化されたターゲット構成によりカバレッジと親整合性が向上し、割り当て閾値が厳格になるにつれて、カバーは崩壊するよりも徐々に減少していった。
このコントリビューションは、再現可能なクロスソーストピック比較を可能にする共有トピック空間を構築するための、外部に固定された方法である。
関連論文リスト
- Dynamic Topic Modeling for Cross-Corpus Temporal Analysis [0.17188280334580194]
トピックは独立して学習され、トレーニング後にのみアライメントされるため、クロスコーパス比較は難しい。
本稿では,共有バックボーン(共有バックボーン)と呼ばれる,統合されたマルチコーパスコレクション上で,まず共通の動的トピック空間を学習するD-ETMフレームワークを提案する。
97年間にわたって時間的に構造化された3つのコーパス(歴史アメリカ英語コーパス、ハーバードビジネスレビュー、国際労働レビュー)の枠組みを評価した。
論文 参考訳(メタデータ) (2026-08-24T14:08:54Z) - Generative Data Transformation: From Mixed to Unified Data [57.84692191369066]
textscTaesarはtextbftarget-textbfal textbfregenerationのためのEmphdata中心のフレームワークである。
ドメイン間のコンテキストを対象のシーケンスにエンコードすることで、複雑な融合アーキテクチャを使わずに、標準的なモデルで複雑な依存関係を学習することができる。
論文 参考訳(メタデータ) (2026-02-26T08:30:09Z) - Multi-label Classification with Panoptic Context Aggregation Networks [61.82285737410154]
本稿では,多次幾何学的文脈を階層的に統合する新しいアプローチであるDeep Panoptic Context Aggregation Network(PanCAN)を紹介する。
PanCANは、ランダムウォークとアテンションメカニズムを組み合わせることで、各スケールで複数階の近傍関係を学習する。
NUS-WIDE、PASCAL VOC、2007、MS-COCOベンチマークの実験は、PanCANが一貫して競争結果を達成することを示した。
論文 参考訳(メタデータ) (2025-12-29T14:16:21Z) - TopiCLEAR: Topic extraction by CLustering Embeddings with Adaptive dimensional Reduction [0.0]
TopiCLEAR: 適応次元還元による埋め込みのクラスタリングによるトピック抽出について述べる。
我々は、20News、AgNewsTitle、Reddit、TweetTopicの4つの多様なデータセットに対するアプローチを評価した。
本手法はより解釈可能なトピックを生成し,ソーシャルメディアデータやWebコンテンツ分析への応用の可能性を強調した。
論文 参考訳(メタデータ) (2025-12-07T07:01:28Z) - Importance-aware Topic Modeling for Discovering Public Transit Risk from Noisy Social Media [8.638879065913246]
都市交通機関は、群衆、遅延、安全事故などの新興サービスのリスクを監視するために、ソーシャルメディアに目を向けている。
言語相互作用とユーザの影響を共同でモデル化することで,この問題に対処する。
提案モデルでは,最先端のトピックコヒーレンスと,先行するベースラインと比較して強い多様性を実現する。
論文 参考訳(メタデータ) (2025-12-06T04:45:17Z) - Bundle Fragments into a Whole: Mining More Complete Clusters via Submodular Selection of Interesting webpages for Web Topic Detection [49.8035161337388]
最先端のソリューションは、まず、Webページを多数の粒度トピック候補にまとめることである。
ホットトピックは、その面白さを推定することによってさらに特定される。
本稿では,フラグメントからより完全なホットトピックを抽出するためのバンドル・リフィニング手法を提案する。
論文 参考訳(メタデータ) (2024-09-19T00:46:31Z) - Self-supervised Topic Taxonomy Discovery in the Box Embedding Space [23.942807248774514]
本稿では,単語やトピックをボックス埋め込み空間にマッピングする,Box Embedding-based Topic Model (BoxTM) を提案する。
BoxTMは、特定のトピック間の相関に基づいて、上位のトピックを明示的に推論する。
広範囲にわたる実験により、BoxTMで学んだトピック分類の質が検証された。
論文 参考訳(メタデータ) (2024-08-27T13:19:32Z) - Localization and Expansion: A Decoupled Framework for Point Cloud Few-shot Semantic Segmentation [39.7657197805346]
Point Cloud few-shot semantic segmentation (PC-FSS)は、特定のクエリポイントクラウドに、いくつかのアノテーション付きのサポートサンプルで、新しいカテゴリのターゲットをセグメントすることを目的としている。
本稿では,DLE(Decoupled Localization and Expansion)の精神における,シンプルで効果的な枠組みを提案する。
構造的ローカライゼーションモジュール(SLM)と自己拡張モジュール(SEM)を含むDLEは、いくつかのメリットを享受している。
論文 参考訳(メタデータ) (2024-08-25T07:34:32Z) - Effective Neural Topic Modeling with Embedding Clustering Regularization [21.692088899479934]
新しいニューラルトピックモデルであるクラスタリング規則化トピックモデル(ECRTM)を提案する。
ECRTMは各トピックの埋め込みを、セマンティック空間内の個別に集約されたワード埋め込みクラスタの中心に強制する。
我々のECRTMは文書の質の高いトピック分布とともに多様で一貫性のあるトピックを生成する。
論文 参考訳(メタデータ) (2023-06-07T07:45:38Z) - Advancing Topic Segmentation and Outline Generation in Chinese Texts: The Paragraph-level Topic Representation, Corpus, and Benchmark [44.06803331843307]
段落レベルのトピック構造は、ドキュメント全体のコンテキストをより高いレベルから把握し、理解することができる。
大規模で高品質な中国語段落レベルの話題構造コーパスの欠如は研究や応用を妨げた。
コーパス構築を導くために,3層からなる階層的な段落レベルのトピック構造表現を提案する。
2段階のマンマシン・コラボレーティブ・アノテーションを用いて,中国最大規模のトピック構造コーパスを構築する。
論文 参考訳(メタデータ) (2023-05-24T06:43:23Z) - Beyond the Prototype: Divide-and-conquer Proxies for Few-shot
Segmentation [63.910211095033596]
少ないショットのセグメンテーションは、少数の濃密なラベル付けされたサンプルのみを与えられた、目に見えないクラスオブジェクトをセグメンテーションすることを目的としている。
分割・分散の精神において, 単純かつ多目的な枠組みを提案する。
提案手法は、DCP(disvision-and-conquer proxies)と呼ばれるもので、適切な信頼性のある情報の開発を可能にする。
論文 参考訳(メタデータ) (2022-04-21T06:21:14Z) - TopicNet: Semantic Graph-Guided Topic Discovery [51.71374479354178]
既存の階層的なトピックモデルでは、教師なしの方法でテキストコーパスから意味論的意味のあるトピックを抽出することができる。
TopicNetを階層的なトピックモデルとして導入し、学習に影響を与えるための帰納的バイアスとして、事前構造知識を注入する。
論文 参考訳(メタデータ) (2021-10-27T09:07:14Z) - Author Clustering and Topic Estimation for Short Texts [69.54017251622211]
同じ文書中の単語間の強い依存をモデル化することにより、遅延ディリクレ割当を拡張できる新しいモデルを提案する。
同時にユーザをクラスタ化し、ホック後のクラスタ推定の必要性を排除しています。
我々の手法は、短文で生じる問題に対する従来のアプローチよりも、-または----------- で機能する。
論文 参考訳(メタデータ) (2021-06-15T20:55:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。