論文の概要: Beyond Top Words: MonoTM for Topic Modeling with Interpretable Monosemantic Features
- arxiv url: http://arxiv.org/abs/2609.09575v1
- Date: Wed, 09 Sep 2026 00:54:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.859644
- Title: Beyond Top Words: MonoTM for Topic Modeling with Interpretable Monosemantic Features
- Title(参考訳): トップワードを超えて: MonoTM for Topic Modeling with Interpretable Monosemantic Features
- Abstract要約: 解釈可能なトピックモデリングフレームワークである textbfMonoTM を紹介する。
文書-トピック混合推定と意味解釈は異なるSAE構成を好むことを示す。
MonoTMは、完全なSAEバッグ・オブ・フューチャーズ表現から混合を推定し、それらが固定された状態で、コーパスグラウンドのセマンティック特徴の別々の語彙についてトピック記述子を学ぶ。
- 参考スコア(独自算出の注目度): 11.011725742250283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Topic models summarize large text corpora, but top-ranked words often provide only a limited representation of topic semantics. Sparse autoencoders (SAEs) offer a way to move beyond word-level descriptors by extracting interpretable features from dense representations, yet how feature interpretability relates to topic-inference quality remains unclear. We introduce \textbf{MonoTM}, an interpretable topic modeling framework that decouples these roles. Across three benchmark corpora, we show that document--topic mixture estimation and semantic interpretation favor different SAE configurations and feature subsets. MonoTM estimates mixtures from the full SAE bag-of-features representation and, with them fixed, learns topic descriptors over a separate vocabulary of corpus-grounded semantic features. This design preserves global topic structure while representing topics with semantic units more meaningful than individual words, making them more useful for downstream corpus analysis.
- Abstract(参考訳): トピックモデルは大きなテキストコーパスを要約するが、上位ランクの単語はしばしばトピック意味論の限られた表現しか提供しない。
スパースオートエンコーダ(SAE)は、高密度表現から解釈可能な特徴を抽出することで、単語レベルの記述子を超えて移動する方法を提供する。
私たちはこれらの役割を分離する解釈可能なトピックモデリングフレームワークである \textbf{MonoTM} を紹介します。
3つのベンチマークコーパスを通して、文書-トピック混合推定と意味解釈が異なるSAE構成と特徴サブセットを好むことを示す。
MonoTMは、完全なSAEバッグ・オブ・フューチャーズ表現から混合を推定し、それらが固定された状態で、コーパスグラウンドのセマンティック特徴の別々の語彙についてトピック記述子を学ぶ。
このデザインは、個々の単語よりも意味のある意味単位を持つトピックを表現しながら、グローバルなトピック構造を保ち、下流コーパス分析に有用である。
関連論文リスト
- Does Syntax Matter? A Graph-Augmented Variational Topic Model for Computational Social Sciences [51.56484100374058]
本稿では、構文依存関係をトピック推論に組み込んだアーキテクチャである、構造的文脈確率的トピックモデル(SCPTM)を紹介する。
本研究では,レジスタ構造と談話構造が異なる4つのコーパスのトピックモデリング手法について検討した。
その結果, SCPTMのニューラルアーキテクチャは, 生成的ベースラインよりも文書・トピックアライメントが著しく向上していることが示唆された。
論文 参考訳(メタデータ) (2026-09-07T17:39:06Z) - Speech Codec Probing from Semantic and Phonetic Perspectives [49.01048570474675]
音声トークン化器は,マルチモーダルシステムにおいて,音声を大言語モデル (LLM) に接続するために必須である。
新たな証拠は、音声表現において「意味」と呼ばれるものは、テキスト由来の意味論と一致しないことを示している。
論文 参考訳(メタデータ) (2026-03-11T03:32:25Z) - Semantic Regexes: Auto-Interpreting LLM Features with a Structured Language [29.636642657652455]
本稿では,大言語モデル(LLM)の機能のセマンティクス,構造化言語記述を紹介する。
セマンティクスは自然言語の精度と一致し、より簡潔で一貫した特徴記述が得られる。
論文 参考訳(メタデータ) (2025-10-07T18:56:45Z) - Question-Driven Analysis and Synthesis: Building Interpretable Thematic Trees with LLMs for Text Clustering and Controllable Generation [1.3750624267664158]
二分木を対話的に構築するための再帰的テーマ分割(RTP)を導入する。
ツリーの各ノードは、データを意味的に分割する自然言語の質問であり、完全に解釈可能な分類である。
RTPの質問駆動階層はBERTopicのような強力なベースラインからのキーワードベースのトピックよりも解釈可能であることを示す。
論文 参考訳(メタデータ) (2025-09-26T11:27:22Z) - Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders [21.650904669171524]
メカニスティックトピックモデル(MTM)はスパースオートエンコーダ(SAE)が学習した解釈可能な特徴で動作する
MTMはトピックベースのステアリングベクトルを用いて制御可能なテキスト生成を可能にする。
LLMに基づくペアワイズ比較評価フレームワークであるtextittopic judgeを提案する。
論文 参考訳(メタデータ) (2025-07-31T03:17:43Z) - Interactive Topic Models with Optimal Transport [75.26555710661908]
ラベル名監視型トピックモデリングのためのアプローチとして,EdTMを提案する。
EdTMは、LM/LLMベースのドキュメントトピック親和性を活用しながら、代入問題としてのトピックモデリングをモデル化する。
論文 参考訳(メタデータ) (2024-06-28T13:57:27Z) - Spatial Semantic Recurrent Mining for Referring Image Segmentation [63.34997546393106]
高品質なクロスモーダリティ融合を実現するために,Stextsuperscript2RMを提案する。
これは、言語特徴の分散、空間的意味的再帰的分離、パーセマンティック・セマンティック・バランシングという三部作の作業戦略に従う。
提案手法は他の最先端アルゴリズムに対して好適に機能する。
論文 参考訳(メタデータ) (2024-05-15T00:17:48Z) - A General and Flexible Multi-concept Parsing Framework for Multilingual Semantic Matching [60.51839859852572]
我々は,テキストを多言語セマンティックマッチングのためのマルチコンセプトに分解し,NERモデルに依存するモデルからモデルを解放することを提案する。
英語データセットのQQPとMRPC、中国語データセットのMedical-SMについて包括的な実験を行った。
論文 参考訳(メタデータ) (2024-03-05T13:55:16Z) - Prompting Large Language Models for Topic Modeling [10.31712610860913]
大規模言語モデル(LLM)の高度な言語理解を活用する新しいトピックモデリング手法であるPromptTopicを提案する。
個々の文書から文章レベルでトピックを抽出し、これらのトピックを事前定義された量に集約して凝縮し、最終的に様々な長さのテキストに対して一貫性のあるトピックを提供する。
PromptTopicを3つの非常に多様なデータセットの最先端のベースラインに対してベンチマークし、意味のあるトピックを発見する能力を確立しました。
論文 参考訳(メタデータ) (2023-12-15T11:15:05Z) - Syntax and Semantics Meet in the "Middle": Probing the Syntax-Semantics
Interface of LMs Through Agentivity [68.8204255655161]
このような相互作用を探索するためのケーススタディとして,作用性のセマンティックな概念を提示する。
これは、LMが言語アノテーション、理論テスト、発見のためのより有用なツールとして役立つ可能性を示唆している。
論文 参考訳(メタデータ) (2023-05-29T16:24:01Z) - Coordinated Topic Modeling [10.710176350043998]
本稿では,テキストコーパスを記述しながら人間の行動を模倣する「協調話題モデリング」という新しい問題を提案する。
我々は,対象のコーパス固有の側面を捕捉するために,参照表現を効果的に利用する埋め込み型協調トピックモデルECTMを設計する。
ECTMでは,課題を解決するための自己学習機構を備えたトピックレベルと文書レベルの監視を導入する。
論文 参考訳(メタデータ) (2022-10-16T15:10:54Z) - Dialogue Meaning Representation for Task-Oriented Dialogue Systems [51.91615150842267]
タスク指向対話のための柔軟かつ容易に拡張可能な表現である対話意味表現(DMR)を提案する。
我々の表現は、合成意味論とタスク固有の概念のためのリッチな意味論を表現するために、継承階層を持つノードとエッジのセットを含んでいる。
異なる機械学習ベースの対話モデルを評価するための2つの評価タスクを提案し、さらにグラフベースのコア参照解決タスクのための新しいコア参照解決モデルGNNCorefを提案する。
論文 参考訳(メタデータ) (2022-04-23T04:17:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。