論文の概要: Detecting Authorship in Political Texts with Inductive Stylometry
- arxiv url: http://arxiv.org/abs/2609.08459v1
- Date: Tue, 08 Sep 2026 08:57:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 16:25:48.337905
- Title: Detecting Authorship in Political Texts with Inductive Stylometry
- Title(参考訳): インダクティブ・スティロメトリーによる政治文章の著者検出
- Authors: Gennadii Iakovlev, Levente Littvay,
- Abstract要約: 本稿では,政治的コミュニケーションにおける遅延オーサシップ構造回復のための帰納的テクスチャ的アプローチを開発し,その評価を行う。
長さの異なる6つのコーパス(つぶやきから長い文書まで)、モード(書き起こし・口頭)、言語(英語・ハンガリー語)にアプローチを適用する。
政治家のツイートを検証済みのサブセットに分類し、さらなる洞察を明らかにし、即興のスピーチと区別する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Political texts are rarely authored by the nominal speaker alone. Tweets, speeches, reports, and official statements are drafted, edited, or harmonized by staff, yet political science has paid limited attention to the stylistic traces these hidden authors leave behind. This paper develops and stress-tests an inductive stylometric approach for recovering latent authorship structure in political communication, combining character 3-gram features with UMAP dimensionality reduction, and Burrows' Delta. We apply the approach to six corpora that vary in length (from tweets to long documents), in mode (written and oral), and in language (English and Hungarian). The approach recovers near-disjoint analyst fingerprints in formal legal prose in both languages, sorts a politician's tweets into validated subsets while uncovering additional insights, and distinguishes scripted from improvised speech. It fails, however, to resolve individual speechwriters within scripted corpora. Frequency-based stylometry is thus a powerful tool that, depending on authorial signal strength and institutional editing, can uncover authorship traces relevant to legislative studies, political communication, and policy research.
- Abstract(参考訳): 政治的文書は名目上の話者だけではめったに出版されない。
ツイート、スピーチ、レポート、公式声明は、スタッフによって起草、編集、調和されるが、政治科学は、これらの隠れた著者が残したスタイル上の痕跡に限定的に注意を払っている。
本稿では, 政治的コミュニケーションにおける潜在的オーサリング構造を復元するための帰納的テクスチャ的手法を開発し, かつ, UMAP次元化とBurrows' Deltaを組み合わせて検討する。
長文のつぶやきから長文まで)、モード(書き起こし・口頭)、言語(英語・ハンガリー語)の6つのコーパスにアプローチを適用する。
このアプローチは、両言語の正式な法的散見文でほぼ一致しないアナリストの指紋を復元し、政治家のツイートを検証済みのサブセットに分類し、追加の洞察を明らかにし、即興のスピーチと区別する。
しかし、スクリプト化されたコーパス内の個々の音声文字を解決できない。
したがって、周波数ベースのスタイメトリーは、権威的な信号強度と制度的な編集に依存する強力なツールであり、立法研究、政治コミュニケーション、政策研究に関連する著者の痕跡を明らかにすることができる。
関連論文リスト
- SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis [45.09009423124683]
音声知覚分析は、多種多様な実世界の応用のためのパラ言語的手がかりを復号する上で重要な役割を担っている。
既存のアプローチは、テキスト分析を伴う自動音声認識をカスケードするテキスト中心のパイプラインに依存している。
本稿では,音声感情分析のための新しいデータセットであるSpeechSenseを提案する。
論文 参考訳(メタデータ) (2026-08-18T15:51:27Z) - A stylometric analysis of speaker attribution from speech transcripts [0.5371337604556311]
法医学的な科学者は、身代金の請求、隠蔽記録、自殺届の疑い、匿名のオンライン通信など、未知の話者や作家を特定する必要があることが多い。
音声領域における話者認識は通常、音声の音声的または音響的特性を調べる。
話者が音声を偽装したり、音声合成ソフトを使用すれば、音声特性はもはや信頼できないかもしれない。
論文 参考訳(メタデータ) (2025-12-15T18:55:25Z) - Large Language Models and Forensic Linguistics: Navigating Opportunities and Threats in the Age of Generative AI [0.0]
大規模言語モデル(LLM)は、スケーラブルなコーパス分析と埋め込みベースのオーサシップ属性を実現する強力な分析ツールとして機能する。
近年のスタイリスティックな研究は、LLMが表面のスタイリスティックな特徴を近似できるが、ヒトのライターとの違いが検出可能であることを示唆している。
この論文は、法医学的言語学は科学的に信頼性があり法的に許容されるように、方法論的な再構成を必要とすると結論付けている。
論文 参考訳(メタデータ) (2025-12-07T17:05:31Z) - Latent Topic Synthesis: Leveraging LLMs for Electoral Ad Analysis [51.95395936342771]
ラベルなしコーパスから解釈可能なトピック分類を自動生成するエンドツーエンドフレームワークを提案する。
われわれはこの枠組みを、2024年アメリカ合衆国大統領選挙の1ヶ月前のMeta政治広告の大規模なコーパスに適用する。
提案手法は,潜在談話構造を明らかにし,意味的に豊かなトピックラベルを合成し,モラル・フレーミングの次元でトピックを注釈する。
論文 参考訳(メタデータ) (2025-10-16T20:30:20Z) - Keep It Private: Unsupervised Privatization of Online Text [13.381890596224867]
音声,感覚,プライバシのバランスを保った書き直しを生成するために,強化学習を通じて大規模言語モデルを微調整する自動テキスト民営化フレームワークを導入する。
短命長テキストからなる68kの著者による大規模な英語Reddit投稿に対して,これを広範囲に評価した。
論文 参考訳(メタデータ) (2024-05-16T17:12:18Z) - A Corpus for Sentence-level Subjectivity Detection on English News Articles [49.49218203204942]
我々はこのガイドラインを用いて、議論を呼んだ話題に関する英ニュース記事から抽出した638の目的語と411の主観的な文からなるNewsSD-ENGを収集する。
我々のコーパスは、語彙や機械翻訳といった言語固有のツールに頼ることなく、英語で主観的検出を行う方法を舗装している。
論文 参考訳(メタデータ) (2023-05-29T11:54:50Z) - PART: Pre-trained Authorship Representation Transformer [52.623051272843426]
文書を書く著者は、自分のテキストに識別情報を印字する。
以前の作品では、手作りの機能や分類タスクを使って著者モデルを訓練していた。
セマンティクスの代わりにテキストの埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z) - A Novel Corpus of Discourse Structure in Humans and Computers [55.74664144248097]
約27,000節からなる445の人文・コンピュータ生成文書からなる新しいコーパスを提示する。
コーパスは、フォーマルな言論と非公式な言論の両方をカバーし、微調整のGPT-2を用いて生成された文書を含んでいる。
論文 参考訳(メタデータ) (2021-11-10T20:56:08Z) - Sentiment analysis in tweets: an assessment study from classical to
modern text representation models [59.107260266206445]
Twitterで公開された短いテキストは、豊富な情報源として大きな注目を集めている。
非公式な言語スタイルや騒々しい言語スタイルといったそれらの固有の特徴は、多くの自然言語処理(NLP)タスクに挑戦し続けている。
本研究では,22データセットの豊富なコレクションを用いて,ツイートに表される感情を識別する既存言語モデルの評価を行った。
論文 参考訳(メタデータ) (2021-05-29T21:05:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。