論文の概要: Narrative Fingerprints: Multi-Scale Author Identification via Novelty Curve Dynamics
- arxiv url: http://arxiv.org/abs/2604.01073v1
- Date: Wed, 01 Apr 2026 16:07:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:32.077607
- Title: Narrative Fingerprints: Multi-Scale Author Identification via Novelty Curve Dynamics
- Title(参考訳): ナラティブフィンガープリント:ノベルティ曲線ダイナミクスによる多スケール著者同定
- Authors: Fred Zimmerman, Hilmar AI,
- Abstract要約: 著者の声は、いかにノベルティがテキストに広がるかを計測可能な痕跡を残している。
指紋の一部がジャンルと混同されているが,著者の約4分の1はジャンル内にとどまっていることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We test whether authors have characteristic "fingerprints" in the information-theoretic novelty curves of their published works. Working with two corpora -- Books3 (52,796 books, 759 qualifying authors) and PG-19 (28,439 books, 1,821 qualifying authors) -- we find that authorial voice leaves measurable traces in how novelty unfolds across a text. The signal is multi-scale: at book level, scalar dynamics (mean novelty, speed, volume, circuitousness) identify 43% of authors significantly above chance; at chapter level, SAX motif patterns in sliding windows achieve 30x-above-chance attribution, far exceeding the scalar features that dominate at book level. These signals are complementary, not redundant. We show that the fingerprint is partly confounded with genre but persists within-genre for approximately one-quarter of authors. Classical authors (Twain, Austen, Kipling) show fingerprints comparable in strength to modern authors, suggesting the phenomenon is not an artifact of contemporary publishing conventions.
- Abstract(参考訳): 著者が出版物の情報理論的ノベルティ曲線に特徴的な「指紋」を持っているかどうかを検証する。
書籍3(52,796冊、資格作家759冊)とPG-19(28,439冊、資格作家1,821冊)の2つのコーパスで作業した結果、著者の声は、新鮮さがテキストにどのように広がるかを計測可能な痕跡を残していることがわかった。
書籍レベルでは、スカラー力学(平均新規性、速度、体積、回路性)は著者の43%をかなり上回る確率で識別し、章レベルでは、スライドウィンドウのSAXモチーフパターンは30倍の精度の属性を達成し、本レベルで支配されるスカラー特徴をはるかに上回る。
これらの信号は相補的であり、冗長ではない。
指紋の一部がジャンルと混同されているが,著者の約4分の1はジャンル内にとどまっていることを示す。
古典作家(トウェイン、オーステン、キプリング)は、現代の作家に匹敵する強さの指紋を示しており、この現象は現代の出版コンベンションの人工物ではないことを示唆している。
関連論文リスト
- Semantic Novelty Trajectories in 80,000 Books: A Cross-Corpus Embedding Analysis [0.0]
私は2世紀の英語出版にまたがる8万冊以上の本で意味的ノベルティの軌跡を分析します。
近代の書物では 段落レベルの新規性が 約10%高くなっています
落ち着いたセマンティックレジスターに向かって斬新さが低下する収束した物語曲線は、1920年以前の文献では2.3倍多い。
論文 参考訳(メタデータ) (2026-03-02T12:20:24Z) - Online Writer Retrieval with Chinese Handwritten Phrases: A Synergistic Temporal-Frequency Representation Learning Approach [53.189911918976655]
DOLPHINは,相乗的時間周波数解析による手書き表現の向上を目的とした新しい検索モデルである。
OLIWER(OLIWER)は,1,731人から670,000以上の中国語の字句を含む大規模オンライン作家検索データセットである。
本研究は,手書き表現の質向上における点サンプリング周波数と圧力特性の重要性を強調した。
論文 参考訳(メタデータ) (2024-12-16T11:19:22Z) - Capturing Style in Author and Document Representation [4.323709559692927]
著者と文書の埋め込みをスタイリスティックな制約で学習する新しいアーキテクチャを提案する。
本稿では,Gutenbergプロジェクトから抽出した文芸コーパス,Blog Authorship,IMDb62の3つのデータセットについて評価を行った。
論文 参考訳(メタデータ) (2024-07-18T10:01:09Z) - Understanding writing style in social media with a supervised
contrastively pre-trained transformer [57.48690310135374]
オンラインソーシャルネットワークは、ヘイトスピーチから偽情報の拡散まで、有害な行動の場として機能している。
本稿では, 4.5 x 106テキストの公開資料から得られた大規模コーパスに基づいて学習したStyle Transformer for Authorship Representations (STAR)を紹介する。
512個のトークンからなる8つのドキュメントからなるサポートベースを使用して、著者を最大1616人の著者のセットから、少なくとも80%の精度で識別することができる。
論文 参考訳(メタデータ) (2023-10-17T09:01:17Z) - Low-Resource Authorship Style Transfer: Can Non-Famous Authors Be Imitated? [41.365967145680116]
オーサリングスタイルの転送は、本来の意味を保ちながら、ターゲットの作者のスタイルに合わせてテキストを変更することを含む。
低リソースなオーサリングスタイルの転送タスクを導入し、ターゲットのオーサリングスタイルに限られたテキストしか存在しないようにする。
実験では、Redditのソースとターゲットの作者を選択し、Redditの投稿を転送し、ターゲットの著者のスタイルのたった16の投稿(平均500ワード)に制限します。
論文 参考訳(メタデータ) (2022-12-18T01:57:30Z) - PART: Pre-trained Authorship Representation Transformer [52.623051272843426]
文書を書く著者は、自分のテキストに識別情報を印字する。
以前の作品では、手作りの機能や分類タスクを使って著者モデルを訓練していた。
セマンティクスの代わりにテキストの埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z) - Computational analyses of the topics, sentiments, literariness,
creativity and beauty of texts in a large Corpus of English Literature [0.0]
Gutenberg Literary English Corpus (GLEC)は、デジタル人文科学、計算言語学、神経認知詩学の研究のための豊富なテキストデータソースを提供する。
GLECの6つのテキストカテゴリのトピックと感情分析の結果を報告する。<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>100</i>,<i>3</i>,<i>3</i>,<i>3</i
論文 参考訳(メタデータ) (2022-01-12T08:16:52Z) - Protagonists' Tagger in Literary Domain -- New Datasets and a Method for
Person Entity Linkage [0.0]
本研究は,小説における人物の識別と識別の課題について考察する。
プロタゴニストのTaggerは、準備されたテストセットで83%以上の精度とリコールを達成している。
我々は、主人公タガーにタグ付けされた13のフルテキスト小説のコーパスを集めた。
論文 参考訳(メタデータ) (2021-10-04T11:54:43Z) - Forensic Authorship Analysis of Microblogging Texts Using N-Grams and
Stylometric Features [63.48764893706088]
この研究は、280文字に制限されたツイートメッセージの作者を特定することを目的としている。
弊社の実験では、40名のユーザによる、ユーザ毎120から200のつぶやきを自己キャプチャしたデータベースを使っています。
この小さなセットを使った結果は有望であり、異なる特徴は92%から98.5%の分類精度を提供する。
論文 参考訳(メタデータ) (2020-03-24T19:32:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。