論文の概要: Literary Non-Style in LLM-Generated Text
- arxiv url: http://arxiv.org/abs/2607.17228v1
- Date: Sun, 19 Jul 2026 12:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.39667
- Title: Literary Non-Style in LLM-Generated Text
- Title(参考訳): LLMテキストにおけるリテラリー非スタイル
- Authors: Cory Massaro,
- Abstract要約: LLM生成テキスト中のn-gramの統計分布の単純だが一貫したパターンについて記す。
高階n-gramはセマンティックな内容と関連しているので、スタイルやセマンティックスの質問はきれいに分離できないと結論付けます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prior work on LLM-generated text has demonstrated quantitative and qualitative departures from text produced by humans. LLM-generated texts differ from human writing in style, resulting in a characteristic textual "feel," while the semantic range of LLMs is much restricted compared to that of humans. In this contribution, I note simple but consistent patterns in the statistical distribution of n-grams within LLM-generated text. Via qualitative analysis of these n-grams, I reveal deficiencies in LLM style. Because higher-order n-grams correlate to semantic content, I conclude that questions of style and semantics are not cleanly separable.
- Abstract(参考訳): LLM生成テキストに関する以前の研究は、人間が生成したテキストから量的および質的な逸脱を実証してきた。
LLMの生成したテキストは、人間の書体と異なるため、典型的には「フィール」となり、LLMのセマンティックレンジは人間の書体に比べて非常に制限される。
本稿では, LLM 生成テキスト中の n-gram の統計分布における単純だが一貫したパターンについて述べる。
これらのn-gramの質的分析により,LLMスタイルの欠陥が明らかになった。
高階n-gramはセマンティックコンテンツと関連しているので、スタイルやセマンティックスの質問はきれいに分離できないと結論付けます。
関連論文リスト
- On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text? [8.484462568964682]
ターゲットの一貫性や正確な定義、すなわち「LLM生成テキスト」は存在しない。
一般的に検出対象と見なされるものは、通常、LLMが生成可能なテキストのサブセットのみを表す。
既存のベンチマークと評価アプローチは、実世界の検出器応用における様々な条件に適切に対応していない。
論文 参考訳(メタデータ) (2025-10-23T17:59:06Z) - QUDsim: Quantifying Discourse Similarities in LLM-Generated Text [70.22275200293964]
本稿では,会話の進行過程の違いの定量化を支援するために,言語理論に基づくQUDと質問意味論を紹介する。
このフレームワークを使って$textbfQUDsim$を作ります。
QUDsimを用いて、コンテンツが異なる場合であっても、LLMはサンプル間で(人間よりも)談話構造を再利用することが多い。
論文 参考訳(メタデータ) (2025-04-12T23:46:09Z) - "I know myself better, but not really greatly": How Well Can LLMs Detect and Explain LLM-Generated Texts? [10.454446545249096]
本稿では,2進(人間対LLM生成)と3進分類(未決定クラスを含む)の2つの設定において,現在のLLMの検出と説明能力について検討する。
異なる大きさの6つのオープンソースLCMを評価し、自己検出(LLM)が相互検出(他のLCMからの出力の同定)を一貫して上回っていることを発見した。
本研究は, 自己検出・自己説明における現在のLCMの限界を浮き彫りにして, 過度に適合し, 一般化性を高めるためのさらなる研究の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-02-18T11:00:28Z) - Idiosyncrasies in Large Language Models [54.26923012617675]
大規模言語モデル(LLM)における慣用句の公開と研究
LLM生成テキストへの微調整テキスト埋め込みモデルにより,優れた分類精度が得られることがわかった。
我々はLLMを審査員として利用し、各モデルの慣用句の詳細かつオープンな記述を生成する。
論文 参考訳(メタデータ) (2025-02-17T18:59:02Z) - ReMoDetect: Reward Models Recognize Aligned LLM's Generations [55.06804460642062]
大型言語モデル (LLM) は人間の好むテキストを生成する。
本稿では,これらのモデルで共有される共通特性について述べる。
報奨モデルの検出能力をさらに向上する2つのトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-05-27T17:38:33Z) - TM-TREK at SemEval-2024 Task 8: Towards LLM-Based Automatic Boundary Detection for Human-Machine Mixed Text [0.0]
本稿では,人文と機械生成の混合テキストにおける境界を識別する大規模言語モデルの能力について検討する。
LLMのアンサンブルモデルは,SemEval'24コンペティションタスク8の「Human-Machine Mixed Text Detection」サブタスクにおいて,第1位を獲得した。
論文 参考訳(メタデータ) (2024-04-01T03:54:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。