論文の概要: Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era
- arxiv url: http://arxiv.org/abs/2606.29540v1
- Date: Sun, 28 Jun 2026 18:03:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.955023
- Title: Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era
- Title(参考訳): エムダッシュのエム・エルジェンス:大言語モデル時代の夜明けにおけるmedRxivプレプリントにおけるエムダッシュ頻度の集団レベル上昇
- Authors: Przemysław Czuma,
- Abstract要約: Em-dashsは、補助テキストに微妙なスタイルの痕跡を残すことができる。
議論におけるエムダッシュの有病率は、ChatGPT以前の4.23%からその後11.58%に増加した。
デザインは因果関係を確立できない。科学文献の書き方には、2020年代初めから、そしてほぼいつにかけて、顕著に変化があったかが示される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) can leave subtle stylistic traces in assisted text; one of the most cited is the em-dash (Unicode U+2014). Yet no one has measured whether em-dash use has changed in the scientific literature. This study, pre-registered on the Open Science Framework (HFT8C), used the full set of medRxiv full-text XML preprints from the official Text-and-Data-Mining resource. The primary cohort was first, original versions deposited 2020-2025 with an extractable Discussion section of at least 500 characters (N = 69,632). The primary endpoint was the presence of at least one em-dash in the Discussion; the principal measure was the absolute change in its prevalence between the pre-ChatGPT era (before 30 November 2022) and the post-ChatGPT era, estimated with a logistic model with standard errors clustered by first author. The analysis plan (six supporting analyses, six sensitivity analyses, two falsification tests) was frozen before any confirmatory result was computed. Em-dash prevalence in Discussion sections rose from 4.23% before ChatGPT to 11.58% afterward, an absolute increase of 7.35 percentage points (95% CI 6.94-7.77; odds ratio 2.96, 95% CI 2.77-3.17). The rise was not a sharp jump but a gradual, delayed acceleration: near 4% through 2023, 8.0% in 2024, and 20.3% in 2025. The effect survived every feasible sensitivity analysis (7.35-7.60 pp) and both falsification tests; a placebo split within the pre-LLM era showed no meaningful change (+0.13 pp, 95% CI -0.33 to +0.58), and was essentially absent in boilerplate sections. Independent LLM-associated lexical markers and within-paper section comparisons pointed the same way. The em-dash is a population-level indicator, not a per-paper detector of LLM use, and the design cannot establish causality; it shows that something in how scientific literature is written changed markedly in the early 2020s, and roughly when.
- Abstract(参考訳): 大規模言語モデル(LLM)は、補助テキストに微妙なスタイル的痕跡を残すことができ、最も引用されているのが Em-dash (Unicode U+2014) である。
しかし、科学文献においてエムダッシュの使用が変化したかどうかを計測する者はいない。
この研究はOpen Science Framework (HFT8C)で事前登録され、公式のText-and-Data-MiningリソースからmedRxivの全文XMLプリプリントを使用した。
初期のコホートは、2020-2025年に少なくとも500文字(N = 69,632)の抽出可能な議論セクションで原版が提出された。
主要な尺度は、2022年11月30日以前のChatGPT時代と、最初の著者によってクラスタリングされた標準エラーを伴うロジスティックモデルで見積もられた後ChatGPT時代との間の、その頻度の絶対的な変化であった。
解析計画 (6つの解析, 6つの感度解析, 2つのファルシフィケーション試験) は, 確認結果が計算される前に凍結した。
ChatGPT以前の4.23%からその後11.58%に増加し、7.35ポイント(95% CI 6.94-7.77; 確率比 2.96, 95% CI 2.77-3.17)が絶対的に増加した。
2023年までの4%近く、2024年には8.0%、2025年には20.3%だった。
有効感度分析 (7.35-7.60 pp) と両ファルシフィケーション試験 (両ファルシフィケーション試験) を生き残ったが、LLM期以前のプラセボは有意な変化は見られず(+0.13 pp, 95% CI-0.33 - +0.58)、ボイラープレートでは基本的に欠如していた。
独立性LLM関連語彙マーカーと紙内比較では同様の傾向を示した。
このエムダッシュは人口レベルの指標であり、LSM使用の紙ごとの検知器ではなく、因果関係を確立できない。
関連論文リスト
- Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models [2.064612766965483]
MedMCQA(4,183質問)とPubMedQA(1,000質問)でMedGemma(4Bおよび27Bパラメータ)を評価する。
実験の結果,いくつかの知見が得られた。
論文 参考訳(メタデータ) (2026-03-26T23:04:20Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Large language models for automated PRISMA 2020 adherence checking [0.01588808390680495]
著作権を意識した108のCreative Commonsライセンスのシステムレビューのベンチマークを構築した。
5種類の入力形式で10大言語モデル(LLM)を評価した。
論文 参考訳(メタデータ) (2025-11-20T02:08:13Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Adoption, usability and perceived clinical value of a UK AI clinical reference platform (iatroX): a mixed-methods formative evaluation of real-world usage and a 1,223-respondent user survey [0.0]
臨床医は、バイオメディカル文献やガイドラインからの情報過剰が増加し、エビデンスベースのケアを妨げている。
RAGをベースとした臨床リファレンスプラットフォームであるiatroXについて述べる。
本報告では, 早期導入, ユーザビリティ, 臨床的価値を, 形式的実装評価から報告する。
論文 参考訳(メタデータ) (2025-09-25T14:03:04Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Evaluating the Predictive Capacity of ChatGPT for Academic Peer Review Outcomes Across Multiple Platforms [3.3543455244780223]
本稿では2つの新しい文脈を導入し、より堅牢な方法である複数のChatGPTスコアを平均化する。
平均的な30のChatGPT予測は、レビュアーガイドラインに基づいて、提出されたタイトルと要約のみを用いて、F1000Researchのピアレビュー結果の予測に失敗した。
論文 参考訳(メタデータ) (2024-11-14T19:20:33Z) - Holistic Evaluation of Language Models [183.94891340168175]
言語モデル(LM)は、ほとんどすべての主要言語技術の基盤となっているが、その能力、制限、リスクはよく理解されていない。
本稿では,言語モデルの透明性を向上させるために,言語モデルの完全性評価(HELM)を提案する。
論文 参考訳(メタデータ) (2022-11-16T18:51:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。