論文の概要: Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News
- arxiv url: http://arxiv.org/abs/2604.03755v1
- Date: Sat, 04 Apr 2026 15:03:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.754108
- Title: Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News
- Title(参考訳): 人間にはわかるか? LLMニュースの人間知覚に関する二重軸的研究
- Authors: Alexander Loth, Martin Kappes, Marc-Oliver Pahl,
- Abstract要約: 人間は、ニュース記事が人によって書かれたか、あるいは大きな言語モデル(LLM)によって書かれたかを知ることができますか?
本稿では,人間対機械(人間対機械)と正当性判定(正当性対偽判定)を連続的なスケールで測定する研究プラットフォームであるJiceGPTを用いて,この問題を考察する。
筆者らは,(1) 被験者が人文テキストから機械生成物を確実に識別できないこと,(2) 認知疲労による約30回の連続的な評価の後,その精度が低下すること,の5つを報告した。
- 参考スコア(独自算出の注目度): 47.03825808787752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can humans tell whether a news article was written by a person or a large language model (LLM)? We investigate this question using JudgeGPT, a study platform that independently measures source attribution (human vs. machine) and authenticity judgment (legitimate vs. fake) on continuous scales. From 2,318 judgments collected from 1,054 participants across content generated by six LLMs, we report five findings: (1) participants cannot reliably distinguish machine-generated from human-written text (p > .05, Welch's t-test); (2) this inability holds across all tested models, including open-weight models with as few as 7B parameters; (3) self-reported domain expertise predicts judgment accuracy (r = .35, p < .001) whereas political orientation does not (r = -.10, n.s.); (4) clustering reveals distinct response strategies ("Skeptics" vs. "Believers"); and (5) accuracy degrades after approximately 30 sequential evaluations due to cognitive fatigue. The answer, in short, is no: humans cannot reliably tell. These results indicate that user-side detection is not a viable defense and motivate system-level countermeasures such as cryptographic content provenance.
- Abstract(参考訳): 人間は、ニュース記事が人によって書かれたか、あるいは大きな言語モデル(LLM)によって書かれたかを知ることができますか?
本研究では,人間対機械)と正当性判定(正当性対偽性)を連続的な尺度で独立に測定する研究プラットフォームであるJiceGPTを用いて,この問題を考察する。
1,054人の参加者から収集された2,318人の判断から,(1) 参加者が人文テキスト(p > .05, Welch's t-test)から機械生成を確実に区別できないこと,(2) 自己申告されたドメインの専門知識が判断精度(r = .35, p < .001)を予測できること,(4) 政治的指向が(r = -.10, n.s.) ,(4) クラスタリングによって異なる応答戦略(Skeptics" vs. "Believers")を明らかにすること,(5) 認知的疲労により約30回の連続的な評価結果が得られたこと,の5つを報告した。
要するに、人間が確実に理解できない、という答えはノーだ。
これらの結果から,ユーザ側検出は,暗号コンテンツ証明などのシステムレベルの対策として有効ではないことが示唆された。
関連論文リスト
- GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics [12.448893104517808]
GPT4o-Receiptは、GPT-4o生成レシートと、確立したデータセットからの認証レシートをペアリングした1,235レシート画像のベンチマークである。
人間のアノテータは評価器の最大の視覚的識別ギャップを示すが、バイナリ検出F1はClaude Sonnet 4より低く、Gemini 2.5 Flashより下にある。
5モデル評価では, 測定精度が不十分で検出精度が低い, 劇的な性能差とキャリブレーション差がみられた。
論文 参考訳(メタデータ) (2026-03-12T02:05:27Z) - Eroding the Truth-Default: A Causal Analysis of Human Susceptibility to Foundation Model Hallucinations and Disinformation in the Wild [47.03825808787752]
フェイクニュースの親しみ」は、被曝が人間の差別者に対する敵対的訓練として機能する可能性を示唆する中間者候補として出現する。
これらの結果から,「プレバンキング」介入は,人口層区分よりも認知源モニタリングを対象とすべきであることが示唆された。
論文 参考訳(メタデータ) (2026-01-30T11:49:58Z) - Large Language Models Pass the Turing Test [0.913127392774573]
独立集団を対象とした2つのチューリング試験において,ELIZA, GPT-4o, LLaMa-3.1-405B, GPT-4.5の4つのシステムについて検討した。
結果は、あらゆる人工システムが標準の3要素チューリングテストに合格するという最初の実証的な証拠である。
論文 参考訳(メタデータ) (2025-03-31T02:37:45Z) - ExaGPT: Example-Based Machine-Generated Text Detection for Human Interpretability [62.285407189502216]
LLM(Large Language Models)によって生成されたテキストの検出は、誤った判断によって致命的な誤りを引き起こす可能性がある。
本稿では,人間の意思決定プロセスに根ざした解釈可能な検出手法であるExaGPTを紹介する。
以上の結果から,ExaGPTは従来の強力な検出器よりも最大で40.9ポイントの精度を1%の偽陽性率で大きく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-02-17T01:15:07Z) - "I'm Not Sure, But...": Examining the Impact of Large Language Models' Uncertainty Expression on User Reliance and Trust [51.542856739181474]
不確実性の自然言語表現の違いが、参加者の信頼、信頼、全体的なタスクパフォーマンスにどのように影響するかを示す。
その結果, 一人称表情は, 参加者のシステムに対する信頼度を低下させ, 参加者の正確性を高めつつ, システムの回答に同調する傾向にあることがわかった。
以上の結果から,不確実性の自然言語表現の使用は,LLMの過度な依存を軽減するための効果的なアプローチである可能性が示唆された。
論文 参考訳(メタデータ) (2024-05-01T16:43:55Z) - How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO [55.25989137825992]
チューリングテストに触発された評価フレームワークECHOを紹介する。
この枠組みは、人間と機械が生成した反応を区別するために、対象個人の知名度に係わる。
基礎モデルとして GPT-3.5 と GPT-4 の3つのロールプレイング LLM をECHO を用いて評価した。
論文 参考訳(メタデータ) (2024-04-22T08:00:51Z) - Six Fallacies in Substituting Large Language Models for Human Participants [0.0]
大規模言語モデル(LLM)のようなAIシステムは、行動研究や心理学研究における人間の参加者を置き換えることができるのだろうか?
ここでは「置き換え」の観点を批判的に評価し、その妥当性を損なう6つの解釈誤りを識別する。
それぞれの誤りは、LSMとは何か、人間の認知について何を教えてくれるのかについて、潜在的な誤解を表している。
論文 参考訳(メタデータ) (2024-02-06T23:28:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。