論文の概要: Who Wrote It Is Not Enough: Detecting Who Contributed the Insight
- arxiv url: http://arxiv.org/abs/2610.07365v1
- Date: Mon, 05 Oct 2026 20:34:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.655372
- Title: Who Wrote It Is Not Enough: Detecting Who Contributed the Insight
- Title(参考訳): 誰がそれで十分ではないのか:誰がインサイトを貢献したのかを検知する
- Abstract要約: インサイト・プロヴァンス(Insight Provenance)は、レビューインサイトが人間、LDM、またはそれらのハイブリッドコントリビューションに由来するかどうかを識別するタスクである。
我々は、4,057の学術論文と12,660の人間レビューからInsightProv-v0を構築し、GPT-4o、Gemini、DeepSeekと異なるレベルのLCMの関与をシミュレートした。
モデルが言語的およびテキスト的オーサシップのショートカットを利用して、段階的に劣化した評価の下で著しく劣化するので、生データに対する強い性能は誤解を招く可能性がある。
- 参考スコア(独自算出の注目度): 24.566160932591014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLMs increasingly assist scientific writing and peer review, detecting who wrote the text is no longer sufficient: we need to determine who contributed the underlying insight. We introduce Insight Provenance, the task of identifying whether a review insight originates from a human, an LLM, or their hybrid contribution. We construct InsightProv-v0 from 4,057 scientific papers and 12,660 human reviews, simulating different levels of LLM involvement with GPT-4o, Gemini, and DeepSeek and annotating provenance at the sentence level. We show that strong performance on raw data can be misleading, as models exploit linguistic and textual-authorship shortcuts that degrade substantially under progressively debiased evaluation. We therefore propose a two-stage adversarial framework that suppresses shortcut signals while preserving provenance-relevant information. Beyond detection, extensive analyses reveal what makes intellectual authorship identifiable: paper grounding and neighboring review context provide complementary provenance signals, while human, hybrid, and AI insights systematically differ in their information sources and failure modes. Most strikingly, AI insights predominantly remain close to generic or paper-provided information, whereas human insights more often introduce external knowledge and independent judgment. These findings suggest that while wording can be rewritten by an LLM, the provenance of an idea leaves a deeper and more persistent signal.
- Abstract(参考訳): LLMは科学的な文章や査読をますます支援しているので、誰がテキストを書いたかを検出するだけでは十分ではない。
インサイト・プロヴァンス(Insight Provenance)は、レビューインサイトが人間、LDM、またはそれらのハイブリッドコントリビューションに由来するかどうかを識別するタスクである。
我々は,4,057の学術論文と12,660の人文レビューからInsightProv-v0を構築し,GPT-4o,Gemini,DeepSeekと異なるレベルのLCMの関与をシミュレートし,文章レベルでの注釈付けを行う。
モデルが言語的およびテキスト的オーサシップのショートカットを利用して、段階的に劣化した評価の下で著しく劣化するので、生データに対する強い性能は誤解を招く可能性がある。
そこで本稿では,プロファイナンス関連情報を保存しつつ,ショートカット信号の抑制を行う2段階対向フレームワークを提案する。
紙の接地と隣接するレビューコンテキストは補完的な前兆信号を提供するが、人間、ハイブリッド、AIの洞察は情報ソースと障害モードで体系的に異なる。
もっとも注目すべきは、AIの洞察は主に一般的な情報や論文が提供する情報に近づき、一方で人間の洞察は外部の知識や独立した判断を導入することが多いことだ。
これらの結果から,LLMによる単語の書き直しは可能であるが,概念の成立はより深く永続的なシグナルを残していることが示唆された。
関連論文リスト
- Summarization is Not Dead Yet [28.302567995407532]
大規模言語モデル(LLM)の進歩は、モデル生成サマリーが人間による参照に匹敵する、あるいは超えているという主張に拍車をかけた。
5つの多様なデータセットと5つの最先端LCMをカバーするマルチトラック評価を通じて、この物語を再検討する。
以上の結果から,人間の参照要約が情報的・忠実性の優位性を示し続ける,より曖昧な風景が明らかとなった。
論文 参考訳(メタデータ) (2026-06-06T06:38:35Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - PeerPrism: Peer Evaluation Expertise vs Review-writing AI [12.533035088439975]
20,690のピアレビューのベンチマークであるPeerPrismを紹介した。
我々はPeerPrism上で最先端のLLMテキスト検出手法をベンチマークする。
以上の結果から,現在の検出手法は表面実現と知的貢献を両立させることが示唆された。
論文 参考訳(メタデータ) (2026-04-16T00:59:55Z) - CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection [60.52240468810558]
我々は、AI生成ピアレビューの詳細なデータセットの上に構築されたコンテンツ指向ベンチマークであるCoCoNUTSを紹介する。
また、マルチタスク学習フレームワークを介してAIレビュー検出を行うCoCoDetを開発し、レビューコンテンツにおけるAIのより正確で堅牢な検出を実現する。
論文 参考訳(メタデータ) (2025-08-28T06:03:11Z) - Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review [6.20631177269082]
ピアレビュープロセスに対する新たなリスクは、Negligentレビュアーが論文をレビューするために大きな言語モデル(LLM)に依存することだ。
我々は、AIで書かれたピアレビューを、対応する人間のレビューと組み合わせた合計788,984件の包括的データセットを導入する。
我々は、この新たなリソースを使用して、既存の18のAIテキスト検出アルゴリズムが、人間が完全に書いたピアレビューと、最先端のLLMを区別する能力を評価する。
論文 参考訳(メタデータ) (2025-02-26T23:04:05Z) - Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review [66.73247554182376]
大規模言語モデル(LLM)がピアレビューに統合された。
未確認のLLMの採用は、ピアレビューシステムの完全性に重大なリスクをもたらす。
5%のレビューを操作すれば、論文の12%が上位30%のランキングでその地位を失う可能性がある。
論文 参考訳(メタデータ) (2024-12-02T16:55:03Z) - Is Your Paper Being Reviewed by an LLM? Investigating AI Text Detectability in Peer Review [8.606381080620789]
既存のAIテキスト検出アルゴリズムが人間の書いたピアレビューと最先端のLLMを区別する能力について検討する。
分析の結果,既存の手法では,多くの GPT-4o 書面レビューを偽陽性分類を発生させることなく識別できないことがわかった。
偽陽性分類の低レベルにおけるGPT-4o書評の同定において,既存の手法を超越した新たな検出手法を提案する。
論文 参考訳(メタデータ) (2024-10-03T22:05:06Z) - LLMs Assist NLP Researchers: Critique Paper (Meta-)Reviewing [106.45895712717612]
大規模言語モデル(LLM)は、様々な生成タスクにおいて顕著な汎用性を示している。
本研究は,NLP研究者を支援するLLMの話題に焦点を当てる。
私たちの知る限りでは、このような包括的な分析を提供するのはこれが初めてです。
論文 参考訳(メタデータ) (2024-06-24T01:30:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。