論文の概要: DeGenTWeb: A First Look at LLM-dominant Websites
- arxiv url: http://arxiv.org/abs/2605.00087v1
- Date: Thu, 30 Apr 2026 17:54:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 17:43:28.685334
- Title: DeGenTWeb: A First Look at LLM-dominant Websites
- Title(参考訳): DeGenTWeb: LLMが支配するWebサイトを初めて見る
- Authors: Sichang Steven He, Calvin Ardi, Ramesh Govindan, Harsha V. Madhyastha,
- Abstract要約: 本稿では,LLMが支配するWebサイトを体系的に識別するDeGenTWebについて述べる。
Web ページ上で LLM 生成テキストの検出に適応する方法を示す。
LLMが優位なサイトはCommon CrawlのデータとBingの検索結果の両方で広く利用されている。
- 参考スコア(独自算出の注目度): 4.7586268097101945
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many recent news reports have claimed that content generated by large language models (LLMs) is taking over the web. However, these claims are typically not based on a representative sample of the web and the methodology underlying them is often opaque. Moreover, when aiming to minimize the chances of falsely attributing human-authored content to LLMs, we find that detectors of LLM-generated text perform much worse than advertised. Consequently, we lack an understanding of the true prevalence and characteristics of LLM content on the web. We describe DeGenTWeb which systematically identifies LLM-dominant websites: sites whose content has been generated using LLMs with little human input. We show how to adapt detectors of LLM-generated text for use on web pages, and how to aggregate detection results from multiple pages on a site for accurate site-level categorization. Using DeGenTWeb, we find that LLM-dominant sites are highly prevalent both in data from Common Crawl and in Bing's search results, and that this share is growing over time. We also show that continuing to accurately identify such sites appears challenging given the capabilities of the latest LLMs.
- Abstract(参考訳): 最近の多くのニュースは、大きな言語モデル(LLM)が生成したコンテンツがウェブを乗っ取っていると主張している。
しかし、これらの主張は典型的にはWebの代表的なサンプルに基づいておらず、それらの基盤となる方法論はしばしば不透明である。
さらに, LLM に人為的コンテンツを不正に投稿する可能性を最小限に抑えるため, LLM 生成テキストの検出精度が広告よりはるかに低下していることが判明した。
その結果,ウェブ上でのLLMコンテンツの真の存在状況と特性の理解が欠如していることが判明した。
本稿では,LLMが支配するWebサイトを体系的に識別するDeGenTWebについて述べる。
Webページ上でLLM生成テキストの検出に適応する方法と、サイトレベルの正確な分類のためにサイト上の複数のページから検出結果を集約する方法を示す。
DeGenTWeb を用いて,Common Crawl のデータと Bing の検索結果の両方で LLM に支配的なサイトが広く普及しており,このシェアは時間とともに拡大している。
また、最新のLCMの能力を考えると、こうしたサイトを正確に識別し続けることは困難であることを示す。
関連論文リスト
- Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization [1.3537117504260623]
大規模言語モデル(LLM)は、コンテンツ要約のためのWebベースシステムに統合されつつある。
本研究では、Webページの可視コンテンツを変更することなく、非可視的なHTML要素をどのように活用して敵の命令を埋め込むかを検討する。
論文 参考訳(メタデータ) (2025-09-06T21:05:18Z) - How Do LLM-Generated Texts Impact Term-Based Retrieval Models? [76.92519309816008]
本稿では,大規模言語モデル(LLM)が項ベース検索モデルに与える影響について検討する。
言語学的解析により,LLM生成テキストはよりスムーズで低周波なZipf勾配を示すことが明らかとなった。
本研究は,項分布がクエリと密接に一致した文書を優先して,項ベース検索モデルがソースバイアスを示すかどうかを考察する。
論文 参考訳(メタデータ) (2025-08-25T06:43:27Z) - Preprint: Poster: Did I Just Browse A Website Written by LLMs? [4.183993881260522]
LLM-dominant」コンテンツは、人間の入力が少ない大規模言語モデル(LLM)によって生成される。
ウェブサイト全体を分類する信頼性が高くスケーラブルなパイプラインを提案する。
LLMが優位なサイトは,検索結果の順に増加し,ランクも高くなっている。
論文 参考訳(メタデータ) (2025-07-18T14:09:04Z) - Idiosyncrasies in Large Language Models [54.26923012617675]
大規模言語モデル(LLM)における慣用句の公開と研究
LLM生成テキストへの微調整テキスト埋め込みモデルにより,優れた分類精度が得られることがわかった。
我々はLLMを審査員として利用し、各モデルの慣用句の詳細かつオープンな記述を生成する。
論文 参考訳(メタデータ) (2025-02-17T18:59:02Z) - Beyond Binary: Towards Fine-Grained LLM-Generated Text Detection via Role Recognition and Involvement Measurement [51.601916604301685]
大規模言語モデル(LLM)は、オンライン談話における信頼を損なう可能性のあるコンテンツを生成する。
現在の手法はバイナリ分類に重点を置いており、人間とLLMのコラボレーションのような現実のシナリオの複雑さに対処できないことが多い。
バイナリ分類を超えてこれらの課題に対処するために,LLM生成コンテンツを検出するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2024-10-18T08:14:10Z) - Learning to Rewrite: Generalized LLM-Generated Text Detection [19.9477991969521]
大規模言語モデル(LLM)は、非現実的コンテンツを生成し、大規模に偽情報を拡散する際に大きなリスクをもたらす。
本稿では、未知の領域に例外的な一般化を伴うAI生成テキストを検出するための新しいフレームワークであるLearning2Rewriteを紹介する。
論文 参考訳(メタデータ) (2024-08-08T05:53:39Z) - Check Your Facts and Try Again: Improving Large Language Models with
External Knowledge and Automated Feedback [127.75419038610455]
大規模言語モデル(LLM)は、ダウンストリームタスクの多くに対して、人間のような、流動的な応答を生成することができる。
本稿では,プラグ・アンド・プレイモジュールのセットでブラックボックスのLSMを増強するLSM-Augmenterシステムを提案する。
論文 参考訳(メタデータ) (2023-02-24T18:48:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。