論文の概要: When Less is More: Understanding When Token Filtering Helps and Fails in AI-generated Text Detection
- arxiv url: http://arxiv.org/abs/2608.29903v1
- Date: Sun, 30 Aug 2026 17:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.103147
- Title: When Less is More: Understanding When Token Filtering Helps and Fails in AI-generated Text Detection
- Title(参考訳): AI生成テキスト検出におけるトークンフィルタリングの助けと失敗の理解
- Abstract要約: 診断プローブとして、上位$k$累積確率フィルタリングを導入する。
低エントロピートークンが有害であるが、強いソースLMが有害でない場合、フィルタリングは弱いソースLMに役立ちます。
我々の研究は、いくつかのトークンが単に非形式的であるだけでなく、エントロピーの誤校正によって体系的に有害であることを示す最初の体系的な分析を提供し、トークンレベルの検出において両面的なトレードオフが明らかとなった。
- 参考スコア(独自算出の注目度): 11.142641505070207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid advancement of large language models (LLMs) has made AI-generated text detection increasingly critical. Existing zero-shot detectors assume that more token-level evidence leads to more reliable detection. However, our empirical study challenges this consensus: fewer tokens sometimes work better, retaining only 40% can yield optimal performance, yet this benefit is not universal. Using the Entropy Gap Score (EGS), we introduce top-$k$ cumulative probability filtering as a diagnostic probe. Across three representative settings, filtering exhibits strikingly different behaviors. We analyze EGS via typical set theory and quantify its dynamics through entropy calibration and distribution analysis. We find that filtering helps for weak source LMs, where low-entropy tokens are harmful, but fails for strong source LMs, where they are not notably harmful. Our work provides the first systematic analysis showing that some tokens are not merely uninformative but systematically harmful due to entropy miscalibration, revealing a two-sided trade-off in token-level detection.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な進歩により、AI生成したテキスト検出がますます重要になっている。
既存のゼロショット検出器は、より多くのトークンレベルの証拠がより信頼性の高い検出につながると仮定する。
しかし、我々の経験的研究は、この合意に異議を唱えている: トークンの少ない方がよく、40%しか最適なパフォーマンスを得られないが、この利点は普遍的ではない。
Entropy Gap Score (EGS) を用いて,診断プローブとしてトップ$k$累積確率フィルタリングを導入する。
3つの代表的な設定の中で、フィルタリングは驚くほど異なる振る舞いを示します。
我々は、典型的な集合論を通してESGを分析し、エントロピーキャリブレーションと分布解析を通してその力学を定量化する。
低エントロピートークンが有害であるが、強いソースLMが有害でない場合、フィルタリングは弱いソースLMに役立ちます。
我々の研究は、いくつかのトークンが単に非形式的であるだけでなく、エントロピーの誤校正によって体系的に有害であることを示す最初の体系的な分析を提供し、トークンレベルの検出において両面的なトレードオフが明らかとなった。
関連論文リスト
- On the Salience of Low-Probability Tokens for AI-Generated Text Detection: A Multiscale Uncertainty Perspective [19.794084116453146]
不確実性は情報的低確率トークンに焦点を当てたマルチスケール不確実性推定器である。
低確率トークンのログ確率を平均化することで、ボイラープレートの優位性を緩和する。
これはレニイエントロピーを通じて、この低確率領域の分布形状を捉え、脆さを減少させる。
論文 参考訳(メタデータ) (2026-06-01T12:21:41Z) - Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens [9.36751822006717]
トークンレベルの未学習正規化器として,Entropy-Guided Token Weighting (ETW)を提案する。
ETWは、予測分布のエントロピーをトークン情報性のプロキシとして利用する。
情報トークンはエントロピーが高い傾向を示す一方、構造トークンはエントロピーが低い傾向を示す。
論文 参考訳(メタデータ) (2026-04-20T04:20:29Z) - Segment-Level Coherence for Robust Harmful Intent Probing in LLMs [13.0633878066404]
予測を一貫してサポートするために複数のエビデンストークンを必要とするストリーミング探索目標を導入する。
定値1%の偽陽性率では、真陽性率を35.55%向上させる。
敵の微調整によって新しい文字レベル暗号が可能であっても、有害な意図は検出可能である。
論文 参考訳(メタデータ) (2026-04-16T10:56:40Z) - Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection [18.509745023735835]
我々は,Exon-Awareトークン再重み付けの観点から,AI生成テキスト検出のためのトレーニング不要な方法であるExons-Detectを提案する。
Exons-Detectは、二重モデル設定下で隠れ状態の不一致を測定して情報的エクソニックトークンを特定し、増幅し、その結果の重要重み付きトークンシーケンスから解釈可能な翻訳スコアを算出する。
論文 参考訳(メタデータ) (2026-03-26T03:12:19Z) - Diversity Boosts AI-Generated Text Detection [51.56484100374058]
DivEyeは、予備的な機能を使って、予測不可能がテキスト間でどのように変動するかをキャプチャする、新しいフレームワークである。
提案手法は、既存のゼロショット検出器を最大33.2%向上させ、微調整ベースラインとの競合性能を達成する。
論文 参考訳(メタデータ) (2025-09-23T10:21:22Z) - Character-Level Perturbations Disrupt LLM Watermarks [64.60090923837701]
我々は,Large Language Model (LLM)ウォーターマーキングのためのシステムモデルを定式化する。
我々は、透かし検出器への限られたアクセスに制約された2つの現実的な脅威モデルの特徴付けを行う。
我々は,最も制限的な脅威モデルの下で,キャラクタレベルの摂動が透かし除去に著しく有効であることを実証した。
現実的な制約下での透かし除去における文字レベルの摂動の優位性と遺伝的アルゴリズム(GA)の有効性を実験的に検証した。
論文 参考訳(メタデータ) (2025-09-11T02:50:07Z) - Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking [48.26359966929394]
Invisible Entropy (IE)は、安全性と効率性の両方を高めるために設計された透かしパラダイムである。
IEはパラメータサイズを99%削減し、最先端のメソッドと同等のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-05-20T09:19:06Z) - Group-Adaptive Threshold Optimization for Robust AI-Generated Text Detection [58.419940585826744]
本稿では,確率的AIテキスト検出のためのグループ固有しきい値最適化アルゴリズムであるFairOPTを紹介する。
属性(例えば、テキストの長さと書き込みスタイル)に基づいてデータをサブグループに分割し、FairOPTを実装して、各グループに対する決定しきい値の学習を行い、不一致を低減しました。
我々のフレームワークは、後処理によるAI生成コンテンツ検出において、より堅牢な分類の道を開く。
論文 参考訳(メタデータ) (2025-02-06T21:58:48Z) - Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection [49.15148871877941]
大規模言語モデル(LLM)の検出に理論的に魅力的なアプローチを提供する次点分布出力
本稿では,LLMの最後の隠蔽状態を用いて,列長の次トーケン分布のメトリクスに基づく一連の特徴量の重み付けを行うパープレキシティ注意重み付けネットワーク(PAWN)を提案する。
PAWNは、トレーニング可能なパラメータのごく一部を持つ最強のベースラインよりも、競争力があり、より優れた分散性能を示している。
論文 参考訳(メタデータ) (2025-01-07T17:00:49Z) - Toxicity Detection for Free [16.07605369484645]
LLMイントロスペクション(MULI)を用いたモデレーションを導入し,LSM自体から直接抽出した情報を用いて有害なプロンプトを検出する。
第一応答トークンロジットの疎ロジスティック回帰モデルを用いて有毒なプロンプトのロバスト検出を行う。
論文 参考訳(メタデータ) (2024-05-29T07:03:31Z) - Token-Level Adversarial Prompt Detection Based on Perplexity Measures
and Contextual Information [67.78183175605761]
大規模言語モデルは、敵の迅速な攻撃に影響を受けやすい。
この脆弱性は、LLMの堅牢性と信頼性に関する重要な懸念を浮き彫りにしている。
トークンレベルで敵のプロンプトを検出するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-20T03:17:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。