論文の概要: Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking
- arxiv url: http://arxiv.org/abs/2608.03859v2
- Date: Wed, 12 Aug 2026 01:26:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.263873
- Title: Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking
- Title(参考訳): 表現的類似性を超えて:生成的プラギアリズム検出と候補情報源再分類のためのソースコンディション記述長ゲイン
- Authors: Peijia Guo, Wenxuan Xie, ZiGuang Li, Ming Li,
- Abstract要約: 大規模言語モデル(LLM)は、学術的整合性とピアレビューに課題を提起する。
生成的盗作検出は 未発見で ほとんど未解決の課題です
確率的予測の記述長に触発されて,出典記述長ゲイン(SCDG)を導入する。
SCDGは、凍結した言語モデルの不審なドキュメントの記述長が$P$であり、候補となるソースが$S$であるのとは対照的な、方向性のないトレーニングなしのフレームワークである。
- 参考スコア(独自算出の注目度): 8.450813632047902
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) pose challenges to academic integrity and peer review. Yet generative plagiarism detection remains an underexplored and largely unresolved challenge. Prior work on LLM-generated-text detection targets AI involvement, which may be permissible, rather than source reuse, while similarity-based methods struggle after extensive rewriting and multi-source synthesis. Motivated by the description-length view of probabilistic prediction, in which relevant side information can reduce a target sequence's code length, we introduce Source-Conditioned Description-Length Gain (SCDG), a directional, training-free framework that contrasts a frozen language model's description length of a suspicious document $P$ with and without a candidate source $S$. This contrast yields token-level log-likelihood gains that measure the incremental predictive evidence supplied by $S$. We evaluate SCDG on the PAN at CLEF benchmarks for generative plagiarism. On a PAN 2025-derived pairwise benchmark, SCDG achieves 0.92 Precision, 0.97 Recall, and 0.94 F1, outperforming all baselines; on PAN 2026's multi-source retrieval task, it reaches 0.83 nDCG@10 and 0.96 Recall@100, surpassing all baselines. On a same-topic, same-event Multi-News test, the calibrated gain-distribution SCDG classifier predicts source reuse for only $0.125\%$ of pairs, supporting robustness to topical overlap under this evaluation protocol. These results establish SCDG as a unified and token-decomposable signal for source-specific content reuse under extensive transformation.
- Abstract(参考訳): 大規模言語モデル(LLM)は、学術的整合性とピアレビューに課題を提起する。
しかし、生成的盗作検出は未発見であり、ほとんど未解決の課題である。
LLMの生成したテキスト検出に関する以前の研究は、ソースの再利用よりも許容可能なAIの関与を目標としていたが、類似性ベースの手法は大規模な書き換えと複数ソースの合成に苦慮している。
対象のシーケンスのコード長を削減できる,確率的予測の記述長ビューに触発されて,疑わしいドキュメントの凍結言語モデル記述長を$P$で比較した,指向性のないフレームワークである Source-Conditioned Description-Length Gain (SCDG) を紹介した。
このコントラストは、$S$で提供される漸進的な予測証拠を測定するトークンレベルのログライクなゲインをもたらす。
CLEFベンチマークのPANにおけるSCDGの評価を行った。
PAN 2025由来のペアワイズベンチマークでは、SCDGは0.92精度、0.97リコール、0.94F1を達成し、すべてのベースラインを上回り、PAN 2026のマルチソース検索タスクでは0.83nDCG@10と0.96リコール@100に到達し、すべてのベースラインを上回っている。
同じトピックで同一のマルチニューズテストにおいて、キャリブレーションされたゲイン分配SCDG分類器は、ソースの再利用をわずか0.125 %のペアで予測し、この評価プロトコルの下でトピックの重複に対するロバスト性をサポートする。
これらの結果は、広範囲な変換の下でのソース固有のコンテンツの再利用のために、SCDGを統一かつトークン分解可能な信号として確立する。
関連論文リスト
- C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders [56.67585330425431]
スパースオートエンコーダ(SAE)は、アクティベーションをスパースで人間の理解可能な機能に分解することで、大きな言語モデルを解釈するために広く使われている。
これらの問題は、サンプル間の一貫性のない潜在的な割り当てに起因している。
我々はC$2$Rを導入し、これは方向的に類似した潜伏剤の共活性化を罰する。
論文 参考訳(メタデータ) (2026-06-29T17:45:31Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach [0.0]
本研究は,RAG検索ランキングの簡易かつ解釈可能な変更について評価する。
このフレームワークは120文書の健康ドメインコーパスの類似性のみのベースラインに対して評価される。
source-aware re ranking は Precision@5 を 0.48 から 0.72 に改善し、平均敵対的なドキュメント検索を減らす。
論文 参考訳(メタデータ) (2026-06-08T14:09:04Z) - Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG [6.324418485299426]
大規模な言語モデルは、競合が発生したとき、検索された情報よりもパラメトリックな知識を優先することができる。
本稿では,モデルパラメータを変更することなくRAGの現実的整合性を改善するために,新しいトレーニングフリーデコーディングフレームワークであるemphGrounded Decodingを提案する。
以上の結果から, 確率レベルの融合は, 忠実なRAG復号化のためのロジットレベルの介入法に代わる, 強力かつ効率的な代替手段となることが示唆された。
論文 参考訳(メタデータ) (2026-05-29T23:47:39Z) - Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding [64.98167175790817]
本稿では、ソース文書の一貫性と他の候補間のコンセンサスという2つの要因を考慮し、候補要約を再引用するConSUMを提案する。
我々のシステムは既存の手法と競合しており、人による評価により、生成した要約が他のシステムよりも好まれていることが確認されている。
論文 参考訳(メタデータ) (2026-05-28T04:14:43Z) - Reproducing Complex Set-Compositional Information Retrieval [11.891887979573925]
複雑な情報には、接続性、解離性、排他性を使った集合合成クエリが含まれる。
我々は,QUESTとQUEST+変数について,主要な検索ファミリと推論対象手法のベンチマークを行った。
論文 参考訳(メタデータ) (2026-05-05T14:51:40Z) - Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction [7.723181091241251]
本稿では、レビュー品質を評価し、自動パターンを検出するための説明可能なフレームワーク(RAG-XAI)を提案する。
XGBoost、Random Forest、LightGBMは99.61%、AUC-ROCは0.999以上、F1スコアは0.9925である。
論文 参考訳(メタデータ) (2026-04-09T08:25:49Z) - Overview of the Plagiarism Detection Task at PAN 2025 [41.899055581824314]
我々は、Llama、DeepSeek-R1、Mistralの3つの大きな言語モデルを用いて、自動生成されたプラジャリズムの新たな大規模データセットを作成しました。
本稿では,本データセットの作成について概説し,すべての参加者と4つのベースラインの結果の要約と比較を行った。
論文 参考訳(メタデータ) (2025-10-08T09:33:26Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Constrained Auto-Regressive Decoding Constrains Generative Retrieval [71.71161220261655]
ジェネレーティブ検索は、従来の検索インデックスデータ構造を1つの大規模ニューラルネットワークに置き換えようとしている。
本稿では,制約とビームサーチという2つの本質的な視点から,制約付き自己回帰生成の固有の制約について検討する。
論文 参考訳(メタデータ) (2025-04-14T06:54:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。