論文の概要: A Unified Detection Framework for AI-Related Content and Artifacts
- arxiv url: http://arxiv.org/abs/2607.07527v1
- Date: Wed, 08 Jul 2026 15:21:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.436761
- Title: A Unified Detection Framework for AI-Related Content and Artifacts
- Title(参考訳): AI関連コンテンツとアーティファクトの統一検出フレームワーク
- Abstract要約: マハラノビス距離スコア(MDS)に基づく統合検出フレームワークを提案する。
提案手法の重要な構成要素は,人為的テキスト,事実文,非透かしテキスト,非敵的サンプルなどの正のクラスを正確に特徴付けることである。
- 参考スコア(独自算出の注目度): 5.8904725273823475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Artificial intelligence (AI) is a double-edged sword: while it has achieved remarkable success across a wide range of domains, its deployment also calls for effective oversight and regulation, for which the detection of AI-related content and artifacts is perhaps the most direct and cost-effective approach. To this end, we propose a unified detection framework based on Mahalanobis distance scores (MDS), applicable to several important settings, including the detection of large language model (LLM) generated text, hallucination, watermark, and adversarial examples. A key component of the proposed method is to accurately characterize the positive class--such as human-generated text, factual statements, unwatermarked text, or non-adversarial samples--which requires an efficient and robust estimator of the covariance matrix of deep representations of positive samples before computing the MDS. Since the positive samples typically consist of multiple classes, and these classes may exhibit both homogeneity and heterogeneity, we develop joint estimation methods for both the casewise and cellwise minimum covariance determinant (MCD) estimators. We provide efficient optimization algorithms for both estimators and prove their convergence. We provide a reasonable definition of the breakdown point for the joint estimators and prove their corresponding high breakdown point properties. Empirical evaluations confirm the effectiveness of the proposed detection framework.
- Abstract(参考訳): 人工知能(AI)は、幅広い領域で大きな成功を収めてきたが、そのデプロイメントでは、AI関連のコンテンツやアーティファクトの検出がおそらく最も直接的で費用対効果の高いアプローチである、効果的な監視と規制も求めている。
本稿では,大言語モデル(LLM)生成テキストの検出,幻覚,透かし,敵の例など,いくつかの重要な設定に適用可能な,マハラノビス距離スコア(MDS)に基づく統一的な検出フレームワークを提案する。
提案手法の鍵となる構成要素は,MDSの計算に先立って,正のサンプルの深部表現の共分散行列の効率的かつ堅牢な推定器を必要とする,人為的なテキスト,事実文,非透かしテキスト,非敵対的なサンプルなど,正のクラスを正確に特徴付けることである。
正のサンプルは典型的には複数のクラスから構成されており、これらのクラスは均一性と不均一性の両方を示す可能性があるため、ケースワイドおよびセルワイドの最小共分散決定因子(MCD)推定器のジョイント推定法を開発した。
両推定器の効率的な最適化アルゴリズムを提供し,その収束性を証明する。
共同推定器の分解点を合理的に定義し,それに対応する高分解点特性の証明を行う。
提案手法の有効性を実証評価により検証した。
関連論文リスト
- BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy [39.407739937584104]
自然主義的なビデオ設定におけるA/H(Ambivalence and Hesitancy)は、感情コンピューティングにおいて重要な課題である。
ビデオレベルでのA/H予測のために,高度に正規化されたマルチモーダル融合パイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-15T12:53:41Z) - Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection [105.14032334647932]
機械生成テキスト(MGT)は偽情報やフィッシングなどのリスクを生じさせ、信頼性の高い検出の必要性を強調している。
MGTの統計的に区別可能な特徴を抽出するメトリックベース法は、オーバーフィットしがちな複雑なモデルベース法よりも実用的であることが多い。
本稿では,2つのコンテキスト検出スコアの関係をモデル化したマルコフ情報を用いたスコアキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2026-02-08T16:06:12Z) - GradID: Adversarial Detection via Intrinsic Dimensionality of Gradients [0.1019561860229868]
本稿では,モデルの入力損失景観の幾何学的特性について検討する。
提案手法の基盤となる自然データと逆データに対するIDの相違点を明らかにした。
我々の検出器は、CWやAutoAttackを含む様々な攻撃に対して既存の手法を大幅に上回り、CIFAR-10では92%以上の検出率を達成した。
論文 参考訳(メタデータ) (2025-12-14T20:16:03Z) - Human Texts Are Outliers: Detecting LLM-generated Texts via Out-of-distribution Detection [71.59834293521074]
我々は,人間によるテキストと機械によるテキストを区別する枠組みを開発した。
提案手法は,DeepFakeデータセット上で98.3%のAUROCとAUPRを8.9%のFPR95で達成する。
コード、事前トレーニングされたウェイト、デモがリリースされる。
論文 参考訳(メタデータ) (2025-10-07T08:14:45Z) - Margin-bounded Confidence Scores for Out-of-Distribution Detection [2.373572816573706]
本稿では,非自明なOOD検出問題に対処するため,Margin bounded Confidence Scores (MaCS) と呼ばれる新しい手法を提案する。
MaCS は ID と OOD のスコアの差を拡大し、決定境界をよりコンパクトにする。
画像分類タスクのための様々なベンチマークデータセットの実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2024-09-22T05:40:25Z) - Token-Level Adversarial Prompt Detection Based on Perplexity Measures
and Contextual Information [67.78183175605761]
大規模言語モデルは、敵の迅速な攻撃に影響を受けやすい。
この脆弱性は、LLMの堅牢性と信頼性に関する重要な懸念を浮き彫りにしている。
トークンレベルで敵のプロンプトを検出するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-20T03:17:21Z) - On the Universal Adversarial Perturbations for Efficient Data-free
Adversarial Detection [55.73320979733527]
本稿では,UAPに対して正常サンプルと逆サンプルの異なる応答を誘導する,データに依存しない逆検出フレームワークを提案する。
実験結果から,本手法は様々なテキスト分類タスクにおいて,競合検出性能を実現することが示された。
論文 参考訳(メタデータ) (2023-06-27T02:54:07Z) - MAUVE Scores for Generative Models: Theory and Practice [95.86006777961182]
本報告では,テキストや画像の生成モデルで発生するような分布のペア間の比較尺度であるMAUVEについて述べる。
我々は、MAUVEが人間の文章の分布と現代のニューラル言語モデルとのギャップを定量化できることを発見した。
我々は、MAUVEが既存のメトリクスと同等以上の画像の既知の特性を識別できることを視覚領域で実証する。
論文 参考訳(メタデータ) (2022-12-30T07:37:40Z) - EAD: an ensemble approach to detect adversarial examples from the hidden
features of deep neural networks [1.3212032015497979]
本稿では,敵のサンプルを識別するためのアンサンブル逆検出器 (EAD) を提案する。
EADは、事前訓練されたディープニューラルネットワーク(DNN)の内部表現における入力インスタンスの異なる特性を利用する複数の検出器を組み合わせる。
EAD が AUROC と AUPR で最良であることを示す。
論文 参考訳(メタデータ) (2021-11-24T17:05:26Z) - Decomposed Adversarial Learned Inference [118.27187231452852]
我々は,DALI(Decomposed Adversarial Learned Inference)という新しいアプローチを提案する。
DALIは、データ空間とコード空間の両方の事前および条件分布を明示的に一致させる。
MNIST, CIFAR-10, CelebAデータセットにおけるDALIの有効性を検証する。
論文 参考訳(メタデータ) (2020-04-21T20:00:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。