論文の概要: Robust AI-Generated Text Detection by Restricted Embeddings
- arxiv url: http://arxiv.org/abs/2410.08113v1
- Date: Thu, 10 Oct 2024 16:58:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-11 14:33:59.958278
- Title: Robust AI-Generated Text Detection by Restricted Embeddings
- Title(参考訳): 制限埋め込みによるロバストAIによるテキスト検出
- Authors: Kristian Kuznetsov, Eduard Tulchinskii, Laida Kushnareva, German Magai, Serguei Barannikov, Sergey Nikolenko, Irina Piontkovskaya,
- Abstract要約: 我々は、AI生成したテキストの検出器の堅牢性、すなわち、目に見えないジェネレータやセマンティックドメインに転送する能力に焦点を当てる。
有害な線形部分空間の除去は、ドメイン固有のスプリアス機能を無視したロバストな分類器の訓練に役立つことを示す。
頭部および座標に基づく部分空間除去のための最良のアプローチは、平均分布分布(OOD)分類スコアを9%、特に14%向上させる。
- 参考スコア(独自算出の注目度): 6.745955674138081
- License:
- Abstract: Growing amount and quality of AI-generated texts makes detecting such content more difficult. In most real-world scenarios, the domain (style and topic) of generated data and the generator model are not known in advance. In this work, we focus on the robustness of classifier-based detectors of AI-generated text, namely their ability to transfer to unseen generators or semantic domains. We investigate the geometry of the embedding space of Transformer-based text encoders and show that clearing out harmful linear subspaces helps to train a robust classifier, ignoring domain-specific spurious features. We investigate several subspace decomposition and feature selection strategies and achieve significant improvements over state of the art methods in cross-domain and cross-generator transfer. Our best approaches for head-wise and coordinate-based subspace removal increase the mean out-of-distribution (OOD) classification score by up to 9% and 14% in particular setups for RoBERTa and BERT embeddings respectively. We release our code and data: https://github.com/SilverSolver/RobustATD
- Abstract(参考訳): AI生成テキストの量と品質の増大により、そのようなコンテンツの検出がより困難になる。
ほとんどの実世界のシナリオでは、生成したデータのドメイン(スタイルとトピック)とジェネレータモデルが事前に分かっていない。
本研究では,AI生成テキストの分類器に基づく検出器の堅牢性,すなわち未知のジェネレータやセマンティックドメインへの転送能力に着目した。
トランスフォーマーベースのテキストエンコーダの埋め込み空間の幾何学について検討し、有害な線形部分空間の除去が、ドメイン固有の突発的特徴を無視した堅牢な分類器の訓練に役立つことを示す。
本稿では,いくつかの部分空間分解と特徴選択戦略について検討し,クロスドメインおよびクロスジェネレータ転送における最先端手法に対する大幅な改善を実現する。
頭部および座標に基づく部分空間除去のための最良のアプローチは,RoBERTa とBERT の埋め込みにおいて,平均分布値 (OOD) の分類スコアを 9% と 14% に引き上げるものである。
コードとデータを公開します。 https://github.com/SilverSolver/RobustATD
関連論文リスト
- Improving Interpretability and Robustness for the Detection of AI-Generated Images [6.116075037154215]
凍結したCLIP埋め込みに基づいて、既存の最先端AIGI検出手法を解析する。
さまざまなAIジェネレータが生成する画像が実際の画像とどのように異なるかを示す。
論文 参考訳(メタデータ) (2024-06-21T10:33:09Z) - Are AI-Generated Text Detectors Robust to Adversarial Perturbations? [9.001160538237372]
AI生成テキスト(AIGT)の現在の検出器は、敵の摂動に対する堅牢性を欠いている。
本稿では,既存のAIGT検出手法の堅牢性について検討し,新しい検出器であるシームズキャリブレーション・リコンストラクション・ネットワーク(SCRN)を導入する。
SCRNは、テキストからのノイズの追加と除去に再構成ネットワークを使用し、局所的な摂動に対して堅牢な意味表現を抽出する。
論文 参考訳(メタデータ) (2024-06-03T10:21:48Z) - Review-Based Cross-Domain Recommendation via Hyperbolic Embedding and Hierarchy-Aware Domain Disentanglement [0.65268245109828]
Cross-Domain Recommendation (CDR)は、ドメイン共有可能な知識をキャプチャし、よりリッチなドメインからスパサーに転送する。
本稿では,ユーザ・イテム関係をモデル化するためのレビューテキストに基づく双曲型CDR手法を提案する。
論文 参考訳(メタデータ) (2024-03-29T17:15:21Z) - Transcending Forgery Specificity with Latent Space Augmentation for Generalizable Deepfake Detection [57.646582245834324]
LSDAと呼ばれる簡易で効果的なディープフェイク検出器を提案する。
より多様な偽の表現は、より一般化可能な決定境界を学べるべきである。
提案手法は驚くほど有効であり, 広く使用されている複数のベンチマークで最先端の検出器を超越することを示す。
論文 参考訳(メタデータ) (2023-11-19T09:41:10Z) - AI-generated text boundary detection with RoFT [7.2286849324485445]
テキストの書き起こし部分と機械生成部分の境界を検出する方法について検討する。
特に,境界検出に対するパープレキシティに基づくアプローチは,RoBERTaモデルの教師付き微調整よりも,ドメイン固有データの特異性に頑健であることがわかった。
論文 参考訳(メタデータ) (2023-11-14T17:48:19Z) - ConDA: Contrastive Domain Adaptation for AI-generated Text Detection [17.8787054992985]
大規模言語モデル(LLM)は、ニュース記事のテキスト生成にますます利用されている。
これらのLSMを大規模に偽情報を生成できる潜在的な悪意のある性質を考えると、このようなAI生成テキストのための効果的な検出器を構築することが重要である。
本研究では、AI生成したニューステキストの検出において、このデータ問題に取り組み、その問題を教師なしドメイン適応タスクとしてフレーム化する。
論文 参考訳(メタデータ) (2023-09-07T19:51:30Z) - Optimizing Factual Accuracy in Text Generation through Dynamic Knowledge
Selection [71.20871905457174]
言語モデル(LM)は、私たちが情報と対話する方法に革命をもたらしたが、しばしば非現実的なテキストを生成する。
従来の手法では、外部知識をテキスト生成の参照として使用して事実性を高めるが、無関係な参照の知識の混在に苦慮することが多い。
本稿では,テキスト生成プロセスを反復処理に分割するDKGenを提案する。
論文 参考訳(メタデータ) (2023-08-30T02:22:40Z) - Paraphrasing evades detectors of AI-generated text, but retrieval is an
effective defense [56.077252790310176]
本稿では,パラフレーズ生成モデル(DIPPER)を提案する。
DIPPERを使って3つの大きな言語モデル(GPT3.5-davinci-003)で生成されたテキストを言い換えると、透かしを含むいくつかの検出器を回避できた。
我々は,言語モデルAPIプロバイダによって維持されなければならない,意味論的に類似した世代を検索するシンプルなディフェンスを導入する。
論文 参考訳(メタデータ) (2023-03-23T16:29:27Z) - Classifiers are Better Experts for Controllable Text Generation [63.17266060165098]
提案手法は, PPLにおける最近のPPLM, GeDi, DExpertsよりも有意に優れており, 生成したテキストの外部分類器に基づく感情の精度が高いことを示す。
同時に、実装やチューニングも簡単で、制限や要件も大幅に少なくなります。
論文 参考訳(メタデータ) (2022-05-15T12:58:35Z) - TSDAE: Using Transformer-based Sequential Denoising Auto-Encoder for
Unsupervised Sentence Embedding Learning [53.32740707197856]
TSDAE(Sequential Denoising Auto-Encoder)を用いた最新の非監視方式を提案する。
ドメイン内の監視されたアプローチのパフォーマンスの93.1%を達成することができる。
論文 参考訳(メタデータ) (2021-04-14T17:02:18Z) - Simultaneous Semantic Alignment Network for Heterogeneous Domain
Adaptation [67.37606333193357]
本稿では,カテゴリ間の相関を同時に利用し,各カテゴリ毎のセントロイドを整列させるために,aSimultaneous Semantic Alignment Network (SSAN)を提案する。
対象の擬似ラベルを利用することで、各カテゴリの特徴表現を整列させるために、ロバストな三重項中心のアライメント機構を明示的に適用する。
テキスト・ツー・イメージ、画像・画像・テキスト・ツー・テキストにわたる様々なHDAタスクの実験は、最先端のHDA手法に対するSSANの優位性を検証することに成功した。
論文 参考訳(メタデータ) (2020-08-04T16:20:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。