論文の概要: POSNoise: An Effective Countermeasure Against Topic Biases in Authorship
Analysis
- arxiv url: http://arxiv.org/abs/2005.06605v2
- Date: Thu, 1 Jul 2021 09:16:06 GMT
- ステータス: 処理完了
- システム内更新日: 2022-12-07 12:07:23.448635
- Title: POSNoise: An Effective Countermeasure Against Topic Biases in Authorship
Analysis
- Title(参考訳): POSNoise:オーサリング分析におけるトピックバイアスの効果的な対策
- Authors: Oren Halvani and Lukas Graner
- Abstract要約: 著者確認は、デジタルテキストの法医学における基本的な研究課題である。
本稿では,あるテキストのトピック関連コンテンツを効果的にマスキングするPOSNoiseという前処理手法を提案する。
以上の結果から, POSNoiseは42例中34例でよく知られたトピックマスキング法と比較して, 最大10%の精度で良好な結果が得られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Authorship verification (AV) is a fundamental research task in digital text
forensics, which addresses the problem of whether two texts were written by the
same person. In recent years, a variety of AV methods have been proposed that
focus on this problem and can be divided into two categories: The first
category refers to such methods that are based on explicitly defined features,
where one has full control over which features are considered and what they
actually represent. The second category, on the other hand, relates to such AV
methods that are based on implicitly defined features, where no control
mechanism is involved, so that any character sequence in a text can serve as a
potential feature. However, AV methods belonging to the second category bear
the risk that the topic of the texts may bias their classification predictions,
which in turn may lead to misleading conclusions regarding their results. To
tackle this problem, we propose a preprocessing technique called POSNoise,
which effectively masks topic-related content in a given text. In this way, AV
methods are forced to focus on such text units that are more related to the
writing style. Our empirical evaluation based on six AV methods (falling into
the second category) and seven corpora shows that POSNoise leads to better
results compared to a well-known topic masking approach in 34 out of 42 cases,
with an increase in accuracy of up to 10%.
- Abstract(参考訳): 著者検証(AV)は、デジタルテキスト鑑定における基本的な研究課題であり、2つのテキストが同一人物によって書かれたかどうかという問題に対処する。
第一のカテゴリは、明確に定義された特徴に基づいており、どの特徴が検討され、それらが実際に何を表現しているかを完全に制御する手法を指す。
一方、第2のカテゴリは、暗黙的に定義された特徴に基づいており、制御機構が関与しない、テキスト中の文字列が潜在的な特徴として機能するように、AVメソッドに関連する。
しかしながら、第2カテゴリに属するAV手法は、テキストのトピックが分類予測に偏りがあるリスクを負っており、その結果について誤解を招く可能性がある。
そこで本研究では,あるテキストのトピック関連コンテンツを効果的にマスキングするPOSNoiseという前処理手法を提案する。
このようにして、AVメソッドは書き方とより関係のあるテキスト単位に集中せざるを得ない。
6種類のAV法(第2分類に該当)と7つのコーパスに基づく実証的評価の結果,42例中34例において,POSNoiseの方が有意な成績を示し,精度は10%まで向上した。
関連論文リスト
- Illusions of Relevance: Using Content Injection Attacks to Deceive Retrievers, Rerankers, and LLM Judges [52.96987928118327]
検索,リランカー,大型言語モデル(LLM)の埋め込みモデルは,コンテンツインジェクション攻撃に対して脆弱であることがわかった。
主な脅威は,(1) 意味不明な内容や有害な内容の挿入,(2) 関連性を高めるために,問合せ全体あるいはキークエリ用語の挿入,の2つである。
本研究は, 注射内容の配置や関連物質と非関連物質とのバランスなど, 攻撃の成功に影響を与える要因を系統的に検討した。
論文 参考訳(メタデータ) (2025-01-30T18:02:15Z) - The \textit{Questio de aqua et terra}: A Computational Authorship Verification Study [49.56191463229252]
本研究は, クエシオの真正性について, 数値的オーサシップ検証(AV)を用いて検討する。
AVシステムのファミリーを構築し、13世紀と14世紀のラテン文字のコーパスを組み立てます。
AVシステムのクエチオへの応用は、その真正性に関する非常に確実な予測を返す。
論文 参考訳(メタデータ) (2025-01-07T18:42:05Z) - Controlling Out-of-Domain Gaps in LLMs for Genre Classification and Generated Text Detection [0.20482269513546458]
本研究は,Large Language Models (LLMs) の現代世代において,事前学習型言語モデル (PLMs) の先行研究において観測された,同じ領域外(OOD) 性能差に悩まされていることを示す。
本稿では,予測指標が使用されるか,分類中に除外されるかを制御する手法を提案する。
このアプローチにより、数ショットのセットアップで最大20パーセントのOODギャップが削減される。
論文 参考訳(メタデータ) (2024-12-29T21:54:39Z) - Detecting Statements in Text: A Domain-Agnostic Few-Shot Solution [1.3654846342364308]
最先端のアプローチは通常、作成にコストがかかる大規模な注釈付きデータセット上の微調整モデルを含む。
本稿では,クレームに基づくテキスト分類タスクの共通パラダイムとして,定性的で多目的な少ショット学習手法の提案とリリースを行う。
本手法は,気候変動対策,トピック/スタンス分類,うつ病関連症状検出の3つの課題の文脈で説明する。
論文 参考訳(メタデータ) (2024-05-09T12:03:38Z) - Forging the Forger: An Attempt to Improve Authorship Verification via Data Augmentation [52.72682366640554]
著者検証(英語: Authorship Verification, AV)とは、ある特定の著者によって書かれたか、別の人物によって書かれたのかを推測するテキスト分類タスクである。
多くのAVシステムは敵の攻撃に弱いことが示されており、悪意のある著者は、その書体スタイルを隠蔽するか、あるいは他の著者の書体を模倣することによって、積極的に分類者を騙そうとしている。
論文 参考訳(メタデータ) (2024-03-17T16:36:26Z) - A comprehensive study on Frequent Pattern Mining and Clustering categories for topic detection in Persian text stream [6.446062819763263]
本研究の目的は,トピック検出のための最適なアルゴリズムについて広範な研究を行うことである。
ペルシアのソーシャルネットワーク投稿のテキストがデータセットとして使用される。
以上の結果から,人間が容易に理解できるキーワードトピックを探索する場合には,ハイブリッドカテゴリーの方が優れていることが示唆された。
論文 参考訳(メタデータ) (2024-03-15T12:08:58Z) - A Review of Adversarial Attack and Defense for Classification Methods [78.50824774203495]
本稿では,敵対的事例の生成と保護に焦点をあてる。
この論文は、多くの統計学者が、この重要かつエキサイティングな分野において、敵の事例を生成・防御することを奨励するものである。
論文 参考訳(メタデータ) (2021-11-18T22:13:43Z) - VL-NMS: Breaking Proposal Bottlenecks in Two-Stage Visual-Language
Matching [75.71523183166799]
マルチモーダル入力をマッチングするための一般的なフレームワークは、2段階のプロセスに基づいている。
これらの手法は、2つの段階における提案の役割間の明らかな不一致を見落としていると論じる。
今回提案するVL-NMSは、問い合わせ対応の提案を第一段階に行う最初の手法です。
論文 参考訳(メタデータ) (2021-05-12T13:05:25Z) - Weakly-Supervised Aspect-Based Sentiment Analysis via Joint
Aspect-Sentiment Topic Embedding [71.2260967797055]
アスペクトベース感情分析のための弱教師付きアプローチを提案する。
We learn sentiment, aspects> joint topic embeddeds in the word embedding space。
次に、ニューラルネットワークを用いて単語レベルの識別情報を一般化する。
論文 参考訳(メタデータ) (2020-10-13T21:33:24Z) - Deep Bayes Factor Scoring for Authorship Verification [10.405174977499497]
2つのよく知られたアプローチを1つのエンドツーエンドの学習手順に階層的に融合させる。
底辺の深い計量学習フレームワークは、可変長の文書を固定サイズの特徴ベクトルにマッピングする擬似メトリックを学習することを目的としている。
上位には確率層を組み込んで、学習された計量空間におけるベイズ係数のスコアリングを行う。
論文 参考訳(メタデータ) (2020-08-23T21:00:33Z) - A Step Towards Interpretable Authorship Verification [0.0]
オーサシップ検証(英: Authorship verification、AV)は、デジタルテキスト法医学の分野における研究分野である。
多くのアプローチでは、文書のトピックに関連するか、影響を受けている機能を活用している。
分類決定における話題に依存しない特徴のみを考慮した代替的なAVアプローチを提案する。
論文 参考訳(メタデータ) (2020-06-22T16:44:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。