論文の概要: Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review
- arxiv url: http://arxiv.org/abs/2605.05271v1
- Date: Wed, 06 May 2026 13:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.332326
- Title: Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review
- Title(参考訳): エコーチェンバーを壊す:AIによるピアレビューの奪取に反対する写本に隠された保護具
- Authors: Oubo Ma, Ruixiao Lin, Jiahao Chen, Yuan Su, Yong Yang, Shouling Ji,
- Abstract要約: エンド・ツー・エンド・レビュー・アウトソーシングは新たな脅威だ。
会場に依存しない防衛フレームワークであるIntraGuardを提案する。
IntraGuardは最大84%の防衛成功率を達成した。
- 参考スコア(独自算出の注目度): 41.467123148467415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLMs become increasingly capable, editorial boards and program committees are growing concerned about reviewers who fully outsource peer review to commercial chatbots. This concern stems from prior findings that current chatbots lack the independent critical thinking and depth of reasoning required to assess scientific novelty. One promising direction for mitigating this concern is to embed hidden instructions into manuscripts that disrupt or alter chatbot-generated reviews. However, existing methods remain intuitive and fragile, as they typically rely on homogeneous payloads injected in an inter-stream manner, rendering them susceptible to sanitization or neutralization. In this paper, we identify End-to-End Review Outsourcing as an emerging threat and propose IntraGuard, a black-box, venue-agnostic defense framework grounded in the structural--visual decoupling inherent to the PDF. Designed for committee-side deployment, IntraGuard supports both explicit strategies that trigger refusal or warning signals, and implicit strategies that embed predefined textual markers into the generated review. These strategies can be deployed via any of three intra-stream injection mechanisms, each of which seamlessly embeds heterogeneous defensive text objects within the PDF's underlying structure without altering its visual presentation. Extensive evaluations across 7 real-world commercial chatbot settings and 12 venues spanning diverse disciplines show that IntraGuard achieves a defense success rate of up to 84%, while preserving peer-review invariance for human reviewers. IntraGuard is lightweight and hardware-independent, incurring an average overhead of only one second per manuscript on a commodity personal computer. We further evaluate 11 adaptive attacks spanning manuscript sanitization and instruction interference, and discuss the implications of constructing ensemble defenses.
- Abstract(参考訳): LLMがますます有能になるにつれて、編集委員会やプログラム委員会は、ピアレビューを完全に商用チャットボットにアウトソースするレビュアーに懸念を抱いている。
この懸念は、現在のチャットボットが科学的新奇性を評価するのに必要な独立した批判的思考と推論の深さを欠いているという以前の発見に由来する。
この懸念を緩和するための有望な方向の1つは、チャットボット生成レビューを中断または変更する原稿に隠された命令を埋め込むことである。
しかし、既存の手法は直感的で脆弱なままであり、通常、ストリーム間で注入される均質なペイロードに依存しており、衛生化や中和の影響を受けやすい。
本稿では,エンド・トゥ・エンド・レビュー・アウトソーシングを新たな脅威とみなし,PDFに固有の構造的・視覚的デカップリングを基盤とした,ブラックボックスで場所に依存しない防衛フレームワークであるIntraGuardを提案する。
委員会側のデプロイメント用に設計されたIntraGuardは、拒否や警告シグナルをトリガーする明示的な戦略と、事前に定義されたテキストマーカーを生成されたレビューに埋め込む暗黙的な戦略の両方をサポートする。
これらの戦略は3つのイントラストリームインジェクションメカニズムのいずれかを介して展開でき、それぞれがPDFの基盤構造に不均一な防御テキストオブジェクトをシームレスに埋め込むことができる。
7つの現実世界の商業チャットボット設定と12の会場で広範囲に評価したところ、IntraGuardは最大84%の防衛成功率を達成し、人間レビュアーにとってはピアレビューの不変性を保っている。
イントラガードは軽量でハードウェアに依存しないため、コモディティのパーソナルコンピュータ上では、原稿1枚につき平均1秒のオーバーヘッドが発生する。
さらに,原稿の衛生化と命令干渉にまたがる11のアダプティブアタックを評価し,アンサンブルディフェンスの構築の意味について検討した。
関連論文リスト
- When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection [9.898508403320438]
本稿では,テキストの逆転を検知する新しいブラックボックスフレームワークRTD-Guardを紹介する。
我々の重要な洞察は、敵攻撃における単語置換摂動は、置換トークン検出識別器が識別するために事前訓練されている「置換トークン」によく似ているということである。
プロセス全体では、敵データ、モデルチューニング、内部モデルアクセスは必要とせず、2つのブラックボックスクエリのみを使用する。
論文 参考訳(メタデータ) (2026-03-13T02:30:56Z) - Bias Injection Attacks on RAG Databases and Sanitization Defenses [9.638140849760108]
本稿では,検索強化世代(RAG)システムにおけるベクトルデータベースに対する攻撃と防御について検討する。
バイアス注入攻撃は、事実的に正しいが、意味的に偏ったパスを知識ベースに挿入する。
論文 参考訳(メタデータ) (2025-11-30T09:27:18Z) - ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning [11.340599332479705]
大規模言語モデル(LLM)は、出力を微妙に操作できる敵攻撃に対して、ますます脆弱である。
本稿では,DeepSeek-Reasonerのチェーン・オブ・シント(CoT)推論機能を活用した,解釈可能な敵防衛フレームワークであるExplainableGuardを紹介する。
GLUE BenchmarkとIMDB Movie Reviewsデータセットの予備的な結果は、防衛効果が有望であることを示している。
論文 参考訳(メタデータ) (2025-11-15T06:11:07Z) - Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review [0.0]
プレプリントのウェブサイト arXiv にある18の学術写本は、AI支援ピアレビューを操作するために設計された隠された命令を含んでいることが発見された。
著者の反応は様々で、1人は影響を受けた論文を撤回する計画を立て、もう1人はレビュアーコンプライアンスの合法的なテストとしてプラクティスを擁護した。
大規模言語モデル (LLM) におけるプロンプト注入技術について検討し, 4種類の隠蔽プロンプトを明らかにする。
論文 参考訳(メタデータ) (2025-07-08T17:11:13Z) - Illusions of Relevance: Using Content Injection Attacks to Deceive Retrievers, Rerankers, and LLM Judges [52.96987928118327]
検索,リランカー,大型言語モデル(LLM)の埋め込みモデルは,コンテンツインジェクション攻撃に対して脆弱であることがわかった。
主な脅威は,(1) 意味不明な内容や有害な内容の挿入,(2) 関連性を高めるために,問合せ全体あるいはキークエリ用語の挿入,の2つである。
本研究は, 注射内容の配置や関連物質と非関連物質とのバランスなど, 攻撃の成功に影響を与える要因を系統的に検討した。
論文 参考訳(メタデータ) (2025-01-30T18:02:15Z) - Defense of Adversarial Ranking Attack in Text Retrieval: Benchmark and
Baseline via Detection [12.244543468021938]
本稿では,敵対的文書に対する2種類の検出タスクを提案する。
敵のランク防衛の調査を容易にするために、ベンチマークデータセットが確立されている。
いくつかの検出基準線の性能を総合的に調査する。
論文 参考訳(メタデータ) (2023-07-31T16:31:24Z) - A Unified Evaluation of Textual Backdoor Learning: Frameworks and
Benchmarks [72.7373468905418]
我々は,テキストバックドア学習の実装と評価を促進するオープンソースツールキットOpenBackdoorを開発した。
また,単純なクラスタリングに基づく防御ベースラインであるCUBEを提案する。
論文 参考訳(メタデータ) (2022-06-17T02:29:23Z) - Improving the Adversarial Robustness for Speaker Verification by Self-Supervised Learning [95.60856995067083]
この研究は、特定の攻撃アルゴリズムを知らずにASVの敵防衛を行う最初の試みの一つである。
本研究の目的は,1) 対向摂動浄化と2) 対向摂動検出の2つの視点から対向防御を行うことである。
実験の結果, 検出モジュールは, 約80%の精度で対向検体を検出することにより, ASVを効果的に遮蔽することがわかった。
論文 参考訳(メタデータ) (2021-06-01T07:10:54Z) - Detecting Cross-Modal Inconsistency to Defend Against Neural Fake News [57.9843300852526]
我々は、画像やキャプションを含む機械生成ニュースに対して、より現実的で挑戦的な対策を導入する。
敵が悪用できる可能性のある弱点を特定するために、4つの異なる種類の生成された記事からなるNeuralNewsデータセットを作成します。
ユーザ実験から得られた貴重な知見に加えて,視覚的意味的不整合の検出にもとづく比較的効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2020-09-16T14:13:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。