論文の概要: The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment
- arxiv url: http://arxiv.org/abs/2607.10080v1
- Date: Sat, 11 Jul 2026 02:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.289385
- Title: The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment
- Title(参考訳): LLM関連判断における多言語・キーワード対応注入の効果
- Abstract要約: 大規模言語モデル (LLM) は情報検索における関連性評価のための自動判断器として, ますます利用されている。
TRECディープラーニングコレクションと2つのオープンウェイトモデルを用いて,LLMに基づく関連判断に対する言語間インジェクション攻撃の効果を検討した。
以上の結果から,複数言語によるクエリベースのインジェクションは,既存のプロンプトインジェクション防御を回避しつつ,関連性のスコアを膨らませる上で極めて有効であることが示唆された。
- 参考スコア(独自算出の注目度): 17.58204111704295
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly being used as automated judges for relevance evaluation in information retrieval, yet their robustness to adversarial manipulation remains insufficiently understood, particularly in multilingual settings. In this work, we investigate the impact of cross-lingual prompt injection attacks on LLM-based relevance judgments using TREC Deep Learning collections and two open-weight models under established prompting frameworks. We examine both instruction-based and content-based injection strategies in 8 languages spanning different resource levels. Our results demonstrate that multilingual query-based injections are highly effective in inflating relevance scores while simultaneously evading existing prompt-injection defenses. We further found that, although existing defense mechanisms can be modified to mitigate such attacks, these injections can be easily adapted to bypass them. These findings highlight a critical gap in current defense approaches and demonstrate that language generalization can act as an attack vector, underscoring the need for more robust and proactive evaluation frameworks for LLM-as-a-judge systems.
- Abstract(参考訳): 大規模言語モデル (LLM) は情報検索における関連性評価のための自動判断器としてますます使われてきているが, 対角的操作に対する頑健さは, 特に多言語的設定において十分に理解されていない。
本研究では, TRECディープラーニングコレクションと, 確立されたプロンプトフレームワーク下での2つのオープンウェイトモデルを用いて, LLMに基づく関連判断に対する言語間プロンプトインジェクション攻撃の影響について検討する。
異なるリソースレベルにまたがる8言語における命令ベースおよびコンテンツベースのインジェクション戦略について検討する。
以上の結果から,複数言語によるクエリベースインジェクションは,既存のプロンプトインジェクション防御を回避しつつ,関連度スコアを膨らませる上で極めて有効であることが示唆された。
さらに,このような攻撃を緩和するために既存の防御機構を変更できるが,これらの注入は容易に回避できることがわかった。
これらの知見は,LLM-as-a-judgeシステムに対するより堅牢で積極的な評価フレームワークの必要性を強調し,言語一般化がアタックベクターとして機能することを示す。
関連論文リスト
- Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain [94.64605746540472]
MLLM(Multimodal large language model)は、より文脈的なマルチモーダル情報を処理するために、大規模言語モデル(LLM)の能力を拡張した。
近年の研究では、MLLMは敵対的な入力、特に視覚成分を標的とする入力に対して非常に脆弱であることが示されている。
本稿では, 構造関連位相領域に対する対向的摂動を明示的に制限する, 位相対応型対向攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-01T06:34:32Z) - DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection [68.92080038934164]
本研究では8次元の先進検出器を評価するためのベンチマークであるTreatorRL-Xを紹介する。
このベンチマークは、商業的文脈で一般的に使用される8つの言語を含み、誤用を受けやすい6つのドメインから人書きのテキストを収集する。
論文 参考訳(メタデータ) (2026-05-15T01:29:26Z) - Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing [26.82171813043921]
大規模言語モデル(LLM)は、学術的ピアレビューを含む、高インパクトでの使用がますます検討されている。
ICMLに受理された約500の実際の学術論文のデータセットを構築し、これらの文書に隠れた敵のプロンプトを埋め込む効果を評価する。
インジェクションは,英語,日本語,中国語のインジェクションに対して,レビュースコアの大幅な変化を誘発するが,アラビアのインジェクションは効果をほとんど与えない。
論文 参考訳(メタデータ) (2025-12-29T18:43:05Z) - CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment [23.1730341293796]
音声に基づく認知障害評価のための大規模言語モデルの言語間およびサイト間一般化性を評価するための最初のベンチマークであるCagBenchを提案する。
以上の結果から,従来のディープラーニングモデルはドメイン間で変換されると大幅に劣化することがわかった。
本研究は,臨床的に有用で言語学的に堅牢な音声に基づく認知評価ツールを構築するための重要なステップを提供する。
論文 参考訳(メタデータ) (2025-08-05T12:06:16Z) - TopicAttack: An Indirect Prompt Injection Attack via Topic Transition [92.26240528996443]
大規模言語モデル(LLM)は間接的なインジェクション攻撃に対して脆弱である。
提案するTopicAttackは,LLMに生成した遷移プロンプトを生成し,徐々にトピックをインジェクション命令にシフトさせる。
提案手法は, インジェクトからオリジナルへのアテンション比が高く, 成功確率が高く, ベースライン法よりもはるかに高い比を達成できることがわかった。
論文 参考訳(メタデータ) (2025-07-18T06:23:31Z) - Large Language Models for Multilingual Vulnerability Detection: How Far Are We? [13.269680075539135]
多言語脆弱性検出のための事前学習言語モデル(PLM)と大規模言語モデル(LLM)の有効性を評価する。
7つの言語にまたがる3万以上の現実世界の脆弱性修正パッチを使用して、機能レベルとラインレベルの両方でモデルパフォーマンスを評価します。
GPT-4oはインストラクションチューニングと数発のプロンプトによって強化され、他の評価モデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-06-09T07:27:49Z) - A Preliminary Study of Large Language Models for Multilingual Vulnerability Detection [13.269680075539135]
言語モデル(LLM)は言語に依存しない機能と意味理解の強化を提供する。
大規模言語モデル(LLM)の最近の進歩は、言語に依存しない機能と意味理解の強化を提供する。
以上の結果から, PLM CodeT5Pは多言語脆弱性検出において最高の性能を発揮することが明らかとなった。
論文 参考訳(メタデータ) (2025-05-12T09:19:31Z) - TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning [63.481446315733145]
多言語大言語モデル(LLM)に対する言語間バックドア攻撃は未調査である。
本研究は, 教育指導データが有毒でない言語に対して, 教育指導データの有毒化がアウトプットに与える影響について検討した。
本手法は,mT5 や GPT-4o などのモデルにおいて,高い攻撃成功率を示し,12言語中7言語以上で90%以上を突破した。
論文 参考訳(メタデータ) (2024-04-30T14:43:57Z) - A Novel Evaluation Framework for Assessing Resilience Against Prompt Injection Attacks in Large Language Models [0.0]
本研究では,アプリケーションのレジリエンスを定量化する新しいフレームワークを提案する。
このフレームワークには、代表性、解釈可能性、堅牢性を保証するために設計された革新的な技術が含まれている。
その結果, 新しいモデルであるLlama2はChatGLMよりも高いレジリエンスを示した。
論文 参考訳(メタデータ) (2024-01-02T02:06:48Z) - Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models [79.0183835295533]
我々は,このような脆弱性のリスクを評価するために,BIPIAと呼ばれる間接的インジェクション攻撃のための最初のベンチマークを導入した。
我々の分析では、LLMが情報コンテキストと動作可能な命令を区別できないことと、外部コンテンツ内での命令の実行を回避できないことの2つの主要な要因を同定した。
ブラックボックスとホワイトボックスという2つの新しい防御機構と、これらの脆弱性に対処するための明確なリマインダーを提案する。
論文 参考訳(メタデータ) (2023-12-21T01:08:39Z) - Evaluating the Instruction-Following Robustness of Large Language Models
to Prompt Injection [70.28425745910711]
LLM(Large Language Models)は、命令追従に非常に熟練した言語である。
この能力は、迅速なインジェクション攻撃のリスクをもたらす。
このような攻撃に対する命令追従LDMの堅牢性を評価する。
論文 参考訳(メタデータ) (2023-08-17T06:21:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。