論文の概要: Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
- arxiv url: http://arxiv.org/abs/2608.04286v1
- Date: Tue, 04 Aug 2026 23:25:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.661425
- Title: Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
- Title(参考訳): 意味論的に等価な逆行性攻撃によるLDMの内因性幻覚の除去
- Abstract要約: 大規模言語モデル(LLM)は、事実の正確性を改善し、幻覚を減らすために外部知識ソースと併用されることが多い。
本稿では,ユーザクエリの自然な意味論的に等価なバリエーションを用いて,ストレステストによりモデルロバスト性を評価する新しいフレームワークを提案する。
- 参考スコア(独自算出の注目度): 16.383448770804492
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are often used in conjunction with external knowledge sources to improve their factual accuracy and decrease hallucinations, through methods such as Retrieval-Augmented Generation (RAG). However, these systems remain susceptible to intrinsic hallucinations, where the model generates unfaithful or fabricated information that is not supported by the retrieved evidence. We propose a novel framework to assess model robustness against this phenomenon by stress-testing using natural, semantically equivalent variations of a user query found via adversarial optimization methods. We apply our framework, which enforces strict semantic equivalence constraints and an intrinsic hallucination objective, to a range of adversarial attack techniques across white-box, gray-box, and black-box adversarial settings. Evaluating these attacks on 5 open-source and 5 closed-source generator models across 3 datasets, we demonstrate that even state-of-the-art models are highly susceptible to meaning-preserving perturbations, which significantly degrade contextual faithfulness (by up to 50% for GPT-5-mini). Our findings indicate that faithful use of in-context evidence remains fragile even in state-of-the-art LLMs, motivating architectures and training objectives that enforce robust grounding independent of surface query form. Code is available at: https://github.com/atriviveksharma/intrinsic_hall
- Abstract(参考訳): 大規模言語モデル (LLM) は、しばしば外部の知識ソースと組み合わせて、検索・拡張生成 (RAG) のような手法によって、その事実の正確性を改善し、幻覚を減少させる。
しかし、これらのシステムは本質的な幻覚に影響を受けやすいままであり、そこではモデルは、得られた証拠に支えられていない不信または偽造の情報を生成する。
本稿では,この現象に対するモデルロバスト性を評価するためのフレームワークを提案する。
我々は,厳密な意味的同値制約と本質的な幻覚を強制する枠組みを,ホワイトボックス,グレーボックス,ブラックボックスの敵対的設定にまたがる様々な敵攻撃手法に適用する。
3つのデータセットにわたる5つのオープンソースおよび5つのクローズドソースジェネレータモデルに対するこれらの攻撃を評価することで、最先端モデルでさえ、文脈的忠実度(GPT-5-miniでは最大50%)を著しく低下させる意味保存摂動の影響を受けやすいことを示した。
現状のLLMやアーキテクチャのモチベーション,表面クエリ形式に依存しない堅牢な基底を強制するトレーニング目標においても,文脈内証拠の忠実な使用は依然として脆弱であることが示唆された。
コードは、https://github.com/atriviveksharma/inrinsic_hallで入手できる。
関連論文リスト
- MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection [25.077055201475442]
顔検出のためのMFAD(Multimodal Large Language Models)を提案する。
MFADは、微細なピクセル・セマンティックアンカー機構により、マルチモーダル大言語モデルの本質的な推論機能を活性化する。
攻撃カテゴリごとに1,000の正確なマスクをアノテートすることで、我々はスプーフされた領域に厳密に対応するエビデンス連鎖を生成する。
論文 参考訳(メタデータ) (2026-08-18T03:38:59Z) - UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation [90.0896070825457]
本稿では,拡散過程におけるノイズダイナミクスのレンズを通して,安全機構を再考する統合ノイズ駆動フレームワークを提案する。
我々の重要な洞察は、早期の予測ノイズは、正常な内容と性的な内容の間に固有の分離性を示すことである。
我々は,計算オーバーヘッドがほとんどなく,精度の高い軽量ノイズベース検出器を開発した。
論文 参考訳(メタデータ) (2026-07-18T14:03:39Z) - Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence [45.78409219344429]
マルチモーダル大言語モデル (MLLM) は, 臨床VQAと放射線学報告の生成に強い期待を示すが, 推測時幻覚は信頼性を損なう。
本稿では,両面のエビデンス注入による幻覚を系統的に緩和する,総合的かつトレーニング不要なエビデンス注入フレームワークを提案する。
textttLLaVA-1.5-7B, texttLLaVA-Med-1.5-7B, texttQwen3-VL-8B/32B, textttInternVL を用いた2つのタスクと5つのデータセットの系統的評価を行った。
論文 参考訳(メタデータ) (2026-06-30T08:07:25Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - Explainability-Guided Defense: Attribution-Aware Model Refinement Against Adversarial Data Attacks [6.573058520271728]
私たちは、トレーニング中に直接活用できる、解釈可能性と堅牢性との関連性を特定します。
本稿では,局所解釈可能なモデル非依存表現をアクティブな訓練信号に変換する属性誘導型改良フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-02T19:36:03Z) - MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks [47.46936341268548]
Retrieval-Augmented Generation (RAG)システムでは、コーパス中毒という致命的な攻撃面が導入されている。
我々は,厳格なブラックボックスとクエリ非依存環境のために設計された,新しい多段階毒素パイプラインであるMIRAGEを提案する。
大規模な実験により、MIRAGEは攻撃効果とステルスネスの両方において既存のベースラインを著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-12-09T06:38:16Z) - Dynamic Evaluation for Oversensitivity in LLMs [68.27609301865174]
過敏性は、言語モデルが実際に良性であるプロンプトを防衛的に拒否するときに起こる。
この振る舞いはユーザインタラクションを妨害するだけでなく、有害なコンテンツと無害なコンテンツの境界を曖昧にする。
既存のベンチマークは、モデルの発展に伴ってオーバータイムを低下させる静的データセットに依存している。
論文 参考訳(メタデータ) (2025-10-21T18:33:47Z) - Graph Representation-based Model Poisoning on Federated Large Language Models [3.5233863453805143]
フェデレートされた大規模言語モデル(FedLLMs)は、データのプライバシを保持しながら、無線ネットワーク内で強力な生成機能を実現する。
本稿では,FedLLMのモデル中毒技術と既存の防御機構の最近の進歩について概説する。
さらに、グラフ表現に基づくモデル中毒(GRMP)は、良質なクライアント勾配間の高次相関を利用して、悪意ある更新を正当なものと区別できないものにする新興攻撃パラダイムである。
論文 参考訳(メタデータ) (2025-07-02T13:20:52Z) - Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search [76.54475437069395]
大きな言語モデル(LLM)は、意味的に一貫性があるがタスクに依存しないコンテキスト情報に直面している場合、元のパフォーマンスを維持するのに苦労することが多い。
本稿では,木探索に基づく動的散逸生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-03T18:43:36Z) - TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation [31.231916859341865]
TrustRAGは、生成のために取得される前に、悪意のある、無関係なコンテンツを体系的にフィルタリングするフレームワークである。
TrustRAGは、検索精度、効率、攻撃抵抗を大幅に改善する。
論文 参考訳(メタデータ) (2025-01-01T15:57:34Z) - Transferable Adversarial Attacks on SAM and Its Downstream Models [87.23908485521439]
本稿では,セグメント・アプライス・モデル(SAM)から微調整した様々な下流モデルに対する敵攻撃の可能性について検討する。
未知のデータセットを微調整したモデルに対する敵攻撃の有効性を高めるために,ユニバーサルメタ初期化(UMI)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-26T15:04:04Z) - FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows" [74.7488607599921]
FaithEvalは、コンテキストシナリオにおける大規模言語モデル(LLM)の忠実度を評価するためのベンチマークである。
FaithEvalは4.9Kの高品質な問題で構成され、厳格な4段階のコンテキスト構築と検証フレームワークを通じて検証されている。
我々の研究は、最先端のモデルでさえ、与えられた文脈に忠実であり続けるのに苦労することが多く、大きなモデルが必ずしも改善された忠実を示すとは限らないことを明らかにしている。
論文 参考訳(メタデータ) (2024-09-30T06:27:53Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。