論文の概要: Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework
- arxiv url: http://arxiv.org/abs/2608.04366v1
- Date: Wed, 05 Aug 2026 02:13:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.689889
- Title: Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework
- Title(参考訳): エージェントシステムにおける知識破壊の議論--ビザンチン耐性セキュア協調RAGフレームワーク
- Authors: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu,
- Abstract要約: ビザンチン耐性協調RAGフレームワークSecureCollaRAGを提案する。
提案手法により,エージェントシステムは動的GNNによる信頼性スコアリングにより,文書の証明を確実に行うことができる。
本研究では,SecureCollaRAGが非IIDデータ配信における攻撃者に対する堅牢性を維持していることを示す。
- 参考スコア(独自算出の注目度): 61.79960727298522
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While retrieval-augmented generation systems partially address the hallucination issues in large language models, it also introduces new vulnerabilities to knowledge corruption attacks. Adversaries exploit these vulnerabilities by poisoning documents provided by RAG system to manipulate LLM outputs. To counter this threat, we propose SecureCollaRAG, a Byzantine-tolerant collaborative RAG framework leveraging Multi-source Knowledge Validation Mechanism. Our approach enables agent system to securely verify document provenance through dynamic GNN-based credibility scoring, effectively preventing stealthy knowledge corruption attacks while preserving essential domain knowledge integrity. Through extensive evaluations and formal analysis, we demonstrate that SecureCollaRAG maintains robustness against attackers under non-IID data distributions.
- Abstract(参考訳): 検索強化された生成システムは、大規模言語モデルにおける幻覚の問題に部分的に対処する一方で、知識腐敗攻撃に新たな脆弱性を導入する。
敵はこれらの脆弱性をRAGシステムが提供する文書に悪用し、LSM出力を操作する。
この脅威に対処するため,マルチソース知識検証機構を活用したビザンチン耐性協調RAGフレームワークSecureCollaRAGを提案する。
本手法により、エージェントシステムは、動的GNNに基づく信頼性スコアリングにより、文書の証明を確実に行うことができ、重要なドメイン知識の完全性を保ちながら、盗難知識の汚職攻撃を効果的に防止できる。
本研究では,SecureCollaRAGが非IIDデータ配信における攻撃者に対する堅牢性を維持していることを示す。
関連論文リスト
- Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability [65.56750741053266]
大規模言語モデル(LLM)は、誤情報をコンテンツ中心の問題からより広範なエコシステムレベルのセキュリティ課題に転換した。
本稿では,これらのリスクと防御を統一する役割層フレームワークを提案する。
この役割はLLMを攻撃者、ディフェンダー、検証システムの脆弱なコンポーネントとして特徴づけ、層次元はコンテンツ、社会的コンテキスト、エビデンス環境、検証をカバーしている。
論文 参考訳(メタデータ) (2026-07-11T17:04:17Z) - GCVE: A Decentralized Model for Vulnerability Identification, Publication, and Operational Enrichment [51.77969450792284]
Global CVEイニシアチブ(Global CVE Initiative, G)は、脆弱性の識別、パブリッシュ、エンリッチメントのための分散化、オープン化、識別子モデルを提案する。
本稿では,自律型G番号認証,ライトウェイトアロケーションルール,分散パブリッシュ,オープン・ベスト・カレントプラクティス,実用的なリファレンス実装を組み合わせた社会技術的取り組みとしてGを提案する。
論文 参考訳(メタデータ) (2026-05-30T19:03:39Z) - INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems [70.37731999972785]
本稿では,感染防止対策の枠組みであるINFA-Guardを提案する。
修復中、INFA-Guardは攻撃者を置き換え、感染した者を修復し、トポロジカルな整合性を維持しながら悪意のある伝播を避ける。
論文 参考訳(メタデータ) (2026-01-21T05:27:08Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Automated Vulnerability Validation and Verification: A Large Language Model Approach [7.482522010482827]
本稿では、生成AI、特に大規模言語モデル(LLM)を利用したエンドツーエンド多段階パイプラインを提案する。
本手法は,国立脆弱性データベース(National Vulnerability Database)のCVE開示情報から抽出する。
これは、Retrieval-Augmented Generation (RAG)を使用して、外部の公開知識(例えば、脅威アドバイザリ、コードスニペット)で拡張する。
パイプラインは生成されたアーティファクトを反復的に洗練し、テストケースでのアタック成功を検証し、複雑なマルチコンテナセットアップをサポートする。
論文 参考訳(メタデータ) (2025-09-28T19:16:12Z) - ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search [69.60882125603133]
本稿では,検索した文書の信頼性情報を明確に活用する,敵対的堅牢性のためのフレームワークであるReliabilityRAGを提案する。
我々の研究は、RAGの回収されたコーパスの腐敗に対するより効果的で確実に堅牢な防御に向けた重要な一歩である。
論文 参考訳(メタデータ) (2025-09-27T22:36:42Z) - RAG Security and Privacy: Formalizing the Threat Model and Attack Surface [4.823988025629304]
Retrieval-Augmented Generation (RAG) は、大規模言語モデル(LLM)と外部文書検索を組み合わせて、より正確で基礎的な応答を生成する自然言語処理における新興のアプローチである。
既存の研究では、RAGがトレーニングデータ記憶や敵対的プロンプトを通じて機密情報を漏洩し、RAGシステムがこれらの脆弱性の多くを継承していることが示されている。
これらのリスクにもかかわらず、現在、RAGシステムの脅威状況を定義する公式なフレームワークは存在しない。
論文 参考訳(メタデータ) (2025-09-24T17:11:35Z) - One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems [28.06028279729382]
Retrieval-Augmented Generation (RAG)により強化されたLarge Language Models (LLMs) は、正確な応答を生成する際の性能改善を示す。
外部知識ベースへの依存は、潜在的なセキュリティ脆弱性をもたらす。
本稿では,RAGシステムに対するより現実的な知識中毒攻撃を明らかにし,単一の文書のみを毒殺することで攻撃を成功させる。
論文 参考訳(メタデータ) (2025-05-15T08:14:58Z) - TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation [31.231916859341865]
TrustRAGは、生成のために取得される前に、悪意のある、無関係なコンテンツを体系的にフィルタリングするフレームワークである。
TrustRAGは、検索精度、効率、攻撃抵抗を大幅に改善する。
論文 参考訳(メタデータ) (2025-01-01T15:57:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。