論文の概要: Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning
- arxiv url: http://arxiv.org/abs/2605.09822v1
- Date: Sun, 10 May 2026 23:55:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.435439
- Title: Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning
- Title(参考訳): Oracleのポジショニング:AIエージェントの推論を弱めるための知識グラフの崩壊
- Authors: Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar,
- Abstract要約: Oracle Poisoningは、相手が構造化知識グラフを破損させる攻撃クラスである。
プロンプトインジェクションとは異なり、Oracle Poisoningはデータエージェントを操作します。
プロダクション4200万ノードのコード知識グラフに対する6つの攻撃シナリオを実演する。
- 参考スコア(独自算出の注目度): 0.9236074230806578
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We define Oracle Poisoning, an attack class in which an adversary corrupts a structured knowledge graph that AI agents query at runtime via tool-use protocols, causing incorrect conclusions through correct reasoning. Unlike prompt injection, Oracle Poisoning manipulates the data agents reason over, not their instructions. We demonstrate six attack scenarios against a production 42-million-node code knowledge graph, providing the first empirical demonstration of knowledge graph poisoning against a production-scale agentic system, distinct from CTI embedding poisoning. Primary evaluation uses real SDK tool-use across nine models from three providers (N=30 per model), where models autonomously invoke a graph query tool and reason from results. The result is unambiguous: every tested model trusts poisoned data at 100% at moderate attacker sophistication(L2), with 269 valid trials (of 270) accepting fabricated security claims under directed queries. Under open-ended prompts, trust drops to 3-55%, confirming prompt framing as a confound; we report both conditions. An attacker sophistication gradient reveals discrete break points, a minimum skill at which trust flips from 0% to 100%, reframing the attack as a question not of whether but of how much. A controlled delivery-mode comparison shows that inline evaluation produces false negatives: GPT-5.1 shows 0% trust inline but 100% under both simulated and real agentic tool-use, demonstrating that delivery mode is a first-order confound. We evaluate five defences; read-only access control eliminates the direct mutation vector, while the remaining four are partial and model-dependent. Analysis of four additional platforms suggests the attack may generalise across the knowledge-graph ecosystem.
- Abstract(参考訳): Oracle Poisoningは、AIエージェントがツール使用プロトコルを介して実行時にクエリする構造化知識グラフを破壊し、正しい推論を通じて誤った結論を導き出す攻撃クラスです。
プロンプトインジェクションとは異なり、Oracle Poisoningはデータエージェントを操作します。
そこで本研究では,生産規模のエージェントシステムに対する知識グラフ中毒の実証実験として,CTI埋め込み毒とは別の6つの攻撃シナリオを実運用用ノードコード知識グラフに対して示す。
一次評価では、3つのプロバイダ(N=30モデル)から9つのモデルにまたがる実際のSDKツールを使用し、モデルがグラフクエリツールを自律的に呼び出し、結果から推論する。
テストされたすべてのモデルは、中間攻撃技術(L2)において100%の有毒データを信頼しており、269の有効なトライアル(270の)が、指示されたクエリの下で偽造されたセキュリティクレームを受け入れている。
オープンエンドのプロンプトでは,信頼度は3~55%に低下し,コンファウンドとしてのプロンプトフレーミングが確認された。
攻撃者の高度化勾配は、信頼が0%から100%に反転する最小のスキルである離散的なブレークポイントを明らかにする。
GPT-5.1は信頼インラインが0%、実際のエージェントツールの使用の両方で100%で信頼インラインが示され、デリバリーモードが1次不一致であることが示される。
読み取り専用アクセス制御は直接突然変異ベクトルを排除し,残りの4つは部分的かつモデルに依存している。
さらに4つのプラットフォームの分析から、この攻撃はナレッジグラフのエコシステム全体にわたって一般化される可能性があることが示唆されている。
関連論文リスト
- AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators [0.0]
AgentCollabBenchは、ソフトウェアエンジニアリング、DevOps、データエンジニアリングにまたがる900の人為的なタスクの診断ベンチマークです。
各タスクは、4つの行動リスクのうちの1つを分離する。
GPT 4.1 mini, Gemini 2.5 Flash Lite, Qwen-3.5-35B-A3B, Llama 3.1 8B の4つの近代LCMの評価を行った。
通信トポロジは、マルチホップ情報サバイバルにおけるばらつきの7-40%を説明する主要なリスクファクターとして現れる。
論文 参考訳(メタデータ) (2026-05-09T03:35:09Z) - Formal Architecture Descriptors as Navigation Primitives for AI Coding Agents [0.0]
正式なアーキテクチャ記述子をエージェントに提供することで,このナビゲーションオーバーヘッドを低減できるかどうかを検討する。
本稿では,S-expression アーキテクチャ記述子である intent.lisp を提案し,Forge ツールキットをオープンソース化する。
論文 参考訳(メタデータ) (2026-04-11T00:26:31Z) - Measuring and Exploiting Confirmation Bias in LLM-Assisted Security Code Review [6.417595678110472]
ソフトウェアサプライチェーン攻撃において,確認バイアスがLSMベースの脆弱性検出に影響を及ぼすか,また,この障害モードを悪用できるかを検討する。
調査1では,5つのフレーミング条件下で4つの最先端モデルに対して評価された250個のCVE脆弱性/パッチペアに対する制御実験により,確認バイアスを定量化する。
調査2は、既知の脆弱性を再導入する敵のプルリクエストを模倣して、セキュリティの改善やプルリクエストメタデータによる緊急機能修正を実施可能であることを評価する。
論文 参考訳(メタデータ) (2026-03-19T10:40:27Z) - The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models [10.377264470934843]
大きな言語モデルに対するバックドア攻撃は、通常、暗黙の悪意のある出力に秘密のトリガーを伴います。
我々はコンプライアンスのみのバックドアを導入し、ほぼ良質なデータセットで教師付き微調整を行い、プロンプトの小さなサブセットを任意の単一ワードトリガでサフィックスする。
本研究は, 毒性予算, 総微調整データセットサイズ, モデルサイズにまたがる, この良性ラベル中毒行動のマルチスケール解析を行った。
論文 参考訳(メタデータ) (2025-11-16T02:01:58Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z) - Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection [66.94175259287115]
命令調整型LLMに適した新しいバックドアアタック設定を提案する。
VPI攻撃では、攻撃者が特定した仮想プロンプトがユーザ命令に形式化されたかのように、バックドアモデルが応答することが期待されている。
我々は、モデルの命令チューニングデータに毒を盛ることによって脅威を実証する。
論文 参考訳(メタデータ) (2023-07-31T17:56:00Z) - IDEA: Invariant Defense for Graph Adversarial Robustness [60.0126873387533]
敵攻撃に対する不変因果判定法(IDEA)を提案する。
我々は,情報理論の観点から,ノードと構造に基づく分散目標を導出する。
実験によると、IDEAは5つのデータセットすべてに対する5つの攻撃に対して、最先端の防御性能を達成している。
論文 参考訳(メタデータ) (2023-05-25T07:16:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。